聯繫我們

課程簡介

生產環境中代理系統的基礎

  • 代理架構:循環、工具、記憶及編排層
  • 代理生命週期:開發、部署及持續運營
  • 大規模代理管理面臨的挑戰

基礎設施與部署模式

  • 在容器化及雲端環境中部署代理
  • 擴展模式:水平與垂直擴展、並發性及節流
  • 多代理編排與工作負載均衡

監控與可觀察性

  • 關鍵指標:延遲、成功率、記憶體使用率及代理調用深度
  • 追蹤代理活動及調用圖
  • 使用 Prometheus、OpenTelemetry 及 Grafana 實現可觀察性插桩

日誌記錄、審計與合規

  • 集中式日誌記錄及結構化事件收集
  • 代理工作流程中的合規性與可審計性
  • 設計審計追蹤及重放機制以便調試

性能調優與資源優化

  • 降低推理開銷並優化代理編排週期
  • 模型緩存及輕量級嵌入以加快檢索速度
  • AI 管線的負載測試及壓力場景模擬

成本管控與治理

  • 理解代理成本驅動因素:API 調用、記憶體、計算資源及外部整合
  • 追蹤代理級別成本並實施費用分攤模型
  • 自動化策略以防止代理膨脹及閒置資源消耗

代理的 CI/CD 與發布策略

  • 將代理管線整合至 CI/CD 系統
  • 代理迭代更新的測試、版本管理及回滾策略
  • 漸進式發布及安全部署機制

故障恢復與可靠性工程

  • 設計容錯機制及優雅降級
  • 代理可靠性的重試、超時及熔断器模式
  • AI 運營的應急響應及事後分析框架

綜合項目

  • 構建並部署具備完整監控及成本追蹤功能的代理式 AI 系統
  • 模擬負載、衡量性能並優化資源使用
  • 向同伴展示最終架構及監控儀表板

總結與後續步驟

最低要求

  • 對 MLOps 及生產級機器學習系統有深入理解
  • 具備容器化部署經驗(Docker/Kubernetes)
  • 熟悉雲成本優化及可觀察性工具

目標受眾

  • MLOps 工程師
  • 網站可靠性工程師(SREs)
  • 負責監督 AI 基礎設施的工程經理
 21 小時

客戶評論 (3)

課程分類