聯繫我們

課程簡介

生產環境中智能代理系統的基礎

  • 代理架構:迴圈、工具、記憶體與編排層
  • 代理的生命週期:開發、部署與持續運行
  • 生產規模下代理管理的挑戰

基礎設施與部署模型

  • 在容器化與雲端環境中部署代理
  • 擴展模式:水平擴展與垂直擴展、並發控制以及限流
  • 多代理編排與負載平衡

監控與可觀測性

  • 關鍵指標:延遲、成功率、記憶體用量及代理呼叫深度
  • 追蹤代理活動與呼叫圖譜
  • 使用Prometheus、OpenTelemetry與Grafana實現可觀測性 instrumentation

日誌、稽核與合規

  • 集中式日誌與結構化事件收集
  • 智能代理工作流程中的合規性與可審計性
  • 設計稽核軌跡與重放機制以供除錯

效能調校與資源優化

  • 降低推論開銷並最佳化代理編排週期
  • 模型快取與輕量級嵌入技術,加速資料檢索
  • AI管線的負載測試與壓力情境模擬

成本控管與治理

  • 理解代理成本驅動因素:API呼叫、記憶體、運算資源及外部整合
  • 追蹤代理層級成本並實施成本分攤模型
  • 制定自動化策略以防止代理過度擴張與閒置資源消耗

CI/CD與代理部署策略

  • 將代理管線整合至CI/CD系統中
  • 迭代式代理更新的測試、版本控管與回滾策略
  • 漸進式部署與安全發布機制

故障復原與可靠性工程

  • 設計容錯機制與優雅降級策略
  • 應用重試、逾時與電路斷開模式以提升代理可靠性
  • AI運營的異常事件處理與事後檢討框架

期末專案

  • 建置並部署具備完整監控與成本追蹤功能的智能代理人工智慧系統
  • 模擬負載、測量效能並最佳化資源使用
  • 向同儕展示最終架構與監控儀表板

總結與後續步驟

最低要求

  • 具備扎实的MLOps與生產環境機器學習系統知識
  • 擁有容器化部署經驗(Docker/Kubernetes)
  • 熟悉雲端成本優化與可觀測性工具

對象

  • MLOps工程師
  • 站點可靠性工程師(SREs)
  • 負責AI基礎設施的工程主管
 21 小時

客戶評論 (3)

課程分類