聯繫我們

課程簡介

AI 主權與 LLM 本地部署

  • 雲端 LLM 的風險:數據保留、基於輸入訓練、外國管轄權。
  • Ollama 架構:模型服務器、註冊表及與 OpenAI 兼容的 API。
  • 與 vLLM、llama.cpp 和 Text Generation Inference 的比較。
  • 模型許可證:Llama、Mistral、Qwen 和 Gemma 的條款。

安裝與硬體設置

  • 在支援 CUDA 和 ROCm 的 Linux 上安裝 Ollama。
  • 僅 CPU 的回退方案及 AVX/AVX2 優化。
  • Docker 部署與持久化卷映射。
  • 多 GPU 設置與 VRAM 分配策略。

模型管理

  • 從 Ollama 註冊表拉取模型:ollama pull llama3。
  • 從 HuggingFace 和 TheBloke 導入 GGUF 模型。
  • 量化級別:Q4_K_M、Q5_K_M、Q8_0 的權衡。
  • 模型切換與並發加載模型的限制。

自定義 Modelfile

  • 編寫 Modelfile 語法:FROM、PARAMETER、SYSTEM、TEMPLATE。
  • 溫度、top_p 和 repeat_penalty 調優。
  • 針對角色特定行為的系統提示工程。
  • 創建並發布自定義模型至本地註冊表。

API 集成

  • 與 OpenAI 兼容的 /v1/chat/completions 端點。
  • 流式響應和 JSON 模式。
  • 與 LangChain、LlamaIndex 及自定義應用程序集成。
  • 通過反向代理進行身份驗證和速率限制。

性能優化

  • 上下文窗口大小調整與 KV 緩存管理。
  • 批量推理與並行請求處理。
  • CPU 線程分配與 NUMA 感知。
  • 監控 GPU 利用率與內存壓力。

安全與合規

  • 模型服務端點的網絡隔離。
  • 輸入過濾與輸出審核管道。
  • 提示和完成的審計日誌記錄。
  • 模型溯源與哈希驗證。

最低要求

  • 中間級 Linux 和容器管理知識。
  • 高級層面對機器學習和變換器模型的理解。
  • 熟悉 REST API 和 JSON。

受眾

  • 替換雲端 LLM API 的 AI 工程師和開發人員。
  • 因數據敏感性而無法使用雲端模型的組織。
  • 需要物理隔離語言模型的情報和國防團隊。
 14 小時

課程分類