聯繫我們

課程簡介

安全與公平人工智能的基礎

  • 核心概念:安全性、偏見、公平性、透明度
  • 偏見的類型:數據集偏見、表征偏見、算法偏見
  • 監管框架概述(如歐盟《人工智能法案》、GDPR 等)

微調模型中的偏見

  • 微調如何引入或放大偏見
  • 案例研究與現實失敗實例
  • 識別數據集與模型預測中的偏見

偏見緩解技術

  • 數據層面策略(重新平衡、數據增強)
  • 訓練期間策略(正則化、對抗性去偏見)
  • 後處理策略(輸出過濾、校準)

模型安全性與魯棒性

  • 檢測不安全或有害的輸出
  • 處理對抗性輸入
  • 對微調模型進行紅隊測試(紅軍推演)與壓力測試

審核與監控人工智能系統

  • 偏見與公平性評估指標(例如:人口統計平等)
  • 可解釋性工具與透明度框架
  • 持續監控與治理實踐

工具包與動手實作

  • 使用開源庫(如 Fairlearn、Transformers、CheckList)
  • 動手實作:在微調模型中檢測並緩解偏見
  • 透過提示設計與約束生成安全輸出

企業應用案例與合規準備

  • 將安全性整合至大型語言模型工作流程的最佳實踐
  • 用於合規的文件記錄與模型卡片(Model Cards)
  • 為審計與外部審查做好準備

總結與後續步驟

最低要求

  • 具備對機器學習模型及訓練過程的理解
  • 擁有微調與大型語言模型(LLM)的實戰經驗
  • 熟悉 Python 及自然語言處理(NLP)概念

受眾

  • 人工智能合規團隊
  • 機器學習工程師
 14 小時

課程分類