T01

人類回饋強化學習

Reinforcement Learning from Human Feedback (RLHF)

簡短答案

利用人類對 AI 輸出的偏好評分來微調語言模型,使其更符合人類期望的訓練方法。

深入解釋

訓練人類偏好模型,再用強化學習根據偏好分數優化 LLM 輸出。ChatGPT 等現代對話 AI 都使用 RLHF,顯著改善了回應的有用性和安全性。

實際案例

OpenAI 讓評分員比較多個 AI 回覆並選出最佳回覆,以此訓練 ChatGPT 的對話品質。

本頁為 AIATCL 備考用非官方內容;考試資訊請以主辦單位公告為準。