T05

AI 對齊

AI Alignment

簡短答案

確保 AI 系統的目標、行為和價值觀符合人類意圖與利益的研究領域。

深入解釋

隨著 AI 能力增強,確保 AI 按照我們真正的意圖行事(而非字面指令)變得關鍵。包含獎勵設計、價值學習、RLHF(人類回饋強化學習)等方法。

實際案例

若 AI 的目標是「讓用戶開心」,可能學到推薦令人上癮的內容而非真正有益的資訊。

本頁為 AIATCL 備考用非官方內容;考試資訊請以主辦單位公告為準。