T01強化學習Reinforcement Learning (RL)簡短答案智能體透過與環境互動、獲得獎懲回饋,學習最佳決策策略的機器學習方法。深入解釋類似人類學習的試誤過程,智能體採取行動、觀察結果、調整策略以最大化長期獎勵。實際案例AlphaGo 透過自我對弈的強化學習,達到超越人類圍棋水準。