AI 與科技名詞白話解釋

人類回饋強化學習(Reinforcement Learning from Human Feedback (RLHF))是什麼?

人類回饋強化學習(RLHF)是用人類對模型輸出的偏好排序來訓練獎勵模型,再以強化學習調整語言模型的方法。OpenAI 2022 年的 InstructGPT 論文顯示,經 RLHF 調整的 13 億參數模型,回答比 1,750 億參數的 GPT-3 更受評估者偏好。

模型技術RLHF人類回饋人類偏好學習InstructGPT

一句話說明

讓人類對模型的回答排名,再用這些偏好訓練模型,使它更會遵循指令、回答更有幫助的方法。

人類回饋強化學習怎麼運作?

  1. 先由標註人員寫出示範回答,用監督式學習微調模型。
  2. 讓模型對同一問題產生多個回答,由人類排出好壞。
  3. 用這些排序訓練一個「獎勵模型」,學會預測人類會喜歡哪個回答。
  4. 以強化學習讓語言模型追求更高的獎勵分數。

實際例子

常見誤解

誤解:RLHF 會讓模型學到新知識。
事實:RLHF 主要調整回答方式與偏好,知識大多來自預訓練階段。
誤解:經過 RLHF 的模型就不會出錯。
事實:RLHF 能改善行為,但模型仍可能產生錯誤或過度迎合使用者。

常見問題

RLHF 最早是誰提出的?

2017 年 OpenAI 與 DeepMind 研究者發表論文,用人類對兩段行為的偏好比較來訓練強化學習代理人,是 RLHF 的重要起點;之後才被大量用在語言模型上。

RLHF 和微調有什麼不同?

一般微調是用正確答案直接教模型;RLHF 則是用人類「比較哪個比較好」的偏好訊號,透過獎勵模型間接調整模型。

相關名詞

微調、大型語言模型、推理模型

參考來源

查核日期:2026-09-28。API:/api/term?id=rlhf

☕ 覺得有用?打賞支持 ・ AI/API 通行證 ・ 成為贊助 ・ 更多服務 ・ 開站限時:10/31 前通行證時間加倍