人類回饋強化學習(Reinforcement Learning from Human Feedback (RLHF))是什麼?
人類回饋強化學習(RLHF)是用人類對模型輸出的偏好排序來訓練獎勵模型,再以強化學習調整語言模型的方法。OpenAI 2022 年的 InstructGPT 論文顯示,經 RLHF 調整的 13 億參數模型,回答比 1,750 億參數的 GPT-3 更受評估者偏好。
模型技術RLHF人類回饋人類偏好學習InstructGPT
一句話說明
讓人類對模型的回答排名,再用這些偏好訓練模型,使它更會遵循指令、回答更有幫助的方法。
人類回饋強化學習怎麼運作?
- 先由標註人員寫出示範回答,用監督式學習微調模型。
- 讓模型對同一問題產生多個回答,由人類排出好壞。
- 用這些排序訓練一個「獎勵模型」,學會預測人類會喜歡哪個回答。
- 以強化學習讓語言模型追求更高的獎勵分數。
實際例子
- 聊天助理學會拒絕不當請求、改用有禮貌的語氣。
- 模型回答更貼近使用者真正的問題,而不是只接續文字。
- 減少明顯不實或有害的內容。
常見誤解
誤解:RLHF 會讓模型學到新知識。
事實:RLHF 主要調整回答方式與偏好,知識大多來自預訓練階段。
事實:RLHF 主要調整回答方式與偏好,知識大多來自預訓練階段。
誤解:經過 RLHF 的模型就不會出錯。
事實:RLHF 能改善行為,但模型仍可能產生錯誤或過度迎合使用者。
事實:RLHF 能改善行為,但模型仍可能產生錯誤或過度迎合使用者。
常見問題
RLHF 最早是誰提出的?
2017 年 OpenAI 與 DeepMind 研究者發表論文,用人類對兩段行為的偏好比較來訓練強化學習代理人,是 RLHF 的重要起點;之後才被大量用在語言模型上。
RLHF 和微調有什麼不同?
一般微調是用正確答案直接教模型;RLHF 則是用人類「比較哪個比較好」的偏好訊號,透過獎勵模型間接調整模型。
相關名詞
參考來源
- Ouyang et al., Training language models to follow instructions with human feedback(InstructGPT,arXiv 2203.02155)
- Christiano et al., Deep reinforcement learning from human preferences(arXiv 1706.03741)
查核日期:2026-09-28。API:/api/term?id=rlhf