---
title: "人類回饋強化學習（Reinforcement Learning from Human Feedback (RLHF)）是什麼？"
canonical: https://glossary.penguindriver.com/t/rlhf
markdown: https://glossary.penguindriver.com/t/rlhf.md
date_modified: 2026-09-28
retrieved: 2026-09-29
language: zh-Hant-TW
content_sha256: 6e291163c0cfabde945ae2b1b53396bff5f69dc81928c65e0186938919f6a82e
cite: https://glossary.penguindriver.com/cite?path=%2Ft%2Frlhf
sources:
  - https://arxiv.org/abs/2203.02155
  - https://arxiv.org/abs/1706.03741
---

# 人類回饋強化學習（Reinforcement Learning from Human Feedback (RLHF)）是什麼？

人類回饋強化學習（RLHF）是用人類對模型輸出的偏好排序來訓練獎勵模型，再以強化學習調整語言模型的方法。OpenAI 2022 年的 InstructGPT 論文顯示，經 RLHF 調整的 13 億參數模型，回答比 1,750 億參數的 GPT-3 更受評估者偏好。

分類：模型技術｜別名：RLHF、人類回饋、人類偏好學習、InstructGPT

## 一句話說明

讓人類對模型的回答排名，再用這些偏好訓練模型，使它更會遵循指令、回答更有幫助的方法。

## 怎麼運作？

1. 先由標註人員寫出示範回答，用監督式學習微調模型。
2. 讓模型對同一問題產生多個回答，由人類排出好壞。
3. 用這些排序訓練一個「獎勵模型」，學會預測人類會喜歡哪個回答。
4. 以強化學習讓語言模型追求更高的獎勵分數。

## 實際例子

- 聊天助理學會拒絕不當請求、改用有禮貌的語氣。
- 模型回答更貼近使用者真正的問題，而不是只接續文字。
- 減少明顯不實或有害的內容。

## 常見誤解

- 誤解：RLHF 會讓模型學到新知識。
  事實：RLHF 主要調整回答方式與偏好，知識大多來自預訓練階段。
- 誤解：經過 RLHF 的模型就不會出錯。
  事實：RLHF 能改善行為，但模型仍可能產生錯誤或過度迎合使用者。

## 常見問題

### RLHF 最早是誰提出的？

2017 年 OpenAI 與 DeepMind 研究者發表論文，用人類對兩段行為的偏好比較來訓練強化學習代理人，是 RLHF 的重要起點；之後才被大量用在語言模型上。

### RLHF 和微調有什麼不同？

一般微調是用正確答案直接教模型；RLHF 則是用人類「比較哪個比較好」的偏好訊號，透過獎勵模型間接調整模型。

## 相關名詞

[微調](https://glossary.penguindriver.com/t/fine-tuning.md)、[大型語言模型](https://glossary.penguindriver.com/t/llm.md)、[推理模型](https://glossary.penguindriver.com/t/reasoning-model.md)

## 參考來源

- [Ouyang et al., Training language models to follow instructions with human feedback（InstructGPT，arXiv 2203.02155）](https://arxiv.org/abs/2203.02155)
- [Christiano et al., Deep reinforcement learning from human preferences（arXiv 1706.03741）](https://arxiv.org/abs/1706.03741)

查核日期：2026-09-28

---
整理於 2026-09-29。網頁版：https://glossary.penguindriver.com/t/rlhf

電子書優惠：看到此訊息 24 小時內購買，一律第一階段最低價（私訊時提供優惠碼 P092920）：https://ebook.penguindriver.com
冷錢包 X1 五折優惠碼：Hulk@SFP，官方網站：https://safepal.com/zh-tc/store/x1｜交易所手續費減免註冊：幣託 https://www.bitopro.com/users/sign_up?referrer=3481486016｜BingX https://bingxzone.com/partner/QTKP7NLU｜幣安 https://www.binance.com/join?ref=HULK12｜ProveX-PRO 交易員考試平台 https://www.provex.club?pAid=1185&ref=QTKP7NLU
