Reinforcement learning from human feedback (RLHF) (KO)
인간 피드백으로부터의 강화 학습 (Reinforcement Learning from Human Feedback, RLHF) — 이는 머신러닝 방법으로, 먼저 인간의 피드백을 바탕으로 특별한 '보상 모델'(reward model)을 학습시킨 후, 이를 강화 학습(RL) 과정에서 지능형 에이전트의 행동을 최적화하는 데 활용하는 방식이다[1].
RLHF는 복잡하거나 정의하기 어려운 목표(예: '유용한', '안전한', '재미있는' 응답)를 인간의 평가를 통해 형식화할 수 있게 해준다. 복잡한 보상 함수를 수동으로 정의하는 대신, RLHF는 인간의 선호도를 직접 학습하여 보상 모델을 훈련시킨다. 이 접근법은 대형 언어 모델(LLM)의 '정렬'(alignment), 즉 모델의 행동을 인간의 가치와 의도에 맞추는 데 있어 핵심적인 방법이 되었다[2].
방법론의 발전과 초기 성과
인간 피드백을 활용한 에이전트 학습이라는 아이디어는 2010년대에 처음 등장했다. 초기의 주요 성과 중 하나는 2017년 OpenAI와 DeepMind의 폴 크리스티아노(Paul Christiano)와 동료들의 연구였다. 이들은 인간의 선호도가 복잡한 RL 과제에서 수동으로 정의된 보상 함수를 대체할 수 있음을 보여주었다. 실험에서 인간은 에이전트의 행동 클립(예: Atari 게임에서)을 보고 더 선호하는 것을 선택했다. 이러한 쌍별 비교를 바탕으로 보상 모델을 학습시켰으며, 에이전트 행동의 1% 미만에 대한 피드백만으로도 여러 복잡한 과제를 성공적으로 해결했다[3].
이후 몇 년에 걸쳐 이 방법은 언어 모델 학습에도 적용되기 시작했다. 2020년에 OpenAI 연구자들은 텍스트 요약 과제에 처음으로 RLHF를 적용했다. 이들은 어떤 요약문을 인간이 선호할지 예측하는 보상 모델을 학습시키고, RL을 통해 이 점수를 최적화하도록 모델을 미세 조정했다. 그 결과는 인간이 작성한 참조 예시로 학습한 모델조차 능가하는 훨씬 높은 요약 품질을 보여주었다[4].
대형 언어 모델에서의 RLHF
대형 언어 모델은 RLHF 도입을 통해 유용성, 정확성, 지시 준수 측면에서 응답 품질이 크게 향상되었다.
InstructGPT와 ChatGPT
주요 연구 중 하나는 OpenAI가 2022년에 발표한 InstructGPT 모델로, 인간의 참여를 통해 미세 조정된 GPT-3 버전이었다[5]. 방법론은 세 단계로 구성된다:
- Supervised Fine-Tuning (SFT): 사람 평가자들이 다양한 요청에 대한 바람직한 응답 예시를 직접 작성한 소규모 고품질 시연 데이터셋으로 모델을 미세 조정한다.
- 보상 모델(Reward Model) 학습: 여러 요청에 대해 모델의 응답을 여러 개 생성한다. 사람 평가자들이 이 응답들을 최선에서 최악 순으로 순위를 매긴다. 이 선호 데이터를 바탕으로 보상 모델을 학습하며, 이 모델은 인간이 선호하는 응답에 더 높은 점수를 부여하는 법을 학습한다.
- RL을 통한 최적화: 원래의 언어 모델을 근위 정책 최적화(PPO) 알고리즘으로 미세 조정하여 보상 모델이 부여하는 점수를 최대화한다. 최적화 과정에서는 언어 능력의 저하를 막기 위해 원래의 SFT 모델에서 크게 벗어나는 것에 패널티를 부과한다.
실험 결과, 비교적 소규모인 InstructGPT 모델(13억 파라미터)이 거대한 GPT-3 모델(1750억 파라미터)보다 유용성 면에서 더 우수한 성능을 보였다. InstructGPT 모델은 또한 독성적이거나 편향되거나 신뢰할 수 없는 콘텐츠를 생성하는 빈도가 크게 줄었다[5].
이 연구 흐름의 발전은 대화형 모델의 탄생으로 이어졌으며, 그 중 가장 잘 알려진 것이 ChatGPT(OpenAI, 2022년 말)이다. ChatGPT는 유사한 방법론으로 RLHF를 사용하여 대화 수행을 위해 특별히 미세 조정된 GPT-3.5 시리즈 모델이다[6].
산업계의 도입
RLHF 방법은 다른 주요 조직들도 채택하였다. DeepMind는 2022년 자연어 규칙 집합(예: '위험한 조언을 하지 말 것')을 추가하여 RLHF로 학습시킨 대화형 에이전트 Sparrow를 개발했다[7]. Anthropic도 유사한 원칙을 사용하여 자사 모델을 학습시켰다. 2023년에 이르러 RLHF는 최첨단 언어 모델 개발에 있어 사실상 표준 구성 요소가 되었다[1].
RLHF 적용의 장점
- 사용자 의도와의 부합: RLHF 튜닝을 거친 모델은 지시를 훨씬 잘 따르고 더 관련성 높고 유용한 응답을 제공한다[5].
- 독성 및 유해 콘텐츠 감소: 학습 루프에 인간을 포함시킴으로써 바람직하지 않은 응답 형태를 명시적으로 페널티화할 수 있다. 그 결과 RLHF 모델은 훨씬 독성이 낮고 덜 편향된 콘텐츠를 생성한다[5].
- 사실성 향상 및 '환각' 감소: 평가자들이 사실을 꾸며낸 응답의 등급을 낮춤으로써 모델이 더 정확해지도록 유도할 수 있다. InstructGPT와 ChatGPT 모델은 이전 모델들에 비해 사실을 '꾸며내는' 빈도가 줄었다[5].
- 학습 효율성: RLHF는 학습 데이터를 비례적으로 늘리지 않고도 모델을 개선할 수 있게 한다. 방대한 양의 데이터가 아니라 양질의 선호도 평가가 필요하다.
한계와 문제점
성과에도 불구하고, RLHF 방법에는 여러 한계와 미해결 문제들이 있다.
- 인간 데이터 수집의 품질과 비용: RLHF의 효과는 피드백의 품질에 직접적으로 달려 있다. 그러한 dataset의 수집은 노동 집약적이고 비용이 많이 드는 과정이다. 또한 평가자 집단이나 평가 기준에 편향이 있을 경우, 모델이 그 편향을 그대로 이어받을 수 있다[2].
- '보상 해킹'(Reward Hacking) 위험: 특정 보상 함수에 최적화된 모델은 진정한 목표가 아닌 해당 함수 자체에 맞게 적응하기 시작할 수 있다. 예를 들어, 평가자들이 응답의 길이를 중시한다면 가능한 한 긴 응답을 하도록 학습하거나, 부정확성으로 패널티를 받으면 단정적인 주장을 회피하는 법을 학습할 수 있다.
- 사실 보증의 부재: RLHF는 모델에 새로운 사실 지식을 추가하는 것이 아니라, 인간이 선호하는 응답 형식을 학습시킬 뿐이다. 따라서 환각 문제가 완전히 해결되지는 않는다. 모델은 불확실성을 더 잘 숨기는 법을 배울 수 있지만, 항상 사실을 검증할 수 있는 것은 아니다[6].
- 선호도 일반화 문제: 보상 모델의 다른 과제로의 전이도 문제를 야기한다. 특정 요청 집합에 대한 선호도로 학습된 모델은 스타일이나 주제가 다른 새로운 과제를 접했을 때 예측 불가능하게 동작할 수 있다.
결론
RLHF는 대형 언어 모델을 인간이 생각하는 좋은 응답의 기준에 맞게 '정렬'하는 중요한 방법으로 자리매김했다. 이를 통해 AI 어시스턴트와의 상호작용 품질이 눈에 띄게 향상되어 응답이 더 유용하고 안전해졌다. RLHF는 단순히 그럴듯한 텍스트를 생성하는 데 그치지 않고, 대화 과정에서 인간의 가치, 선호도, 의도를 고려할 수 있는 모델을 만드는 여정에서 핵심 도구로 여겨진다[8].
참고 링크
- 지시 따르기를 위한 모델 미세 조정에 관한 OpenAI 논문
- IBM의 RLHF 개요
참고 문헌
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
각주
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]