LLM hallucinations — LLM의 환각 및 부정확한 응답

From Systems analysis wiki
Jump to navigation Jump to search

환각 (영어: hallucination)은 대형 언어 모델(LLM)의 맥락에서, 모델이 겉보기에 그럴듯한(plausible) 응답을 자신감 있게 생성하지만 실제로는 사실에 부합하지 않거나, 제공된 맥락과 일치하지 않거나, 내부적으로 모순된 현상을 의미한다[1][2]. 모델은 원본 데이터에 존재하지 않는 사실, 세부 정보 또는 논리적 결론을 "지어낸다".

환각은 전통적인 의미의 오류나 버그가 아님을 유의해야 한다. 모델은 설계된 대로 작동한다. 즉, 학습 데이터에서 추출한 패턴을 기반으로 가장 그럴듯한 텍스트 연속을 예측한다. 모델에는 진실성을 검증하는 내장 메커니즘이 없다[3]. 환각은 단순한 오류와 달리, 존재하지 않는 사실, 참고문헌 또는 사건을 포함하는 자신감 있게 제시된 거짓 정보라는 점에서 구별된다[4]. 이 현상은 매우 중요해져서 2023년 케임브리지 사전은 인공지능과 관련된 "hallucination"이라는 용어에 새로운 의미를 추가했다[5].

환각의 정의 및 분류

다양한 용어(예: "혼화증", "지어내기")가 사용되지만, LLM의 환각은 크게 두 가지 범주로 나눌 수 있다: 사실적 정확성과 관련된 것과 출처 충실성(맥락적 일관성)과 관련된 것이다[6].

사실적 환각

모델이 실제 세계에 대해 사실적으로 잘못된 정보를 제시하는 경우이다. 모델은 거짓 "사실"을 진실로 주장한다[1].

  • 예시: "찰스 린드버그는 달 표면을 처음 밟은 사람이었다" — 완전히 꾸며낸 사실.
  • 거짓 인용 및 참고문헌: 모델은 실제 참고문헌의 형식을 모방하여 존재하지 않는 학술 논문이나 법률에 대한 참고문헌을 만들어낼 수 있다[2]. 이는 정확성이 요구되는 애플리케이션(교육, 뉴스, 컨설팅)에서 모델에 대한 신뢰를 훼손한다[7].

논리적 오류

모델이 추론에서 불일치 또는 오류를 범하는 경우이다. 응답의 개별 사실은 맞을 수 있지만 결론이 비논리적이거나 기본적인 논리에 모순된다[2]. 이는 모델이 형식 논리가 아닌 단어의 확률적 연관성으로 작동하는 복잡한 추론이나 수학 및 인과관계 과제에서 자주 발생한다[2][2].

  • 예시: "새가 날기 때문에 우주비행사는 중력을 느끼지 못한다" — 텍스트는 일관성 있어 보이지만 논리적으로 잘못되었다.

맥락적 환각

모델의 응답이 제공된 맥락이나 지시와 일치하지 않는 경우이다. 모델이 맥락에서 "이탈"하여 불필요한 정보를 추가하거나 필요한 정보를 무시한다[1].

  • 지시 위반: "텍스트를 스페인어로 번역해 달라"는 요청에 모델이 영어로 응답한다[1].
  • 출처에 없는 정보: 요약 과제에서 모델이 원본 문서에 없는 사실을 "추가"하거나 왜곡한다[1].
  • 맥락 혼합: 응답 도중 모델이 갑자기 다른 영역에 대해 이야기하기 시작한다. 예를 들어, NBA 커미셔너 아담 실버에 대한 질문에 모델이 전임자인 데이비드 스턴으로 전환하여 두 가지 다른 맥락을 혼합할 수 있다[6].

비일관성

모델이 하나의 응답 또는 일련의 응답 내에서 스스로 모순되는 환각의 한 유형이다[6]. 한 연구에서 ChatGPT의 자기 모순적 응답 비율이 약 14%에 달하는 것으로 나타났다[6][6].

  • 예시: "X 회사는 1990년에 설립되었다... 몇 문장 후 ...2000년에 설립된 X 회사..."

코드에서의 환각

코드로 학습된 LLM은 존재하지 않는 함수, 라이브러리 또는 매개변수를 사용하여 구문적으로는 올바르지만 작동하지 않는 코드 조각을 생성할 수 있다[2]. 예를 들어, 모델은 Python에서 `import quantum`을 생성할 수 있지만 그러한 표준 모듈은 존재하지 않는다. 2024년에는 "code hallucination"이라는 용어가 제안되고, 이 문제를 체계화하기 위한 benchmark CodeMirage가 만들어졌다[8].

발생 원인

환각 현상은 모델 아키텍처에서 데이터 품질에 이르기까지 여러 요인의 복합적인 결과이다.

  • 아키텍처 및 학습 원리: 대부분의 LLM(예: GPT)은 다음 token을 예측하도록 학습된 자기회귀 transformer이다. 이들의 목표는 텍스트의 그럴듯함을 최대화하는 것이지 주장의 진실성을 검증하는 것이 아니다[2]. 모델은 학습 데이터에서 사실과 허구를 구분하지 않고 모든 것을 텍스트 패턴으로 인식한다[2].
  • 학습 데이터 품질: LLM은 수많은 부정확성, 미신, 구식 정보를 포함하는 인터넷의 방대한 텍스트 코퍼스로 학습된다[1]. 모델은 이러한 오류를 기억하고 재현한다. 또한 모델이 정보를 보유하는 시간적 한계인 knowledge cutoff도 중요하다.
  • 텍스트 생성 방식: 생성의 확률적 특성(온도를 이용한 샘플링)은 모델이 더 "창의적"이지만 덜 정확한 응답을 생성할 수 있게 한다. 제한된 컨텍스트 길이로 인해 모델이 대화의 초반 세부 사항을 "잊어버리고" 스스로 모순되기 시작할 수 있다[6].

평가 및 측정 방법

환각을 탐지하고 측정하기 위해 자동 지표, 인간 평가 및 전문 benchmark가 사용된다.

  • 자동 지표: 응답의 정확성을 평가하기 위해 다른 LLM이 "심판" 역할을 하는 접근법(LLM-as-a-judge)[9]이나 생성 시 모델의 엔트로피(불확실성) 분석이 포함된다[10].
  • 인간 주석: "금본위"로 간주된다. 전문가 또는 크라우드소싱 평가자가 응답을 수동으로 평가하여 오류를 표시한다. 이 방법은 RLHF를 통한 모델 학습 시 사용된다[11].
  • Benchmark 및 스트레스 테스트: 모델이 일반적인 미신을 재현하도록 유도하는 질문을 포함하는 TruthfulQA와 같은 특수 dataset이 만들어졌다[12]. 또한 모델을 환각 수준으로 비교하는 Hugging Face Hallucination Leaderboard와 같은 리더보드도 있다[13].

완화 및 예방 방법

  • Retrieval-Augmented Generation (RAG): 모델을 외부 지식에 "연결"하는 가장 성공적인 접근법이다. 응답 생성 전에 모델은 데이터베이스, 검색 엔진 또는 API에서 관련 정보를 받는다. 이를 통해 모델이 추측이 아닌 검증된 데이터를 기반으로 응답할 수 있다[2].
  • Chain-of-Thought 및 자기 검증: 모델이 최종 응답을 제공하기 전에 단계별 추론을 먼저 생성하여 정확도를 높인다. Self-Verification과 같은 더 발전된 방법에서는 모델이 초안 응답을 생성한 다음 이를 검증하고 수정하는 작업을 받는다[14].
  • 내장 규칙 및 필터: 모델은 확신이 없을 때 응답을 거부하도록 학습된다. 예를 들어, Anthropic의 Claude 모델은 "진실성" 원칙을 따르며 사실을 지어내는 대신 "정확히 알 수 없습니다..."라고 자주 응답한다[11].
  • 외부 도구와의 통합: Gemini와 같은 모델은 외부 도구(예: 계산을 위한 계산기 또는 최신 뉴스를 위한 검색)가 필요한 시점을 자동으로 인식하고 활용하여 환각 횟수를 크게 줄일 수 있다[11].

위험 및 결과

  • 법적 및 평판 위험: 법률 분야에서 환각은 심각한 결과를 초래할 수 있다. Mata v. Avianca (2023) 사건이 널리 알려졌는데, 변호사가 ChatGPT를 사용하여 판례를 검색하던 중 존재하지 않는 여러 사건을 지어냈다. 변호사들은 벌금을 부과받았으며, 이 사건은 검증 없이 AI를 신뢰해서는 안 된다는 교훈이 되었다[1].
  • 허위 정보 확산: 사회적 규모에서 LLM은 가짜 뉴스 문제를 악화시킬 수 있다. Meta의 Galactica 모델은 과학자들을 돕기 위해 만들어졌지만 꾸며낸 실험과 참고문헌이 포함된 유사과학 텍스트를 생성하기 시작했다. 사흘 만에 모델에 대한 공개 접근이 차단되었다[15].
  • 잘못된 의사결정: 특히 경험이 부족한 사용자들은 자신감 있게 표현된 AI 응답을 신뢰하는 경향이 있어, 금융, 의료 및 기타 중요한 영역에서 잘못된 결정을 내릴 수 있다[7].

실제 사례

  • Air Canada 사건 (2023): 항공사 챗봇이 존재하지 않는 환불 정책을 지어냈다. 고객이 해당 정책의 적용을 요구했을 때 회사는 거부했다. 캐나다 교통 재판소는 Air Canada가 챗봇이 제공한 정보에 책임을 지고 고객에게 손해를 배상하도록 판결했다[9].
  • OpenAI 상대 명예훼손 소송 (2023): 라디오 진행자 마크 월터스는 ChatGPT가 한 기자의 요청에 대한 응답에서 그를 사기로 허위 고발했다는 이유로 OpenAI를 고소했다. 이 사건은 모델이 생성하는 콘텐츠에 대한 기업의 법적 책임을 부각시켰다[6].

참고 링크

  • The Beginner's Guide to Hallucinations in Large Language Models — Lakera의 상세 안내서
  • Survey of Hallucination in Natural Language Generation — arXiv의 현상에 대한 학술 개요

문헌

  • Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
  • Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
  • Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
  • Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
  • Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
  • O'Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
  • Finlayson, M. et al. (2024). Basis-Aware Truncation Sampling for Neural Text Generation. arXiv:2412.14352.
  • Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
  • Yu, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
  • Chen, S. J. et al. (2024). Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods. arXiv:2410.03968.

주석

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «The Beginner's Guide to Hallucinations in Large Language Models». Lakera. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 2.7 2.8 «What Is LLM Hallucination and How To Prevent It». Astera. [2]
  3. «Hallucination (artificial intelligence)». In Wikipedia. [3]
  4. «OpenAI describes LLM hallucinations as 'making up facts' in moments of uncertainty'». [источник не указан в тексте].
  5. «Cambridge Dictionary adds new definition for 'hallucinate'». [источник не указан в тексте].
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «LLM Hallucination—Types, Causes, and Solutions». Nexla. [4]
  7. 7.0 7.1 «Effective Tips to Prevent AI Hallucinations in Generative AI». QuickCreator. [5]
  8. [2408.08333] CodeMirage: Hallucinations in Code Generated by Large Language Models. arXiv. [6]
  9. 9.0 9.1 «LLM hallucinations and failures: lessons from 4 examples». Evidently AI Blog. [7]
  10. «How to Perform Hallucination Detection for LLMs». Kolena. [8]
  11. 11.0 11.1 11.2 «ChatGPT vs Google Gemini vs Anthropic Claude: Comprehensive Comparison & Report». DataStudios. [9]
  12. «Mastering LLM Accuracy: How to Test, Detect, and Fix Hallucinations in AI Models». Stephen Weber on Medium. [10]
  13. «LLM Benchmarks and Leaderboards: Avoiding Foundation Model Mistakes». Arize Blog. [11]
  14. «Improving the Reliability of LLMs: Combining Chain-of-Thought Reasoning and Retrieval-Augmented Generation». arXiv. [12]
  15. «Why Meta Took Down its 'Hallucinating' AI Model Galactica?». Analytics India Magazine. [13]