Метрики за качество на LLM

From Systems analysis wiki
Jump to navigation Jump to search

Метрики за качество на големите езикови модели (LLM) — това е систематичен подход и набор от стандартизирани инструменти за измерване на различни аспекти на производителността на езиковите модели, включително точност, безопасност, справедливост и надеждност[1]. Тъй като LLM намират все по-широко приложение в критично важни области като здравеопазването, финансите и образованието, възниква остра необходимост от тяхната комплексна и обективна оценка[2].

Метриките и benchmark-овете изпълняват няколко ключови функции: те позволяват обективно сравняване на различни модели, проследяване на напредъка в тяхното развитие, идентифициране на слабите места и осигуряване на прозрачност на резултатите за изследователи и практици[1].

Категории метрики

Метриките за оценка на LLM могат да бъдат разделени на няколко основни категории: автоматични метрики, оценка с участието на човек и специализирани метрики за оценка на безопасността и надеждността.

Автоматични метрики

Тези метрики позволяват бърза и мащабируема оценка без участието на човек.

Метрики на базата на n-грами

Традиционни метрики, измерващи лексикалното съвпадение между генерирания и еталонния текст.

  • BLEU (Bilingual Evaluation Understudy): Първоначално разработена за оценка на качеството на машинния превод. Измерва точността на съвпадение на n-грами (последователности от n думи) и прилага наказание за прекалено кратки генерирани текстове[3].
  • ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Фокусира се върху пълнотата, измервайки доколко добре n-грамите от еталонния текст са представени в генерирания. Особено ефективна за оценка на задачи по резюмиране[3].
  • METEOR: Разширява възможностите на BLEU, като отчита синоними, еднокоренни думи и морфологични варианти, което позволява постигане на по-добра корелация с човешките оценки[3].

Семантични метрики

Тези метрики използват контекстуални embedding-и за оценка на семантичната близост, а не само на лексикалното съвпадение.

  • BERTScore: Изчислява семантичното сходство между token-ите на генерирания и еталонния текст, използвайки embedding-и от модела BERT. Това позволява разпознаване на семантична еквивалентност дори при различна формулировка[4].
  • MAUVE: Измерва разминаването между разпределенията на машинния и човешкия текст в пространството на embedding-ите. Особено ефективна за оценка на отворена генерация, при която няма фиксиран еталонен текст[5].

Вътрешни метрики на езиковото моделиране

  • Перплексия (Perplexity): Фундаментална метрика, измерваща доколко добре езиковият модел предсказва последователност от текст. Тя отразява несигурността на модела при предсказване на следващия token. По-ниските стойности на перплексията указват по-добра производителност[6].
  • Точност и F1-мярка: Широко прилагани в задачи по класификация и въпросно-отговорни системи. F1-мярката представлява хармонично средно между точността и пълнотата, осигурявайки балансирана оценка[6].

Оценка с участието на човек

Човешката оценка остава „златен стандарт", тъй като автоматичните метрики често не са в състояние да уловят фините аспекти на качеството, като свързаност, креативност и релевантност[7].

  • Пряка оценка: Експерти или краудсорсъри оценяват качеството на генерацията по зададена скала (например от 1 до 5) по такива критерии като плавност и свързаност.
  • Сравнителна оценка: На оценителите се предлага да сравнят изходите на два или повече модела и да изберат най-добрия (двойно сравнение) или да ги наредят от най-добрия към най-лошия.

Недостатъците на човешката оценка са висока цена, сложност при мащабиране и субективност[7].

Оценка с помощта на LLM (LLM-as-a-Judge)

Нов подход, при който един (обикновено по-мощен) езиков модел се използва за оценка на отговорите на друг. Например GPT-4 може да наредва изходите на модели по зададени критерии. Този метод осигурява мащабируема алтернатива на човешката оценка, макар и да има свои проблеми, като чувствителност към стила на заявките и потенциална предубеденост[8].

Специализирани метрики и benchmark-ове

За оценка на конкретни аспекти на производителността и надеждността на LLM се използват специализирани метрики и benchmark-ове.

Фактологична надеждност

Оценява способността на модела да генерира достоверна информация и да не прибягва до халюцинации.

  • TruthfulQA: Benchmark, специално разработен за измерване на склонността на моделите да генерират отговори, основани на разпространени митове и заблуди. От модела се изисква да дава фактически верни, а не просто популярни отговори[9].

Безопасност и етика

  • Оценка на токсичността: Измерва наличието на обидно или вредно съдържание. За целта се използват специализирани класификатори и API, например Perspective API[9].
  • Оценка на предубеденост и справедливост: Оценява дали моделът демонстрира дискриминационно поведение спрямо различни демографски групи. Изследванията показват, че LLM могат да запазват и усилват социални стереотипи от обучаващите данни[10].
  • SafetyBench: Комплексен benchmark за оценка на безопасността, включващ проверка на устойчивостта срещу adversarial атаки и способността за избягване на генериране на вредно съдържание[11].

Комплексни benchmark-ове

  • MMLU (Massive Multitask Language Understanding): Един от най-широко използваните benchmark-ове, включващ въпроси с множествен избор по 57 предмета, от елементарна математика до международно право. Той оценява широчината и дълбочината на знанията на модела[12].
  • BIG-bench (Beyond the Imitation Game): Съдържа повече от 204 задачи, разработени за оценка на способности, излизащи извън рамките на възможностите на стандартните езикови модели, включително задачи от игра на шах до познаване на емоджи[12].

Предизвикателства и ограничения

  • Проблемът с корелацията: Традиционните автоматични метрики като BLEU и ROUGE често корелират слабо с човешките оценки, особено при творчески задачи[13].
  • Замърсяване на данните (Data Contamination): Съществува риск тестовите данни на benchmark-а да са попаднали в обучаващия набор на модела, което води до завишени и недостоверни оценки[14].
  • Многоезична оценка: По-голямата част от съществуващите метрики и benchmark-ове са насочени към английски език, което ограничава тяхната приложимост за оценка на многоезичните способности на LLM[15].

Препратки

  • What Are LLM Benchmarks? — обзорна статия от IBM
  • 20 LLM evaluation benchmarks and how they work — ръководство за benchmark-ове от Evidently AI

Литература

  • Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
  • Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
  • Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
  • Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
  • Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.

Бележки

  1. 1.0 1.1 «Метрики качества LLM». Perplexity AI.
  2. «Специализированные метрики безопасности». Perplexity AI.
  3. 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
  4. «Семантические метрики». Perplexity AI.
  5. «Метрики на основе распределений». Perplexity AI.
  6. 6.0 6.1 «Intrinsic метрики». Perplexity AI.
  7. 7.0 7.1 «Оценка с участием человека». Perplexity AI.
  8. «LLM-as-a-Judge». Perplexity AI.
  9. 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
  10. «Предвзятость и справедливость». Perplexity AI.
  11. «Benchmark'ы безопасности». Perplexity AI.
  12. 12.0 12.1 «Comprehensive оценка». Perplexity AI.
  13. «Проблемы корреляции». Perplexity AI.
  14. «Загрязнение данных». Perplexity AI.
  15. «Многоязычная оценка». Perplexity AI.