Метрики за качество на LLM
Метрики за качество на големите езикови модели (LLM) — това е систематичен подход и набор от стандартизирани инструменти за измерване на различни аспекти на производителността на езиковите модели, включително точност, безопасност, справедливост и надеждност[1]. Тъй като LLM намират все по-широко приложение в критично важни области като здравеопазването, финансите и образованието, възниква остра необходимост от тяхната комплексна и обективна оценка[2].
Метриките и benchmark-овете изпълняват няколко ключови функции: те позволяват обективно сравняване на различни модели, проследяване на напредъка в тяхното развитие, идентифициране на слабите места и осигуряване на прозрачност на резултатите за изследователи и практици[1].
Категории метрики
Метриките за оценка на LLM могат да бъдат разделени на няколко основни категории: автоматични метрики, оценка с участието на човек и специализирани метрики за оценка на безопасността и надеждността.
Автоматични метрики
Тези метрики позволяват бърза и мащабируема оценка без участието на човек.
Метрики на базата на n-грами
Традиционни метрики, измерващи лексикалното съвпадение между генерирания и еталонния текст.
- BLEU (Bilingual Evaluation Understudy): Първоначално разработена за оценка на качеството на машинния превод. Измерва точността на съвпадение на n-грами (последователности от n думи) и прилага наказание за прекалено кратки генерирани текстове[3].
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Фокусира се върху пълнотата, измервайки доколко добре n-грамите от еталонния текст са представени в генерирания. Особено ефективна за оценка на задачи по резюмиране[3].
- METEOR: Разширява възможностите на BLEU, като отчита синоними, еднокоренни думи и морфологични варианти, което позволява постигане на по-добра корелация с човешките оценки[3].
Семантични метрики
Тези метрики използват контекстуални embedding-и за оценка на семантичната близост, а не само на лексикалното съвпадение.
- BERTScore: Изчислява семантичното сходство между token-ите на генерирания и еталонния текст, използвайки embedding-и от модела BERT. Това позволява разпознаване на семантична еквивалентност дори при различна формулировка[4].
- MAUVE: Измерва разминаването между разпределенията на машинния и човешкия текст в пространството на embedding-ите. Особено ефективна за оценка на отворена генерация, при която няма фиксиран еталонен текст[5].
Вътрешни метрики на езиковото моделиране
- Перплексия (Perplexity): Фундаментална метрика, измерваща доколко добре езиковият модел предсказва последователност от текст. Тя отразява несигурността на модела при предсказване на следващия token. По-ниските стойности на перплексията указват по-добра производителност[6].
- Точност и F1-мярка: Широко прилагани в задачи по класификация и въпросно-отговорни системи. F1-мярката представлява хармонично средно между точността и пълнотата, осигурявайки балансирана оценка[6].
Оценка с участието на човек
Човешката оценка остава „златен стандарт", тъй като автоматичните метрики често не са в състояние да уловят фините аспекти на качеството, като свързаност, креативност и релевантност[7].
- Пряка оценка: Експерти или краудсорсъри оценяват качеството на генерацията по зададена скала (например от 1 до 5) по такива критерии като плавност и свързаност.
- Сравнителна оценка: На оценителите се предлага да сравнят изходите на два или повече модела и да изберат най-добрия (двойно сравнение) или да ги наредят от най-добрия към най-лошия.
Недостатъците на човешката оценка са висока цена, сложност при мащабиране и субективност[7].
Оценка с помощта на LLM (LLM-as-a-Judge)
Нов подход, при който един (обикновено по-мощен) езиков модел се използва за оценка на отговорите на друг. Например GPT-4 може да наредва изходите на модели по зададени критерии. Този метод осигурява мащабируема алтернатива на човешката оценка, макар и да има свои проблеми, като чувствителност към стила на заявките и потенциална предубеденост[8].
Специализирани метрики и benchmark-ове
За оценка на конкретни аспекти на производителността и надеждността на LLM се използват специализирани метрики и benchmark-ове.
Фактологична надеждност
Оценява способността на модела да генерира достоверна информация и да не прибягва до халюцинации.
- TruthfulQA: Benchmark, специално разработен за измерване на склонността на моделите да генерират отговори, основани на разпространени митове и заблуди. От модела се изисква да дава фактически верни, а не просто популярни отговори[9].
Безопасност и етика
- Оценка на токсичността: Измерва наличието на обидно или вредно съдържание. За целта се използват специализирани класификатори и API, например Perspective API[9].
- Оценка на предубеденост и справедливост: Оценява дали моделът демонстрира дискриминационно поведение спрямо различни демографски групи. Изследванията показват, че LLM могат да запазват и усилват социални стереотипи от обучаващите данни[10].
- SafetyBench: Комплексен benchmark за оценка на безопасността, включващ проверка на устойчивостта срещу adversarial атаки и способността за избягване на генериране на вредно съдържание[11].
Комплексни benchmark-ове
- MMLU (Massive Multitask Language Understanding): Един от най-широко използваните benchmark-ове, включващ въпроси с множествен избор по 57 предмета, от елементарна математика до международно право. Той оценява широчината и дълбочината на знанията на модела[12].
- BIG-bench (Beyond the Imitation Game): Съдържа повече от 204 задачи, разработени за оценка на способности, излизащи извън рамките на възможностите на стандартните езикови модели, включително задачи от игра на шах до познаване на емоджи[12].
Предизвикателства и ограничения
- Проблемът с корелацията: Традиционните автоматични метрики като BLEU и ROUGE често корелират слабо с човешките оценки, особено при творчески задачи[13].
- Замърсяване на данните (Data Contamination): Съществува риск тестовите данни на benchmark-а да са попаднали в обучаващия набор на модела, което води до завишени и недостоверни оценки[14].
- Многоезична оценка: По-голямата част от съществуващите метрики и benchmark-ове са насочени към английски език, което ограничава тяхната приложимост за оценка на многоезичните способности на LLM[15].
Препратки
- What Are LLM Benchmarks? — обзорна статия от IBM
- 20 LLM evaluation benchmarks and how they work — ръководство за benchmark-ове от Evidently AI
Литература
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
Бележки
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.