LLM quality metrics — معیارهای کیفیت مدلهای زبانی بزرگ
معیارهای کیفیت مدلهای زبانی بزرگ (LLM) — رویکردی نظاممند و مجموعهای از ابزارهای استانداردشده برای اندازهگیری جنبههای مختلف عملکرد مدلهای زبانی، از جمله دقت، ایمنی، انصاف و قابلیت اطمینان هستند[1]. با گسترش روزافزون کاربرد LLMها در حوزههای حیاتی نظیر بهداشت و درمان، مالی و آموزش، نیاز مبرمی به ارزیابی جامع و عینی آنها احساس میشود[2].
معیارها و benchmarkها چندین کارکرد کلیدی دارند: امکان مقایسه عینی مدلهای مختلف، پیگیری پیشرفت در توسعه آنها، شناسایی نقاط ضعف و تضمین شفافیت نتایج برای پژوهشگران و متخصصان را فراهم میکنند[1].
دستهبندی معیارها
معیارهای ارزیابی LLM را میتوان به چند دسته اصلی تقسیم کرد: معیارهای خودکار، ارزیابی با مشارکت انسان و معیارهای تخصصی برای سنجش ایمنی و قابلیت اطمینان.
معیارهای خودکار
این معیارها امکان ارزیابی سریع و مقیاسپذیر بدون مشارکت انسان را فراهم میکنند.
معیارهای مبتنی بر n-gram
معیارهای سنتی که تطابق واژگانی میان متن تولیدشده و متن مرجع را اندازه میگیرند.
- BLEU (Bilingual Evaluation Understudy): در اصل برای ارزیابی کیفیت ترجمه ماشینی طراحی شده است. دقت تطابق n-gramها (دنبالههایی از n کلمه) را اندازه میگیرد و جریمهای برای متنهای تولیدشده بیش از حد کوتاه اعمال میکند[3].
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): بر فراخوانی تمرکز دارد و میسنجد که n-gramهای متن مرجع تا چه حد در متن تولیدشده بازنمایی شدهاند. بهویژه برای ارزیابی وظایف خلاصهسازی کارآمد است[3].
- METEOR: قابلیتهای BLEU را با در نظر گرفتن مترادفها، کلمات همریشه و گونههای صرفی گسترش میدهد که همبستگی بهتری با ارزیابیهای انسانی ایجاد میکند[3].
معیارهای معنایی
این معیارها از embeddingهای متنی برای ارزیابی نزدیکی معنایی، نه صرفاً تطابق واژگانی، استفاده میکنند.
- BERTScore: شباهت معنایی میان tokenهای متن تولیدشده و متن مرجع را با استفاده از embeddingهای مدل BERT محاسبه میکند. این امر شناسایی همارزی معنایی را حتی با صورتبندیهای متفاوت ممکن میسازد[4].
- MAUVE: واگرایی میان توزیعهای متن ماشین و متن انسان را در فضای embedding اندازه میگیرد. بهویژه برای ارزیابی تولید آزاد، که در آن متن مرجع ثابتی وجود ندارد، کارآمد است[5].
معیارهای درونی مدلسازی زبانی
- Perplexity (پیچیدگی): معیاری بنیادی که میسنجد یک مدل زبانی تا چه حد خوب توالی متن را پیشبینی میکند. این معیار عدم اطمینان مدل در پیشبینی token بعدی را نشان میدهد. مقادیر پایینتر perplexity نشاندهنده عملکرد بهتر است[6].
- دقت و F1-score: بهطور گسترده در وظایف طبقهبندی و سیستمهای پرسش و پاسخ بهکار میروند. F1-score میانگین هارمونیک دقت و فراخوانی است و ارزیابی متوازنی ارائه میدهد[6].
ارزیابی با مشارکت انسان
ارزیابی انسانی «استاندارد طلایی» باقی میماند، زیرا معیارهای خودکار اغلب قادر به درک جنبههای ظریف کیفیت مانند انسجام، خلاقیت و ارتباط نیستند[7].
- ارزیابی مستقیم: متخصصان یا افراد از طریق crowdsourcing کیفیت تولید را بر اساس مقیاس مشخصی (مثلاً از ۱ تا ۵) بر اساس معیارهایی نظیر روانی و انسجام میسنجند.
- ارزیابی مقایسهای: به ارزیابان پیشنهاد میشود خروجیهای دو یا چند مدل را مقایسه کرده و بهترین را انتخاب کنند (مقایسه زوجی) یا آنها را از بهترین به بدترین رتبهبندی کنند.
معایب ارزیابی انسانی هزینه بالا، دشواری مقیاسپذیری و ذهنی بودن آن است[7].
ارزیابی با کمک LLM (LLM-as-a-Judge)
رویکردی نوین که در آن یک مدل زبانی (معمولاً قدرتمندتر) برای ارزیابی پاسخهای مدل دیگری بهکار میرود. برای مثال، GPT-4 میتواند خروجیهای مدلها را بر اساس معیارهای تعریفشده رتبهبندی کند. این روش جایگزینی مقیاسپذیر برای ارزیابی انسانی فراهم میآورد، هرچند چالشهایی نظیر حساسیت به سبک درخواستها و تعصب بالقوه نیز دارد[8].
معیارها و benchmarkهای تخصصی
برای ارزیابی جنبههای خاص عملکرد و قابلیت اطمینان LLMها از معیارها و benchmarkهای تخصصی استفاده میشود.
قابلیت اطمینان واقعی
توانایی مدل در تولید اطلاعات صحیح و پرهیز از توهمزایی را ارزیابی میکند.
- TruthfulQA: benchmarkای که بهطور خاص برای سنجش میزان گرایش مدلها به تولید پاسخهای مبتنی بر افسانهها و باورهای رایج نادرست طراحی شده است. از مدل انتظار میرود پاسخهای واقعاً درست، نه صرفاً محبوب، ارائه دهد[9].
ایمنی و اخلاق
- ارزیابی سمیّت: حضور محتوای توهینآمیز یا مضر را اندازه میگیرد. برای این منظور از طبقهبندهای تخصصی و APIها، مانند Perspective API، استفاده میشود[9].
- ارزیابی تعصب و انصاف: میسنجد که آیا مدل رفتار تبعیضآمیزی نسبت به گروههای جمعیتی مختلف نشان میدهد یا خیر. پژوهشها نشان میدهند LLMها میتوانند کلیشههای اجتماعی موجود در دادههای آموزشی را حفظ و تقویت کنند[10].
- SafetyBench: یک benchmark جامع برای ارزیابی ایمنی که شامل بررسی استحکام در برابر adversarial attackها و توانایی اجتناب از تولید محتوای مضر است[11].
benchmarkهای جامع
- MMLU (Massive Multitask Language Understanding): یکی از پرکاربردترین benchmarkها که شامل سؤالات چندگزینهای از ۵۷ حوزه موضوعی، از ریاضیات ابتدایی تا حقوق بینالملل، است. این benchmark وسعت و عمق دانش مدل را ارزیابی میکند[12].
- BIG-bench (Beyond the Imitation Game): بیش از ۲۰۴ وظیفه را در بر میگیرد که برای ارزیابی قابلیتهایی طراحی شدهاند که فراتر از تواناییهای مدلهای زبانی استاندارد هستند و شامل وظایفی از شطرنج تا حدس زدن ایموجی میشوند[12].
چالشها و محدودیتها
- مشکل همبستگی: معیارهای خودکار سنتی مانند BLEU و ROUGE اغلب همبستگی ضعیفی با ارزیابیهای انسانی دارند، بهویژه در وظایف خلاقانه[13].
- آلودگی داده (Data Contamination): این خطر وجود دارد که دادههای آزمون benchmark به مجموعه آموزشی مدل راه یافته باشند، که به ارزیابیهای بیش از حد خوشبینانه و غیرقابل اعتماد منجر میشود[14].
- ارزیابی چندزبانه: اکثر معیارها و benchmarkهای موجود بر زبان انگلیسی متمرکز هستند که قابلیت کاربرد آنها را برای ارزیابی تواناییهای چندزبانه LLMها محدود میکند[15].
پیوندها
- What Are LLM Benchmarks? — مقاله مروری از IBM
- 20 LLM evaluation benchmarks and how they work — راهنمای benchmarkها از Evidently AI
منابع
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
یادداشتها
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.