LLM quality metrics — معیارهای کیفیت مدل‌های زبانی بزرگ

From Systems analysis wiki
Jump to navigation Jump to search

معیارهای کیفیت مدل‌های زبانی بزرگ (LLM) — رویکردی نظام‌مند و مجموعه‌ای از ابزارهای استانداردشده برای اندازه‌گیری جنبه‌های مختلف عملکرد مدل‌های زبانی، از جمله دقت، ایمنی، انصاف و قابلیت اطمینان هستند[1]. با گسترش روزافزون کاربرد LLMها در حوزه‌های حیاتی نظیر بهداشت و درمان، مالی و آموزش، نیاز مبرمی به ارزیابی جامع و عینی آن‌ها احساس می‌شود[2].

معیارها و benchmark‌ها چندین کارکرد کلیدی دارند: امکان مقایسه عینی مدل‌های مختلف، پیگیری پیشرفت در توسعه آن‌ها، شناسایی نقاط ضعف و تضمین شفافیت نتایج برای پژوهشگران و متخصصان را فراهم می‌کنند[1].

دسته‌بندی معیارها

معیارهای ارزیابی LLM را می‌توان به چند دسته اصلی تقسیم کرد: معیارهای خودکار، ارزیابی با مشارکت انسان و معیارهای تخصصی برای سنجش ایمنی و قابلیت اطمینان.

معیارهای خودکار

این معیارها امکان ارزیابی سریع و مقیاس‌پذیر بدون مشارکت انسان را فراهم می‌کنند.

معیارهای مبتنی بر n-gram

معیارهای سنتی که تطابق واژگانی میان متن تولیدشده و متن مرجع را اندازه می‌گیرند.

  • BLEU (Bilingual Evaluation Understudy): در اصل برای ارزیابی کیفیت ترجمه ماشینی طراحی شده است. دقت تطابق n-gramها (دنباله‌هایی از n کلمه) را اندازه می‌گیرد و جریمه‌ای برای متن‌های تولیدشده بیش از حد کوتاه اعمال می‌کند[3].
  • ROUGE (Recall-Oriented Understudy for Gisting Evaluation): بر فراخوانی تمرکز دارد و می‌سنجد که n-gramهای متن مرجع تا چه حد در متن تولیدشده بازنمایی شده‌اند. به‌ویژه برای ارزیابی وظایف خلاصه‌سازی کارآمد است[3].
  • METEOR: قابلیت‌های BLEU را با در نظر گرفتن مترادف‌ها، کلمات هم‌ریشه و گونه‌های صرفی گسترش می‌دهد که همبستگی بهتری با ارزیابی‌های انسانی ایجاد می‌کند[3].

معیارهای معنایی

این معیارها از embedding‌های متنی برای ارزیابی نزدیکی معنایی، نه صرفاً تطابق واژگانی، استفاده می‌کنند.

  • BERTScore: شباهت معنایی میان token‌های متن تولیدشده و متن مرجع را با استفاده از embedding‌های مدل BERT محاسبه می‌کند. این امر شناسایی هم‌ارزی معنایی را حتی با صورت‌بندی‌های متفاوت ممکن می‌سازد[4].
  • MAUVE: واگرایی میان توزیع‌های متن ماشین و متن انسان را در فضای embedding اندازه می‌گیرد. به‌ویژه برای ارزیابی تولید آزاد، که در آن متن مرجع ثابتی وجود ندارد، کارآمد است[5].

معیارهای درونی مدل‌سازی زبانی

  • Perplexity (پیچیدگی): معیاری بنیادی که می‌سنجد یک مدل زبانی تا چه حد خوب توالی متن را پیش‌بینی می‌کند. این معیار عدم اطمینان مدل در پیش‌بینی token بعدی را نشان می‌دهد. مقادیر پایین‌تر perplexity نشان‌دهنده عملکرد بهتر است[6].
  • دقت و F1-score: به‌طور گسترده در وظایف طبقه‌بندی و سیستم‌های پرسش و پاسخ به‌کار می‌روند. F1-score میانگین هارمونیک دقت و فراخوانی است و ارزیابی متوازنی ارائه می‌دهد[6].

ارزیابی با مشارکت انسان

ارزیابی انسانی «استاندارد طلایی» باقی می‌ماند، زیرا معیارهای خودکار اغلب قادر به درک جنبه‌های ظریف کیفیت مانند انسجام، خلاقیت و ارتباط نیستند[7].

  • ارزیابی مستقیم: متخصصان یا افراد از طریق crowdsourcing کیفیت تولید را بر اساس مقیاس مشخصی (مثلاً از ۱ تا ۵) بر اساس معیارهایی نظیر روانی و انسجام می‌سنجند.
  • ارزیابی مقایسه‌ای: به ارزیابان پیشنهاد می‌شود خروجی‌های دو یا چند مدل را مقایسه کرده و بهترین را انتخاب کنند (مقایسه زوجی) یا آن‌ها را از بهترین به بدترین رتبه‌بندی کنند.

معایب ارزیابی انسانی هزینه بالا، دشواری مقیاس‌پذیری و ذهنی بودن آن است[7].

ارزیابی با کمک LLM (LLM-as-a-Judge)

رویکردی نوین که در آن یک مدل زبانی (معمولاً قدرتمندتر) برای ارزیابی پاسخ‌های مدل دیگری به‌کار می‌رود. برای مثال، GPT-4 می‌تواند خروجی‌های مدل‌ها را بر اساس معیارهای تعریف‌شده رتبه‌بندی کند. این روش جایگزینی مقیاس‌پذیر برای ارزیابی انسانی فراهم می‌آورد، هرچند چالش‌هایی نظیر حساسیت به سبک درخواست‌ها و تعصب بالقوه نیز دارد[8].

معیارها و benchmark‌های تخصصی

برای ارزیابی جنبه‌های خاص عملکرد و قابلیت اطمینان LLMها از معیارها و benchmark‌های تخصصی استفاده می‌شود.

قابلیت اطمینان واقعی

توانایی مدل در تولید اطلاعات صحیح و پرهیز از توهم‌زایی را ارزیابی می‌کند.

  • TruthfulQA: benchmark‌ای که به‌طور خاص برای سنجش میزان گرایش مدل‌ها به تولید پاسخ‌های مبتنی بر افسانه‌ها و باورهای رایج نادرست طراحی شده است. از مدل انتظار می‌رود پاسخ‌های واقعاً درست، نه صرفاً محبوب، ارائه دهد[9].

ایمنی و اخلاق

  • ارزیابی سمیّت: حضور محتوای توهین‌آمیز یا مضر را اندازه می‌گیرد. برای این منظور از طبقه‌بندهای تخصصی و APIها، مانند Perspective API، استفاده می‌شود[9].
  • ارزیابی تعصب و انصاف: می‌سنجد که آیا مدل رفتار تبعیض‌آمیزی نسبت به گروه‌های جمعیتی مختلف نشان می‌دهد یا خیر. پژوهش‌ها نشان می‌دهند LLMها می‌توانند کلیشه‌های اجتماعی موجود در داده‌های آموزشی را حفظ و تقویت کنند[10].
  • SafetyBench: یک benchmark جامع برای ارزیابی ایمنی که شامل بررسی استحکام در برابر adversarial attack‌ها و توانایی اجتناب از تولید محتوای مضر است[11].

benchmark‌های جامع

  • MMLU (Massive Multitask Language Understanding): یکی از پرکاربردترین benchmark‌ها که شامل سؤالات چندگزینه‌ای از ۵۷ حوزه موضوعی، از ریاضیات ابتدایی تا حقوق بین‌الملل، است. این benchmark وسعت و عمق دانش مدل را ارزیابی می‌کند[12].
  • BIG-bench (Beyond the Imitation Game): بیش از ۲۰۴ وظیفه را در بر می‌گیرد که برای ارزیابی قابلیت‌هایی طراحی شده‌اند که فراتر از توانایی‌های مدل‌های زبانی استاندارد هستند و شامل وظایفی از شطرنج تا حدس زدن ایموجی می‌شوند[12].

چالش‌ها و محدودیت‌ها

  • مشکل همبستگی: معیارهای خودکار سنتی مانند BLEU و ROUGE اغلب همبستگی ضعیفی با ارزیابی‌های انسانی دارند، به‌ویژه در وظایف خلاقانه[13].
  • آلودگی داده (Data Contamination): این خطر وجود دارد که داده‌های آزمون benchmark به مجموعه آموزشی مدل راه یافته باشند، که به ارزیابی‌های بیش از حد خوش‌بینانه و غیرقابل اعتماد منجر می‌شود[14].
  • ارزیابی چندزبانه: اکثر معیارها و benchmark‌های موجود بر زبان انگلیسی متمرکز هستند که قابلیت کاربرد آن‌ها را برای ارزیابی توانایی‌های چندزبانه LLMها محدود می‌کند[15].

پیوندها

  • What Are LLM Benchmarks? — مقاله مروری از IBM
  • 20 LLM evaluation benchmarks and how they work — راهنمای benchmark‌ها از Evidently AI

منابع

  • Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
  • Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
  • Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
  • Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
  • Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.

یادداشت‌ها

  1. 1.0 1.1 «Метрики качества LLM». Perplexity AI.
  2. «Специализированные метрики безопасности». Perplexity AI.
  3. 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
  4. «Семантические метрики». Perplexity AI.
  5. «Метрики на основе распределений». Perplexity AI.
  6. 6.0 6.1 «Intrinsic метрики». Perplexity AI.
  7. 7.0 7.1 «Оценка с участием человека». Perplexity AI.
  8. «LLM-as-a-Judge». Perplexity AI.
  9. 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
  10. «Предвзятость и справедливость». Perplexity AI.
  11. «Benchmark'ы безопасности». Perplexity AI.
  12. 12.0 12.1 «Comprehensive оценка». Perplexity AI.
  13. «Проблемы корреляции». Perplexity AI.
  14. «Загрязнение данных». Perplexity AI.
  15. «Многоязычная оценка». Perplexity AI.