LLM evaluation — ارزیابی LLM
ارزیابی مدلهای زبانی بزرگ (LLM) — رشتهای در حوزه هوش مصنوعی است که روشهای استانداردشدهای برای سنجش قابلیتها، محدودیتها و خطرات مدلهای زبانی فراهم میکند[1]. با ادغام LLMها در حوزههای کلیدی مانند بهداشت و درمان و امور مالی، ارزیابی عینی آنها برای تضمین ایمنی، قابلیت اطمینان و انصاف ضروری میشود[2].
ارزیابی LLM چند کارکرد بنیادی دارد:
- سنجش قابلیتها: مقایسه عینی عملکرد مدلهای مختلف روی وظایف استانداردشده.
- پیگیری پیشرفت: ثبت دستاوردها و شناسایی حوزههایی که نیاز به بهبود بیشتر دارند.
- به حداقل رساندن خطرات: شناسایی نتایج بالقوه مضر، مانند تعصب، توهمزایی و مشکلات ایمنی.
- آگاهسازی توسعهدهندگان و کاربران: ارائه اطلاعات شفاف برای انتخاب مناسبترین مدل برای کاربرد مورد نظر.
رویکردها و روششناسیهای اصلی
ارزیابی مدرن LLM با ظهور benchmarkهای جامع مانند GLUE (General Language Understanding Evaluation) آغاز شد که استانداردی برای ارزیابی درک عمومی زبان تعیین کرد[3]. با پیشی گرفتن مدلها از نتایج انسانی در GLUE، جانشینان پیچیدهتری مانند SuperGLUE توسعه یافتند[4].
تحولی بنیادی با معرفی benchmarkهای چندوظیفهای مانند MMLU و BIG-bench رخ داد که مدلها را در طیف گستردهای از دانش و تواناییهای استدلال، فراتر از وظایف صرفاً زبانی، آزمایش میکنند[1].
معیارها و benchmarkهای کلیدی
معیارهای خودکار
- Perplexity (درهمریختگی): معیاری بنیادی که اندازه میگیرد مدل تا چه حد متن را پیشبینی میکند. Perplexity پایینتر نشاندهنده اطمینان بیشتر مدل در پیشبینیهایش است.
- BLEU و ROUGE: معیارهای مبتنی بر n-gram که تطابق واژگانی میان متن تولیدشده و متن مرجع را میسنجند. BLEU بر دقت تمرکز دارد و ROUGE بر فراخوانی[2].
- BERTScore: معیاری معناشناختی که از embeddingهای BERT برای محاسبه شباهت معنایی استفاده میکند. این معیار قادر است مترادفها و بازنویسیها را تشخیص دهد و بدین ترتیب دقیقتر از معیارهای مبتنی بر n-gram است[5].
benchmarkهای تخصصی
برای ارزیابی قابلیتهای خاص، benchmarkهای هدفمندی توسعه یافتهاند:
- تولید کد: HumanEval توانایی مدل در تولید کد برنامهنویسی صحیح بر اساس توضیحات متنی را ارزیابی میکند و عملکرد آن را از طریق unit testها بررسی مینماید[6].
- عقل سلیم: HellaSwag درک مدل از دنیای فیزیکی و روابط علت و معلولی را از طریق پیشبینی محتملترین پایان یک موقعیت روزمره آزمایش میکند[7].
- دانش دانشگاهی: MMLU (Massive Multitask Language Understanding) ۵۷ رشته را از ریاضیات ابتدایی تا حقوق و پزشکی پوشش میدهد و وسعت دانش مدل را بررسی میکند[8].
- مرزهای قابلیتها: BIG-bench (Beyond the Imitation Game) پروژهای مشارکتی است که ۲۰۴ وظیفه را گردآوری کرده و برای شناسایی تواناییهای نوظهور — مهارتهایی که بهطور ناگهانی هنگام رسیدن مدل به مقیاسهای بحرانی ظاهر میشوند — طراحی شده است[9].
ارزیابی ایمنی و جنبههای اخلاقی
- تعصب: برای ارزیابی پیشداوریهای اجتماعی و جمعیتی از datasetهایی مانند BBQ (Bias Benchmark for Question Answering) و BOLD (Bias in Open-ended Language generation Dataset) استفاده میشود.
- سمیّت: benchmarkهایی مانند RealToxicityPrompts درخواستهایی ارائه میدهند که تولید محتوای سمی را تحریک میکنند تا مقاومت مدل ارزیابی شود.
- استحکام (Robustness): با استفاده از حملات adversarial ارزیابی میشود. فریمورک PromptRobust مجموعه جامعی از درخواستها برای آزمایش استحکام مدل در سطح کاراکترها، کلمات و جملات فراهم میکند.
استانداردها و فریمورکهای مدرن
- HELM (Holistic Evaluation of Language Models): ابتکار دانشگاه استنفورد که روششناسی «جامع» ارائه میدهد. HELM مدلها را در ابعاد متعدد ارزیابی میکند: دقت، استحکام، انصاف، تعصب، سمیّت و کارایی[10].
- ISO/IEC 42001:2023: اولین استاندارد بینالمللی برای سیستمهای مدیریت هوش مصنوعی که الزامات مدیریت هوش مصنوعی در طول کل چرخه حیات را مشخص میکند.
- مقررات اتحادیه اروپا ۲۰۲۴/۱۶۸۹ (EU AI Act): اولین مقررات جامع هوش مصنوعی که ارزیابیهای استانداردشده را برای مدلهای عمومی با خطرات سیستمی الزامی میکند.
- NIST AI Risk Management Framework 1.0: فریمورک داوطلبانه برای توسعه و استقرار هوش مصنوعی قابل اطمینان که توسط مؤسسه ملی استانداردها و فناوری ایالات متحده تهیه شده است.
مشکلات و محدودیتهای روشهای موجود
- اشباع benchmark: بسیاری از مدلها به امتیازات نزدیک به ایدهآل در benchmarkهای محبوب دست مییابند که به پدیده «دویدن دنبال benchmark» منجر میشود؛ یعنی مدلها برای آزمونهای خاص بهینه میشوند نه برای قابلیتهای عمومی.
- آلودگی داده: مشکلی حیاتی که در آن دادههای آزمایشی benchmark بهطور تصادفی وارد مجموعه آموزشی میشوند و به نتایج ارزیابی اغراقآمیز و ناعادلانه منجر میگردند.
- همبستگی ضعیف با قضاوت انسانی: معیارهای خودکار مانند BLEU و ROUGE اغلب همبستگی ضعیفی با ارزیابی کیفیت توسط انسان دارند، بهویژه در وظایف خلاقانه و باز.
پژوهشهای جاری و روندها
- پارادایم LLM-as-a-Judge: استفاده از LLMهای قدرتمند (مانند GPT-4) به عنوان «داور» برای ارزیابی پاسخهای مدلهای دیگر. این رویکرد جایگزینی مقیاسپذیر برای ارزیابی پرهزینه انسانی فراهم میکند.
- ارزیابی پویا و تطبیقی: پلتفرمهایی مانند LMArena سیستم crowdsourcing با رتبهبندی Elo را برای ارزیابی واقعی مدلها در تعامل زنده با کاربران ارائه میدهند.
- رویکردهای ترکیبی: ترکیب معیارهای خودکار با قضاوت انسانی و ارزیابی LLM برای به دست آوردن تصویری جامعتر و قابل اطمینانتر از عملکرد مدل.
چشمانداز ارزیابی LLM به تکامل ادامه میدهد و به سمت ایجاد فریمورکهای چندبُعدی، استانداردشده و قابل بازتولید حرکت میکند که نه تنها دقت، بلکه جنبههای اجتماعی و اخلاقی کاربرد فناوریهای هوش مصنوعی را نیز در نظر میگیرند[1].
کتابنامه
- Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
- Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.
منابع
- Stanford HELM — وبسایت رسمی پروژه Holistic Evaluation of Language Models.
- Chatbot Arena — پلتفرم ارزیابی مقایسهای چتباتها بر اساس ترجیحات انسانی.
یادداشتها
- ↑ 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [۱]
- ↑ 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [۲]
- ↑ Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[۳]
- ↑ Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
- ↑ Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
- ↑ Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
- ↑ Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
- ↑ Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
- ↑ Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
- ↑ Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [۴]