SuperGLUE (benchmark) (FA)

From Systems analysis wiki
Jump to navigation Jump to search

SuperGLUE — یک benchmark جامع (مجموعه‌ای از آزمون‌های ارزیابی) برای سنجش سیستم‌های پردازش زبان طبیعی، به‌ویژه مدل‌های زبانی بزرگ (LLM) است[1]. این benchmark در سال ۲۰۱۹ توسط گروهی از پژوهشگران به رهبری الکس وانگ از دانشگاه نیویورک، با مشارکت Facebook AI Research و سایر سازمان‌ها معرفی شد[1].

انگیزه ایجاد SuperGLUE این بود که تا اواسط سال ۲۰۱۹، benchmark پیشین یعنی GLUE برای مدل‌های پیشرفته «آسان» شده بود: امتیاز ترکیبی بهترین مدل‌ها روی GLUE به ۸۸٫۴ رسیده و از میانگین عملکرد انسان (۸۷٫۱) پیشی گرفته بود[1]. بدین ترتیب، فضای پیشرفت بیشتر محدود شده بود[1]. در پاسخ به این وضعیت، نویسندگان SuperGLUE را به عنوان جایگزینی دشوارتر طراحی کردند که بتواند درک زبانی مدل‌ها را با دقت بیشتری بسنجد[1]. هدف SuperGLUE ارائه معیاری بی‌طرف و «سخت‌آموز» برای سنجش پیشرفت در درک عمومی زبان انگلیسی است[1]. انتظار می‌رفت که بهبود چشمگیر نتایج در SuperGLUE مستلزم نوآوری‌های اساسی در روش‌های Machine Learning باشد — از جمله یادگیری کارآمدتر با نمونه‌های کم، یادگیری چندوظیفه‌ای و یادگیری خودنظارتی[1]. به بیان دیگر، SuperGLUE شامل آزمون‌هایی است که برای انسان ساده، اما برای هوش ماشینی دشوار هستند[1]، تا توسعه مدل‌هایی با درک زبانی عمیق و واقعی را تشویق کند.

ویژگی‌ها و تفاوت‌ها با GLUE

SuperGLUE تا حد زیادی قالب GLUE را دنبال می‌کند — یک امتیاز ترکیبی واحد بر اساس مجموعه وظایف، یک leaderboard عمومی و ابزارهای تحلیل مدل ارائه می‌دهد[1]. با این حال، SuperGLUE چندین بهبود و نوآوری نسبت به پیشینیان خود دارد[1]:

  • آزمون‌های دشوارتر: در SuperGLUE هشت وظیفه دشوارتر انتخاب شده‌اند[1]. دو مورد از آن‌ها از GLUE به ارث رسیده‌اند (از میان دشوارترین‌های آن)، و بقیه از میان نامزدهای جدید بر اساس سختی برای مدل‌های NLP پیشرفته انتخاب شده‌اند[1]. بدین ترتیب، benchmark بر جنبه‌هایی از درک تمرکز دارد که مدل‌ها پیش‌تر در آن‌ها ضعیف‌ترین عملکرد را داشتند.
  • تنوع قالب‌ها: اگر در GLUE همه وظایف به طبقه‌بندی جمله یا جفت جملات خلاصه می‌شد، SuperGLUE شامل طیف گسترده‌تری از قالب‌ها است[1]. علاوه بر طبقه‌بندی، وظایف حل ارجاع مشترک و پرسش و پاسخ نیز اضافه شده‌اند که از مدل می‌خواهند متن منسجم را درک کرده و استنتاج منطقی انجام دهد[1].
  • ارزیابی انسانی برای همه وظایف: برای هر وظیفه SuperGLUE، سطح پایه عملکرد انسانی (غیرمتخصص) محاسبه شده است[1]، که تأیید می‌کند حتی مدل‌های قوی مانند BERT در زمان راه‌اندازی benchmark به‌طور قابل توجهی از انسان عقب بودند[1]. وجود مرجع انسانی (حدود ۹۰٪ به‌طور ترکیبی) فضایی برای رشد مدل فراهم می‌کند و هدف را مشخص می‌سازد[1].
  • قوانین و ابزارهای شفاف: قوانین ارسال نتایج به leaderboard بازنگری شده‌اند (برای تضمین مقایسه منصفانه و ذکر سهم نویسندگان dataset)[1]. همچنین ابزار کدنویسی متن‌باز جدیدی برای تسهیل fine-tuning و یادگیری چندوظیفه‌ای مدل‌ها بر روی داده‌های SuperGLUE منتشر شده است[1].

مجموع این اقدامات SuperGLUE را به آزمونی قابل‌اطمینان‌تر برای سنجش توانایی‌های زبانی عمومی مدل‌ها تبدیل می‌کند و امکان کسب نتایج بالا از طریق تقلب محدود یا سازگاری با قالب‌های خاص GLUE قدیمی را از بین می‌برد[1].

مجموعه وظایف SuperGLUE

SuperGLUE از هشت وظیفه تشکیل شده که جنبه‌های مختلف درک متن را پوشش می‌دهند.

  • BoolQ (Boolean Questions): یک وظیفه پرسش و پاسخ (QA) که در آن هر نمونه شامل یک متن کوتاه (گزیده‌ای از ویکی‌پدیا) و یک سؤال است که باید با «بله» یا «خیر» پاسخ داده شود[1]. سؤالات توسط کاربران (از جستجوهای Google) تهیه شده و نیازمند استخراج واقعیت صریح یا ضمنی از متن هستند؛ معیار ارزیابی دقت (accuracy) است[1].
  • CB (CommitmentBank): یک وظیفه استلزام منطقی (textual entailment) با سه کلاس[1]. این dataset شامل متون کوتاه با جملات پیچیده وابسته است؛ هدف تعیین این است که نویسنده متن تا چه حد به صحت گزاره تودرتو متعهد است[1]. در واقع این بررسی می‌کند که آیا یک ادعا از زمینه داده‌شده استنتاج می‌شود یا خیر. این وظیفه به دلیل اندازه کوچک نمونه (حدود ۲۵۰ مثال) و عدم تعادل کلاس‌ها دشوار است؛ کیفیت بر اساس دقت و F1 میانگین‌شده بر کلاس‌ها ارزیابی می‌شود[1].
  • COPA (Choice of Plausible Alternatives): یک وظیفه استدلال علّی[1]. به مدل یک مقدمه (یک جمله) داده می‌شود و باید علت یا معلول درست را از میان دو گزینه انتخاب کند[1]. تمام نمونه‌های COPA به‌صورت دستی تهیه شده و برای برقراری رابطه علّی نیازمند عقل سلیم هستند. موضوعات شامل موقعیت‌هایی از وبلاگ‌ها و یک دانشنامه تخصصی است؛ معیار دقت (نسبت انتخاب‌های درست) است[1]. مثال: جمله «کودک در برابر بیماری ایمنی پیدا کرد» داده می‌شود و سؤال «چرا؟» پرسیده می‌شود — انسان فوراً می‌فهمد که پاسخ درست «واکسن دریافت کرد» است، در حالی که مدل باید رابطه علّی را حدس بزند[1].
  • MultiRC (Multi-Sentence Reading Comprehension): یک وظیفه درک متن چندجمله‌ای با عناصر انتخاب چندگانه[1]. مدل یک پاراگراف متن، یک سؤال درباره محتوای آن و فهرستی از پاسخ‌های ممکن دریافت می‌کند؛ باید مشخص کند کدام پاسخ‌ها درست هستند (هر سؤال می‌تواند چند پاسخ درست داشته باشد)[1]. ویژگی: برای پاسخ به سؤال معمولاً باید اطلاعاتی از چند جمله متن ترکیب شود، که توانایی مدل در پیوند دادن واقعیات را می‌سنجد[1]. کیفیت با دو معیار اندازه‌گیری می‌شود: F1 بر اساس پاسخ‌ها (که مجموعه‌های نیمه‌درست را هم در نظر می‌گیرد) و Exact Match — نسبت سؤالاتی که مجموعه پاسخ کاملاً درست داده شده[1].
  • ReCoRD (Reading Comprehension with Commonsense Reasoning Dataset): یک وظیفه خواندن با درک و استفاده از دانش[1]. این یک آزمون Cloze اصلاح‌شده است: یک متن خبری (مقاله CNN/Daily Mail) و جمله‌ای با یک موجودیت حذف‌شده داده می‌شود؛ مدل باید تعیین کند کدام موجودیت از متن در جای خالی قرار می‌گیرد[1]. گزینه‌های پاسخ شامل همه موجودیت‌های ذکرشده در مقاله هستند و ممکن است از نظر مفهومی با هم همپوشانی داشته باشند[1]. حل موفق مستلزم درک زمینه و عقل سلیم است. معیارها: حداکثر token-level F1 و Exact Match (تطابق دقیق) برای پاسخ‌های پیش‌بینی‌شده هستند[1].
  • RTE (Recognizing Textual Entailment): یک وظیفه طبقه‌بندی دوتایی بر اساس استلزام متنی (entailment در برابر not entailment)[1]. این dataset نمونه‌هایی از چندین مسابقه تشخیص استنتاج متنی (سری RTE 1-5) را ترکیب می‌کند[1]. هر آزمون شامل یک جفت قطعه متنی (فرض-فرضیه) است؛ مدل باید تعیین کند آیا فرضیه از متن استنتاج می‌شود. برخلاف بسیاری از dataset های بزرگ، RTE نسبتاً کوچک است (حدود ۲۵۰۰ نمونه آموزشی)، اما با ظهور مدل‌هایی مثل BERT سود قابل توجهی از transfer learning نشان داد: دقت از حدود ۵۶٪ (سطح حدس تصادفی) به حدود ۸۶٪ رسید[1]. با این حال، در زمان راه‌اندازی SuperGLUE، دقت مدل‌ها هنوز حدود ۸ واحد درصد از انسان عقب بود[1]، بنابراین RTE به عنوان یکی از وظایفی که فاصله تا سطح انسانی را حفظ کرده بود، گنجانده شد.
  • WiC (Word-in-Context): یک وظیفه رفع ابهام معنای کلمه در زمینه (WSD)[1]. دو جمله مستقل داده می‌شود که در هر کدام یک کلمه چندمعنا ظاهر می‌شود؛ باید تعیین شود آیا این کلمه در هر دو مورد به یک معنا استفاده شده است[1]. داده‌ها از منابع واژه‌نامه‌ای (WordNet، VerbNet، Wiktionary) گرفته شده‌اند، بنابراین طیف گسترده‌ای از کلمات و معانی را پوشش می‌دهند[1]. این وظیفه به صورت طبقه‌بندی دوتایی قالب‌بندی شده و بر اساس نسبت پاسخ‌های درست ارزیابی می‌شود. WiC از مدل می‌خواهد تفاوت‌های معنایی ظریف را درک کند و در واقع معناشناسی واژگانی را می‌سنجد.
  • WSC (Winograd Schema Challenge): یک وظیفه رفع ارجاع مشترک با استفاده از عقل سلیم[1]. هر آزمون شامل یک جمله با یک ضمیر و فهرستی از دو موجودیت (اسم) از همان جمله است[1]. باید تعیین شود کدام اسم است که این ضمیر به آن اشاره می‌کند[1]. مثال کلاسیک از جمله Winograd: «جایزه در چمدان جا نشد چون خیلی کوچک بود» — انسان می‌فهمد که «آن» به چمدان اشاره دارد (چمدان خیلی کوچک بود). این‌گونه نمونه‌ها بدون دانش روزمره و زمینه قابل حل نیستند[1]. در GLUE نسخه ساده‌شده‌ای از این وظیفه (WNLI) وجود داشت، اما مدل‌ها برای مدت طولانی حتی از سطح تصادفی هم نمی‌توانستند فراتر روند[1]. تنها ترفندهای خاص، مانند افزودن داده‌های خارجی با نمونه‌های مشابه، کیفیت مدل‌ها را در WSC تا حدود ۹۰٪ در سال ۲۰۱۹ بالا برد[1]. با این حال، انسان وظایف WSC را تقریباً بدون خطا حل می‌کند (حدود ۹۶-۱۰۰٪ پاسخ‌های درست)[1]. در SuperGLUE، نسخه اصلی WSC در قالب طبقه‌بندی دوتایی گنجانده شده است (برای هر جفت «ضمیر-موجودیت» مدل پاسخ می‌دهد که آیا به یک مرجع اشاره دارند)[1]. این وظیفه یکی از دشوارترین آزمون‌هایی است که نیازمند استدلال بر اساس دانش عمومی است.

همه آزمون‌های SuperGLUE دارای مجموعه‌های آزمایشی بسته با پاسخ‌های ناشناخته برای توسعه‌دهندگان هستند[1]. مدل‌ها پیش‌بینی‌های خود را به سرور ارسال می‌کنند، جایی که امتیاز ترکیبی محاسبه می‌شود — میانگین دقت بر اساس وظایف (برای وظایف با چند معیار، ابتدا میانگین معیار داخلی محاسبه می‌شود)[1]. این امتیاز SuperGLUE واحد، مقایسه مدل‌ها بر اساس سطح کلی هوش زبانی را ساده می‌کند.

نتایج و پیشرفت مدل‌ها

در زمان راه‌اندازی SuperGLUE، نویسندگان نتایج یک مدل پایه قوی (BERT تقویت‌شده) را به عنوان مرجع ارائه دادند — و این نتایج به‌طور قابل توجهی پایین‌تر از انسان در همه وظایف بود[1]. به‌طور میانگین، بهترین مدل آن زمان حدود ۲۰ امتیاز کمتر از انسان در معیار ترکیبی کسب کرد[1]. در برخی وظایف، شکاف به‌ویژه بزرگ بود: برای مثال، در وظیفه WSC مدل به سختی به حدود ۶۵٪ دقت می‌رسید در برابر ۱۰۰٪ انسان (تفاوت حدود ۳۵ امتیاز)[1]. حتی در وظایف به‌ظاهر «ساده‌تر» (BoolQ، CB، RTE، WiC) سیستم‌های خودکار حدود ۱۰ امتیاز از سطح انسانی عقب بودند[1]. این تفاوت‌ها تأیید کرد که SuperGLUE واقعاً چالش جدی‌ای برای فناوری‌های موجود ایجاد می‌کند و به‌سادگی قابل حل نیست.

با این حال، تنها چند ماه پس از ظهور SuperGLUE، پیشرفت سریع آغاز شد[1]. در اواخر سال ۲۰۱۹، پژوهشگران Google مدل T5 (Text-To-Text Transfer Transformer) با ۱۱ میلیارد پارامتر را معرفی کردند که امتیاز ترکیبی ۸۸٫۹ به دست آورد و به سطح انسانی حدود ۸۹٫۸ نزدیک شد[2]. در واقع، T5 رکورد قبلی را در SuperGLUE یک‌باره ۴٫۳ امتیاز بهبود داد و نسبت خطا را تقریباً یک‌سوم کاهش داد[2]، و تنها یک شکاف ۰٫۹ امتیازی تا سطح انسانی باقی ماند[2]. توسعه‌دهندگان اشاره کردند که SuperGLUE عمداً به گونه‌ای طراحی شده که وظایف برای انسان‌ها آسان باشند، بنابراین رسیدن مدل به سطح حدود ۸۹٪ یک نقطه عطف مهم بود[2].

اولین کسی که موفق شد از میانگین کیفیت انسانی پیشی بگیرد، مدل Microsoft با نام DeBERTa (Decoding-enhanced BERT with disentangled attention) بود[3]. در ژانویه ۲۰۲۱، پژوهشگران گزارش دادند که نسخه‌ای از DeBERTa با ۱٫۵ میلیارد پارامتر امتیاز ۸۹٫۹ کسب کرد، کمی بالاتر از مرجع انسانی ۸۹٫۸[3]. این اولین مورد بود که یک مدل منفرد از انسان در معیار SuperGLUE پیشی گرفت[3]. علاوه بر این، یک ensemble از چند مدل DeBERTa رکورد را تا حدود ۹۰٫۳ امتیاز بالا برد[3]. مدل DeBERTa از پیشتاز قبلی (Google T5) حدود ۰٫۶٪ جلو زد و اثربخشی ایده‌های جدید در معماری Transformer (نمایش جداگانه محتوا و موقعیت کلمات، decoder mask بهبودیافته و غیره) را نشان داد[4].

پیشرفت در همین نقطه متوقف نشد: با رشد اندازه و پیچیدگی مدل‌های زبانی، نتایج SuperGLUE به بهبود ادامه دادند[5]. تا پایان سال ۲۰۲۱، مدل T-NLRv5 از Microsoft (خانواده Microsoft Turing NLR) در صدر leaderboard قرار گرفت — و شکاف را نسبت به سطح انسانی باز هم بیشتر افزایش داد[5]. آخرین وظایف حل‌نشده GLUE برای ماشین (مانند ظرافت‌های NLI) توسط این مدل «بسته» شدند و به برابری کامل با انسان حتی در سخت‌ترین زیروظایف نزدیک شد[5].

تا سال‌های ۲۰۲۲-۲۰۲۳، آستانه سطح انسانی در SuperGLUE توسط چندین مدل بزرگ مستقل با اطمینان پشت سر گذاشته شد[6]. برای مثال، مدل PaLM از Google (با ۵۴۰ میلیارد پارامتر) پس از fine-tuning روی وظایف SuperGLUE به حدود ۹۰٫۴ امتیاز رسید، و مدل GPT-4 (ساخته OpenAI) نتیجه‌ای حتی کمی بالاتر نشان داد[6]. تا اواسط سال ۲۰۲۳، در جدول leaderboard SuperGLUE چندین مدل با امتیاز بالاتر از ۹۰ (یعنی بالاتر از سطح میانگین انسانی) وجود داشتند[6]. می‌توان گفت که benchmark به‌طور عملی توسط سیستم‌های مدرن حل شده است[6]: امتیازات بهترین مدل‌ها آنقدر بالاست که از توانایی‌های اکثر افراد غیرمتخصص فراتر می‌رود[6]. این موفقیت نشان‌دهنده پیشرفت عظیم در NLP در مدت کوتاهی است، اما در عین حال ضرورت آزمون‌های جدید و حتی دشوارتر برای مدل‌های نسل جدید را نشان می‌دهد[6]. benchmark های بعدی (مانند MMLU، BIG-Bench و غیره) در حال ظهور هستند که هدفشان سنجش مدل‌ها بر اساس درک گسترده‌تر و دانش عمومی فراتر از محدوده وظایف SuperGLUE است[6].

تأثیر و پژوهش‌های پیشین

SuperGLUE بدین ترتیب به عنوان مرحله‌ای مهم در تکامل روش‌های ارزیابی در پردازش زبان جایگاه خود را تثبیت کرده است[3]. در محافل علمی و تخصصی، نتایج آن به نوعی «محک» برای معماری‌های جدید LLM تبدیل شده است: رسیدن به سطح انسانی یا فراتر رفتن از آن در SuperGLUE نشانه یک مدل پیشرفته با درک زبانی عمیق تلقی می‌شود[3]. این موضوع در عمل هم منعکس شده است — بسیاری از مدل‌های زبانی مدرن که نتایج بالایی در SuperGLUE کسب کرده‌اند، پایه سیستم‌های کاربردی پرسش و پاسخ، عوامل گفتگومحور، سیستم‌های خلاصه‌سازی متن و غیره شده‌اند[3]. SuperGLUE همچنان توسط پژوهشگران برای fine-tuning و مقایسه الگوریتم‌ها استفاده می‌شود، هرچند پیشگامی آن به تدریج به سمت مرزهای جدید ارزیابی هوش مصنوعی در حال جابجایی است.

پیوندها

  • وب‌سایت رسمی SuperGLUE
  • مقاله اصلی SuperGLUE (NeurIPS)
  • مقاله Microsoft درباره رسیدن DeBERTa به سطح انسانی
  • صفحه dataset SuperGLUE در Papers With Code

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

[1] [2] [3] [4] [5] [6] </references>

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS. [۱]
  2. 2.0 2.1 2.2 2.3 2.4 «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit /r/linguistics. [۲]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». Microsoft Research Blog. [۳]
  4. 4.0 4.1 «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». Synced Review. [۴]
  5. 5.0 5.1 5.2 5.3 «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». Microsoft Research Blog. [۵]
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 6.7 «The Ultimate Guide to AI Benchmarks». The AI Navigator. [۶]