GSM8K (Grade School Math 8K) (FA)

From Systems analysis wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — یک مجموعه داده مرجع است که حاوی حدود ۸٫۵ هزار مسئله متنی ریاضی در سطح مدرسه می‌باشد. این مجموعه در سال ۲۰۲۱ توسط پژوهشگران OpenAI برای ارزیابی و توسعه توانایی‌های مدل‌های زبانی بزرگ (LLM) در استدلال‌های ریاضی چندمرحله‌ای ساخته شد[1]. GSM8K به یکی از benchmark‌های کلیدی برای اندازه‌گیری پیشرفت در حوزه تفکر ریاضی هوش مصنوعی تبدیل شده است.

هر مسئله در این dataset به صورت یک داستان متنی کوتاه است که حل آن نیازمند انجام ۲ تا ۸ عمل حسابی متوالی (جمع، تفریق، ضرب، تقسیم) می‌باشد. علی‌رغم سادگی ظاهری، این مسائل نیازمند درک عمیق متن و استدلال منطقی هستند که آن‌ها را برای بسیاری از LLM‌ها دشوار می‌سازد[2].

ویژگی‌های کلیدی

حجم و ساختار

دataset GSM8K حاوی حدود ۸۵۰۰ مسئله است که به دو بخش تقسیم می‌شوند:

  • مجموعه آموزشی: ~۷۵۰۰ مسئله، که برای fine-tuning مدل‌ها در نظر گرفته شده‌اند. هر مسئله دارای یک راه‌حل گام‌به‌گام تفصیلی است.
  • مجموعه آزمایشی: ~۱۰۰۰ مسئله، که برای ارزیابی مستقل عملکرد مدل‌ها استفاده می‌شوند[1].

دشواری و محتوا

مسائل به گونه‌ای طراحی شده‌اند که یک دانش‌آموز مستعد مقطع متوسطه بتواند آن‌ها را حل کند، اما در عین حال نیازمند استدلال‌های چندمرحله‌ای هستند. این امر به جای سنجش دانش ریاضی مدل، توانایی آن در تجزیه مسئله و اجرای متوالی عملیات منطقی را به آزمون می‌گذارد.

تنوع زبانی

صورت‌بندی مسائل در GSM8K از تنوع زیادی در سبک‌ها و ساختارهای زبانی برخوردار است. این کار برای بررسی توانایی مدل‌ها در درک شرایط مسائل بیان‌شده به روش‌های مختلف و جلوگیری از «حفظ» الگوهای خاص انجام شده است[3].

تاریخچه و تکامل ارزیابی مدل‌ها

مدل‌های اولیه و نتایج پایه

در مقاله اصلی سال ۲۰۲۱، نویسندگان نشان دادند که حتی مدل‌های بزرگ آن زمان، مانند GPT-3 (۱۷۵ میلیارد پارامتر)، با این dataset با مشکلات قابل توجهی مواجه بودند. پس از fine-tuning و استفاده از یک مدل تأییدکننده کمکی، دقت حل مسائل تنها به حدود ۵۵٪ رسید[1]. این نتیجه نشان داد که یک خطای کوچک در زنجیره استدلال می‌تواند به پاسخ کاملاً اشتباه منجر شود.

روش‌های پیشگام: Chain-of-Thought

رویکرد «زنجیره استدلال» (Chain-of-Thought, CoT) نقطه عطفی در حل مسائل GSM8K بود. در سال ۲۰۲۲، پژوهشگران Google نشان دادند که اگر مدل را تشویق کنیم تا گام‌های حل را پیش از ارائه پاسخ به صراحت توضیح دهد، دقت به طور قابل توجهی افزایش می‌یابد. مدل PaLM (۵۴۰ میلیارد پارامتر) با استفاده از CoT به دقت ۵۸٪ دست یافت[4]. به‌کارگیری تکنیک پیچیده‌تر self-consistency (تولید چندین راه‌حل و انتخاب پاسخ متداول‌تر) دقت را تا ۷۴٪ ارتقا داد[4].

فراتر رفتن از سطح انسانی

از سال ۲۰۲۳ به بعد، جدیدترین مدل‌های مولد از سطح انسانی در این benchmark پیشی گرفتند.

  • GPT-4 از OpenAI در حالت few-shot CoT (زمانی که چند نمونه مسئله حل‌شده در prompt ارائه می‌شود) به دقت حدود ۹۲٪ رسید[5]، و با راهبردهای اضافی تا ۹۷٪[6].
  • Claude 2 از Anthropic نتیجه ۸۸٪ را نشان داد، و نسخه جدیدتر Claude 3 — حدود ۹۵٪[3].

چنین امتیازات بالایی نشان‌دهنده پیشرفت قابل توجه در توانایی‌های استدلالی LLM‌ها است، اما همچنین حاکی از آن است که GSM8K برای مدل‌های پیشرفته «تقریباً حل‌شده» می‌شود، که این امر توسعه benchmark‌های پیچیده‌تری مانند MATH و MMLU را تشویق می‌کند.

نقش در آموزش و توسعه مدل‌ها

علاوه بر ارزیابی، GSM8K به طور فعال برای آموزش و بهبود مدل‌ها استفاده می‌شود.

  • Fine-tuning (دقیق‌سازی): مجموعه آموزشی با راه‌حل‌های گام‌به‌گام منبع ارزشمندی برای fine-tuning مدل‌ها در منطق ریاضی است.
  • آموزش تأییدکننده‌ها: در مقاله اصلی OpenAI، بخشی از داده‌های GSM8K برای آموزش یک مدل تأییدکننده جداگانه استفاده شد که صحت راه‌حل‌های تولیدشده را ارزیابی می‌کرد. این رویکرد آموزش جداگانه مولد و منتقد کارایی خود را به اثبات رسانده است[1].
  • Prompt Engineering: وجود تعداد زیادی نمونه به پژوهشگران اجازه داده تکنیک‌های prompt را مانند Chain-of-Thought و Tree-of-Thought توسعه داده و تکمیل کنند، که مدل را بدون تغییر وزن‌هایش به استدلال وا می‌دارند.

پیوندها

  • صفحه dataset در Papers With Code
  • مخزن رسمی در GitHub

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [۱]
  2. «GSM8K Dataset». Papers With Code. [۲]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [۳]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [۴]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [۵]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [۶]