GSM8K (Grade School Math 8K) (FA)
GSM8K (Grade School Math 8K) — یک مجموعه داده مرجع است که حاوی حدود ۸٫۵ هزار مسئله متنی ریاضی در سطح مدرسه میباشد. این مجموعه در سال ۲۰۲۱ توسط پژوهشگران OpenAI برای ارزیابی و توسعه تواناییهای مدلهای زبانی بزرگ (LLM) در استدلالهای ریاضی چندمرحلهای ساخته شد[1]. GSM8K به یکی از benchmarkهای کلیدی برای اندازهگیری پیشرفت در حوزه تفکر ریاضی هوش مصنوعی تبدیل شده است.
هر مسئله در این dataset به صورت یک داستان متنی کوتاه است که حل آن نیازمند انجام ۲ تا ۸ عمل حسابی متوالی (جمع، تفریق، ضرب، تقسیم) میباشد. علیرغم سادگی ظاهری، این مسائل نیازمند درک عمیق متن و استدلال منطقی هستند که آنها را برای بسیاری از LLMها دشوار میسازد[2].
ویژگیهای کلیدی
حجم و ساختار
دataset GSM8K حاوی حدود ۸۵۰۰ مسئله است که به دو بخش تقسیم میشوند:
- مجموعه آموزشی: ~۷۵۰۰ مسئله، که برای fine-tuning مدلها در نظر گرفته شدهاند. هر مسئله دارای یک راهحل گامبهگام تفصیلی است.
- مجموعه آزمایشی: ~۱۰۰۰ مسئله، که برای ارزیابی مستقل عملکرد مدلها استفاده میشوند[1].
دشواری و محتوا
مسائل به گونهای طراحی شدهاند که یک دانشآموز مستعد مقطع متوسطه بتواند آنها را حل کند، اما در عین حال نیازمند استدلالهای چندمرحلهای هستند. این امر به جای سنجش دانش ریاضی مدل، توانایی آن در تجزیه مسئله و اجرای متوالی عملیات منطقی را به آزمون میگذارد.
تنوع زبانی
صورتبندی مسائل در GSM8K از تنوع زیادی در سبکها و ساختارهای زبانی برخوردار است. این کار برای بررسی توانایی مدلها در درک شرایط مسائل بیانشده به روشهای مختلف و جلوگیری از «حفظ» الگوهای خاص انجام شده است[3].
تاریخچه و تکامل ارزیابی مدلها
مدلهای اولیه و نتایج پایه
در مقاله اصلی سال ۲۰۲۱، نویسندگان نشان دادند که حتی مدلهای بزرگ آن زمان، مانند GPT-3 (۱۷۵ میلیارد پارامتر)، با این dataset با مشکلات قابل توجهی مواجه بودند. پس از fine-tuning و استفاده از یک مدل تأییدکننده کمکی، دقت حل مسائل تنها به حدود ۵۵٪ رسید[1]. این نتیجه نشان داد که یک خطای کوچک در زنجیره استدلال میتواند به پاسخ کاملاً اشتباه منجر شود.
روشهای پیشگام: Chain-of-Thought
رویکرد «زنجیره استدلال» (Chain-of-Thought, CoT) نقطه عطفی در حل مسائل GSM8K بود. در سال ۲۰۲۲، پژوهشگران Google نشان دادند که اگر مدل را تشویق کنیم تا گامهای حل را پیش از ارائه پاسخ به صراحت توضیح دهد، دقت به طور قابل توجهی افزایش مییابد. مدل PaLM (۵۴۰ میلیارد پارامتر) با استفاده از CoT به دقت ۵۸٪ دست یافت[4]. بهکارگیری تکنیک پیچیدهتر self-consistency (تولید چندین راهحل و انتخاب پاسخ متداولتر) دقت را تا ۷۴٪ ارتقا داد[4].
فراتر رفتن از سطح انسانی
از سال ۲۰۲۳ به بعد، جدیدترین مدلهای مولد از سطح انسانی در این benchmark پیشی گرفتند.
- GPT-4 از OpenAI در حالت few-shot CoT (زمانی که چند نمونه مسئله حلشده در prompt ارائه میشود) به دقت حدود ۹۲٪ رسید[5]، و با راهبردهای اضافی تا ۹۷٪[6].
- Claude 2 از Anthropic نتیجه ۸۸٪ را نشان داد، و نسخه جدیدتر Claude 3 — حدود ۹۵٪[3].
چنین امتیازات بالایی نشاندهنده پیشرفت قابل توجه در تواناییهای استدلالی LLMها است، اما همچنین حاکی از آن است که GSM8K برای مدلهای پیشرفته «تقریباً حلشده» میشود، که این امر توسعه benchmarkهای پیچیدهتری مانند MATH و MMLU را تشویق میکند.
نقش در آموزش و توسعه مدلها
علاوه بر ارزیابی، GSM8K به طور فعال برای آموزش و بهبود مدلها استفاده میشود.
- Fine-tuning (دقیقسازی): مجموعه آموزشی با راهحلهای گامبهگام منبع ارزشمندی برای fine-tuning مدلها در منطق ریاضی است.
- آموزش تأییدکنندهها: در مقاله اصلی OpenAI، بخشی از دادههای GSM8K برای آموزش یک مدل تأییدکننده جداگانه استفاده شد که صحت راهحلهای تولیدشده را ارزیابی میکرد. این رویکرد آموزش جداگانه مولد و منتقد کارایی خود را به اثبات رسانده است[1].
- Prompt Engineering: وجود تعداد زیادی نمونه به پژوهشگران اجازه داده تکنیکهای prompt را مانند Chain-of-Thought و Tree-of-Thought توسعه داده و تکمیل کنند، که مدل را بدون تغییر وزنهایش به استدلال وا میدارند.
پیوندها
- صفحه dataset در Papers With Code
- مخزن رسمی در GitHub
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [۱]
- ↑ «GSM8K Dataset». Papers With Code. [۲]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [۳]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [۴]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [۵]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [۶]