GSM8K (Grade School Math 8K) (TR)

From Systems analysis wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — ilkokul düzeyinde yaklaşık 8,5 bin metin tabanlı matematik problemi içeren bir referans dataset'idir. 2021 yılında OpenAI araştırmacıları tarafından, büyük dil modellerinin (LLM) çok adımlı matematiksel akıl yürütme yeteneklerini değerlendirmek ve geliştirmek amacıyla oluşturulmuştur[1]. GSM8K, yapay zekanın matematiksel düşünme alanındaki ilerlemeyi ölçen en önemli benchmark'lardan biri hâline gelmiştir.

Dataset'teki her problem, çözümü için 2 ile 8 arasında ardışık aritmetik işlem (toplama, çıkarma, çarpma, bölme) gerektiren kısa bir metin hikâyesinden oluşmaktadır. Görünüşteki basitliğine karşın bu problemler, derin metin anlama ve mantıksal akıl yürütme gerektirmekte; bu da birçok LLM için ciddi bir zorluk oluşturmaktadır[2].

Temel Özellikler

Hacim ve Yapı

GSM8K dataset'i yaklaşık 8500 problem içermekte olup iki bölüme ayrılmıştır:

  • Eğitim kümesi: Modellerin fine-tuning işlemi için tasarlanmış ~7500 problem. Her problem, ayrıntılı adım adım çözümle birlikte sunulmaktadır.
  • Test kümesi: Modellerin performansını bağımsız olarak değerlendirmek için kullanılan ~1000 problem[1].

Zorluk ve İçerik

Problemler, yetenekli bir ortaokul öğrencisinin çözebileceği şekilde tasarlanmış olmakla birlikte çok adımlı akıl yürütme gerektirmektedir. Bu sayede modelin matematiksel bilgisinden çok bir problemi parçalara ayırma ve mantıksal işlemleri sırayla uygulama becerisi test edilmektedir.

Dilsel Çeşitlilik

GSM8K'daki problem ifadeleri, geniş bir üslup ve dil yapısı çeşitliliğine sahiptir. Bu çeşitlilik; modellerin farklı biçimlerde ifade edilen problem koşullarını anlayıp anlayamadığını test etmek ve belirli kalıpları "ezberlemekten" kaçınmalarını sağlamak amacıyla bilinçli olarak tasarlanmıştır[3].

Model Değerlendirmesinin Tarihsel Gelişimi

Erken Modeller ve Temel Sonuçlar

2021 yılındaki özgün çalışmada araştırmacılar, dönemin büyük modelleri olan GPT-3 (175 milyar parametre) gibi modellerin bile bu dataset'te ciddi güçlükler yaşadığını göstermiştir. Fine-tuning uygulaması ve yardımcı bir doğrulayıcı model kullanıldıktan sonra dahi çözüm doğruluğu yalnızca yaklaşık %55 seviyesine ulaşabilmiştir[1]. Bu sonuç, akıl yürütme zincirindeki tek bir küçük hatanın tamamen yanlış bir cevaba yol açabileceğini ortaya koymuştur.

Çığır Açan Yöntemler: Chain-of-Thought

GSM8K problemlerinin çözümünde önemli bir atılım, «düşünce zinciri» (Chain-of-Thought, CoT) yaklaşımıyla gerçekleşmiştir. 2022 yılında Google araştırmacıları, modeli yanıtı vermeden önce çözüm adımlarını açıkça yazmaya yönlendirmenin doğruluğu önemli ölçüde artırdığını göstermiştir. CoT kullanılan PaLM modeli (540 milyar parametre) %58 doğruluk oranına ulaşmıştır[4]. Daha karmaşık bir teknik olan self-consistency (birden fazla çözüm üretip en sık görülen yanıtı seçme) uygulanmasıyla doğruluk %74'e yükseltilmiştir[4].

İnsan Düzeyinin Aşılması

2023 yılından itibaren en yeni üretken modeller, bu benchmark'ta insan düzeyini geride bırakmıştır.

  • OpenAI'ın GPT-4 modeli, few-shot CoT modunda (ipucunda birkaç çözülmüş problem örneği verildiğinde) yaklaşık %92 doğruluğa ulaşmış[5]; ek stratejilerle bu oran %97'ye çıkmıştır[6].
  • Anthropic'in Claude 2 modeli %88, daha yeni sürümü Claude 3 ise yaklaşık %95 sonuç elde etmiştir[3].

Bu yüksek sonuçlar, LLM'lerin akıl yürütme yeteneklerindeki kayda değer ilerlemeye işaret etmekle birlikte, GSM8K'nın önde gelen modeller için artık "neredeyse çözülmüş" bir hâl aldığına da dikkat çekmektedir. Bu durum, MATH ve MMLU gibi daha karmaşık benchmark'ların geliştirilmesini teşvik etmektedir.

Modellerin Eğitimindeki ve Gelişimindeki Rolü

GSM8K, değerlendirmenin ötesinde modellerin eğitimi ve iyileştirilmesi için de aktif biçimde kullanılmaktadır.

  • Fine-tuning (ince ayar): Adım adım çözümlerin yer aldığı eğitim kümesi, modellerin matematiksel mantık konusunda fine-tuning işlemi için değerli bir kaynaktır.
  • Doğrulayıcı Eğitimi: OpenAI'ın özgün çalışmasında GSM8K verilerinin bir kısmı, üretilen çözümlerin doğruluğunu değerlendiren ayrı bir doğrulayıcı model eğitmek için kullanılmıştır. Üretici ve eleştirmenin ayrı ayrı eğitildiği bu yaklaşım etkinliğini kanıtlamıştır[1].
  • Prompt Engineering: Çok sayıda örneğin varlığı, araştırmacıların modeli ağırlıklarını değiştirmeden akıl yürütmeye yönlendiren Chain-of-Thought ve Tree-of-Thought gibi ipucu tekniklerini geliştirip olgunlaştırmasına olanak tanımıştır.

Dış bağlantılar

  • Страница датасета на Papers With Code
  • Официальный репозиторий на GitHub

Kaynakça

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Notlar

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]