WinoGrande Benchmark (DE)

From Systems analysis wiki
Jump to navigation Jump to search

WinoGrande ist ein umfangreicher Benchmark-Datensatz, der entwickelt wurde, um die Fähigkeit von Systemen der künstlichen Intelligenz zum logischen Schließen auf Basis von gesundem Menschenverstand (Common-Sense-Reasoning) zu bewerten. Er enthält etwa 44.000 Aufgaben, die auf dem Format der Winograd Schema Challenge (WSC) basieren, jedoch durch eine „adversarielle“ Filterungsmethode erheblich erweitert und erschwert wurden, um statistische Hinweise zu eliminieren[1].

Der Datensatz wurde 2019 von einer Forschergruppe des Allen Institute for AI und der University of Washington entwickelt. Jede Aufgabe besteht aus einem Satz mit einer Lücke, die mit einer von zwei Optionen gefüllt werden muss, wobei die richtige Wahl auf der Grundlage des Kontexts und des Situationsverständnisses getroffen werden muss. WinoGrande hat sich zu einem der wichtigsten Benchmarks im Bereich der Verarbeitung natürlicher Sprache (NLP) entwickelt[2].

Hintergrund der Entwicklung: Die Veralterung des WSC

Die ursprüngliche Winograd Schema Challenge (WSC), die 2011 vorgeschlagen wurde, umfasste nur 273 Aufgaben und galt lange Zeit als zuverlässiger Test für gesunden Menschenverstand. Die Aufgaben waren so konzipiert, dass sie ein Verständnis der Welt erforderten und nicht nur einen einfachen Wortabgleich[3].

Mit dem Aufkommen großer Sprachmodelle auf Basis der Transformer-Architektur, wie z. B. BERT, änderte sich die Situation jedoch in den Jahren 2018–2019. Die Modelle lernten, den Test zu „knacken“, indem sie eine Genauigkeit von etwa 90 % erreichten, indem sie unbeabsichtigte statistische Regelmäßigkeiten (Artefakte) in den Daten ausnutzten, anstatt ein echtes Verständnis zu zeigen[4]. Der WSC war kein verlässlicher Indikator mehr, was zur Notwendigkeit führte, einen neuen, komplexeren und umfangreicheren Benchmark zu schaffen – WinoGrande.

Entwicklung und die Methode des Adversarial Filtering

Die Erstellung von WinoGrande erfolgte in zwei Hauptphasen: der massenhaften Generierung von Aufgaben und deren anschließender Filterung.

Crowdsourcing

In der ersten Phase wurde über die Plattform Amazon Mechanical Turk eine große Datenbank mit über 47.000 Sätzen gesammelt. Die Crowdworker erstellten Satzpaare nach dem Winograd-Schema, was für sprachliche Vielfalt und das für die natürliche Sprache typische „Rauschen“ sorgte, im Gegensatz zu Aufgaben, die von einer kleinen Expertengruppe verfasst wurden[1].

Der AfLite-Algorithmus

Die zentrale Innovation von WinoGrande war der AfLite-Algorithmus (Adversarial Filtering Lite). Diese Methode wurde entwickelt, um Aufgaben automatisch auszusortieren, die mit einfachen statistischen Hinweisen gelöst werden können, ohne dass gesunder Menschenverstand erforderlich ist. Der Algorithmus verwendete einfache Modelle, um jene Beispiele zu identifizieren und zu entfernen, bei denen eine der Antworten zu offensichtlich mit anderen Wörtern im Satz verbunden war. Zum Beispiel würde die Aufgabe „Die Löwen fraßen die Zebras, weil sie Raubtiere sind“ herausgefiltert, da das Wort „Raubtiere“ statistisch stark mit „Löwen“ assoziiert ist.

Durch die Filterung wurden etwa 14 % der gesammelten Daten verworfen. Die endgültige Version des Datensatzes umfasst 43.972 Aufgaben, was ihn zu einem deutlich zuverlässigeren und anspruchsvolleren Test macht[1].

Modellergebnisse und Fortschritte

Bei der Veröffentlichung von WinoGrande zeigten die damals besten Modelle Ergebnisse, die deutlich unter den menschlichen Leistungen lagen.

  • RoBERTa (eine verbesserte Version von BERT) erreichte eine Genauigkeit von ~79 %.
  • Ein Mensch löst die Aufgaben im Durchschnitt mit einer Genauigkeit von ~94 %[1].

Diese Lücke bestätigte, dass die AfLite-Filterung viele „einfache“ Lösungswege für die Modelle erfolgreich beseitigt hatte. Mit der Entwicklung von LLMs begann sich dieser Abstand jedoch zu verringern.

  • Bis 2022 erreichte das Modell ST-MoE-32B eine Genauigkeit von 96,1 % und übertraf damit das menschliche Niveau[5].
  • GPT-3 zeigte ein Ergebnis von etwa 88 %[6].
  • GPT-4 löst die Aufgaben ohne spezielles Fine-Tuning mit einer Genauigkeit von ~87,5 %[7].

Einfluss und Kritik

WinoGrande hat sich zu einem der wichtigsten Benchmarks für die Bewertung des gesunden Menschenverstandes entwickelt und wird regelmäßig zum Testen neuer Modelle verwendet. Seine Ergebnisse werden in den technischen Berichten führender KI-Unternehmen und auf Plattformen zum Modellvergleich veröffentlicht[8].

Gleichzeitig ist die Methode zur Erstellung des Datensatzes Gegenstand wissenschaftlicher Diskussionen geworden. Einige Forscher merken an, dass massenhaftes Crowdsourcing zur Entstehung unnatürlicher oder mehrdeutiger Formulierungen geführt haben könnte. Es wurden auch Zweifel geäußert, ob die automatische Filterung durch AfLite alle versteckten Artefakte vollständig beseitigen kann[5]. Dennoch hat WinoGrande nicht nur den Fortschritt bei den Metriken, sondern auch eine wichtige Diskussion über die Entwicklung robusterer und zuverlässigerer Methoden zur Bewertung von KI angeregt.

Literatur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Einzelnachweise

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]