BIG-bench (benchmark) (TH)

From Systems analysis wiki
Jump to navigation Jump to search

BIG-bench (ตัวย่อจากภาษาอังกฤษ Beyond the Imitation Game benchmark) — คือชุดงานขนาดใหญ่ (benchmark) ที่สร้างขึ้นเพื่อประเมินความสามารถและขีดจำกัดของโมเดลภาษาขนาดใหญ่ (LLM) โครงการนี้พัฒนาขึ้นในปี ค.ศ. 2021–2022 โดยความร่วมมือของนักวิจัยกว่า 450 คนจาก 132 องค์กร ภายใต้การดูแลของ Google[1]

Benchmark นี้ประกอบด้วย งาน 204 รายการที่หลากหลาย ครอบคลุมสาขาที่กว้างขวาง ได้แก่ ภาษาศาสตร์ คณิตศาสตร์ การเขียนโปรแกรม สามัญสำนึก ชีววิทยา ฟิสิกส์ และการประเมินอคติทางสังคม เป้าหมายหลักของ BIG-bench คือการก้าวข้าม "การเล่นเกมเลียนแบบ" (ทดสอบแบบทัวริง) และทดสอบโมเดลด้วยงานที่ถือว่ายากหรือแก้ไม่ได้สำหรับสถาปัตยกรรมที่มีอยู่ในปัจจุบัน Benchmark นี้มีจุดประสงค์ไม่เพียงแค่วัดความสามารถในปัจจุบัน แต่ยังเพื่อคาดการณ์ความสามารถในอนาคตตามการขยายขนาดของโมเดล[2]

การพัฒนาและโครงสร้าง

ผู้ริเริ่มสร้าง BIG-bench คือกลุ่มนักวิจัยจาก Google ซึ่งจัดให้มีการรวบรวมงานแบบเปิดจากชุมชนวิทยาศาสตร์ ผลลัพธ์ที่ได้คือชุดงานสุดท้ายประกอบด้วย 204 งานจากทีมอิสระหลายสิบทีม แต่ละงานได้รับการออกแบบให้เป็นความท้าทายสำหรับ LLM และมีรูปแบบและเมตริกการประเมินเป็นของตนเอง (เช่น ความแม่นยำของการเลือก การประเมินคำตอบที่สร้างขึ้นอย่างอิสระ)

งานมีตั้งแต่คำถามเชิงวิชาการมาตรฐานไปจนถึงปริศนาที่ไม่ธรรมดา เช่น:

  • การแก้ปัญหาทางคณิตศาสตร์และตรรกะ
  • การทำความเข้าใจลำดับอีโมจิ
  • การแก้ปัญหาหมากรุกจากคำอธิบายเป็นข้อความ
  • การระบุอคติทางสังคมในคำตอบของโมเดล

Benchmark ทั้งหมดและโค้ดของมันเปิดเผยต่อสาธารณะบน GitHub ซึ่งช่วยให้นักวิจัยสามารถทดสอบโมเดลใหม่และเสนองานเพิ่มเติมได้[3]

การประเมินโมเดลและระดับพื้นฐานของมนุษย์

ในงานวิจัยต้นฉบับปี ค.ศ. 2022 ได้มีการทดสอบโมเดลในวงกว้าง รวมถึงตระกูล GPT จาก OpenAI และโมเดลแบบหนาแน่นและกระจายจาก Google เช่น PaLM และ Switch Transformers

เพื่อเปรียบเทียบผลลัพธ์ ได้มีการกำหนด ระดับพื้นฐานของมนุษย์ ผู้ประเมินที่เชี่ยวชาญทำงานทั้งหมดโดยใช้ทรัพยากรที่มีอยู่ มีการกำหนดตัวชี้วัดสองตัว:

  • ผลลัพธ์เฉลี่ยของผู้เชี่ยวชาญ: ประมาณ 45/100 ในการปรับมาตรฐานแบบมีเงื่อนไข
  • ผลลัพธ์ที่ดีที่สุดของผู้เชี่ยวชาญ: ประมาณ 80/100 (เมื่อผู้เชี่ยวชาญอย่างน้อยหนึ่งคนแก้ปัญหาได้อย่างเหมาะสมที่สุด)

แม้แต่โมเดลที่ใหญ่ที่สุดในยุคนั้นก็ยังด้อยกว่ามนุษย์อย่างมีนัยสำคัญ ตัวอย่างเช่น โมเดลที่ดีที่สุดในบรรดาโมเดลเหล่านั้น (รวมถึง GPT-3) ทำได้เพียงประมาณ 15/100 คะแนน ซึ่งเน้นให้เห็นถึงความยากของงานและศักยภาพอันมากในการก้าวหน้าต่อไป[1]

ผลลัพธ์และข้อสรุปสำคัญ

การวิเคราะห์ผลลัพธ์บน BIG-bench เผยให้เห็นรูปแบบสำคัญหลายประการ:

  1. ผลกระทบของขนาด ความแม่นยำของโมเดลเพิ่มขึ้นตามจำนวนพารามิเตอร์ที่เพิ่มขึ้นในเกือบทุกหมวดหมู่งาน
  2. ความสามารถแบบ emergent ในงานหลายรายการ ประสิทธิภาพของโมเดลอยู่ในระดับการเดาสุ่มเป็นเวลานาน แต่หลังจากถึงขนาด "วิกฤต" ที่กำหนด จะเกิดการกระโดดขึ้นอย่างรวดเร็วของคุณภาพ ปรากฏการณ์นี้เรียกว่า emergent behavior
  3. อคติทางสังคม (bias) เมื่อขนาดโมเดลเพิ่มขึ้น ระดับการแสดงออกของอคติทางสังคมที่เรียนรู้มาจากข้อมูลการฝึกอาจเพิ่มขึ้นด้วย อย่างไรก็ตาม มีการแสดงให้เห็นว่าการกำหนดคำถามที่ถูกต้อง (prompting) สามารถลดผลกระทบนี้ได้

วิวัฒนาการของ Benchmark

เมื่อโมเดลมีความสามารถมากขึ้น งานบางอย่างใน BIG-bench เริ่มไม่ท้าทายอีกต่อไป สิ่งนี้นำไปสู่การสร้างชุดย่อยที่ยากยิ่งขึ้น

Big-bench Hard (BBH)

ในปี ค.ศ. 2022 นักวิจัยได้แยก งาน 23 รายการที่ยากที่สุด ซึ่งโมเดลทั้งหมดในตอนแรกด้อยกว่าระดับเฉลี่ยของมนุษย์ ชุดนี้ได้รับชื่อว่า BIG-bench Hard (BBH) การทดลองแสดงให้เห็นว่าการใช้เทคนิค Chain-of-Thought (CoT) — เมื่อโมเดลสร้างห่วงโซ่การใช้เหตุผลก่อนตอบ — ช่วยเพิ่มประสิทธิภาพอย่างรวดเร็ว ด้วย CoT โมเดล PaLM (540 พันล้านพารามิเตอร์) สามารถเอาชนะผลลัพธ์เฉลี่ยของมนุษย์ใน 10 จาก 23 งาน และ Codex (เวอร์ชัน GPT-3) ใน 17 จาก 23 งาน[4]

Big-bench Extra Hard (BBEH)

เมื่อถึงปี ค.ศ. 2024 เมื่อแม้แต่งานจาก BBH ก็เริ่มได้รับการแก้ไขโดยโมเดลขั้นสูง จึงมีการเสนอขั้นตอนถัดไป — BIG-bench Extra Hard (BBEH) ผู้เขียนจาก DeepMind แทนที่แต่ละงานจาก 23 งานของ BBH ด้วยงานใหม่ที่คล้ายคลึงกันในประเภทการใช้เหตุผล แต่ยากกว่าอย่างมีนัยสำคัญ[5] การทดสอบเบื้องต้นบน BBEH แสดงให้เห็นว่าแม้แต่ LLM ที่ทรงพลังที่สุดในปัจจุบันก็ยังห่างไกลจากการแก้ปัญหาเหล่านี้ ซึ่งสร้างความท้าทายระยะยาวสำหรับโมเดลในอนาคต

Big-bench Lite (BBL)

สำหรับการทดสอบที่รวดเร็วและใช้ทรัพยากรน้อยกว่า จึงได้สร้างเวอร์ชันที่เบาลง — BIG-bench Lite (BBL) ซึ่งเป็นตัวอย่างของ 24 งาน ที่สะท้อนความหลากหลายของชุดงานเต็ม BBL ช่วยให้นักพัฒนาสามารถประเมินโมเดลของตนได้อย่างรวดเร็วและเปรียบเทียบบนลีดเดอร์บอร์ดสาธารณะ

ลิงก์

  • คลังข้อมูลอย่างเป็นทางการของ BIG-bench บน GitHub
  • หน้า BIG-bench บน Papers With Code

เอกสารอ้างอิง

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

หมายเหตุ

  1. 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [1]
  2. «BIG-Bench: The New Benchmark for Language Models». Deepgram. [2]
  3. «google/BIG-bench». GitHub. [3]
  4. Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [4]
  5. Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [5]