Multimodal large language models — โมเดลภาษาขนาดใหญ่แบบหลายโหมด
โมเดลภาษาขนาดใหญ่แบบหลายโหมด (อังกฤษ: Multimodal Large Language Models, MLLMs) คือกลุ่มของโมเดล AI ที่สามารถประมวลผลและสร้างข้อมูลในโหมดต่าง ๆ ได้ ทั้งข้อความ รูปภาพ เสียง และวิดีโอ[1] ต่างจากโมเดลภาษาแบบโหมดเดียวที่ทำงานกับข้อความเพียงอย่างเดียว MLLM รวมข้อมูลจากแหล่งต่าง ๆ เพื่อแก้ปัญหาการทำความเข้าใจและการสร้างเนื้อหาที่ซับซ้อน
แนวคิดหลักของ MLLM คือการสร้าง embedding เวกเตอร์เดียวสำหรับโหมดต่าง ๆ ซึ่งช่วยให้โมเดลสร้างความสัมพันธ์เชิงความหมายระหว่าง เช่น รูปภาพกับคำอธิบายข้อความของรูปภาพนั้น[2] ความก้าวหน้าสำคัญที่วางรากฐานให้กับ MLLM ยุคปัจจุบันคือการใช้การเรียนรู้แบบ contrastive เพื่อปรับแนวการแทนค่าทางภาพและข้อความในปริภูมิ feature ร่วมกัน ดังที่นำไปใช้ในโมเดล CLIP[3]
ประวัติการพัฒนา
ยุคแรก (2013–2020)
รากฐานแนวคิดของ AI แบบหลายโหมดถูกวางในปี 2013 เมื่อนักวิจัยจากมหาวิทยาลัย Stanford แสดงให้เห็นถึงความเป็นไปได้ของการเรียนรู้แบบ zero-shot learning โดยใช้การแทนค่าเวกเตอร์ของคำ[4] ในปี 2016 ทีม FAIR (Meta AI) แสดงให้เห็นถึงประสิทธิภาพของการใช้คำอธิบายภาษาธรรมชาติในการฝึกโมเดล computer vision โดยทำความแม่นยำได้ 11.5% บน ImageNet โดยไม่ต้องฝึกตรง ๆ[5]
ยุค CLIP (2021)
จุดเปลี่ยนสำคัญคือการเปิดตัวโมเดล CLIP (Contrastive Language-Image Pre-training) โดย OpenAI ในเดือนมกราคม 2021 โมเดลที่ฝึกด้วยคู่รูปภาพ-ข้อความ 400 ล้านคู่ แสดงให้เห็นความสามารถในการจำแนกรูปภาพโดยไม่ต้องฝึกเฉพาะทางสำหรับงานใดงานหนึ่ง CLIP กลายเป็นพื้นฐานสำหรับ MLLM ที่ตามมาอีกมากมาย[6]
การขยายขนาดและนวัตกรรม (2022–2024)
หลังจากความสำเร็จของ CLIP มีโมเดลสำคัญเกิดขึ้นมากมาย:
- Flamingo (DeepMind, 2022) — โมเดลขนาด 80 พันล้านพารามิเตอร์ที่แสดงความสามารถโดดเด่นในการเรียนรู้จากตัวอย่างจำนวนน้อย
- BLIP (Salesforce, 2022) — สถาปัตยกรรมแบบรวมศูนย์สำหรับการทำความเข้าใจและการสร้างเนื้อหา
- GPT-4V (OpenAI, 2023) — โมเดลหลายโหมดเชิงพาณิชย์โมเดลแรกในระดับนี้
- LLaVA (Microsoft, 2023) — ทางเลือกแบบโอเพนซอร์สที่ได้รับความนิยมแทน GPT-4V
- Gemini (Google, 2023) — สถาปัตยกรรมที่เป็นหลายโหมดโดยกำเนิด ออกแบบมาตั้งแต่ต้นเพื่อรองรับข้อมูลหลายประเภท
- GPT-4o (OpenAI, 2024) — โมเดลที่สามารถประมวลผลข้อความ เสียง และวิดีโอแบบ real-time ด้วย latency ต่ำ[1]
- Claude 3.5 Sonnet (Anthropic, 2024) — โมเดลที่มีความสามารถในการวิเคราะห์ข้อมูลทางภาพที่ดีขึ้น
แนวทางสถาปัตยกรรม
สถาปัตยกรรม Dual-Encoder
ใช้ encoder แยกสำหรับแต่ละโหมด ซึ่งฉายข้อมูลเข้าสู่ปริภูมิการแทนค่าร่วม ตัวแทนที่โดดเด่นคือ CLIP ซึ่ง visual transformer ประมวลผลรูปภาพและ text transformer ประมวลผลข้อมูลภาษา ข้อดีคือความเป็นโมดูลและประสิทธิภาพในการคำนวณ ข้อเสียคือการปฏิสัมพันธ์ข้ามโหมดที่จำกัด[7]
สถาปัตยกรรม Encoder-Decoder
Encoder เดียวประมวลผลอินพุตหลายโหมด และ decoder สร้างเอาต์พุตเป็นข้อความ โมเดล Flamingo ใช้กลไก Perceiver Resampler สำหรับประมวลผลอินพุตทางภาพที่มีความยาวแปรผัน และ layer attention ข้ามโหมด แนวทางนี้ให้การปฏิสัมพันธ์ระหว่างโหมดที่สมบูรณ์ยิ่งขึ้น แต่ต้องการทรัพยากรการคำนวณมากกว่า[8]
สถาปัตยกรรม Alignment
แนวทางนี้ใช้ encoder ที่ผ่านการ pre-training และแช่แข็งไว้ เชื่อมต่อผ่านโมดูล alignment ขนาดเล็กที่ฝึกได้ ตัวอย่างเช่น BLIP-2 ใช้ Q-Former (Querying Transformer) เป็นตัวเชื่อมขนาดเบาระหว่าง visual encoder ที่แช่แข็งกับโมเดลภาษา โดยต้องการพารามิเตอร์ที่ฝึกได้น้อยกว่าอย่างมีนัยสำคัญ[9]
โมเดลหลัก
GPT-4V / GPT-4o (OpenAI)
ตระกูลโมเดล GPT-4 ประเมินว่ามีพารามิเตอร์สูงถึง 1.8 ล้านล้าน (ในสถาปัตยกรรม mixture of experts) โมเดล GPT-4o ที่เปิดตัวในเดือนพฤษภาคม 2024 รองรับการประมวลผลข้อความ รูปภาพ เสียง และวิดีโอแบบ real-time บน benchmark MMMU ทำความแม่นยำได้ 69.1%[10]
Gemini (Google)
สถาปัตยกรรมที่เป็นหลายโหมดโดยกำเนิด ฝึกตั้งแต่ต้นด้วยข้อความ รูปภาพ เสียง และวิดีโอ Gemini 1.5 Pro รองรับ context window สูงถึง 10 ล้าน token และเหนือกว่า GPT-4 ใน 30 จาก 32 benchmark ยอดนิยม[11]
Claude 3 (Anthropic)
ตระกูลโมเดล (Haiku, Sonnet, Opus) ที่มี context window สูงถึง 200,000 token Claude 3 Opus ทำคะแนน 58.5% บน benchmark MMMU เพื่อเพิ่มความปลอดภัยของโมเดล ใช้แนวทาง Constitutional AI[12]
LLaVA (โมเดลโอเพนซอร์ส)
ผสมผสาน visual encoder CLIP เข้ากับโมเดลภาษา Vicuna มีรุ่นให้เลือกที่มี 7, 13 และ 34 พันล้านพารามิเตอร์ โมเดลทำประสิทธิภาพได้ 85.1% เทียบกับ GPT-4 บนงานสังเคราะห์[13]
ด้านการประยุกต์ใช้
- การถาม-ตอบด้วยภาพ (VQA): ช่วยให้ผู้ใช้สามารถถามคำถามเกี่ยวกับเนื้อหาทางภาพได้
- การวิเคราะห์เอกสาร: MLLM ยุคใหม่สามารถประมวลผลได้สูงถึง 2,000 หน้าต่อนาที
- การสร้างภาพทางการแพทย์: โมเดลอย่าง Med-PaLM M (Google) วิเคราะห์รูปภาพทางการแพทย์และข้อมูลทางคลินิก
- หุ่นยนต์: โมเดลอย่าง RT-2 (Google DeepMind) ช่วยให้หุ่นยนต์เข้าใจสภาพแวดล้อมทางภาพและปฏิบัติตามคำสั่งในภาษาธรรมชาติได้
ข้อจำกัดในปัจจุบัน
- Hallucination: อัตรา hallucination ในเนื้อหาที่สร้างขึ้นประเมินอยู่ที่ 27–46% โมเดลอาจอธิบายวัตถุที่ไม่มีอยู่จริงหรือตีความข้อมูลทางภาพผิดพลาด[14]
- ความต้องการการคำนวณสูง: การฝึกและการใช้งาน MLLM ต้องการโครงสร้างพื้นฐานด้านการคำนวณที่มีนัยสำคัญ
- อคติในข้อมูล: การมีตัวแทนไม่เพียงพอของกลุ่มประชากร ภาษา และวัฒนธรรมในข้อมูลการฝึกนำไปสู่ข้อผิดพลาดเชิงระบบ
ลิงก์
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
เอกสารอ้างอิง
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
หมายเหตุ
- ↑ 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
- ↑ «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
- ↑ Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
- ↑ DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
- ↑ «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
- ↑ «Understanding CLIP». Stanford CS231n. [6]
- ↑ «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
- ↑ «The Architectures of Multimodal Language Models». Determined AI. [8]
- ↑ «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
- ↑ «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
- ↑ «Google Gemini: A Deep Dive». DaveAI Blog. [11]
- ↑ «Introducing the Claude 3 Family». Anthropic. [12]
- ↑ Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
- ↑ «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]