Multimodal large language models — ملٹی موڈل بڑے زبانی ماڈل
ملٹی موڈل بڑے زبانی ماڈل (انگریزی: Multimodal Large Language Models, MLLMs) — یہ مصنوعی ذہانت کے ماڈلوں کا ایک ایسا طبقہ ہے جو مختلف modalities میں معلومات کو پروسیس اور تخلیق کرنے کی صلاحیت رکھتا ہے، جن میں متن، تصاویر، آڈیو اور ویڈیو شامل ہیں[1]۔ یونی موڈل زبانی ماڈلوں کے برعکس، جو صرف متن کے ساتھ کام کرتے ہیں، MLLM مختلف ذرائع سے معلومات کو یکجا کر کے مواد کی سمجھ اور تخلیق کے پیچیدہ مسائل حل کرتے ہیں۔
MLLM کا بنیادی تصور مختلف modalities کے لیے ایک مشترکہ embedding تیار کرنا ہے۔ اس سے ماڈل کو مثلاً کسی تصویر اور اس کی متنی تفصیل کے درمیان معنوی روابط قائم کرنے میں مدد ملتی ہے[2]۔ جدید MLLM کی بنیاد رکھنے والی اہم پیش رفت contrastive learning کا استعمال تھی، جو بصری اور متنی representations کو مشترکہ feature space میں ہم آہنگ کرتی ہے، جیسا کہ CLIP ماڈل میں نافذ کیا گیا[3]۔
تاریخی ارتقاء
ابتدائی دور (2013–2020)
ملٹی موڈل AI کی نظریاتی بنیادیں 2013 میں رکھی گئیں، جب Stanford کے محققین نے لفظی vector representations کے استعمال سے zero-shot learning کی صلاحیت ظاہر کی[4]۔ 2016 میں FAIR (Meta AI) کی ٹیم نے یہ ثابت کیا کہ کمپیوٹر وژن ماڈلوں کی تربیت کے لیے قدرتی زبان کی تفصیلات کا استعمال مؤثر ہے، اور براہ راست تربیت کے بغیر ImageNet پر 11.5 فیصد درستگی حاصل کی[5]۔
CLIP کا دور (2021)
جنوری 2021 میں OpenAI کی جانب سے CLIP (Contrastive Language-Image Pre-training) ماڈل کا اجراء ایک انقلابی لمحہ ثابت ہوا۔ یہ ماڈل 40 کروڑ تصویر-متن جوڑوں پر تربیت یافتہ تھا اور اس نے مخصوص کاموں پر خصوصی تربیت کے بغیر تصاویر کی درجہ بندی کی صلاحیت ظاہر کی۔ CLIP بعد کے بہت سے MLLM کی بنیاد بنی[6]۔
توسیع اور جدت (2022–2024)
CLIP کی کامیابی کے بعد متعدد اہم ماڈل سامنے آئے:
- Flamingo (DeepMind، 2022) — 80 ارب پیرامیٹرز والا ماڈل جس نے کم مثالوں سے سیکھنے میں غیر معمولی صلاحیتیں ظاہر کیں۔
- BLIP (Salesforce، 2022) — سمجھ اور تخلیق کے لیے یکساں architecture۔
- GPT-4V (OpenAI، 2023) — اس پیمانے کا پہلا تجارتی ملٹی موڈل ماڈل۔
- LLaVA (Microsoft، 2023) — GPT-4V کا مقبول اوپن سورس متبادل۔
- Gemini (Google، 2023) — مقامی طور پر ملٹی موڈل architecture، جو ابتدا ہی سے مختلف اقسام کے ڈیٹا کے ساتھ کام کرنے کے لیے ڈیزائن کی گئی۔
- GPT-4o (OpenAI، 2024) — ماڈل جو کم تاخیر کے ساتھ متن، آڈیو اور ویڈیو کو حقیقی وقت میں پروسیس کر سکتا ہے[1]۔
- Claude 3.5 Sonnet (Anthropic، 2024) — بصری معلومات کے تجزیے میں بہتر صلاحیتوں والا ماڈل۔
آرکیٹیکچرل طریقے
دوہرا encoder آرکیٹیکچر (Dual-Encoder)
یہ ہر modality کے لیے الگ encoders استعمال کرتا ہے جو ڈیٹا کو مشترکہ representation space میں project کرتے ہیں۔ اس کی نمایاں مثال CLIP ہے، جہاں visual transformer تصاویر کو پروسیس کرتا ہے اور متنی transformer زبانی ڈیٹا کو۔ اس کے فوائد میں modularity اور حسابی کارکردگی شامل ہیں، جبکہ خامی محدود cross-modal تعامل ہے[7]۔
encoder-decoder آرکیٹیکچر
ایک واحد encoder ملٹی موڈل ان پٹ کو پروسیس کرتا ہے، اور decoder متنی آؤٹ پٹ تیار کرتا ہے۔ Flamingo ماڈل متغیر لمبائی کے بصری ان پٹس کی پروسیسنگ کے لیے Perceiver Resampler میکانزم اور cross-modal attention layers استعمال کرتا ہے۔ یہ طریقہ کار بھرپور inter-modal تعامل فراہم کرتا ہے، لیکن زیادہ حسابی وسائل کا تقاضا کرتا ہے[8]۔
Alignment آرکیٹیکچر
یہ طریقہ جمی ہوئی (frozen) پری ٹرینڈ encoders استعمال کرتا ہے جو ایک چھوٹے قابل تربیت alignment ماڈیول کے ذریعے جڑے ہوتے ہیں۔ مثلاً BLIP-2 ایک جمے ہوئے visual encoder اور زبانی ماڈل کے درمیان ہلکے رابطے کے طور پر Q-Former (Querying Transformer) استعمال کرتا ہے، جس میں قابل تربیت پیرامیٹرز نمایاں طور پر کم ہوتے ہیں[9]۔
اہم ماڈل
GPT-4V / GPT-4o (OpenAI)
GPT-4 ماڈلوں کے خاندان میں تخمیناً 1.8 ٹریلین پیرامیٹرز ہیں (mixture of experts architecture میں)۔ مئی 2024 میں جاری کیا گیا GPT-4o ماڈل متن، تصاویر، آڈیو اور ویڈیو کو حقیقی وقت میں پروسیس کرنے کی صلاحیت رکھتا ہے۔ MMMU benchmark پر یہ 69.1 فیصد درستگی حاصل کرتا ہے[10]۔
Gemini (Google)
مقامی طور پر ملٹی موڈل architecture، جو متن، تصاویر، آڈیو اور ویڈیو پر صفر سے تربیت یافتہ ہے۔ Gemini 1.5 Pro 10 ملین tokens تک کی context window کی حمایت کرتا ہے اور 32 مقبول benchmarks میں سے 30 پر GPT-4 سے بہتر کارکردگی دکھاتا ہے[11]۔
Claude 3 (Anthropic)
ماڈلوں کا خاندان (Haiku، Sonnet، Opus) جس کی context window 200,000 tokens تک ہے۔ Claude 3 Opus MMMU benchmark پر 58.5 فیصد نتیجہ دکھاتا ہے۔ حفاظت بڑھانے کے لیے Constitutional AI طریقہ استعمال کیا جاتا ہے[12]۔
LLaVA (اوپن ماڈل)
CLIP کے visual encoder کو Vicuna زبانی ماڈل کے ساتھ ملاتا ہے۔ 7، 13 اور 34 ارب پیرامیٹرز کے ورژن دستیاب ہیں۔ ماڈل مصنوعی کاموں پر GPT-4 کی نسبتی کارکردگی کا 85.1 فیصد حاصل کرتا ہے[13]۔
استعمال کے شعبے
- بصری سوال و جواب (VQA): صارفین کو بصری مواد کے بارے میں سوالات پوچھنے کی سہولت دیتا ہے۔
- دستاویزات کا تجزیہ: جدید MLLM فی منٹ 2000 صفحات تک پروسیس کرنے کی صلاحیت رکھتے ہیں۔
- طبی تصویر کشی: Med-PaLM M (Google) جیسے ماڈل طبی تصاویر اور طبی ڈیٹا کا تجزیہ کرتے ہیں۔
- روبوٹکس: RT-2 (Google DeepMind) جیسے ماڈل روبوٹس کو بصری ماحول سمجھنے اور قدرتی زبان میں دی گئی ہدایات پر عمل کرنے کے قابل بناتے ہیں۔
موجودہ حدود
- Hallucinations: تخلیق کردہ مواد میں hallucinations کی شرح 27 سے 46 فیصد تک آنکی جاتی ہے۔ ماڈل غیر موجود اشیاء کو بیان کر سکتے ہیں یا بصری معلومات کو غلط طریقے سے تشریح کر سکتے ہیں[14]۔
- زیادہ حسابی تقاضے: MLLM کی تربیت اور استعمال کے لیے وسیع حسابی بنیادی ڈھانچے کی ضرورت ہوتی ہے۔
- ڈیٹا کا تعصب: تربیتی ڈیٹا میں آبادیاتی گروہوں، زبانوں اور ثقافتوں کی ناکافی نمائندگی منظم غلطیوں کا سبب بنتی ہے۔
روابط
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
ادب
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
حواشی
- ↑ 1.0 1.1 «A Comprehensive Guide to Multimodal LLMs». Encord Blog. [1]
- ↑ «A Survey on Multimodal Large Language Models». ACM Computing Surveys. [2]
- ↑ Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». arXiv:2103.00020. [3]
- ↑ DeOldify, J. «Zero-Shot Learning by Predicting Attributes». arXiv:1312.5650. [4]
- ↑ «Learning from captions: A milestone in visual language understanding». OpenAI Blog. [5]
- ↑ «Understanding CLIP». Stanford CS231n. [6]
- ↑ «Multimodal LLMs: The Complete Guide». Viso.ai. [7]
- ↑ «The Architectures of Multimodal Language Models». Determined AI. [8]
- ↑ «Understanding BLIP-2: The New Vision-Language Model». Clarifai Blog. [9]
- ↑ «MMMU: A New Benchmark for Multimodal LLMs». Encord Blog. [10]
- ↑ «Google Gemini: A Deep Dive». DaveAI Blog. [11]
- ↑ «Introducing the Claude 3 Family». Anthropic. [12]
- ↑ Liu, H., et al. «Visual Instruction Tuning». arXiv:2304.08485. [13]
- ↑ «Hallucinations in Multimodal Large Language Models». arXiv:2308.08726. [14]