MM-RAG (Multimodal RAG) (BN)
MM-RAG (ইংরেজি Multimodal Retrieval-Augmented Generation) — এটি ক্লাসিক RAG প্যারাডাইমের একটি সম্প্রসারণ, যেখানে LLM উত্তর দেওয়ার জন্য শুধু টেক্সট নয়, ভিজ্যুয়াল ডেটাও (ছবি, ডায়াগ্রাম, টেবিল, গ্রাফিক্স) ব্যবহার করে। মাল্টিমোডাল retrieval বিভিন্ন উপস্থাপনায় প্রমাণ খুঁজে বের করতে এবং সংযুক্ত করতে সক্ষম, পৃষ্ঠার অংশ ও অঞ্চলের (bounding boxes) সাথে সুনির্দিষ্ট সংযোগসহ বাহ্যিক উৎসের উপর নির্ভর করে হ্যালুসিনেশনের ঝুঁকি কমায়[1][2]।
MM-RAG বিশেষভাবে এমন দলিলের জন্য উপকারী যেখানে অর্থের উল্লেখযোগ্য অংশ অ-পাঠ্য আকারে উপস্থাপিত (পৃষ্ঠার বিন্যাস, ডায়াগ্রাম, টেবিলের কাঠামো)। এই ধরনের ক্ষেত্রে ক্লাসিক টেক্সট RAG প্রায়ই গুরুত্বপূর্ণ প্রসঙ্গ উপাদান হারিয়ে ফেলে[3][4]।
প্রেক্ষাপট ও সমাধানযোগ্য সমস্যা
ক্লাসিক RAG টেক্সট প্যাসেজ নিয়ে কাজ করে এবং ভিজ্যুয়াল কাঠামো দেখতে পায় না (উপাদানের অবস্থান, চিত্রের ক্যাপশন, গ্রাফের অক্ষ)। MM-RAG এই ফাঁকগুলো পূরণ করে: কাঠামোগত উপাদান (টেক্সট, টেবিল, স্থানাঙ্কসহ ছবি) বের করে, সেগুলোকে ভেক্টর স্পেসে ইন্ডেক্স করে এবং বিভিন্ন modality থেকে প্রমাণ একত্রিত করে[5][6]।
MM-RAG আর্কিটেকচার
MM-RAG পাইপলাইন ক্লাসিক RAG-এ ভিজ্যুয়াল ডেটা প্রক্রিয়াকরণ ও modality সংযোজনের ধাপ যোগ করে: ইনজেস্ট → ইন্ডেক্সিং → মাল্টিমোডাল retrieval → একত্রীকরণ ও reranking → ট্রেসিং সহ জেনারেশন।
- সংগ্রহ ও প্রিপ্রসেসিং (Ingestion)। ইনপুটে PDF/স্ক্যান/ছবি আসে। জোন চিহ্নিত করতে OCR ও পৃষ্ঠার বিন্যাস বিশ্লেষণ করা হয়: অনুচ্ছেদ, শিরোনাম, টেবিল, ছবি এবং তাদের স্থানাঙ্ক। সাধারণ সরঞ্জামগুলো হল LayoutLM পরিবারের মডেল এবং LayoutParser টুল লাইব্রেরি; যাচাইকরণ ও প্রশিক্ষণ প্রায়ই PubLayNet ও DocLayNet dataset-এর উপর নির্ভর করে[7][8][9]।
- অঞ্চলে বিভাজন। ভিজ্যুয়াল অবজেক্ট (ডায়াগ্রাম, টেবিল, চিত্র, ক্যাপশন) বের করা হয়। উন্নত স্থিতিশীলতার জন্য OCR‑free মডেল (যেমন Donut) বা সংযুক্ত OCR+VLM পাইপলাইন ব্যবহার করা হয়[10]।
- ইন্ডেক্সিং (Vector Index)। টেক্সট chunk এবং ভিজ্যুয়াল উপাদান (ছবি বা তাদের বিবরণ) ভেক্টর উপস্থাপনায় রূপান্তরিত হয়ে ভেক্টর ডেটাবেসে যুক্ত হয়। একত্রিত text↔image স্পেসের জন্য CLIP বা SigLIP ব্যবহার করা হয়; প্রোডাকশনে মাল্টিমোডাল/মাল্টিভেক্টর ইন্ডেক্স সুবিধাজনক (একটি অবজেক্ট — একাধিক ভেক্টর)[6][11][12]।
- মাল্টিমোডাল retrieval ও reranking। টেক্সট এবং ভিজ্যুয়াল অনুসন্ধানের সমন্বয় করা হয়; প্রার্থীরা (অনুচ্ছেদ, টেবিল, ছবি/অঞ্চল) একত্রিত হয়ে আরও "ভারী" মডেল (cross-encoder/LLM-reranker) দ্বারা নির্ভুলতা বাড়াতে reranked হয়[13]।
- প্রসঙ্গ প্যাকেজিং ও জেনারেশন। নির্বাচিত অংশগুলো LLM/VLM-এ পাঠানো হয়। যদি মডেলটি মাল্টিমোডাল হয় (যেমন GPT‑4V/4o), ছবি সরাসরি পাঠানো যায়; টেক্সট LLM-এর ক্ষেত্রে ছবি আগেই বিস্তারিত বিবরণে রূপান্তরিত হয়[14][15]।
- ট্রেসিং ও উদ্ধৃতি। উত্তরে ক্লিকযোগ্য উদ্ধৃতি থাকে যা শুধু দলিল/পৃষ্ঠায় নয়, অঞ্চলেও (স্থানাঙ্কে) সংযুক্ত। এটি grounding স্তর ও ব্যবহারকারীর আস্থা বাড়ায়[2]।
মান মূল্যায়ন ও মেট্রিক
MM‑RAG-এর কার্যকারিতা নিষ্কাশন, retrieval ও জেনারেশন স্তরে মূল্যায়ন করা হয়।
- ভিজ্যুয়াল ডেটা নিষ্কাশনের মান। OCR নির্ভুলতা (WER/CER), DocLayNet/PubLayNet সেটে বিন্যাস বিশ্লেষণের মান (mAP/Precision/Recall)[8][7]।
- Retrieval-এর মান। তথ্য অনুসন্ধানের আদর্শ মেট্রিক: Recall@K, Precision@K, MRR; মাল্টিমোডালিটির জন্য — আলাদাভাবে modality অনুযায়ী এবং একত্রে।
- উত্তরের মান (end‑to‑end)। স্বয়ংক্রিয় faithfulness/groundedness মেট্রিক ও মানবিক মূল্যায়ন। ব্যবহারিকভাবে RAGAS/TruLens/DeepEval ফ্রেমওয়ার্ক প্রয়োগ করা হয়[16]।
- Benchmark।
- DocVQA: দলিলের ছবিতে প্রশ্ন[3]।
- TextVQA: ছবিতে টেক্সট পড়ার প্রয়োজন এমন প্রশ্ন[4]।
- InfographicVQA: ইনফোগ্রাফিক বিষয়ক প্রশ্ন[17]।
- ChartQA: যৌক্তিক বিশ্লেষণের প্রয়োজনীয় ডায়াগ্রাম বিষয়ক প্রশ্ন[18]।
- MMDocRAG: DocQA-এর জন্য মাল্টিমোডাল RAG benchmark (বহু-পৃষ্ঠার দলিল, cross-modal প্রমাণ শৃঙ্খল)[19]।
উপাদানের তুলনামূলক সারণি
| উপাদান | বাস্তবায়নের বিকল্প | সুবিধা | অসুবিধা / ঝুঁকি | কখন বেছে নেবেন |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / ক্লাউড API | স্থানীয় — গোপনীয়তা ও নিয়ন্ত্রণ; ক্লাউড — বাক্সের বাইরে উচ্চ নির্ভুলতা। | জটিল বিন্যাসে ত্রুটি; API — খরচ ও সম্মতির প্রয়োজনীয়তা। | ব্যক্তিগত ডেটা — স্থানীয় OCR; সর্বোচ্চ নির্ভুলতা — ক্লাউড (যদি অনুমোদিত)। |
| বিন্যাস বিশ্লেষণ | নিয়ম / ML‑মডেল (LayoutLM, LayoutParser) | নিয়ম একই ধরনের টেমপ্লেটের জন্য সহজ; ML — বৈচিত্র্যে স্থিতিশীল। | নিয়ম নতুন বিন্যাসে ব্যর্থ হয়; ML-এর জন্য সম্পদ/ডেটা প্রয়োজন। | একই ধরনের ফর্ম — নিয়ম; বৈচিত্র্যময় কর্পাস — ML। |
| ভেক্টরাইজেশন (ছবি) | CLIP / SigLIP / OCR‑free বিবরণ (Donut/Pix2Struct) | সাধারণ text↔image latent স্পেস (CLIP/SigLIP); OCR‑free OCR নির্ভরতা দূর করে। | CLIP ছবির ভেতরের টেক্সট পড়তে পারে না; বিবরণ অর্থ বিকৃত করতে পারে। | CLIP/SigLIP — মৌলিক মাল্টিমোডাল অনুসন্ধান; জটিল মানের স্ক্যানের জন্য OCR‑free। |
| ফলাফল একত্রীকরণ | স্কোর অনুযায়ী সাজানো / modality কোটা / LLM‑reranker | Reranker প্রসঙ্গ নির্বাচনের নির্ভুলতা উল্লেখযোগ্যভাবে বাড়ায়। | বিলম্ব ও খরচ বৃদ্ধি। | High‑precision পরিস্থিতি; সহজ পদ্ধতি — PoC-এর জন্য। |
| স্টোরেজ/ইন্ডেক্স | একক ভেক্টর / মাল্টিভেক্টর (text+image) / হাইব্রিড (BM25+vector) | মাল্টিভেক্টর একই অবজেক্টের বিভিন্ন উপস্থাপনা কভার করে; হাইব্রিড কীওয়ার্ড/কোড রক্ষা করে। | স্কিমা ও আপডেটের জটিলতা। | মিশ্র ডেটা ও কঠোর SLA সহ প্রোডাকশন সিস্টেম। |
ব্যবহারিক মন্তব্য
- হাইব্রিড অনুসন্ধান (BM25 + ভেক্টর) — নির্দিষ্ট পদ/কোডে সম্পূর্ণতা ও নির্ভুলতা বাড়াতে ডি ফ্যাক্টো মান[20]।
- Reranking cross-encoder/LLM দিয়ে জেনারেশনের আগে "আবর্জনা" প্রার্থী বাদ দিয়ে token সাশ্রয় করে[13]।
- আধুনিক VLM retriever (যেমন ColPali) পৃষ্ঠা-ছবির সরাসরি ইন্ডেক্সিংয়ের মাধ্যমে ভিজ্যুয়ালভাবে সমৃদ্ধ দলিলে সুবিধা দেখায়[21]।
সাহিত্য
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
আরও দেখুন
- Retrieval-Augmented Generation
- ভেক্টর ডেটাবেস
- Embedding
- GraphRAG
টীকা
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.