MM-RAG (Multimodal RAG) (FA)
MM-RAG (به انگلیسی: Multimodal Retrieval-Augmented Generation) — گسترشی از پارادایم کلاسیک RAG است که در آن LLM برای پاسخدهی نهتنها از متن، بلکه از دادههای بصری (تصاویر، نمودارها، جداول، گرافها) نیز بهره میبرد. بازیابی چندوجهی امکان یافتن و پیوند شواهد در قالبهای مختلف را فراهم میکند و با تکیه بر منابع خارجی با انتساب دقیق به بخشهای صفحات و نواحی (bounding boxes)، خطر توهمزایی را کاهش میدهد[1][2].
MM-RAG بهویژه برای اسنادی مفید است که بخش قابلتوجهی از معنای آنها به شکل غیرمتنی ارائه شده است (چیدمان صفحه، نمودارها، ساختار جداول). در چنین مواردی، RAG متنی کلاسیک اغلب عناصر مهم زمینه را از دست میدهد[3][4].
زمینه و مسئلهای که حل میشود
RAG کلاسیک با گذرهای متنی کار میکند و ساختارهای بصری را نمیبیند (موقعیت عناصر، زیرنویس شکلها، محورهای نمودار). MM-RAG این شکافها را پر میکند: عناصر ساختاریافته (متن، جداول، تصاویر با مختصات) را استخراج میکند، آنها را در فضای برداری ایندکس میکند و شواهد از وجههای مختلف را ترکیب مینماید[5][6].
معماری MM-RAG
پایپلاین MM-RAG مراحل پردازش دادههای بصری و همراستاسازی وجهها را به RAG کلاسیک میافزاید: ورودی → ایندکسگذاری → بازیابی چندوجهی → ادغام و رتبهبندی مجدد → تولید با ردیابی.
- جمعآوری و پیشپردازش (Ingestion). ورودی شامل PDF/اسکن/تصاویر است. OCR و تحلیل چیدمان صفحه برای تشخیص نواحی انجام میشود: پاراگرافها، عنوانها، جداول، تصاویر و مختصات آنها. ابزارهای رایج شامل مدلهای خانواده LayoutLM و کتابخانههای ابزاری LayoutParser هستند؛ اعتبارسنجی و آموزش اغلب بر datasetهای PubLayNet و DocLayNet متکی است[7][8][9].
- تقسیمبندی به نواحی. اشیاء بصری (نمودارها، جداول، تصاویر، زیرنویسها) استخراج میشوند. برای پایداری بیشتر، مدلهای بدون OCR (مانند Donut) یا پایپلاینهای ترکیبی OCR+VLM به کار میروند[10].
- ایندکسگذاری (Vector Index). تکههای متنی و عناصر بصری (تصاویر یا توضیحات آنها) به بازنماییهای برداری تبدیل و در پایگاه داده برداری ذخیره میشوند. برای فضای یکپارچه text↔image از CLIP یا SigLIP استفاده میشود؛ برای محیط تولید، ایندکسهای چندوجهی/چندبرداری (یک شیء — چند بردار) مناسبترند[6][11][12].
- بازیابی چندوجهی و رتبهبندی مجدد. ترکیبی از جستجوی متنی و بصری انجام میشود؛ کاندیداها (پاراگرافها، جداول، تصاویر/نواحی) ادغام شده و توسط مدلی «سنگینتر» (cross-encoder/LLM-reranker) برای افزایش دقت رتبهبندی مجدد میشوند[13].
- بستهبندی زمینه و تولید. بخشهای انتخابشده به LLM/VLM تغذیه میشوند. اگر مدل چندوجهی باشد (مانند GPT‑4V/4o)، تصاویر میتوانند مستقیماً ارائه شوند؛ در صورت استفاده از LLM متنی، تصاویر از پیش به توضیحات دقیق تبدیل میشوند[14][15].
- ردیابی و استناد. پاسخ با استنادهای قابلکلیک همراه است که نهتنها به سند/صفحه، بلکه به ناحیه (مختصات) نیز اشاره دارند. این امر سطح grounding و اعتماد کاربران را افزایش میدهد[2].
ارزیابی کیفیت و معیارها
اثربخشی MM‑RAG در سطوح استخراج، بازیابی و تولید ارزیابی میشود.
- کیفیت استخراج دادههای بصری. دقت OCR (WER/CER)، کیفیت تحلیل چیدمان (mAP/Precision/Recall) بر مجموعههای DocLayNet/PubLayNet[8][7].
- کیفیت بازیابی. معیارهای استاندارد بازیابی اطلاعات: Recall@K، Precision@K، MRR؛ برای چندوجهی — جداگانه بر اساس وجهها و در ترکیب.
- کیفیت پاسخ (end‑to‑end). معیارهای خودکار faithfulness/groundedness و ارزیابی انسانی. در عمل، چارچوبهای RAGAS/TruLens/DeepEval استفاده میشوند[16].
- Benchmarkها.
جدول مقایسهای اجزا
| جزء | گزینههای پیادهسازی | مزایا | معایب / ریسکها | چه زمانی انتخاب شود |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / APIهای ابری | محلی — حریم خصوصی و کنترل؛ ابری — دقت بالا «از جعبه». | خطا در چیدمان پیچیده؛ API — هزینه و الزامات انطباق. | دادههای خصوصی — OCR محلی؛ حداکثر دقت — ابر (در صورت مجاز بودن). |
| تحلیل چیدمان | قوانین / مدل ML‑ (LayoutLM, LayoutParser) | قوانین برای قالبهای یکنواخت سادهاند؛ ML — در برابر تنوع مقاوم است. | قوانین در چیدمانهای جدید شکست میخورند؛ ML به منابع/داده نیاز دارد. | فرمهای یکنواخت — قوانین؛ مجموعه ناهمگون — ML. |
| برداریسازی (تصویر) | CLIP / SigLIP / توضیحات بدون OCR (Donut/Pix2Struct) | فضای پنهان مشترک text↔image (CLIP/SigLIP)؛ بدون OCR وابستگی به OCR را حذف میکند. | CLIP متن داخل تصاویر را نمیخواند؛ توضیحات ممکن است معنا را تحریف کنند. | CLIP/SigLIP — جستجوی چندوجهی پایه؛ بدون OCR برای اسکنهای با کیفیت پیچیده. |
| ادغام نتایج | مرتبسازی بر اساس امتیاز / سهمیهبندی بر اساس وجه / LLM-reranker | رتبهبندمجدد دقت انتخاب زمینه را بهطور محسوسی افزایش میدهد. | افزایش تأخیر و هزینه. | سناریوهای با دقت بالا؛ روشهای ساده — برای PoC. |
| ذخیرهسازی/ایندکس | یک بردار / چندبردار (text+image) / ترکیبی (BM25+vector) | چندبردار نمایشهای مختلف یک شیء را پوشش میدهد؛ ترکیبی کلیدواژهها/کدها را نجات میدهد. | پیچیدگی طرح و بهروزرسانیها. | سیستمهای تولیدی با دادههای مختلط و SLA سختگیرانه. |
نکات عملی
- جستجوی ترکیبی (BM25 + برداری) — استاندارد de facto برای افزایش فراخوانی و دقت در اصطلاحات/کدهای تخصصی[20].
- رتبهبندی مجدد با cross-encoder/LLM با حذف کاندیداهای «بیارزش» پیش از تولید، توکنها را ذخیره میکند[13].
- VLM-retrieverهای مدرن (مانند ColPali) در اسناد غنی از نظر بصری با ایندکسگذاری مستقیم صفحات-تصویر مزایایی نشان میدهند[21].
همچنین ببینید
- Retrieval-Augmented Generation
- پایگاه داده برداری
- Embedding
- GraphRAG
منابع
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
یادداشتها
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.