MM-RAG (Multimodal RAG) (FA)

From Systems analysis wiki
Jump to navigation Jump to search

MM-RAG (به انگلیسی: Multimodal Retrieval-Augmented Generation) — گسترشی از پارادایم کلاسیک RAG است که در آن LLM برای پاسخ‌دهی نه‌تنها از متن، بلکه از داده‌های بصری (تصاویر، نمودارها، جداول، گراف‌ها) نیز بهره می‌برد. بازیابی چندوجهی امکان یافتن و پیوند شواهد در قالب‌های مختلف را فراهم می‌کند و با تکیه بر منابع خارجی با انتساب دقیق به بخش‌های صفحات و نواحی (bounding boxes)، خطر توهم‌زایی را کاهش می‌دهد[1][2].

MM-RAG به‌ویژه برای اسنادی مفید است که بخش قابل‌توجهی از معنای آن‌ها به شکل غیرمتنی ارائه شده است (چیدمان صفحه، نمودارها، ساختار جداول). در چنین مواردی، RAG متنی کلاسیک اغلب عناصر مهم زمینه را از دست می‌دهد[3][4].

زمینه و مسئله‌ای که حل می‌شود

RAG کلاسیک با گذرهای متنی کار می‌کند و ساختارهای بصری را نمی‌بیند (موقعیت عناصر، زیرنویس شکل‌ها، محورهای نمودار). MM-RAG این شکاف‌ها را پر می‌کند: عناصر ساختاریافته (متن، جداول، تصاویر با مختصات) را استخراج می‌کند، آن‌ها را در فضای برداری ایندکس می‌کند و شواهد از وجه‌های مختلف را ترکیب می‌نماید[5][6].

معماری MM-RAG

پایپ‌لاین MM-RAG مراحل پردازش داده‌های بصری و هم‌راستاسازی وجه‌ها را به RAG کلاسیک می‌افزاید: ورودی → ایندکس‌گذاری → بازیابی چندوجهی → ادغام و رتبه‌بندی مجدد → تولید با ردیابی.

  1. جمع‌آوری و پیش‌پردازش (Ingestion). ورودی شامل PDF/اسکن/تصاویر است. OCR و تحلیل چیدمان صفحه برای تشخیص نواحی انجام می‌شود: پاراگراف‌ها، عنوان‌ها، جداول، تصاویر و مختصات آن‌ها. ابزارهای رایج شامل مدل‌های خانواده LayoutLM و کتابخانه‌های ابزاری LayoutParser هستند؛ اعتبارسنجی و آموزش اغلب بر dataset‌های PubLayNet و DocLayNet متکی است[7][8][9].
  2. تقسیم‌بندی به نواحی. اشیاء بصری (نمودارها، جداول، تصاویر، زیرنویس‌ها) استخراج می‌شوند. برای پایداری بیشتر، مدل‌های بدون OCR (مانند Donut) یا پایپ‌لاین‌های ترکیبی OCR+VLM به کار می‌روند[10].
  3. ایندکس‌گذاری (Vector Index). تکه‌های متنی و عناصر بصری (تصاویر یا توضیحات آن‌ها) به بازنمایی‌های برداری تبدیل و در پایگاه داده برداری ذخیره می‌شوند. برای فضای یکپارچه text↔image از CLIP یا SigLIP استفاده می‌شود؛ برای محیط تولید، ایندکس‌های چندوجهی/چندبرداری (یک شیء — چند بردار) مناسب‌ترند[6][11][12].
  4. بازیابی چندوجهی و رتبه‌بندی مجدد. ترکیبی از جستجوی متنی و بصری انجام می‌شود؛ کاندیداها (پاراگراف‌ها، جداول، تصاویر/نواحی) ادغام شده و توسط مدلی «سنگین‌تر» (cross-encoder/LLM-reranker) برای افزایش دقت رتبه‌بندی مجدد می‌شوند[13].
  5. بسته‌بندی زمینه و تولید. بخش‌های انتخاب‌شده به LLM/VLM تغذیه می‌شوند. اگر مدل چندوجهی باشد (مانند GPT‑4V/4o)، تصاویر می‌توانند مستقیماً ارائه شوند؛ در صورت استفاده از LLM متنی، تصاویر از پیش به توضیحات دقیق تبدیل می‌شوند[14][15].
  6. ردیابی و استناد. پاسخ با استنادهای قابل‌کلیک همراه است که نه‌تنها به سند/صفحه، بلکه به ناحیه (مختصات) نیز اشاره دارند. این امر سطح grounding و اعتماد کاربران را افزایش می‌دهد[2].

ارزیابی کیفیت و معیارها

اثربخشی MM‑RAG در سطوح استخراج، بازیابی و تولید ارزیابی می‌شود.

  • کیفیت استخراج داده‌های بصری. دقت OCR (WER/CER)، کیفیت تحلیل چیدمان (mAP/Precision/Recall) بر مجموعه‌های DocLayNet/PubLayNet[8][7].
  • کیفیت بازیابی. معیارهای استاندارد بازیابی اطلاعات: Recall@K، Precision@K، MRR؛ برای چندوجهی — جداگانه بر اساس وجه‌ها و در ترکیب.
  • کیفیت پاسخ (end‑to‑end). معیارهای خودکار faithfulness/groundedness و ارزیابی انسانی. در عمل، چارچوب‌های RAGAS/TruLens/DeepEval استفاده می‌شوند[16].
  • Benchmark‌ها.
    • DocVQA: سؤال از تصاویر اسناد[3].
    • TextVQA: سؤالاتی که نیاز به خواندن متن در تصاویر دارند[4].
    • InfographicVQA: سؤال درباره اینفوگرافیک‌ها[17].
    • ChartQA: سؤال درباره نمودارها با نیاز به استدلال منطقی[18].
    • MMDocRAG: benchmark چندوجهی RAG برای DocQA (اسناد چندصفحه‌ای، زنجیره‌های شواهد بین وجهی)[19].

جدول مقایسه‌ای اجزا

مقایسه اجزا و رویکردهای کلیدی در MM‑RAG
جزء گزینه‌های پیاده‌سازی مزایا معایب / ریسک‌ها چه زمانی انتخاب شود
OCR Tesseract / PaddleOCR / APIهای ابری محلی — حریم خصوصی و کنترل؛ ابری — دقت بالا «از جعبه». خطا در چیدمان پیچیده؛ API — هزینه و الزامات انطباق. داده‌های خصوصی — OCR محلی؛ حداکثر دقت — ابر (در صورت مجاز بودن).
تحلیل چیدمان قوانین / مدل ML‑ (LayoutLM, LayoutParser) قوانین برای قالب‌های یکنواخت ساده‌اند؛ ML — در برابر تنوع مقاوم است. قوانین در چیدمان‌های جدید شکست می‌خورند؛ ML به منابع/داده نیاز دارد. فرم‌های یکنواخت — قوانین؛ مجموعه ناهمگون — ML.
برداری‌سازی (تصویر) CLIP / SigLIP / توضیحات بدون OCR (Donut/Pix2Struct) فضای پنهان مشترک text↔image (CLIP/SigLIP)؛ بدون OCR وابستگی به OCR را حذف می‌کند. CLIP متن داخل تصاویر را نمی‌خواند؛ توضیحات ممکن است معنا را تحریف کنند. CLIP/SigLIP — جستجوی چندوجهی پایه؛ بدون OCR برای اسکن‌های با کیفیت پیچیده.
ادغام نتایج مرتب‌سازی بر اساس امتیاز / سهمیه‌بندی بر اساس وجه / LLM-reranker رتبه‌بندمجدد دقت انتخاب زمینه را به‌طور محسوسی افزایش می‌دهد. افزایش تأخیر و هزینه. سناریوهای با دقت بالا؛ روش‌های ساده — برای PoC.
ذخیره‌سازی/ایندکس یک بردار / چندبردار (text+image) / ترکیبی (BM25+vector) چندبردار نمایش‌های مختلف یک شیء را پوشش می‌دهد؛ ترکیبی کلیدواژه‌ها/کدها را نجات می‌دهد. پیچیدگی طرح و به‌روزرسانی‌ها. سیستم‌های تولیدی با داده‌های مختلط و SLA سخت‌گیرانه.

نکات عملی

  • جستجوی ترکیبی (BM25 + برداری) — استاندارد de facto برای افزایش فراخوانی و دقت در اصطلاحات/کدهای تخصصی[20].
  • رتبه‌بندی مجدد با cross-encoder/LLM با حذف کاندیداهای «بی‌ارزش» پیش از تولید، توکن‌ها را ذخیره می‌کند[13].
  • VLM-retriever‌های مدرن (مانند ColPali) در اسناد غنی از نظر بصری با ایندکس‌گذاری مستقیم صفحات-تصویر مزایایی نشان می‌دهند[21].

همچنین ببینید

  • Retrieval-Augmented Generation
  • پایگاه داده برداری
  • Embedding
  • GraphRAG

منابع

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

یادداشت‌ها

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.