Hybrid retrieval (DE)

From Systems analysis wiki
Jump to navigation Jump to search

Hybrid Retrieval (hybrides Retrieval) — ist eine Klasse von Methoden des Information Retrieval, bei denen lexikalische (sparse) und semantische (dense/late‑interaction) Signale kombiniert werden, um den Recall und die Präzision der Ergebnisse zu verbessern. Hybride Schemata verbinden die Vorteile der exakten Übereinstimmung von Termen (BM25/TF-IDF) und der Vektorähnlichkeit (Bi-Encoder, multivektorale Late-Interaction-Modelle). Zudem nutzen sie Methoden zur Fusion von Ranglisten, die robust gegenüber unterschiedlichen Skalierungen der Scores sind (z. B. Reciprocal Rank Fusion, CombSUM/CombMNZ), sowie das Reranking durch Cross‑Encoder.[1][2][3]

Definition und Motivation

Hybrides Retrieval ist eine parallele oder kaskadierte Suche über zwei (oder mehr) unabhängige Signalkanäle mit anschließender Fusion und/oder Reranking. Typische Motivationen sind: (i) die Überwindung der „terminologischen Lücke“ (Synonyme, Umformulierungen), (ii) Robustheit gegenüber Tippfehlern/Morphologie, (iii) die Extraktion spezifischer Codes/Identifikatoren (wo Sparse-Modelle stark sind) und (iv) die Übertragbarkeit auf neue Domänen/Sprachen (wo Dense-Modelle eine semantische Generalisierung ermöglichen).[4][5][6]

Komponenten der hybriden Suche

Lexikalisch (sparse)

  • Klassische Modelle. TF-IDF und BM25/BM25F sind standardmäßige Basisverfahren, die auf invertierten Indizes basieren. BM25 ist im probabilistischen Relevanz-Framework (PRF) begründet und wird häufig in der ersten Ranking-Stufe eingesetzt.[7]
  • Lernbasierte Sparse-Modelle.
    • SPLADE / SPLADE++/v3. Ein neuronales Sparse-Modell, das die Erweiterung und Gewichtung von Termen über einen MLM-Kopf mit Sparsity-Regularisierung lernt; es zeigt starke Ergebnisse und eine gute Übertragbarkeit (BEIR).[8][9][10]
    • uniCOIL/COIL. Kontextualisierte invertierte Listen und ihre vereinfachte Version uniCOIL; sie sind mit klassischen invertierten Indizes kompatibel.[11]

Semantisch (dense/late-interaction)

  • Bi-Encoder (Single-Vector). Anfrage und Dokument werden durch Vektormodelle kodiert, die Ähnlichkeit wird mittels Skalarprodukt (dot product) oder MIPS berechnet. Beispiele: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5.[16]
  • Late-Interaction (Multi-Vector). Modelle, die Übereinstimmungen auf Token-Ebene durch eine „späte“ Interaktion modellieren: ColBERT/ColBERTv2. Der Kompromiss besteht in einer höheren Genauigkeit bei größerem Index und höherer Latenz, was durch technische Beschleuniger (PLAID, WARP) gemildert wird.[17][18][19]

Schemata für Hybridisierung und Rank Fusion

  • Parallele Suche und Kandidatenfusion. Die Kandidatenlisten (sparse und dense) werden unabhängig voneinander mit ihren internen Scores generiert; anschließend erfolgt die Fusion der Ranglisten.[20]
  • RRF (Reciprocal Rank Fusion). Eine Technik, die robust gegenüber nicht vergleichbaren Scores ist und die reziproken Ränge summiert:

RRF(d)=i=1m1k+ranki(d), wobei üblicherweise k60.[21] Wird in kommerziellen Suchmaschinen (Elasticsearch/OpenSearch) als nativer Retriever/Prozessor unterstützt.[22][23]

  • CombSUM/CombMNZ u. a. Klassische Funktionen zur „Score-Summierung“ (gegebenenfalls mit Normalisierung).[24][25][26]
  • Gewichtete lineare Mischung.

S(d)=αSsparse(d)+(1α)Sdense(d), α[0,1]. Die Wahl von α kann fest oder lernbasiert sein (pro Sammlung/pro Anfrage).[27]

  • Score-Normalisierung. Für CombSUM/CombMNZ werden häufig Min-Max-Skalierung, Z-Score-Normalisierung u. a. verwendet, um die Skalen anzugleichen;[28] RRF hingegen basiert ausschließlich auf den Rängen.
  • Dynamische/adaptive Gewichtung. Query Routing, Anfrage-Merkmale und LTR-Modelle zur Auswahl/Gewichtung der Kanäle. Aktuelle Studien zeigen, dass eine einfache gelernte Mischung oft RRF übertrifft und wenig empfindlich gegenüber Normalisierung ist.[29]

Reranking und mehrstufige Pipelines

Hybride Systeme werden typischerweise als Retrieval → Fusion → Rerank aufgebaut. Für das Reranking werden eingesetzt:

  • Cross-Encoder (BERT/T5). Die genauesten, aber rechenintensivsten Modelle: MonoBERT/MonoT5 zur Neusortierung der Top-N-Kandidaten.[30][31]
  • Late-Interaction als Reranker. Die ColBERT-Familie kann auch als Reranker fungieren; moderne Beschleuniger (PLAID, WARP) reduzieren die Latenz ohne Qualitätsverlust.[32][33]

Der Kompromiss zwischen Qualität ↔ Latenz/Kosten ist besonders wichtig bei RAG und strengen SLAs (siehe Tail-Latenzen p95/p99).[34]

Evaluierung auf Benchmarks

  • BEIR. Ein vereinheitlichter Satz von heterogenen Sammlungen/Aufgaben zur Zero-Shot-/Out-of-Domain-Evaluierung von Retrieval-Modellen (z. B. TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia-entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack u. a.).[35]
  • TREC Deep Learning / MS MARCO. Klassische Ressourcen für das Training/die Evaluierung von Retrievern und Rerankern im Big-Data-Kontext.[36][37][38]
  • Qualitätsmetriken. nDCG@k, Recall@k, MRR; für die Leistung – Latenz p50/p95/p99, QPS; für den Betrieb – Speicher/Kosten (CPU/GPU, Index).[39][40]
  • Ablationsstudien. Es wird empfohlen, den Beitrag jedes Kanals/jeder Gewichtung und die Sensitivität gegenüber den Parametern k bei RRF und α bei der Mischung zu untersuchen sowie die Robustheit gegenüber Umformulierungen und OOD-Verschiebungen zu bewerten.[41][42]

Technische Aspekte und Praktiken im Produktivbetrieb

  • Indizes und ANN. FAISS (Flat/HNSW/IVF-PQ), HNSW, ScaNN für MIPS/Kosinus-Ähnlichkeit.[43][44][45]
  • IR-Stack. Lucene/Anserini/Pyserini für sparse, dense und hybride Pipelines; „Zwei-Klick“-Reproduzierbarkeit auf BEIR.[46][47]
  • Vektordatenbanken und Suchmaschinen. Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch bieten native Modi für die hybride Suche (BM25F+Vektor) und/oder RRF/lineare Mischung.[48][49][50][51][52]
  • RAG-Pattern. Architektur: Retrieval → Fusion → Rerank → LLM-Kontext mit Token-Begrenzung und Quellenverfolgung.[53]
  • Indexaktualisierung, Deduplizierung, Tokenisierung. Es ist wichtig, die Tokenisierung zwischen BM25 und dem Vektorisierer abzustimmen; ebenso die Kalibrierung der Scores (Normalisierung/Skalierung) vor der Mischung.[54]

Einschränkungen und offene Fragen

  • Übertragbarkeit und Mehrsprachigkeit. Dense-Modelle (GTR/E5) verbessern die Übertragbarkeit, sind aber empfindlich gegenüber Domäne/Sprache; Sparse-Modelle (SPLADE) sind oft robuster bei OOD.[55][56]
  • Integration mit LLMs und Halluzinationen. Hybrides Retrieval reduziert Auslassungen und Rauschen in RAG-Kontexten, beseitigt Halluzinationen jedoch nicht vollständig; es sind strikte Reranker und eine Quellenfilterung erforderlich.[57]
  • Kosten und Datenschutz. Speicherung von Multi-Vektor-Indizes, Kompression, Verschlüsselung und On-Premise-Stacks; TCO-Bewertung.
  • Trends. HyDE/doc2query/PRF zur Dokumenten-/Anfrageerweiterung; das Lernen der Mischung (per-query α), effizientere Late-Interaction-Modelle (PLAID/WARP), lange Dokumente und Multi-Vektor-Indizes.[58][59][60][61]

Vergleichstabelle der Methoden

Stand: 10.09.2025 (Beispiel anhand der BEIR-Sammlung trec-covid; nDCG@10 / Recall@100):[62]

Vergleich der Methoden auf trec-covid
Methode Typ (sparse/dense/hybrid) Idee/Modell Fusionsschema Reranker nDCG@10 / R@100 Latenz (rel.) Quellen
BM25 sparse Exakte Termübereinstimmung (PRF/BM25) 0.595 / 0.109 sehr gering [63][64]
SPLADE++ (ED) sparse (learned) Spärliche Term-Erweiterung/-Gewichtung 0.727 / 0.128 niedrig–mittel [65][66]
Contriever (MS MARCO FT) dense Bi-Encoder mit kontrastivem Lernen 0.596 / 0.091 mittel [67][68]
BGE-base-en-v1.5 dense Starker Allzweck-Embedder 0.781 / 0.141 mittel [69]
Cohere embed-english-v3.0 dense Kommerzielles Text-Embedding-Modell 0.818 / 0.159 mittel [70]
BM25 + dense (Beispiel: BM25+BGE) hybrid Paralleles Retrieval + Listenfusion RRF (k≈60) oder gewichtete Mischung opt.: MonoT5/ColBERT (variiert je nach Implementierung; typischerweise besser als der beste Einzelkanal) mittel [71][72][73]

Hinweis: Die letzte Zeile veranschaulicht das Schema; die genauen Zahlen hängen von der Wahl des Embedders, der Normalisierung und den Fusionsparametern ab (siehe Quellen und reproduzierbare Pyserini-Skripte).

Literatur

  • Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
  • Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
  • Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
  • Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  • Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.

Einzelnachweise

  1. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
  2. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
  3. Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
  4. Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (siehe Kapitel zu TF-IDF, Evaluierung und dem Problem des vocabulary mismatch).
  5. Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
  6. Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
  7. Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
  8. Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
  9. Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
  10. Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
  11. Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
  12. Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
  13. Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
  14. Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
  15. Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
  16. Wang, L. et al. (2022/2024). arXiv:2212.03533.
  17. Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
  18. Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
  19. Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
  20. Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
  21. Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
  22. Elastic Docs. Reciprocal Rank Fusion. (abgerufen am 10.09.2025). elastic.co/docs/.../reciprocal-rank-fusion.
  23. OpenSearch Docs. Score ranker processor (RRF). (abgerufen am 10.09.2025). docs.opensearch.org/.../score-ranker-processor/.
  24. Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
  25. Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
  26. Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
  27. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  28. Hsu, D.F., Taksa, I. (2005). siehe oben.
  29. Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
  30. Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
  31. Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
  32. Santhanam, K. et al. (2022). arXiv:2205.09707.
  33. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  34. Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
  35. Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
  36. Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
  37. Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
  38. Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
  39. Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
  40. Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
  41. Bruch, S. et al. (2023). DOI:10.1145/3596512.
  42. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  43. Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
  44. Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
  45. Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
  46. Yang, P., Fang, H., Lin, J. (208). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
  47. Lin, J. et al. (2021). SIGIR. PDF.
  48. Qdrant Docs. Hybrid queries (RRF, DBSF). (abgerufen am 10.09.2025). qdrant.tech/.../hybrid-queries/.
  49. Weaviate Docs. Hybrid search. (abgerufen am 10.09.2025). docs.weaviate.io/weaviate/search/hybrid.
  50. pgvector GitHub. (abgerufen am 10.09.2025). github.com/pgvector/pgvector.
  51. Vespa Docs. Hybrid Text Search Tutorial. (abgerufen am 10.09.2025). docs.vespa.ai/.../hybrid-search.html.
  52. Elastic Docs. Reciprocal Rank Fusion. (abgerufen am 10.09.2025). elastic.co/docs/.../rrf.
  53. Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  54. Hsu, D.F., Taksa, I. (2005). siehe oben.
  55. Ni, J. et al. (2021/2022). arXiv:2112.07899.
  56. Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
  57. Lewis, P. et al. (2020). arXiv:2005.11401.
  58. Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
  59. Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
  60. Santhanam, K. et al. (2022). arXiv:2205.09707.
  61. Scheerer, J.L. et al. (2025). arXiv:2501.17788.
  62. Pyserini BEIR Regressions (abgerufen am 10.09.2025): Ergebnisse für trec-covid für BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
  63. Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
  64. Pyserini BEIR. Siehe obigen Link.
  65. Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
  66. Pyserini BEIR.
  67. Izacard, G. et al. (2022). arXiv:2112.09118.
  68. Pyserini BEIR.
  69. Pyserini BEIR.
  70. Pyserini BEIR.
  71. Cormack et al. (2009). SIGIR. RRF.
  72. Bruch et al. (2023). TOIS.
  73. Elastic/OpenSearch RRF Docs.