Hybrid retrieval (DE)
Hybrid Retrieval (hybrides Retrieval) — ist eine Klasse von Methoden des Information Retrieval, bei denen lexikalische (sparse) und semantische (dense/late‑interaction) Signale kombiniert werden, um den Recall und die Präzision der Ergebnisse zu verbessern. Hybride Schemata verbinden die Vorteile der exakten Übereinstimmung von Termen (BM25/TF-IDF) und der Vektorähnlichkeit (Bi-Encoder, multivektorale Late-Interaction-Modelle). Zudem nutzen sie Methoden zur Fusion von Ranglisten, die robust gegenüber unterschiedlichen Skalierungen der Scores sind (z. B. Reciprocal Rank Fusion, CombSUM/CombMNZ), sowie das Reranking durch Cross‑Encoder.[1][2][3]
Definition und Motivation
Hybrides Retrieval ist eine parallele oder kaskadierte Suche über zwei (oder mehr) unabhängige Signalkanäle mit anschließender Fusion und/oder Reranking. Typische Motivationen sind: (i) die Überwindung der „terminologischen Lücke“ (Synonyme, Umformulierungen), (ii) Robustheit gegenüber Tippfehlern/Morphologie, (iii) die Extraktion spezifischer Codes/Identifikatoren (wo Sparse-Modelle stark sind) und (iv) die Übertragbarkeit auf neue Domänen/Sprachen (wo Dense-Modelle eine semantische Generalisierung ermöglichen).[4][5][6]
Komponenten der hybriden Suche
Lexikalisch (sparse)
- Klassische Modelle. TF-IDF und BM25/BM25F sind standardmäßige Basisverfahren, die auf invertierten Indizes basieren. BM25 ist im probabilistischen Relevanz-Framework (PRF) begründet und wird häufig in der ersten Ranking-Stufe eingesetzt.[7]
- Lernbasierte Sparse-Modelle.
- SPLADE / SPLADE++/v3. Ein neuronales Sparse-Modell, das die Erweiterung und Gewichtung von Termen über einen MLM-Kopf mit Sparsity-Regularisierung lernt; es zeigt starke Ergebnisse und eine gute Übertragbarkeit (BEIR).[8][9][10]
- uniCOIL/COIL. Kontextualisierte invertierte Listen und ihre vereinfachte Version uniCOIL; sie sind mit klassischen invertierten Indizes kompatibel.[11]
Semantisch (dense/late-interaction)
- Bi-Encoder (Single-Vector). Anfrage und Dokument werden durch Vektormodelle kodiert, die Ähnlichkeit wird mittels Skalarprodukt (dot product) oder MIPS berechnet. Beispiele: DPR,[12] ANCE,[13] Contriever,[14] GTR,[15] E5.[16]
- Late-Interaction (Multi-Vector). Modelle, die Übereinstimmungen auf Token-Ebene durch eine „späte“ Interaktion modellieren: ColBERT/ColBERTv2. Der Kompromiss besteht in einer höheren Genauigkeit bei größerem Index und höherer Latenz, was durch technische Beschleuniger (PLAID, WARP) gemildert wird.[17][18][19]
Schemata für Hybridisierung und Rank Fusion
- Parallele Suche und Kandidatenfusion. Die Kandidatenlisten (sparse und dense) werden unabhängig voneinander mit ihren internen Scores generiert; anschließend erfolgt die Fusion der Ranglisten.[20]
- RRF (Reciprocal Rank Fusion). Eine Technik, die robust gegenüber nicht vergleichbaren Scores ist und die reziproken Ränge summiert:
, wobei üblicherweise .[21] Wird in kommerziellen Suchmaschinen (Elasticsearch/OpenSearch) als nativer Retriever/Prozessor unterstützt.[22][23]
- CombSUM/CombMNZ u. a. Klassische Funktionen zur „Score-Summierung“ (gegebenenfalls mit Normalisierung).[24][25][26]
- Gewichtete lineare Mischung.
, . Die Wahl von kann fest oder lernbasiert sein (pro Sammlung/pro Anfrage).[27]
- Score-Normalisierung. Für CombSUM/CombMNZ werden häufig Min-Max-Skalierung, Z-Score-Normalisierung u. a. verwendet, um die Skalen anzugleichen;[28] RRF hingegen basiert ausschließlich auf den Rängen.
- Dynamische/adaptive Gewichtung. Query Routing, Anfrage-Merkmale und LTR-Modelle zur Auswahl/Gewichtung der Kanäle. Aktuelle Studien zeigen, dass eine einfache gelernte Mischung oft RRF übertrifft und wenig empfindlich gegenüber Normalisierung ist.[29]
Reranking und mehrstufige Pipelines
Hybride Systeme werden typischerweise als Retrieval → Fusion → Rerank aufgebaut. Für das Reranking werden eingesetzt:
- Cross-Encoder (BERT/T5). Die genauesten, aber rechenintensivsten Modelle: MonoBERT/MonoT5 zur Neusortierung der Top-N-Kandidaten.[30][31]
- Late-Interaction als Reranker. Die ColBERT-Familie kann auch als Reranker fungieren; moderne Beschleuniger (PLAID, WARP) reduzieren die Latenz ohne Qualitätsverlust.[32][33]
Der Kompromiss zwischen Qualität ↔ Latenz/Kosten ist besonders wichtig bei RAG und strengen SLAs (siehe Tail-Latenzen p95/p99).[34]
Evaluierung auf Benchmarks
- BEIR. Ein vereinheitlichter Satz von heterogenen Sammlungen/Aufgaben zur Zero-Shot-/Out-of-Domain-Evaluierung von Retrieval-Modellen (z. B. TREC‑COVID, NFCorpus, NQ, HotpotQA, FiQA‑2018, DBPedia-entity, ArguAna, Webis‑Touché‑2020, FEVER/Climate‑FEVER, Scidocs, SciFact, CQADupStack u. a.).[35]
- TREC Deep Learning / MS MARCO. Klassische Ressourcen für das Training/die Evaluierung von Retrievern und Rerankern im Big-Data-Kontext.[36][37][38]
- Qualitätsmetriken. nDCG@k, Recall@k, MRR; für die Leistung – Latenz p50/p95/p99, QPS; für den Betrieb – Speicher/Kosten (CPU/GPU, Index).[39][40]
- Ablationsstudien. Es wird empfohlen, den Beitrag jedes Kanals/jeder Gewichtung und die Sensitivität gegenüber den Parametern bei RRF und bei der Mischung zu untersuchen sowie die Robustheit gegenüber Umformulierungen und OOD-Verschiebungen zu bewerten.[41][42]
Technische Aspekte und Praktiken im Produktivbetrieb
- Indizes und ANN. FAISS (Flat/HNSW/IVF-PQ), HNSW, ScaNN für MIPS/Kosinus-Ähnlichkeit.[43][44][45]
- IR-Stack. Lucene/Anserini/Pyserini für sparse, dense und hybride Pipelines; „Zwei-Klick“-Reproduzierbarkeit auf BEIR.[46][47]
- Vektordatenbanken und Suchmaschinen. Qdrant, Weaviate, pgvector/PostgreSQL, Vespa, Elasticsearch/OpenSearch bieten native Modi für die hybride Suche (BM25F+Vektor) und/oder RRF/lineare Mischung.[48][49][50][51][52]
- RAG-Pattern. Architektur: Retrieval → Fusion → Rerank → LLM-Kontext mit Token-Begrenzung und Quellenverfolgung.[53]
- Indexaktualisierung, Deduplizierung, Tokenisierung. Es ist wichtig, die Tokenisierung zwischen BM25 und dem Vektorisierer abzustimmen; ebenso die Kalibrierung der Scores (Normalisierung/Skalierung) vor der Mischung.[54]
Einschränkungen und offene Fragen
- Übertragbarkeit und Mehrsprachigkeit. Dense-Modelle (GTR/E5) verbessern die Übertragbarkeit, sind aber empfindlich gegenüber Domäne/Sprache; Sparse-Modelle (SPLADE) sind oft robuster bei OOD.[55][56]
- Integration mit LLMs und Halluzinationen. Hybrides Retrieval reduziert Auslassungen und Rauschen in RAG-Kontexten, beseitigt Halluzinationen jedoch nicht vollständig; es sind strikte Reranker und eine Quellenfilterung erforderlich.[57]
- Kosten und Datenschutz. Speicherung von Multi-Vektor-Indizes, Kompression, Verschlüsselung und On-Premise-Stacks; TCO-Bewertung.
- Trends. HyDE/doc2query/PRF zur Dokumenten-/Anfrageerweiterung; das Lernen der Mischung (per-query ), effizientere Late-Interaction-Modelle (PLAID/WARP), lange Dokumente und Multi-Vektor-Indizes.[58][59][60][61]
Vergleichstabelle der Methoden
Stand: 10.09.2025 (Beispiel anhand der BEIR-Sammlung trec-covid; nDCG@10 / Recall@100):[62]
| Methode | Typ (sparse/dense/hybrid) | Idee/Modell | Fusionsschema | Reranker | nDCG@10 / R@100 | Latenz (rel.) | Quellen |
|---|---|---|---|---|---|---|---|
| BM25 | sparse | Exakte Termübereinstimmung (PRF/BM25) | — | — | 0.595 / 0.109 | sehr gering | [63][64] |
| SPLADE++ (ED) | sparse (learned) | Spärliche Term-Erweiterung/-Gewichtung | — | — | 0.727 / 0.128 | niedrig–mittel | [65][66] |
| Contriever (MS MARCO FT) | dense | Bi-Encoder mit kontrastivem Lernen | — | — | 0.596 / 0.091 | mittel | [67][68] |
| BGE-base-en-v1.5 | dense | Starker Allzweck-Embedder | — | — | 0.781 / 0.141 | mittel | [69] |
| Cohere embed-english-v3.0 | dense | Kommerzielles Text-Embedding-Modell | — | — | 0.818 / 0.159 | mittel | [70] |
| BM25 + dense (Beispiel: BM25+BGE) | hybrid | Paralleles Retrieval + Listenfusion | RRF (k≈60) oder gewichtete Mischung | opt.: MonoT5/ColBERT | (variiert je nach Implementierung; typischerweise besser als der beste Einzelkanal) | mittel | [71][72][73] |
Hinweis: Die letzte Zeile veranschaulicht das Schema; die genauen Zahlen hängen von der Wahl des Embedders, der Normalisierung und den Fusionsparametern ab (siehe Quellen und reproduzierbare Pyserini-Skripte).
Weblinks
- Pyserini / Anserini: github.com/castorini/pyserini • github.com/castorini/anserini
- FAISS: arXiv:1702.08734
- Weaviate (Hybrid search): docs.weaviate.io/weaviate/search/hybrid
- pgvector: github.com/pgvector/pgvector
- Vespa (Hybrid search tutorial): docs.vespa.ai/en/tutorials/hybrid-search.html
Literatur
- Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715.
- Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval 3(4):333–389. DOI:10.1561/1500000019.
- Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR. SIGIR.
- Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
- Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
Einzelnachweise
- ↑ Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. DOI:10.1561/1500000019.
- ↑ Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009, 758–759. PDF.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). An Analysis of Fusion Functions for Hybrid Retrieval. ACM TOIS 42(1):1–35. DOI:10.1145/3596512 • arXiv:2210.11934.
- ↑ Manning, C.D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press. ISBN 978‑0521865715 (siehe Kapitel zu TF-IDF, Evaluierung und dem Problem des vocabulary mismatch).
- ↑ Izacard, G. et al. (2022). Unsupervised Dense Information Retrieval with Contrastive Learning (Contriever). TACL 10:1089–1108. arXiv:2112.09118.
- ↑ Wang, L. et al. (2022/2024). Text Embeddings by Weakly‑Supervised Contrastive Pre‑training (E5). arXiv:2212.03533.
- ↑ Robertson, S., Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. DOI:10.1561/1500000019.
- ↑ Formal, T., Piwowarski, B., Clinchant, S. (2021). SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking. arXiv:2107.05720.
- ↑ Formal, T. et al. (2022). Making Sparse Neural IR Models More Effective. Findings of EMNLP. arXiv:2205.04733.
- ↑ Formal, T. et al. (2024). SPLADE‑v3: New baselines for SPLADE. arXiv:2403.06789.
- ↑ Lin, J., Ma, X. (2021). A Few Brief Notes on DeepImpact, COIL, and uniCOIL. arXiv:2106.14807.
- ↑ Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain QA. EMNLP. arXiv:2004.04906.
- ↑ Xiong, L. et al. (2021). Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval (ANCE). ICLR. arXiv:2007.00808.
- ↑ Izacard, G. et al. (2022). TACL. arXiv:2112.09118.
- ↑ Ni, J. et al. (2021/2022). Large Dual Encoders Are Generalizable Retrievers (GTR). EMNLP. arXiv:2112.07899.
- ↑ Wang, L. et al. (2022/2024). arXiv:2212.03533.
- ↑ Khattab, O., Zaharia, M. (2020). ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. SIGIR. arXiv:2004.12832.
- ↑ Santhanam, K. et al. (2022). ColBERTv2 & PLAID. NAACL/ArXiv. arXiv:2112.01488; arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). WARP: An Efficient Engine for Multi‑Vector Retrieval. arXiv:2501.17788.
- ↑ Lin, J. et al. (2021). Pyserini: A Python Toolkit for Reproducible IR with Sparse and Dense Representations. SIGIR. PDF.
- ↑ Cormack, G.V., Clarke, C.L.A., Büttcher, S. (2009). SIGIR. PDF.
- ↑ Elastic Docs. Reciprocal Rank Fusion. (abgerufen am 10.09.2025). elastic.co/docs/.../reciprocal-rank-fusion.
- ↑ OpenSearch Docs. Score ranker processor (RRF). (abgerufen am 10.09.2025). docs.opensearch.org/.../score-ranker-processor/.
- ↑ Fox, E.A., Shaw, J.A. (1994). Combination of Multiple Searches. TREC‑2, NIST SP 500‑215, 243–252. PDF.
- ↑ Lee, J.H. (1997). Analyses of Multiple Evidence Combination. SIGIR, 267–276. DOI:10.1145/258525.258587.
- ↑ Hsu, D.F., Taksa, I. (2005). Comparing Rank and Score Combination Methods for Data Fusion in IR. (Tech. report). PDF.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
- ↑ Hsu, D.F., Taksa, I. (2005). siehe oben.
- ↑ Bruch, S., Gai, S., Ingber, A. (2023). TOIS. DOI:10.1145/3596512.
- ↑ Nogueira, R., Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
- ↑ Nogueira, R., Jiang, Z., Lin, J. (2020). Document Ranking with a Pretrained Sequence‑to‑Sequence Model (MonoT5). Findings of EMNLP. arXiv:2003.06713.
- ↑ Santhanam, K. et al. (2022). arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). arXiv:2501.17788.
- ↑ Dean, J., Barroso, L.A. (2013). The Tail at Scale. CACM 56(2):74–80. DOI:10.1145/2408776.2408794.
- ↑ Thakur, N. et al. (2021). BEIR: A Heterogeneous Benchmark for Zero‑shot Evaluation of IR Models. NeurIPS Datasets & Benchmarks. arXiv:2104.08663.
- ↑ Craswell, N. et al. (2020). Overview of the TREC 2019 Deep Learning Track. arXiv:2003.07820.
- ↑ Craswell, N. et al. (2021). Overview of the TREC 2020 Deep Learning Track. arXiv:2102.07662.
- ↑ Bajaj, P. et al. (2016). MS MARCO: A Human Generated MAchine Reading COmprehension Dataset. arXiv:1611.09268.
- ↑ Järvelin, K., Kekäläinen, J. (2002). Cumulated Gain‑Based Evaluation of IR Techniques. Information Retrieval 6:241–256. DOI:10.1023/A:1016043826386.
- ↑ Dean, J., Barroso, L.A. (2013). CACM. DOI:10.1145/2408776.2408794.
- ↑ Bruch, S. et al. (2023). DOI:10.1145/3596512.
- ↑ Ni, J. et al. (2021/2022). arXiv:2112.07899.
- ↑ Johnson, J., Douze, M., Jégou, H. (2017). Billion‑scale Similarity Search with GPUs (FAISS). arXiv:1702.08734.
- ↑ Malkov, Y., Yashunin, D. (2020). HNSW. IEEE TPAMI 42(4):824–836. DOI:10.1109/TPAMI.2018.2889473.
- ↑ Guo, R. et al. (2020). ScaNN: Efficient Vector Similarity Search at Scale. arXiv:1908.10396.
- ↑ Yang, P., Fang, H., Lin, J. (208). Anserini: Reproducible IR Research with Lucene. JDIQ 10(4):1–20. DOI:10.1145/3239571.
- ↑ Lin, J. et al. (2021). SIGIR. PDF.
- ↑ Qdrant Docs. Hybrid queries (RRF, DBSF). (abgerufen am 10.09.2025). qdrant.tech/.../hybrid-queries/.
- ↑ Weaviate Docs. Hybrid search. (abgerufen am 10.09.2025). docs.weaviate.io/weaviate/search/hybrid.
- ↑ pgvector GitHub. (abgerufen am 10.09.2025). github.com/pgvector/pgvector.
- ↑ Vespa Docs. Hybrid Text Search Tutorial. (abgerufen am 10.09.2025). docs.vespa.ai/.../hybrid-search.html.
- ↑ Elastic Docs. Reciprocal Rank Fusion. (abgerufen am 10.09.2025). elastic.co/docs/.../rrf.
- ↑ Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ Hsu, D.F., Taksa, I. (2005). siehe oben.
- ↑ Ni, J. et al. (2021/2022). arXiv:2112.07899.
- ↑ Formal, T. et al. (2021, 2022, 2024). arXiv:2107.05720; 2205.04733; 2403.06789.
- ↑ Lewis, P. et al. (2020). arXiv:2005.11401.
- ↑ Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL. arXiv:2212.10496.
- ↑ Nogueira, R. et al. (2019). Document Expansion by Query Prediction. arXiv:1904.08375; docTTTTTquery. PDF.
- ↑ Santhanam, K. et al. (2022). arXiv:2205.09707.
- ↑ Scheerer, J.L. et al. (2025). arXiv:2501.17788.
- ↑ Pyserini BEIR Regressions (abgerufen am 10.09.2025): Ergebnisse für trec-covid für BM25/SPLADE/Contriever/BGE/Cohere. castorini.github.io/pyserini/2cr/beir.html.
- ↑ Robertson, S., Zaragoza, H. (2009). DOI:10.1561/1500000019.
- ↑ Pyserini BEIR. Siehe obigen Link.
- ↑ Formal, T. et al. (2021, 2022). arXiv:2107.05720; 2205.04733.
- ↑ Pyserini BEIR.
- ↑ Izacard, G. et al. (2022). arXiv:2112.09118.
- ↑ Pyserini BEIR.
- ↑ Pyserini BEIR.
- ↑ Pyserini BEIR.
- ↑ Cormack et al. (2009). SIGIR. RRF.
- ↑ Bruch et al. (2023). TOIS.
- ↑ Elastic/OpenSearch RRF Docs.