RAG ist einfacher als du denkst: 6 Architekturen ohne Over-Engineering
RAG Is Simpler Than You Think

Viele Teams überkomplizieren ihre RAG-Systeme mit Embeddings, Vektor-Datenbanken und Reranking-Pipelines, obwohl die Nutzer oft nur ein Dokument suchen, das erklärt, wie man das Passwort zurücksetzt. Dieser Artikel zeigt einen pragmatischen Ansatz: Sechs RAG-Architekturen, von einfacher Volltextsuche (BM25) über Query Rewriting mit LLMs bis hin zu Hybrid-Suche, On-the-fly-Embeddings, Hot/Cold-Tiers und vollständiger Vorab-Embedding. Für jede Architektur werden die passenden Bedingungen beschrieben – etwa Datenaktualität, Korpus-Eigenschaften, Query-Muster, Skalierung und Team-Fähigkeiten. Der Autor betont, dass man mit BM25 und Query Rewriting oft 90 % der Probleme löst, und warnt vor unnötiger Komplexität, wie sie bei Modell-Deprecations oder hoher Dokumentfluktuation entsteht.
Die meisten Probleme der 'semantischen Suche' sind eigentlich Probleme der Query-Formulierung.