Von 70% auf 95%: Was wir über RAG-Optimierung in der Praxis gelernt haben
Von 70% auf 95% RAG-Präzision: Was wir in der Praxis über Chunking, Embedding und Reranking gelernt haben.
Von 70% auf 95%: Was wir über RAG-Optimierung in der Praxis gelernt haben
Geplantes Posting: 7. Februar 2027 | BERTA Lab — Bechtle AI Competence Center Bremen
Unser erster RAG-Prototyp hat funktioniert. Er hat auch gelogen — manchmal subtil, manchmal offensichtlich. Die Retrievalgenauigkeit lag bei 70%. Das klingt gut, bis man merkt: 30% der Antworten basierten auf dem falschen Kontext.
Hier ist, was uns wirklich geholfen hat.
Das Problem mit naivem Chunking
Standard-RAG: Dokument in 512-Token-Blöcke zerschneiden, einbetten, fertig. Das Problem: Ein Satz wie „Die Frist endet am 31. März" hat ohne Dokumentenkontext keinen Wert. Wir haben angefangen, semantisch zu chunken — Absätze statt Zeichenzahlen, Überschriften als Kontext mitgeben, Metadaten strukturiert ablegen.
Hybridsuche statt reines Embedding
Embedding-Suche ist gut für semantische Nähe. Keyword-Suche ist gut für exakte Begriffe (Artikelnummern, Firmennamen, Paragrafenverweise). Wir kombinieren beides: BM25 + Dense Retrieval, gewichtet nach Dokumententyp. Das brachte allein 8–10 Prozentpunkte.
Reranking als zweite Filterschicht
Die Top-10 aus dem ersten Retrieval sind nicht automatisch die relevantesten 3. Ein leichtes Reranker-Modell (Cross-Encoder) bewertet die Kandidaten nochmal gegen die eigentliche Frage. Ergebnis: weniger Rauschen, mehr Präzision im generierten Text.
Das Modell ist nicht das Problem
Wenn das RAG-System schlechte Ergebnisse liefert, ist das Modell selten schuld. Meistens liegt es an der Datenpipeline. Wir haben gelernt: Zuerst die Retrieval-Qualität messen (MRR, Recall@K), bevor man das LLM wechselt.
Evaluierung als Prozess, nicht als Einmalereignis
Wir führen nach jedem Dokumenten-Update automatisch Evaluierungsläufe durch. 50 fest definierte Fragen mit Referenzantworten. Wenn die Qualität fällt, merken wir es bevor der User es tut.
Von 70% auf 95% war keine Magie — es war iteratives Engineering.
Was sind eure Erfahrungen mit RAG in der Praxis? Kommentare gerne!
BERTA Lab — Bechtle AI Competence Center Bremen. Wir bauen, testen und dokumentieren KI-Lösungen für Enterprise-Anforderungen.