Von 70% auf 95%: Was wir über RAG-Optimierung in der Praxis gelernt haben

Von 70% auf 95% RAG-Präzision: Was wir in der Praxis über Chunking, Embedding und Reranking gelernt haben.

Von 70% auf 95%: Was wir über RAG-Optimierung in der Praxis gelernt haben

Geplantes Posting: 7. Februar 2027 | BERTA Lab — Bechtle AI Competence Center Bremen


Unser erster RAG-Prototyp hat funktioniert. Er hat auch gelogen — manchmal subtil, manchmal offensichtlich. Die Retrievalgenauigkeit lag bei 70%. Das klingt gut, bis man merkt: 30% der Antworten basierten auf dem falschen Kontext.

Hier ist, was uns wirklich geholfen hat.

Das Problem mit naivem Chunking

Standard-RAG: Dokument in 512-Token-Blöcke zerschneiden, einbetten, fertig. Das Problem: Ein Satz wie „Die Frist endet am 31. März" hat ohne Dokumentenkontext keinen Wert. Wir haben angefangen, semantisch zu chunken — Absätze statt Zeichenzahlen, Überschriften als Kontext mitgeben, Metadaten strukturiert ablegen.

Hybridsuche statt reines Embedding

Embedding-Suche ist gut für semantische Nähe. Keyword-Suche ist gut für exakte Begriffe (Artikelnummern, Firmennamen, Paragrafenverweise). Wir kombinieren beides: BM25 + Dense Retrieval, gewichtet nach Dokumententyp. Das brachte allein 8–10 Prozentpunkte.

Reranking als zweite Filterschicht

Die Top-10 aus dem ersten Retrieval sind nicht automatisch die relevantesten 3. Ein leichtes Reranker-Modell (Cross-Encoder) bewertet die Kandidaten nochmal gegen die eigentliche Frage. Ergebnis: weniger Rauschen, mehr Präzision im generierten Text.

Das Modell ist nicht das Problem

Wenn das RAG-System schlechte Ergebnisse liefert, ist das Modell selten schuld. Meistens liegt es an der Datenpipeline. Wir haben gelernt: Zuerst die Retrieval-Qualität messen (MRR, Recall@K), bevor man das LLM wechselt.

Evaluierung als Prozess, nicht als Einmalereignis

Wir führen nach jedem Dokumenten-Update automatisch Evaluierungsläufe durch. 50 fest definierte Fragen mit Referenzantworten. Wenn die Qualität fällt, merken wir es bevor der User es tut.


Von 70% auf 95% war keine Magie — es war iteratives Engineering.

Was sind eure Erfahrungen mit RAG in der Praxis? Kommentare gerne!


BERTA Lab — Bechtle AI Competence Center Bremen. Wir bauen, testen und dokumentieren KI-Lösungen für Enterprise-Anforderungen.

RAG #RetrievalAugmentedGeneration #KI #EnterpriseAI #LocalAI #Embeddings #VectorDatabase #KIEngineering #BertaLab #Bechtle

Lab-Blog · AI Competence Center · Bechtle Bremen / Oldenburg  |  Kein offizieller Bechtle-Kanal