RAG meets MCP: Wenn Enterprise-Wissen zur KI-nativen API wird
RAG meets MCP: Wenn Enterprise-Wissen zur KI-nativen API wird — Model Context Protocol in der Praxis.
RAG meets MCP: Wenn Enterprise-Wissen zur KI-nativen API wird
Post 34 — September 2027 | Bechtle AI Competence Center Bremen
Eine Frage, die wir immer wieder hören: "Wir haben eine großartige RAG-Wissensdatenbank aufgebaut. Aber wie machen wir sie für Claude, Codex und unsere anderen KI-Tools direkt nutzbar — ohne jeden Access-Code neu schreiben zu müssen?"
Die Antwort liegt im Model Context Protocol (MCP). Und unsere Antwort im Lab heißt RAG-MCP.
Das Problem: Wissen und Werkzeuge sind getrennt
Unser BERTA Lab betreibt seit über einem Jahr einen produktiven NVIDIA Enterprise RAG Blueprint auf eigenem Server. Die Wissensdatenbank umfasst Compliance-Dokumente, Ausschreibungsunterlagen, technische Spezifikationen — tausende Dokumente, präzise indexiert mit Milvus als Vektor-DB.
Parallel dazu wächst unser KI-Tool-Ökosystem: Claude Code, Archon, OpenClaw, eigene Agenten. Jedes Tool, das RAG-Wissen braucht, muss aktuell:
1. Den RAG-Server-Endpoint kennen (http://rag-server:8081/generate)
2. Die Query-API kennen und implementieren
3. Mit Collections umgehen können
4. Citations parsen
Das führt zu n × m Integrationsproblemen — n Tools, m Wissensquellen.
Die Lösung: MCP als universelle Brücke
Das Model Context Protocol (MCP, von Anthropic) löst genau dieses Problem. MCP standardisiert, wie KI-Tools auf externe Ressourcen und Fähigkeiten zugreifen:
KI-Client (Claude, Codex, etc.)
↕ MCP-Protokoll
MCP-Server (RAG-MCP)
↕ HTTP-API
Enterprise-RAG (NVIDIA Blueprint)
↕ Vektorsuche
Milvus (Wissensdatenbank)
Statt jedes Tool einzeln zu integrieren, implementiert man einmal einen MCP-Server — und alle MCP-kompatiblen Clients können damit arbeiten.
RAG-MCP: Unser Wrapper für den Enterprise-RAG
Unser RAG-MCP-Projekt ist ein FastMCP-basierter MCP-Server, der unseren NVIDIA Enterprise RAG Blueprint nach außen öffnet. Die bereitgestellten MCP-Tools:
Collection-Management:
- rag_list_collections — Welche Wissensräume gibt es?
- rag_create_collection — Neuen Wissensraum anlegen
- rag_delete_collection — Aufräumen
Dokument-Ingestion:
- rag_upload_document — PDF, DOCX, CSV hochladen und indexieren
- rag_get_document_status — Indexierungsfortschritt verfolgen
- rag_list_documents — Welche Dokumente sind in einer Collection?
Suche & Antwort:
- rag_search — Reine Vektorsuche (Top-K Chunks mit Scores)
- rag_generate — Vollständige RAG-Antwort mit Quellen-Citations
- rag_multi_search — Parallele Suche über mehrere Collections
Wie das in der Praxis aussieht
Ein Beispiel aus unserem Lab — Daniel fragt Claude Code direkt:
"Prüfe das Angebot von Dienstleister X gegen unsere Compliance-Anforderungen (Collection: vergaberecht_kb) und fasse die kritischen Punkte zusammen."
Claude Code ruft über MCP automatisch rag_generate auf:
- Collection: vergaberecht_kb
- Query: "Compliance-Anforderungen für Dienstleister-Angebote"
- Antwort kommt mit Citations (Dokument, Seite, Passage)
Claude integriert die RAG-Antwort in seine Analyse. Kein copy-paste, kein manuelles Suchen.
Sicherheit und Zugriffssteuerung
Da der RAG-MCP-Server auch extern erreichbar sein soll (via Pangolin Reverse Proxy), haben wir eine mehrstufige Sicherheitsarchitektur:
- Bearer-Token-Authentifizierung pro Request
- RBAC: Lese-Tokens (nur search/generate), Admin-Tokens (auch create/delete)
- Rate-Limiting auf Ingestion-Endpoints (PDF-Upload kann teuer sein)
- Request-Logging für Audit-Trail (welcher Agent hat was abgefragt)
- Collection-Scoping: Tokens können auf bestimmte Collections beschränkt werden
Extern (Claude.ai, Codex Cloud)
→ HTTPS (Bearer-Token)
→ rag-mcp.demo.bechtle-bremen.de (Pangolin)
→ RAG-MCP-Server :8085
→ NVIDIA RAG Blueprint (intern)
Was uns überrascht hat
MCP ist schneller als erwartet: Die Latenz eines RAG-MCP-Calls (MCP overhead + HTTP-Call + Embedding + Vektorsuche) beträgt bei uns 800ms–2s. Für synchrone Konversation ist das grenzwertig, für Analyse-Workflows völlig akzeptabel.
Multi-Collection-Queries sind der Game-Changer: rag_multi_search durchsucht mehrere Wissensräume parallel. Ein Claude-Aufruf kann gleichzeitig vergaberecht_kb, technische_spezifikationen und angebote_2027 abfragen — und die Ergebnisse kommen ranked zurück.
Citations machen den Unterschied: Enterprise-Nutzer wollen wissen, woher eine Antwort stammt. Citations (Dokument + Seite) sind nicht nice-to-have, sie sind Grundvoraussetzung für Akzeptanz.
Das größere Bild: Wissensinfrastruktur als Plattform
RAG-MCP ist ein Beispiel für einen Paradigmenwechsel, den wir in unserem Lab beobachten:
Alt: Jede KI-Anwendung baut ihre eigene Datenzugriffsschicht.
Neu: Zentrale Wissensinfrastruktur (RAG) + standardisiertes Interface (MCP) = Plattform für alle KI-Tools.
Die Konsequenz: Ein gut gepflegter MCP-Server für Enterprise-Wissen multipliziert den Wert für jedes KI-Tool, das hinzukommt — ohne Mehraufwand pro Tool.
Bechtle AI Competence Center Bremen | Lokale KI-Infrastruktur für Enterprise-Teams