RAG meets MCP: Wenn Enterprise-Wissen zur KI-nativen API wird

RAG meets MCP: Wenn Enterprise-Wissen zur KI-nativen API wird — Model Context Protocol in der Praxis.

RAG meets MCP: Wenn Enterprise-Wissen zur KI-nativen API wird

Post 34 — September 2027 | Bechtle AI Competence Center Bremen


Eine Frage, die wir immer wieder hören: "Wir haben eine großartige RAG-Wissensdatenbank aufgebaut. Aber wie machen wir sie für Claude, Codex und unsere anderen KI-Tools direkt nutzbar — ohne jeden Access-Code neu schreiben zu müssen?"

Die Antwort liegt im Model Context Protocol (MCP). Und unsere Antwort im Lab heißt RAG-MCP.


Das Problem: Wissen und Werkzeuge sind getrennt

Unser BERTA Lab betreibt seit über einem Jahr einen produktiven NVIDIA Enterprise RAG Blueprint auf eigenem Server. Die Wissensdatenbank umfasst Compliance-Dokumente, Ausschreibungsunterlagen, technische Spezifikationen — tausende Dokumente, präzise indexiert mit Milvus als Vektor-DB.

Parallel dazu wächst unser KI-Tool-Ökosystem: Claude Code, Archon, OpenClaw, eigene Agenten. Jedes Tool, das RAG-Wissen braucht, muss aktuell:
1. Den RAG-Server-Endpoint kennen (http://rag-server:8081/generate)
2. Die Query-API kennen und implementieren
3. Mit Collections umgehen können
4. Citations parsen

Das führt zu n × m Integrationsproblemen — n Tools, m Wissensquellen.


Die Lösung: MCP als universelle Brücke

Das Model Context Protocol (MCP, von Anthropic) löst genau dieses Problem. MCP standardisiert, wie KI-Tools auf externe Ressourcen und Fähigkeiten zugreifen:

KI-Client (Claude, Codex, etc.)
         ↕ MCP-Protokoll
MCP-Server (RAG-MCP)
         ↕ HTTP-API
Enterprise-RAG (NVIDIA Blueprint)
         ↕ Vektorsuche
Milvus (Wissensdatenbank)

Statt jedes Tool einzeln zu integrieren, implementiert man einmal einen MCP-Server — und alle MCP-kompatiblen Clients können damit arbeiten.


RAG-MCP: Unser Wrapper für den Enterprise-RAG

Unser RAG-MCP-Projekt ist ein FastMCP-basierter MCP-Server, der unseren NVIDIA Enterprise RAG Blueprint nach außen öffnet. Die bereitgestellten MCP-Tools:

Collection-Management:
- rag_list_collections — Welche Wissensräume gibt es?
- rag_create_collection — Neuen Wissensraum anlegen
- rag_delete_collection — Aufräumen

Dokument-Ingestion:
- rag_upload_document — PDF, DOCX, CSV hochladen und indexieren
- rag_get_document_status — Indexierungsfortschritt verfolgen
- rag_list_documents — Welche Dokumente sind in einer Collection?

Suche & Antwort:
- rag_search — Reine Vektorsuche (Top-K Chunks mit Scores)
- rag_generate — Vollständige RAG-Antwort mit Quellen-Citations
- rag_multi_search — Parallele Suche über mehrere Collections


Wie das in der Praxis aussieht

Ein Beispiel aus unserem Lab — Daniel fragt Claude Code direkt:

"Prüfe das Angebot von Dienstleister X gegen unsere Compliance-Anforderungen (Collection: vergaberecht_kb) und fasse die kritischen Punkte zusammen."

Claude Code ruft über MCP automatisch rag_generate auf:
- Collection: vergaberecht_kb
- Query: "Compliance-Anforderungen für Dienstleister-Angebote"
- Antwort kommt mit Citations (Dokument, Seite, Passage)

Claude integriert die RAG-Antwort in seine Analyse. Kein copy-paste, kein manuelles Suchen.


Sicherheit und Zugriffssteuerung

Da der RAG-MCP-Server auch extern erreichbar sein soll (via Pangolin Reverse Proxy), haben wir eine mehrstufige Sicherheitsarchitektur:

  • Bearer-Token-Authentifizierung pro Request
  • RBAC: Lese-Tokens (nur search/generate), Admin-Tokens (auch create/delete)
  • Rate-Limiting auf Ingestion-Endpoints (PDF-Upload kann teuer sein)
  • Request-Logging für Audit-Trail (welcher Agent hat was abgefragt)
  • Collection-Scoping: Tokens können auf bestimmte Collections beschränkt werden
Extern (Claude.ai, Codex Cloud)
    → HTTPS (Bearer-Token)
    → rag-mcp.demo.bechtle-bremen.de (Pangolin)
    → RAG-MCP-Server :8085
    → NVIDIA RAG Blueprint (intern)

Was uns überrascht hat

MCP ist schneller als erwartet: Die Latenz eines RAG-MCP-Calls (MCP overhead + HTTP-Call + Embedding + Vektorsuche) beträgt bei uns 800ms–2s. Für synchrone Konversation ist das grenzwertig, für Analyse-Workflows völlig akzeptabel.

Multi-Collection-Queries sind der Game-Changer: rag_multi_search durchsucht mehrere Wissensräume parallel. Ein Claude-Aufruf kann gleichzeitig vergaberecht_kb, technische_spezifikationen und angebote_2027 abfragen — und die Ergebnisse kommen ranked zurück.

Citations machen den Unterschied: Enterprise-Nutzer wollen wissen, woher eine Antwort stammt. Citations (Dokument + Seite) sind nicht nice-to-have, sie sind Grundvoraussetzung für Akzeptanz.


Das größere Bild: Wissensinfrastruktur als Plattform

RAG-MCP ist ein Beispiel für einen Paradigmenwechsel, den wir in unserem Lab beobachten:

Alt: Jede KI-Anwendung baut ihre eigene Datenzugriffsschicht.
Neu: Zentrale Wissensinfrastruktur (RAG) + standardisiertes Interface (MCP) = Plattform für alle KI-Tools.

Die Konsequenz: Ein gut gepflegter MCP-Server für Enterprise-Wissen multipliziert den Wert für jedes KI-Tool, das hinzukommt — ohne Mehraufwand pro Tool.


Bechtle AI Competence Center Bremen | Lokale KI-Infrastruktur für Enterprise-Teams

MCP #RAG #EnterpriseAI #KI #ModelContextProtocol #NVIDIA #KnowledgeManagement #BERTALab #OnPremiseAI

Lab-Blog · AI Competence Center · Bechtle Bremen / Oldenburg  |  Kein offizieller Bechtle-Kanal