Wenn KI sich erinnert: Persistentes Memory für Self-Hosted KI-Assistenten

Mem0 + OpenClaw: Persistentes Memory für Self-Hosted KI-Assistenten — wenn KI sich an Gespräche erinnert.

Wenn KI sich erinnert: Persistentes Memory für Self-Hosted KI-Assistenten

Unser OpenClaw-Assistent kennt uns — und das seit Monaten.

Er weiß, welche Projekte wir gerade vorantreiben. Er kennt unsere Präferenzen bei Code-Reviews. Er erinnert sich, dass wir im Januar entschieden haben, keine React-Klassen-Komponenten mehr zu schreiben. Und er fragt nicht jedes Mal neu nach, was RAG eigentlich bedeutet.

Das klingt selbstverständlich. Ist es aber nicht.


Das Goldfish-Problem der KI

Die meisten KI-Assistenten haben ein fundamentales Problem: Sie vergessen alles.

Jede neue Sitzung ist ein Neustart. Sie erklären denselben Kontext. Sie wiederholen dieselben Präferenzen. Sie geben dieselben Hintergrundinformationen. Der Assistent ist mächtig — aber er lernt nie, wer Sie sind.

Das ist kein Fehler im System. Es ist Absicht: Datenschutz durch Vergessen. Aber für Teams, die täglich mit KI arbeiten, wird dieses Vergessen zur echten Produktivitätsbremse.

Die Frage ist: Können wir das ändern — ohne Datenschutz zu opfern?


Was wir gebaut haben: Mem0 + OpenClaw

Im BERTA Lab haben wir unser OpenClaw-System — unser selbst gehosteter KI-Assistent für Telegram, Slack und iMessage — mit einem persistenten Memory-Layer ausgestattet.

Die Architektur ist bewusst modular:

┌─────────────────┐     ┌─────────────────┐     ┌─────────────────┐
│    OpenClaw     │────▶│   Mem0 API      │────▶│     Qdrant      │
│   Extension     │     │   :8050         │     │   Vector Store  │
└─────────────────┘     └────────┬────────┘     └─────────────────┘
                                 │
                                 ▼
                        ┌─────────────────┐
                        │  Ollama bge-m3  │
                        │   Embeddings    │
                        └─────────────────┘
  • Mem0 übernimmt die Intelligenzschicht: Extraktion, Deduplizierung, Versionierung von Erinnerungen
  • Qdrant speichert die Vektoren für semantische Suche
  • Ollama bge-m3 erzeugt die Embeddings — lokal, ohne Cloudabfrage
  • OpenClaw Extension verbindet alles als Plugin mit Auto-Recall und Auto-Capture

Jede Konversation wird analysiert. Relevante Fakten werden extrahiert und gespeichert. Beim nächsten Gespräch ruft der Assistent automatisch relevante Erinnerungen ab — ohne dass der Nutzer etwas tun muss.


Was Mem0 besser macht als naive Lösungen

Die naive Lösung wäre: Alle Nachrichten in eine Datenbank schreiben, dann beim nächsten Start den letzten Chatverlauf anhängen. Das skaliert nicht.

Mem0 geht einen anderen Weg:

Deduplizierung: Wenn Sie zweimal sagen, dass Sie Python bevorzugen — wird daraus nicht zwei Erinnerungen. Mem0 erkennt semantische Überlappungen und konsolidiert.

Versionierung: Erinnerungen können sich ändern. „Ich arbeite an Projekt X" wird nach Projektabschluss überschrieben, nicht einfach dupliziert. Die History bleibt erhalten.

Selektiver Recall: Beim nächsten Gespräch werden nicht alle 500 gespeicherten Fakten in den Kontext geladen — sondern nur die semantisch relevanten. Das hält die Antworten schnell und fokussiert.


Was das in der Praxis bedeutet

Nach einigen Monaten produktivem Einsatz haben wir 503 Erinnerungen angesammelt. Darunter:

  • Projektkontext (welche Repos, welche Technologien, welche Entscheidungen)
  • Präferenzen (Code-Stil, bevorzugte Tools, Sprachen)
  • Persönliche Fakten (Rollen, Zuständigkeiten, Ziele)
  • Entscheidungstrails (warum haben wir was wann entschieden)

Der Effekt: Der Assistent antwortet nicht mehr generisch. Er antwortet im Kontext. Ein Satz wie „Wie war das nochmal mit der Voicebot-Architektur?" bekommt eine fundierte Antwort — weil er sich an die Diskussionen von vor drei Monaten erinnert.


Datenschutz durch lokale Souveränität

Das entscheidende Feature: Alles läuft lokal.

Kein Cloudanbieter hat Zugriff auf Ihre gespeicherten Erinnerungen. Keine Trainingsdaten werden abgegriffen. Kein SaaS-Abo, das Ihre Konversationshistorie als Produkt behandelt.

Setup:

docker compose up -d   # Qdrant + Mem0 API
openclaw gateway restart

Das war es. Der Assistent beginnt automatisch, zu lernen.

Für Backup und Restore nutzen wir ein einfaches JSON-Format: Alle Memories werden ohne Vektoren exportiert (die werden beim Import aus den Texten neu berechnet). Das läuft als nächtlicher Git-Commit ins private Repo.


Was Enterprise-Teams daraus lernen können

Persistentes Memory ist kein nettes Extra. Es ist das, was den Unterschied zwischen einem Tool und einem Kollegen ausmacht.

Ein KI-Assistent, der neu konfiguriert, neu gebrieft, neu kontextualisiert werden muss, ist kein Assistent — er ist ein Aufwand.

Die Kombination aus selbst gehostetem Assistenten + persisten Memory + lokalen Embeddings zeigt, wie weit man heute kommt, ohne Daten aus dem Haus zu geben.

Wir haben in diesem System 503 Erinnerungen, die über Monate gewachsen sind. Das entspricht dem Wissen, das ein guter neuer Mitarbeiter in seiner ersten Woche aufnimmt — nur dass dieser Mitarbeiter nie schläft, nie vergisst, und nie ins Büro pendeln muss.


Technischer Stack auf einen Blick

Komponente Rolle Technologie
Assistent-Gateway Chat-Interface OpenClaw (Telegram/Slack)
Memory-Intelligenz Extraktion, Deduplizierung Mem0 (FastAPI)
Vektorspeicher Semantische Suche Qdrant
Embeddings Lokale Vektorisierung Ollama bge-m3

Alle Komponenten laufen als Docker-Container auf unserem KI-Server. Keine externen Abhängigkeiten.


Wenn Ihr KI-Assistent nach jedem Gespräch wieder ein Unbekannter ist, fehlt ihm Gedächtnis — nicht Intelligenz.

Das lässt sich ändern. Lokal. Datenschutzkonform. Mit Open-Source-Tools.

Wir haben es gebaut. Es funktioniert.

#EnterpriseAI #LocalAI #KIAssistent #Datenschutz #OpenSource #BERTALAB #mem0 #Qdrant #OpenClaw

Lab-Blog · AI Competence Center · Bechtle Bremen / Oldenburg  |  Kein offizieller Bechtle-Kanal