Bea v3 Launch: Voicebot 3.0 live

Bea v3 Launch: Voicebot 3.0 live — Multimodale Sprachsteuerung für das Vergaberecht in Produktion.

Bea v3 Launch: Voicebot 3.0 live

BERTA Lab | März 2029

Es ist so weit. Bea v3 ist live.

Für die, die die Entwicklung verfolgt haben: Im Februar haben wir die Architektur beschrieben — Persistent Memory Layer, audio-native STT, Multimodalität, Response Sanitization. Heute ist das alles in Produktion.

Hier ist, was sich verändert hat — und was wir dabei gelernt haben.


Was Bea v3 jetzt kann

Persistent Memory across Sessions. Bea erinnert sich. Sie weiß, welche Ausschreibungen ein Nutzer zuletzt bearbeitet hat. Sie kennt den Kontext vergangener Gespräche. Sie fragt nicht mehr „Können Sie mir kurz erklären, worum es geht?" — sie setzt an dem an, wo das letzte Gespräch geendet hat.

In der Praxis macht das einen unterschätzten Unterschied: Nutzer entspannen sich. Das Gespräch fühlt sich weniger wie eine Transaktion an und mehr wie eine Arbeitssitzung.

Multimodaler Input. Bea kann jetzt Dokumente verarbeiten, die ihr während des Gesprächs übergeben werden. PDF einer Vergabeunterlage? Bea liest sie und antwortet darauf. Tabelle mit Bewertungskriterien? Sie extrahiert die relevanten Punkte und kommentiert sie im Kontext der Frage.

Das war das meistgefragte Feature nach dem Bea-v2-Launch. Wir haben es für v3 priorisiert.

Nahezu halluzinationsfreie STT. Der Wechsel auf ein audio-natives Sprachmodell hat das Pausen-Halluzinationsproblem aus Bea v2 praktisch eliminiert. In internen Tests: 0 halluzinierte englische Sätze über 200 Testgespräche. In v2 lag das bei ~3%.

Die Latenz ist dabei nur marginal höher: 280ms im Median (v2: 220ms). Innerhalb unserer 300ms-Grenze.

Saubere TTS-Ausgabe. Response Sanitization läuft vor jeder TTS-Übergabe. Keine Asterisken, keine Markdown-Artefakte mehr. Die Ausgabe klingt wie natürliche gesprochene Sprache — nicht wie vorgelesenes HTML.


Zahlen aus der ersten Woche

Nach sieben Tagen Produktivbetrieb sind die ersten Zahlen da:

  • Gesprächslänge: +38% gegenüber Bea v2 (Nutzer bleiben länger im Gespräch)
  • Abbruchrate bei >5 Austauschen: -52% (Kontextverlust war der Hauptabbruchgrund in v2)
  • STT-Fehlerrate: 1,2% (v2: 4,8%)
  • Nutzerzufriedenheit (intern, n=18): 4,4/5 (v2: 3,7/5)

Das sind noch kleine Stichproben. Aber die Richtung stimmt.


Was wir falsch gemacht haben — und was wir gelernt haben

Kein Launch ohne Lernmomente.

Consent Flows waren zu komplex. Die DSGVO-konforme Memory-Einwilligung, die wir gebaut haben, war in der ersten Version dreistufig. Nutzer haben abgebrochen. Wir haben sie auf eine einzige, klare Abfrage reduziert: „Bea darf sich an dieses Gespräch erinnern. Einverstanden?" Akzeptanzrate: 91%.

Multimodal-Latenz unterschätzt. Die Dokumentenverarbeitung fügt Latenz hinzu. Bei größeren PDFs (+20 Seiten) kam es zu Wartezeiten von 3-8 Sekunden. Wir haben asynchrones Vorab-Processing implementiert — während Bea antwortet, verarbeitet sie bereits das Dokument im Hintergrund. Das hilft. Vollständig gelöst ist es noch nicht.

Memory-Feedback fehlte. Nutzer wussten nicht, was Bea sich gemerkt hat. Das erzeugte Unbehagen: „Erinnert sie sich an alles?" Wir haben eine Memory-Übersicht eingebaut — Nutzer können sehen, was gespeichert ist, und einzelne Einträge löschen.


Was das für Enterprise Voice-KI bedeutet

Bea v3 ist kein Sprung in eine neue Technologie-Kategorie. Es ist die Reife der Kategorie.

Voice-KI im Enterprise-Einsatz funktioniert, wenn drei Dinge zusammenkommen:

  1. Domänenwissen — ein RAG-Backend, das die richtigen Antworten kennt
  2. Kontextgedächtnis — ein System, das weiß, wen es gerade unterstützt
  3. Sprachlicher Fluss — eine TTS/STT-Pipeline, die sich nicht wie ein Roboter anfühlt

Bea v2 hatte (1). Bea v3 hat alle drei.

Das Interessante: Die Nutzer, die bisher skeptisch gegenüber Voice-Interfaces waren, sind jetzt die enthusiastischsten Bea-v3-Nutzer. Weil (2) und (3) offenbar der entscheidende Unterschied zwischen „Spielzeug" und „Werkzeug" waren.


Nächste Schritte

Bea v3 ist live — aber nicht fertig.

Was wir für Q2/Q3 2029 planen:

  • Aktives Retrieval: Bea sucht proaktiv nach relevanten Dokumenten, ohne dass der Nutzer explizit danach fragt
  • Multi-User-Kontext: Mehrere Nutzer arbeiten an derselben Ausschreibung — Bea synchronisiert den Kontext
  • Feedback Loop: Bea lernt aus Korrekturen, die Nutzer im Gespräch vornehmen

Außerdem: Wir bereiten ein Open-Source-Release der Response-Sanitization-Pipeline vor. Die ist zu nützlich, um sie für uns zu behalten.


Daniel Röding
KI-Architekt und Leiter BERTA Lab, Bechtle AI Competence Center Bremen

#KI #EnterpriseKI #BERTALab #BeaV3 #Voicebot #VoiceAI #Multimodal #LaunchDay #OnPremiseKI

Lab-Blog · AI Competence Center · Bechtle Bremen / Oldenburg  |  Kein offizieller Bechtle-Kanal