Bea v3 nach einem Jahr: Was Voicebot 3.0 im Produktiveinsatz über multimodale Voice-KI gelehrt hat

Bea v3 nach einem Jahr: Was Voicebot 3.0 im Produktiveinsatz über multimodale Voice-KI gelehrt hat.

Bea v3 nach einem Jahr: Was Voicebot 3.0 im Produktiveinsatz über multimodale Voice-KI gelehrt hat

Datum: 2029-11-02 | Post #59 | Serie: BERTA Lab Insights 2029


Im März 2029 haben wir Bea v3 in Produktion gebracht. Seitdem — knapp neun Monate — hat Bea tausende von Vergaberechtsfragen beantwortet.

Das ist lange genug für eine ehrliche Lessons-Learned-Bilanz.

Was Bea v3 anders macht als v2

Zur Erinnerung: Bea v2 war ein textbasierter Sprachassistent mit RAG über Vergaberecht. Bea v3 ist multimodal — sie versteht Sprache in Echtzeit (STT mit Voxtral), antwortet mit natürlicher Sprachsynthese (TTS) und kann zusätzlich Dokumente entgegennehmen und visuell verarbeiten.

Die Hypothese beim Launch: Multimodalität macht Bea nützlicher, weil Nutzer natürlicher mit ihr interagieren können.

Die Realität nach neun Monaten: Ja — aber nicht auf die Art, die wir erwartet haben.

Was wir erwartet haben — und was wirklich passiert ist

Erwartung 1: Sprachinteraktion wird dominieren

Realität: ~60% der Interaktionen sind Sprach-zu-Sprach. Aber ~30% sind Hybrid: Nutzer sprechen eine Frage, laden dabei ein Dokument hoch ("Schau dir diesen Vertrag an und sag mir, ob §17 DSGVO-konform ist"). Das war häufiger als erwartet.

Erwartung 2: Nutzerzufriedenheit steigt linear mit Genauigkeit

Realität: Genauigkeit ist notwendig, aber nicht hinreichend. Die wichtigste Zufriedenheitsvariable ist Antwortgeschwindigkeit. Nutzer tolerieren eine leicht weniger präzise Antwort in 2 Sekunden besser als eine perfekte Antwort in 8 Sekunden.

Das hat unsere Infrastruktur-Prioritäten verändert: Mehr Investition in Latenzoptimierung, weniger in marginale Qualitätsverbesserungen.

Erwartung 3: Nutzende lernen die Grenzen des Systems schnell

Realität: Ja — aber die Grenzen werden aktiv getestet. Nutzer, die Bea eine Weile genutzt haben, entwickeln ein Modell ihrer Kompetenz und formulieren ihre Fragen entsprechend. Das ist gut. Es zeigt auch: Ein System, das konsistente Grenzen hat, wird besser genutzt als eines mit unvorhersehbaren Grenzen.

Die technischen Herausforderungen, die geblieben sind

1. STT-Halluzination in Pausen

Wenn Nutzer länger pausieren (nachdenken, Dokument suchen), halluziniert das STT-Modell gelegentlich Wörter oder kurze Sätze. Das ist ein bekanntes Problem mit Whisper-basierten Systemen — und noch nicht gelöst.

Unser Workaround: Aggressiveres Voice Activity Detection (VAD) und eine kurze "Warte"-Bestätigung ("Ich höre zu..."), die STT-Ausgabe in Pausen unterdrückt.

2. Markdownausgabe in TTS

Wenn das Sprachmodell Markdown-formatierte Antworten generiert (Aufzählungen, Fettdruck, Codeblöcke), klingt das im TTS unnatürlich — der Assistent liest "Sternchen Sternchen wichtig Sternchen Sternchen" vor.

Gelöst durch: Post-Processing-Layer, der Markdown-Syntax vor TTS entfernt und Listenelemente in natürliche Prosaformulierungen übersetzt.

3. Kontextfenster über lange Gespräche

Bea verliert bei sehr langen Gesprächen (15+ Minuten) Kontext aus dem Gesprächsanfang. Das ist eine fundamentale Limitation aktueller Architekturen.

Unser Ansatz: Aktives Zusammenfassen des Gesprächs alle paar Minuten in ein komprimiertes "Sitzungsgedächtnis". Kein perfekter Ersatz für einen echten langen Kontext — aber praktisch ausreichend.

Was wirklich gut funktioniert

Vergaberechtskompetenz: Die RAG-Integration über aktuelle Vergaberecht-Dokumentation liefert konsistent präzise Antworten. In Kundentests wurde die Antwortqualität für Standard-Vergabefragen mit 4,2/5 bewertet.

Mehrsprachigkeit: Bea versteht Fachfragen auf Deutsch, antwortet auf Deutsch, kann aber auch Englisch — was bei internationalen Projekten genutzt wird.

Dokumentenintegration: Das Hochladen von Vergabeunterlagen und Verträgen für Kontext-spezifische Fragen wird von Nutzern intensiv genutzt und sehr positiv bewertet.

Was wir für Bea v4 planen

Keine konkreten Commitments — aber die Stoßrichtungen:

  1. Gedächtnissystem über Sitzungen hinweg: Bea soll sich an Nutzerpräferenzen und häufige Projektkontexte erinnern (datenschutzkonform opt-in).

  2. Proaktive Hinweise: Wenn Bea in einem Vergabekontext bemerkt, dass eine häufige Folgefrage wahrscheinlich ist ("Sie fragen nach DSGVO — möchten Sie auch die Verarbeitungsverzeichnis-Anforderungen für Auftragsverarbeitungsverträge klären?").

  3. Integration mit Procurement-Systemen: Direktes Einlesen aus Vergabe-Managementsystemen, statt manuellen Dokumenten-Upload.

Die große Frage: War multimodal richtig?

War der Aufwand für Bea v3 gerechtfertigt gegenüber einer verbesserten v2?

Antwort nach neun Monaten: Ja — aber der Mehrwert kommt primär aus der Sprachinteraktion (STT/TTS), nicht aus der visuellen Modalität. Document-Understanding ist gut, aber 80% der Nutzung ist voice-first.

Für ähnliche Projekte: Eine gute STT/TTS-Integration ist das lohnendste Investment. Visuelle Modalität ist wertvoll, aber sekundär.


Daniel Röding ist IT-Consultant bei Bechtle Bremen und leitet das BERTA Lab. Bea v3 ist unter https://bea.demo.bechtle-bremen.de erreichbar (Pangolin-SSO geschützt).

#VoiceAI #MultimodalAI #EnterpriseAI #Vergaberecht #KI #Chatbot #BertaLab #ProductionAI

Lab-Blog · AI Competence Center · Bechtle Bremen / Oldenburg  |  Kein offizieller Bechtle-Kanal