Multimodale KI im Lab: Wenn Sprache, Bild und Audio zusammenwachsen
Multimodale KI im Lab: Wenn Sprache, Bild und Audio zusammenwachsen — Voxtral und Vision im Enterprise-Einsatz.
Multimodale KI im Lab: Wenn Sprache, Bild und Audio zusammenwachsen
BERTA Lab | Mai 2028
Lange Zeit haben wir KI-Modalitäten getrennt gedacht: Sprachmodelle für Text, Vision-Modelle für Bilder, Sprachmodelle für Audio. Seit Anfang 2028 löst sich diese Grenze im BERTA Lab zunehmend auf. Dieser Artikel beschreibt, was wir in der Praxis gelernt haben.
Wie wir zur Multimodalität kamen
Der Auslöser war kein großer strategischer Plan — sondern ein konkretes Problem bei Voicebot Bea.
Bea (unser Enterprise Voice-Assistent für Vergaberecht) musste Ausschreibungsdokumente bearbeiten, die nicht nur Text enthielten, sondern auch Tabellen als Scans, Signaturen als JPEG und Organigramme als eingebettete Bilder. Ein reines Sprachmodell konnte diese Dokumente nicht vollständig erfassen.
Die Lösung: Wir haben Beas Pipeline um einen Vision-Schritt erweitert, der Bildseiten vorverarbeitet, bevor das Sprachmodell die Inhalte bewertet. Das war der Beginn unserer multimodalen Reise.
Was wir seither gebaut haben
Voxtral + Vision: Die Vergabe-Pipeline
Mistral Voxtral hat uns bei Bea bereits bei Sprache überzeugt. Mit Voxtral V3 kam die echte Multimodalität: Das Modell versteht nun gesprochene Fragen, beantwortet sie mit Blick auf hochgeladene Dokument-Scans und gibt strukturierte Antworten zurück — alles in einem API-Aufruf.
Konkreter Use Case:
Benutzer spricht: „Ich möchte die Eignungskriterien aus dem Dokument zusammenfassen."
Bea erkennt Sprache → extrahiert Text aus Scan-Seiten → identifiziert Eignungsabschnitte → antwortet auf Deutsch.
Ohne Multimodalität waren dafür drei separate Dienste nötig (STT, OCR, LLM). Heute ist es ein kohärenter Workflow.
CoVision 2.0: Bild + Text + Kontext
Unser CoVision-Projekt (COVID-Schnelltests per Kamera auslesen) hat mit der multimodalen Erweiterung einen Qualitätssprung gemacht: Das Modell bewertet nun nicht nur das Testergebnis, sondern erkennt zusätzlich Chargennummer, Hersteller und Ablaufdatum — und korreliert das mit einer lokalen Produktdatenbank.
Accuracy ist von 90% auf 97% gestiegen — ohne zusätzliche OCR-Pipeline.
LevelLens mit Kontextverständnis
LevelLens (Wasserstand-Erkennung aus Video) wurde um natürlichsprachige Erklärungen erweitert: Das System beschreibt jetzt automatisch, was es sieht — auf Deutsch, für Betriebspersonal ohne Technik-Hintergrund.
„Pegel bei 87 cm — Warnschwelle bei 95 cm — Zunahme in den letzten 6 Stunden: 4,2 cm/h."
Das klingt einfach. Die Integration war es nicht. Aber der Business-Value ist sofort spürbar.
Was wirklich funktioniert — ehrliche Einschätzung
✅ Stärken der Multimodalität
Weniger Pipeline-Komplexität: Statt OCR → NLP → Sprachsynthese in drei separaten Diensten: ein Modell, eine API, ein Fehlerraum.
Bessere Kontextualisierung: Das Modell versteht, dass ein Diagramm zu einem bestimmten Textabschnitt gehört — etwas, das klassische OCR-Pipelines nicht leisten.
Natürliche Interaktion: Benutzer können Fragen zu Bildern stellen, ohne dass ihnen klar sein muss, dass ein Bild ein anderes Modalitäts-System triggert. Der Dialog ist seamless.
⚠️ Grenzen, die uns überraschten
Halluzinationen bei schlechter Bildqualität: Bei niedrig aufgelösten Scans oder schiefen Fotos halluziniert das Modell Inhalte. Wir haben eine Vorfilterung mit Qualitäts-Checks einbauen müssen.
Kosten explodieren bei Bildern: Ein Text-Only-Prompt kostet Bruchteile eines Bild-Prompts. Wir haben unsere Token-Schätzung komplett überarbeitet, nachdem die ersten Rechnungen kamen.
Lokale Alternativen hinken noch hinterher: Für Text-Only-Aufgaben sind lokale Modelle (GLM-5, Llama 4) kompetitive Alternativen zu Cloud-APIs. Bei echter Multimodalität sehen wir noch einen deutlichen Qualitätsgap. LLaVA-Nachfolger werden besser — aber für Produktions-Use-Cases greifen wir noch auf Cloud-APIs zurück.
Unsere Architektur-Entscheidung: Modal-agnostisches Routing
Wir haben in unserem LiteLLM-Proxy ein Routing-Layer ergänzt, das Anfragen nach Modalität sortiert:
Anfrage → Modalitätserkennung → Router
↓ Text-only → GLM-5 (lokal)
↓ Text + Bild → Voxtral / Claude Vision (Cloud)
↓ Audio + Text → Voxtral Realtime (Cloud)
↓ Audio + Bild + Text → Voxtral Multimodal (Cloud)
Lokales Modell, wenn es geht. Cloud-API, wenn die Modalität es erfordert.
Das klingt komplex — in der Praxis spart es uns erhebliche Kosten, weil 80% aller Anfragen Text-only sind.
Was für Enterprise-Einsteiger wichtig ist
Multimodale KI ist verlockend. Sie löst echte Probleme, die reine Textverarbeitung nicht lösen kann. Aber sie bringt zusätzliche Komplexität:
1. Starten Sie mit einem echten Use Case, nicht mit einer Technologie-Demo
Die Frage ist nicht „Können wir Bilder verarbeiten?" sondern „Welches Business-Problem wird durch visuelle Eingaben gelöst?"
2. Planen Sie Kosten realistisch
Bildverarbeitung kostet in Cloud-APIs 5-20× mehr pro Request als reine Textverarbeitung. Kalkulieren Sie das in Ihren Business Case ein.
3. Behalten Sie Fallbacks
Wenn das Bild schlecht ist oder das Modell halluziniert, brauchen Sie einen Eskalationspfad — entweder menschliche Prüfung oder ein konservatives Default-Verhalten.
Fazit
Multimodale KI ist kein Hype. Sie löst Probleme, die wir vor zwei Jahren noch mit umständlichen Multi-Pipeline-Architekturen angegangen sind — jetzt mit einem API-Call.
Aber sie ist auch kein Allheilmittel. Für Text-Only-Aufgaben sind lokale Modelle oft ausreichend und deutlich kostengünstiger. Die Kunst liegt im richtigen Routing.
Im BERTA Lab haben wir gelernt: Multimodalität dort einsetzen, wo sie wirklich zählt. Den Rest lokal lassen.
Das BERTA Lab (Bechtle AI Competence Center Bremen) entwickelt und testet seit 2026 KI-Lösungen für Enterprise-Kunden. Dieser Artikel dokumentiert unsere eigenen Erfahrungen — kein Sponsored Content.