Open-Source-LLMs 2028: Llama 4, Mistral 4 und GLM-5 im Enterprise-Einsatz — ein ehrlicher Vergleich

Open-Source-LLMs 2028: Llama 4, Mistral 4 und GLM-5 im Enterprise-Einsatz — ein ehrlicher Vergleich aus dem Lab.

Open-Source-LLMs 2028: Llama 4, Mistral 4 und GLM-5 im Enterprise-Einsatz — ein ehrlicher Vergleich

BERTA Lab | August 2028

Drei Jahre lang haben wir im BERTA Lab lokale KI-Modelle betrieben — lange bevor „On-Premise AI" ein Buzzword wurde. In dieser Zeit haben wir mehr Modelle evaluiert, gemigriert und wieder verworfen als die meisten Unternehmen in einem Jahrzehnt. Hier ist unser ehrlicher Stand 2028.


Die Ausgangslage: Warum Open-Source überhaupt?

2025 war die Antwort noch einfach: Datenschutz und Kosten. Kundendaten in die Cloud zu schicken war rechtlich riskant, und GPT-4-API-Kosten bei hohem Volumen kaum kalkulierbar.

2028 ist die Antwort komplexer — und interessanter. Die Frage ist nicht mehr „Open-Source oder Cloud?", sondern „welches Open-Source-Modell für welchen Use Case?"


Was sich in drei Jahren verändert hat

Qualität: Die Lücke ist fast geschlossen

2025 war der Qualitätsabstand zwischen lokalen Modellen und GPT-4/Claude-Frontier noch deutlich spürbar — besonders bei komplexen Reasoning-Aufgaben.

2028 ist das anders. Llama 4 Scout und Maverick (Meta, April 2025) markierten eine Zäsur: Multi-Token-Prediction, 128k-Kontextfenster, Mixture-of-Experts-Architektur. Für strukturierte Extraktion, RAG und Code-Generation sind diese Modelle den proprietären Frontier-Modellen ebenbürtig oder überlegen.

Mistral 4 (erschienen Q1 2028) baut auf dem Erfolg von Mistral Small weiter: schneller, effizienter, besser auf europäische Compliance-Anforderungen optimiert.

GLM-5 (ZhipuAI) ist in unserer Infrastruktur seit drei Generationen ein treuer Begleiter. Was mit GLM-4 als Reasoning-Experiment begann, ist heute unser bevorzugtes Modell für mehrstufige Analyse-Pipelines.

Infrastruktur: vLLM hat gewonnen

Wir haben Ollama, llama.cpp, LMStudio, SGLang und vLLM in der Produktion betrieben. 2028 läuft bei uns alles über vLLM und LiteLLM als Proxy-Layer.

vLLMs Tensor-Parallelism über mehrere GPUs, kontinuierliches Batching und PagedAttention machen es für Mehrnutzer-Szenarien unschlagbar. LiteLLM ermöglicht uns, Modelle ohne Codeänderungen auszutauschen — wir schalten heute von GLM auf Mistral, ohne dass irgendjemand im Team etwas merkt.

Kosten: Die Rechnung hat sich verändert

Szenario 2025 2028
Hostingkosten (2× H100) Hauptkostentreiber Auf mehrere Use Cases verteilt
Modell-Downloads GB-Aufwand Automatisiert, gemanagt
Fine-Tuning Projekt-Aufwand Standard-Pipeline
Compliance-Aufwand Manuell Teils automatisiert (EU AI Act)

Die Hardware amortisiert sich bei uns nach 14 Monaten. Das ist keine Schätzung — das haben wir durchgerechnet.


Unser aktueller Modell-Stack

Für Allround-Aufgaben: Llama 4 Scout

Scout (17B-Aktivparameter, MoE) läuft bei uns auf zwei H100 ohne Tensor-Parallel — schnell, günstig, zuverlässig. Für RAG, Dokumentenanalyse, Chatbots und erste Entwürfe ist das unser Standard.

Stärken: Balance zwischen Qualität und Geschwindigkeit. Instruction-following auch für komplexere Prompts stabil.

Schwächen: Bei sehr langen Reasoning-Chains (>10 Schritte) verliert das Modell den Faden. Hier kommt GLM-5 zum Einsatz.

Für komplexe Analysen: GLM-5

GLM-5 ist unser Reasoning-Powerhouse. Im BERTA Lab nutzen wir es für:
- Vergaberecht-Analyse mit Bea (200+ Seiten Ausschreibungstexte)
- Multi-Step-Evaluationen in IT-Ausschreibungsanalyse
- Komplexe Agent-Orchestrierung, bei der Llama 4 zu häufig Fehler produziert

Stärken: Überragendes Reasoning, stabile Multi-Turn-Konversationen, gutes Funktionsaufruf-Verhalten.

Schwächen: Langsamer. Bei hohem Parallelism-Bedarf kein Selbstläufer.

Für europäische Compliance: Mistral 4

Seit Mistral 4 haben wir für Kunden-Projekte mit DSGVO-sensitiven Daten einen dedizierten Stack: Mistral-Infrastruktur in Europa, EU-eigene Serverinfrastruktur, Mistral als französisches Unternehmen unter europäischem Recht.

Das ist kein Marketing. Das ist ein handfestes Argument gegenüber Datenschutzbeauftragten, die nach Drittlandtransfers fragen.


Was in der Praxis wirklich entscheidet

1. Context-Länge ist nicht gleich Context-Qualität

Llama 4 Maverick hat ein 1-Million-Token-Kontextfenster. Das klingt beeindruckend. In der Praxis haben wir gelernt: Modelle „vergessen" im langen Kontext. Die Qualität der Antworten nimmt ab, wenn kritische Informationen in der Mitte von 200k Token begraben liegen.

Unsere Praxis: Maximales effektives Kontextfenster für RAG: 32k. Für Reasoning-Aufgaben: 16k. Alles darüber braucht ein cleveres Chunking, nicht mehr Kontext.

2. Quantisierung kostet Qualität — meistens

4-Bit-Quantisierung (GGUF) spart GPU-RAM, kostet aber Qualität. Für einfache Extraktion vernachlässigbar. Für komplexes Reasoning spürbar.

Unsere Praxis: Wir betreiben Produktionsmodelle auf 8-Bit, Entwicklungsinstanzen auf 4-Bit. Der Unterschied rechtfertigt das.

3. Fine-Tuning ist eine Investition, kein Automatismus

Wir haben sechs Fine-Tuning-Projekte durchgeführt. Zwei waren ein klarer Erfolg (Bea für Vergaberecht, Hermes für Compliance-Klassifikation). Vier haben sich nicht rentiert.

Wann Fine-Tuning sinnvoll ist:
- Hochspezialisierte Domäne mit Fachvokabular (Vergaberecht, Medizin)
- Klarer Output-Typ mit messbarer Qualität
- Mindestens 500 hochwertige Trainingsbeispiele

Wann nicht:
- „Das Modell versteht unsere Firma nicht gut genug" → Das ist ein RAG- oder Prompt-Problem, kein Modell-Problem.
- Zu wenig Daten → LoRA macht dann wenig bis nichts.


Was 2028 noch fehlt

Trotz aller Fortschritte gibt es Bereiche, wo lokale Open-Source-Modelle noch hinter proprietären Frontier-Modellen zurückliegen:

Multimodalität im Grenzbereich: Bei sehr schlechter Bildqualität, Handschriften oder nicht-standardisierten Layouts halluzinieren selbst Llama 4 Vision noch stärker als GPT-4o oder Claude.

Spontanes Multi-Step-Reasoning: Bei Aufgaben, die wirklich mehrere Erkenntnisschritte erfordern (nicht nur Faktenabfrage + Formulierung), sind die besten proprietären Modelle noch einen Schritt voraus.

Schlechte Anweisungen tolerieren: Frontier-Modelle kompensieren unklare Prompts besser. Lokale Modelle brauchen präzisere Instruktionen — das ist ein Aufwand, den man einplanen muss.


Unser Fazit

Open-Source-LLMs 2028 sind Enterprise-ready — für die meisten Use Cases. Der Schlüssel ist, zu wissen, welches Modell man wofür einsetzt.

Unser Stack-Prinzip: Scout für Geschwindigkeit, GLM-5 für Tiefe, Mistral 4 für Compliance. Alle über LiteLLM abstrahiert, alle über vLLM betrieben, alle intern.

Wer 2025 gesagt hat, lokale Modelle seien ein Kompromiss, der muss 2028 neu nachdenken. Der Kompromiss ist jetzt meistens: proprietär nutzen und Datenschutz und Kostenvorhersagbarkeit aufgeben — oder lokal betreiben und Qualität und Compliance selbst kontrollieren.

Für uns war die Antwort seit drei Jahren dieselbe. Sie ist es heute noch mehr.


Daniel Röding
KI-Architekt und Leiter BERTA Lab, Bechtle AI Competence Center Bremen

#KI #OpenSource #EnterpriseAI #LLM #Llama4 #Mistral #OnPremiseAI #BERTALab #AIGovernance

Lab-Blog · AI Competence Center · Bechtle Bremen / Oldenburg  |  Kein offizieller Bechtle-Kanal