KI-Modellwahl: Kosten, Kontrolle und Kontinuität des Produkts.
Die Modellwahl muss sich an realen Aufgaben bewähren. Daten, Anwendungsabläufe, Kosten und Wechselmöglichkeiten zählen ebenso wie Benchmark-Ergebnisse.
Von der Aufgabe ausgehen
Welches ist das kostengünstigste Modell, das die Anforderungen dieser Aufgabe zuverlässig erfüllt?
Zunächst kläre ich Mindestqualität, Antwortzeit, Volumen, Datenschutz und Kontinuität. Die Wahl eines Anbieters folgt später. Ein insgesamt hervorragendes Modell kann für eine bestimmte Tätigkeit ungeeignet sein; ein kleineres kann genügen, wenn repräsentative Tests dies zeigen.
Die organisatorische und wirtschaftliche Bewertung geht dieser Wahl voraus. Die technische Qualität der Antworten erfordert gesonderte Entwicklungs- und Prüfungsarbeit.
Verfügbare Gewichte und proprietäre Dienste
Open-Weight bedeutet, dass die Modellgewichte verfügbar sind. Daraus folgen nicht automatisch eine Open-Source-Lizenz, uneingeschränkte Nutzung oder geringere Kosten. Auch ein Open-Weight-Modell kann über einen externen Dienst genutzt werden.
Epoch AI stellt in seiner Analyse vom Mai 2026 fest: Seit Januar lagen die leistungsfähigsten Open-Weight-Modelle im ECI-Index durchschnittlich etwa vier Monate hinter der Closed-Weight-Spitze. Das beschreibt einen Zeitraum und einen Messansatz, keine Gleichwertigkeit bei jeder Aufgabe.
Anthropics Cyber-Vergleich vom September 2026 liefert ein weiteres begrenztes Beispiel: Bei 41 V8-Schwachstellen erzeugte GLM-5.3 in etwa 12 % der Versuche funktionierende Exploits, Mythos Preview in 14 %. Das ist kein Vergleich der allgemeinen Modellqualität.
Meine architektonische Schlussfolgerung: Ein Wechsel sollte möglich sein, wenn sich der Vorteil eines Modells verändert. Der Aufwand dafür muss zum Projektrisiko passen.
Die Kosten des gesamten Prozesses
Token-Preise sind ein Teil der Rechnung. Hinzu kommen Datenaufbereitung, Infrastruktur, Wiederholungen, menschliche Prüfungen, Überwachung und Wartung. Eigenbetrieb erfordert GPUs und Betriebskompetenz; bei geringer oder unregelmäßiger Last kann eine API wirtschaftlicher sein.
In McKinseys Umfrage vom Mai 2026 berichteten 93 % der 75 qualifizierten Befragten von einer Überschreitung ihres KI-Budgets. Die Stichprobe repräsentiert nicht alle Unternehmen, macht aber auf die Kosten einer breiten Einführung aufmerksam.
Ein Ablauf kann unterschiedliche Tätigkeiten an verschiedene Modelle weiterleiten: höhere Leistungsfähigkeit, wo das Problem sie erfordert, günstigere oder spezialisierte Modelle für klar definierte Schritte. Jeder Pfad muss die Datenvorgaben einhalten und dieselben Qualitätsprüfungen bestehen.
Wie lange muss die Lösung funktionieren?
Wer Gewichte, Laufzeitumgebung und Hardware kontrolliert, kann eine Konfiguration beibehalten, solange sie die Anforderungen erfüllt. Ein neues Modell erfordert nicht automatisch einen Wechsel; Sicherheitsaktualisierungen und Komponentenwartung bleiben notwendig.
Eine externe API hat einen anderen Lebenszyklus: OpenAI und Anthropic dokumentieren Abkündigungen und Stilllegungen. Ein notwendiger Wechsel, weil ein Dienst entfällt, ist von einem wirtschaftlich sinnvollen Wechsel zu unterscheiden, der Qualität, Kosten oder Leistung verbessert.
Ich plane deshalb Aufwand für eine erneute Bewertung und die Kontinuität des Dienstes ein. Modellunabhängigkeit ist eine Investition: Ihr Wert steigt mit der Wahrscheinlichkeit und den Kosten eines späteren Wechsels.
Veränderliche Teile abgrenzen
Ich würde das System in Teile mit klaren Verantwortlichkeiten gliedern:
- 01Anwendung und Fachdomäne
Produktregeln, Berechtigungen und Daten, für die die Anwendung verantwortlich bleibt.
- 02Ablauf und Werkzeuge
Schritte, Prüfungen, Informationsabruf und zulässige Aktionen.
- 03Modelladapter
Anbieterspezifische Formate, Anweisungen, strukturierte Ausgaben und Werkzeugaufrufe.
- 04Modell und Ausführungsumgebung
Ein externer Dienst oder ein Modell auf kontrollierten Ressourcen.
Dies ist ein Entwurfsvorschlag, keine allgemeingültige Vorgabe. Adapter verringern Abhängigkeiten, doch Modelle verhalten sich unterschiedlich: Ein Wechsel erfordert häufig Anpassungen an Prompts, Werkzeugen und Kontextverwaltung.
Ein Wechsel muss die Prüfungen bestehen
Ein Modellwechsel wird mit einer stabilen Evaluierungssuite verlässlich planbar. Ich vergleiche das aktuelle Modell und den Kandidaten anhand realer Anfragen und Grenzfälle mit ausdrücklich festgelegten Abnahmekriterien.
- Korrektheit, Quellenbindung und Regressionen gegenüber dem geforderten Verhalten.
- Erfolg der gesamten Aufgabe und der Werkzeugaufrufe.
- Latenz, gleichzeitige Anfragen, Kosten pro abgeschlossener Operation und Ressourcenverbrauch.
- Fehler, Ablehnungen, Wiederherstellung nach Störungen und Einhaltung der Sicherheitsvorgaben.
Nach Änderungen an Modell, Daten oder Ablauf werden die Messungen wiederholt. Ein öffentlicher Benchmark hilft bei der Vorauswahl, ersetzt aber keine Prüfung der Anwendung.
Auch das Abwarten bewerten
Meiner Einschätzung nach verdient auch der Verzicht auf eine Einführung eine Bewertung: Ein Wettbewerber könnte eine Tätigkeit früher automatisieren oder früher Kompetenzen aufbauen. Das ist ein zu prüfendes strategisches Szenario, keine Prognose für jedes Unternehmen.
Ich schlage aktive Vorsicht vor: in einem begrenzten Rahmen erproben, Nutzen und Kosten messen, Kompetenzen erhalten und anhand eigener Erkenntnisse entscheiden. Ein Projekt kann verschoben oder verworfen werden, wenn der Nutzen Investition und Risiken nicht rechtfertigt.
Quellen zur Einordnung
Die Quellen stützen Fakten und Bewertungskriterien. Der Architekturvorschlag und die Abwägung zwischen Einführung und Abwarten sind meine methodischen Vorschläge, keine für jedes Projekt nachgewiesenen Ergebnisse.
- Epoch AI — Open-/Closed-Weight-Vergleich (öffnet in einem neuen Tab): aggregierter Index und Beobachtungszeitraum, kein Vergleich eines einzelnen Anwendungsfalls.
- Anthropic — Cyber-Fähigkeiten von GLM-5.3 (öffnet in einem neuen Tab): spezifische Exploit-Tests, getrennt von der allgemeinen Modellqualität.
- McKinsey — KI-Kosten in Unternehmen (öffnet in einem neuen Tab): Umfrage und Kriterien für Modellwahl und Aufgaben-Routing.
- OpenAI — API-Abkündigungen (öffnet in einem neuen Tab): Ankündigungen zur Stilllegung und Migration von Diensten.
- Anthropic — Modelllebenszyklus (öffnet in einem neuen Tab): Status und Stilllegung der über APIs verfügbaren Modelle.
- Microsoft — RAG-Evaluierungen (öffnet in einem neuen Tab): Beispiele für Messungen zum Informationsabruf und zur Antwortqualität.