Luca Morelli
Softwareanalytiker und -entwickler
Teamleiter

KI-Modellwahl: Kosten, Kontrolle und Kontinuität des Produkts.

Die Modellwahl muss sich an realen Aufgaben bewähren. Daten, Anwendungsabläufe, Kosten und Wechselmöglichkeiten zählen ebenso wie Benchmark-Ergebnisse.

Von der Aufgabe ausgehen

Welches ist das kostengünstigste Modell, das die Anforderungen dieser Aufgabe zuverlässig erfüllt?

Zunächst kläre ich Mindestqualität, Antwortzeit, Volumen, Datenschutz und Kontinuität. Die Wahl eines Anbieters folgt später. Ein insgesamt hervorragendes Modell kann für eine bestimmte Tätigkeit ungeeignet sein; ein kleineres kann genügen, wenn repräsentative Tests dies zeigen.

Die organisatorische und wirtschaftliche Bewertung geht dieser Wahl voraus. Die technische Qualität der Antworten erfordert gesonderte Entwicklungs- und Prüfungsarbeit.

Die Voraussetzungen: Machbarkeit eines KI-Projekts

Verfügbare Gewichte und proprietäre Dienste

Open-Weight bedeutet, dass die Modellgewichte verfügbar sind. Daraus folgen nicht automatisch eine Open-Source-Lizenz, uneingeschränkte Nutzung oder geringere Kosten. Auch ein Open-Weight-Modell kann über einen externen Dienst genutzt werden.

Epoch AI stellt in seiner Analyse vom Mai 2026 fest: Seit Januar lagen die leistungsfähigsten Open-Weight-Modelle im ECI-Index durchschnittlich etwa vier Monate hinter der Closed-Weight-Spitze. Das beschreibt einen Zeitraum und einen Messansatz, keine Gleichwertigkeit bei jeder Aufgabe.

Anthropics Cyber-Vergleich vom September 2026 liefert ein weiteres begrenztes Beispiel: Bei 41 V8-Schwachstellen erzeugte GLM-5.3 in etwa 12 % der Versuche funktionierende Exploits, Mythos Preview in 14 %. Das ist kein Vergleich der allgemeinen Modellqualität.

Meine architektonische Schlussfolgerung: Ein Wechsel sollte möglich sein, wenn sich der Vorteil eines Modells verändert. Der Aufwand dafür muss zum Projektrisiko passen.

Die Kosten des gesamten Prozesses

Token-Preise sind ein Teil der Rechnung. Hinzu kommen Datenaufbereitung, Infrastruktur, Wiederholungen, menschliche Prüfungen, Überwachung und Wartung. Eigenbetrieb erfordert GPUs und Betriebskompetenz; bei geringer oder unregelmäßiger Last kann eine API wirtschaftlicher sein.

In McKinseys Umfrage vom Mai 2026 berichteten 93 % der 75 qualifizierten Befragten von einer Überschreitung ihres KI-Budgets. Die Stichprobe repräsentiert nicht alle Unternehmen, macht aber auf die Kosten einer breiten Einführung aufmerksam.

Ein Ablauf kann unterschiedliche Tätigkeiten an verschiedene Modelle weiterleiten: höhere Leistungsfähigkeit, wo das Problem sie erfordert, günstigere oder spezialisierte Modelle für klar definierte Schritte. Jeder Pfad muss die Datenvorgaben einhalten und dieselben Qualitätsprüfungen bestehen.

Wie lange muss die Lösung funktionieren?

Wer Gewichte, Laufzeitumgebung und Hardware kontrolliert, kann eine Konfiguration beibehalten, solange sie die Anforderungen erfüllt. Ein neues Modell erfordert nicht automatisch einen Wechsel; Sicherheitsaktualisierungen und Komponentenwartung bleiben notwendig.

Eine externe API hat einen anderen Lebenszyklus: OpenAI und Anthropic dokumentieren Abkündigungen und Stilllegungen. Ein notwendiger Wechsel, weil ein Dienst entfällt, ist von einem wirtschaftlich sinnvollen Wechsel zu unterscheiden, der Qualität, Kosten oder Leistung verbessert.

Ich plane deshalb Aufwand für eine erneute Bewertung und die Kontinuität des Dienstes ein. Modellunabhängigkeit ist eine Investition: Ihr Wert steigt mit der Wahrscheinlichkeit und den Kosten eines späteren Wechsels.

Veränderliche Teile abgrenzen

Ich würde das System in Teile mit klaren Verantwortlichkeiten gliedern:

  1. 01Anwendung und Fachdomäne

    Produktregeln, Berechtigungen und Daten, für die die Anwendung verantwortlich bleibt.

  2. 02Ablauf und Werkzeuge

    Schritte, Prüfungen, Informationsabruf und zulässige Aktionen.

  3. 03Modelladapter

    Anbieterspezifische Formate, Anweisungen, strukturierte Ausgaben und Werkzeugaufrufe.

  4. 04Modell und Ausführungsumgebung

    Ein externer Dienst oder ein Modell auf kontrollierten Ressourcen.

Dies ist ein Entwurfsvorschlag, keine allgemeingültige Vorgabe. Adapter verringern Abhängigkeiten, doch Modelle verhalten sich unterschiedlich: Ein Wechsel erfordert häufig Anpassungen an Prompts, Werkzeugen und Kontextverwaltung.

Ein Wechsel muss die Prüfungen bestehen

Ein Modellwechsel wird mit einer stabilen Evaluierungssuite verlässlich planbar. Ich vergleiche das aktuelle Modell und den Kandidaten anhand realer Anfragen und Grenzfälle mit ausdrücklich festgelegten Abnahmekriterien.

  • Korrektheit, Quellenbindung und Regressionen gegenüber dem geforderten Verhalten.
  • Erfolg der gesamten Aufgabe und der Werkzeugaufrufe.
  • Latenz, gleichzeitige Anfragen, Kosten pro abgeschlossener Operation und Ressourcenverbrauch.
  • Fehler, Ablehnungen, Wiederherstellung nach Störungen und Einhaltung der Sicherheitsvorgaben.

Nach Änderungen an Modell, Daten oder Ablauf werden die Messungen wiederholt. Ein öffentlicher Benchmark hilft bei der Vorauswahl, ersetzt aber keine Prüfung der Anwendung.

Ein Beispiel für einen überprüfbaren Anwendungsablauf

Sicherheit von KI-Anwendungen

Auch das Abwarten bewerten

Meiner Einschätzung nach verdient auch der Verzicht auf eine Einführung eine Bewertung: Ein Wettbewerber könnte eine Tätigkeit früher automatisieren oder früher Kompetenzen aufbauen. Das ist ein zu prüfendes strategisches Szenario, keine Prognose für jedes Unternehmen.

Ich schlage aktive Vorsicht vor: in einem begrenzten Rahmen erproben, Nutzen und Kosten messen, Kompetenzen erhalten und anhand eigener Erkenntnisse entscheiden. Ein Projekt kann verschoben oder verworfen werden, wenn der Nutzen Investition und Risiken nicht rechtfertigt.

Quellen zur Einordnung

Die Quellen stützen Fakten und Bewertungskriterien. Der Architekturvorschlag und die Abwägung zwischen Einführung und Abwarten sind meine methodischen Vorschläge, keine für jedes Projekt nachgewiesenen Ergebnisse.

Wählen Sie ein Modell für eine Anwendung aus?

Ausführlicher Lebenslauf und Referenzen auf Anfrage verfügbar.