GPT-5.6 mit Sol, Terra und Luna: Welche Stufe zu welcher Aufgabe passt
OpenAI hat Anfang Juli drei Modellstufen veröffentlicht. Preise, Kontextfenster und eine Entscheidungshilfe für den Mittelstand.
KI-Grundlagen · 28. September 2026

Am 3. September hat OpenAI GPT-6 Astra vorgestellt, am 22. September folgte Anthropic mit Claude Opus 5.5. Wer produktive Anwendungen betreibt, steht regelmäßig vor derselben Frage: Wechseln, abwarten oder zusätzlich testen? Mit sechs Prüfpunkten treffen Sie die Entscheidung auf Basis Ihrer eigenen Daten.
Sammeln Sie 20 bis 30 reale Vorgänge aus Ihrem Alltag, zum Beispiel Kundenanfragen, Angebotsentwürfe oder Dokumente zur Prüfung. Halten Sie zu jedem fest, was ein gutes Ergebnis ausmacht. Dieses Set ist Ihr Maßstab, unabhängig von Ranglisten der Hersteller.
Lassen Sie Ergebnisse von den Personen beurteilen, die den Vorgang kennen. Eine einfache Skala mit drei Stufen genügt: brauchbar, mit Korrektur brauchbar, unbrauchbar. Wechseln Sie das Modell nur, wenn sich der Anteil brauchbarer Ergebnisse spürbar verbessert.
Rechnen Sie nicht mit dem Preis je Million Token, sondern mit den Kosten je Vorgang. Ein teureres Modell kann günstiger sein, wenn es weniger Korrekturschleifen braucht. Umgekehrt zahlt sich ein Spitzenmodell für einfache Sortieraufgaben selten aus. Die Preise der beiden Septembermodelle liegen laut Herstellerangaben und Vergleichsberichten bei 4 und 20 US-Dollar (Opus 5.5) beziehungsweise 10 und 50 US-Dollar (Astra) je Million Eingabe- und Ausgabetoken.
Klären Sie, wo die Daten verarbeitet werden, ob Eingaben zum Training genutzt werden und welcher Vertrag gilt. Das gilt besonders, wenn Sie den Zugang über einen anderen Weg wählen, etwa über eine Cloud-Plattform statt direkt beim Hersteller. Bei personenbezogenen Daten gehört die Datenschutzbeauftragte oder der Datenschutzbeauftragte früh dazu.
Notieren Sie je Prozess, welche Modellversion läuft, und legen Sie fest, wer eine Umstellung freigibt. Nur so lassen sich Ergebnisse später erklären und Qualitätsschwankungen einer Ursache zuordnen.
Bauen Sie Anwendungen so, dass das Modell hinter einer eigenen Schnittstelle steckt. Dann ist ein Wechsel eine Konfigurationsfrage und kein Umbauprojekt. Halten Sie Ihre Anweisungen und Testfälle getrennt vom Modell, damit sie bei jedem Wechsel wiederverwendbar sind.
Planen Sie für einen Vergleich rund eine Woche ein: zwei Tage für das Testset, zwei Tage für die Läufe und die Bewertung, einen Tag für Kosten und Entscheidung. Danach dokumentieren Sie das Ergebnis in einer halben Seite. Beim nächsten Release wiederholen Sie nur die Läufe.
Die Kostenseite der Modellwahl beschreibt Modellpreise im Sommer 2026, ein Beispiel für ein teures Spitzenmodell Claude Fable 5.