Eine Million Token: Wann ein langer Kontext reicht und wann Sie RAG brauchen
Lange Kontextfenster zum Standardpreis: Wann Sie Dokumente einfach mitgeben können und wann eine Wissensdatenbank mit RAG die bessere Wahl bleibt.
KI-Grundlagen · 8. April 2026

Google hat am 2. April 2026 die Modellfamilie Gemma 4 veröffentlicht. Sie umfasst vier Varianten: zwei kleine Modelle mit 2 und 4 Milliarden effektiven Parametern (E2B und E4B), ein Mixture-of-Experts-Modell mit 26 Milliarden Parametern und ein dichtes Modell mit 31 Milliarden. Die Gewichte stehen unter der Apache-2.0-Lizenz, die kommerzielle Nutzung ohne Sonderbedingungen erlaubt. Frühere Gemma-Versionen liefen unter einer eigenen Google-Lizenz.
Die kleinen Modelle verarbeiten bis zu 128.000 Token Kontext, die größeren bis zu 256.000. Alle sind für Text und Bilder ausgelegt, die kleinen auch für Audio. Google nennt Unterstützung für mehr als 140 Sprachen, Funktionsaufrufe für Agenten und Code-Erzeugung. Nach Angaben des Unternehmens liegt das 31B-Modell auf Platz 3 der Open-Source-Rangliste von Arena AI, das 26B-Modell auf Platz 6. Solche Ranglisten messen vor allem allgemeine Chat-Qualität, nicht Ihre Fachaufgaben.
Laufen sollen die Modelle auf einem breiten Spektrum von Hardware, vom Android-Gerät über Laptop-Grafikkarten und Workstations bis zu Rechenzentrumsbeschleunigern wie Nvidia H100.
Ein offenes Modell können Sie im eigenen Rechenzentrum oder bei einem Anbieter Ihrer Wahl betreiben. Daten verlassen dann nicht automatisch Ihre Umgebung. Das kann bei sensiblen Inhalten wie Personalakten, Konstruktionsdaten oder Verträgen ein Argument sein. Außerdem fallen keine Gebühren pro Anfrage an. Dafür zahlen Sie mit Hardware, Betrieb und Pflege.
Für wechselnde, anspruchsvolle Aufgaben liefern die großen proprietären Modelle weiterhin oft bessere Ergebnisse. Für kleine Teams mit wenig Betriebserfahrung ist die Cloud häufig günstiger, wenn man Wartung und Sicherheitsupdates einrechnet.
Nehmen Sie 50 echte, anonymisierte Beispiele einer Aufgabe und lassen Sie ein offenes und ein Cloud-Modell beide bearbeiten. Zwei Mitarbeitende bewerten blind. So sehen Sie nach einem Nachmittag, ob die kleinere Lösung reicht. Prüfen Sie parallel, ob Ihre Hardware die gewünschte Variante tragen kann, und rechnen Sie Strom in die Betriebskosten ein.
Ein offenes Modell ist keine Datenschutzgarantie. Entscheidend bleibt, wie Sie es betreiben, wer Zugriff hat und was protokolliert wird.