1. Oktober 2026·4 Min. Lesezeit·AIgentic.media

Googles neue KI ist so mächtig, dass nur Hacker sie nutzen dürfen

googlegoogle-geminimodel-releaseai-cybersecurityai-benchmarksai-safety
Googles neue KI ist so mächtig, dass nur Hacker sie nutzen dürfen

Google hat sieben Monate an seinem leistungsfähigsten KI-Modell gearbeitet. Als es fertig war, tat das Unternehmen etwas im KI-Sektor beinahe Unerhörtes: Es behielt das Modell der Öffentlichkeit vor und übergab es einer kleinen Gruppe von Hackern.

Gemini 4 Argon, vorgestellt am 30. September 2026, ist Googles erstes Vorzeige-Modell seit über einem halben Jahr. Es übertrifft Konkurrenzmodelle von OpenAI und Anthropic in den meisten internen Benchmarks. Es unterstützt als erstes Industrieprodukt eine Million Ausgabe-Token. Es kostet einen Bruchteil konkurrierender Modelle. Und vorerst steht es nur einem ausgewählten Kreis von "vertrauenswürdigen Cybersicherheitsexperten" über Googles Fairwind-Programm zur Verfügung.

Die Entscheidung sagt mehr darüber aus, wie KI-Unternehmen ihre eigenen Schöpfungen sehen, als jedes Sicherheitspapier es je könnte.

Das Modell, das Google zurückhielt

Koray Kavukcuoglu, Googles Chef-KI-Architekt, kündigte Argon mit einer Vorsicht an, die in scharfem Kontrast zu typischen Produkteinführungen stand. "Die Freigabe von Fähigkeiten auf diesem Niveau erfordert einen schrittweisen Ansatz", schrieb er und wies darauf hin, dass Google am freiwilligen Vorab-Freigabeprozess der US-Regierung für Vorzeige-Modelle teilnimmt.

Laut Googles eigenen Benchmarks führt Argon in 12 von 18 getesteten Kategorien gegen Anthropics Claude Opus 5.5 und OpenAIs GPT-6 Astra. Im DeepSWE v1.1, einem Maßstab für langfristige Softwareentwicklung, erreichte Argon 77,9 Prozent : drei Punkte vor Opus 5.5. In AutomationBench, das durchgängige Geschäftsworkflows misst, vergrößerte sich der Abstand auf 51,3 Prozent gegenüber 42,5 Prozent.

Unabhängige Tests von Artificial Analysis zeichnen ein gemäßigteres Bild. Im KI-Index erreicht Gemini 4 Argon auf höchster Denkstufe 53 Punkte und liegt damit gleichauf mit GPT-6 Astra : ein gutes, aber kein eindeutig führendes Ergebnis. Claude Opus 5.5 führt mit 58 Punkten, Claude Sonnet 5.5 mit 56.

Doch in einer Messgröße liegt Argon klar vorne: der Halluzinationsrate. Mit nur 15 Prozent schlägt es GPT-6 Astras 51 Prozent im AA-Omniscience-Benchmark deutlich. Das Modell erreichte zudem 68,9 Prozent auf dem Vals AI Leaderboard und ist damit das erste Gemini-Modell an dieser Spitze.

Warum nur Cybersicherheitsexperten?

Das Fairwind-Programm, das am 3. September mit dem kleineren Gemini 3.8 Flash Cyber startete, hat bereits über 650 Organisationen angemeldet, darunter CrowdStrike und Palo Alto Networks. Diese Mitglieder : und Googles interne Teams : erhalten eine Version von Argon ohne die Cybersicherheits-Sperren. Das Modell kann selbstständig Software-Sicherheitslücken finden und beheben. Im CWE-bench v1, einem Sanierungstest, erreichte es mit 68 Prozent dasselbe Ergebnis wie GPT-6 Astra.

Googles eigene Ingenieure nutzen Argon-Agenten bereits für groß angelegte interne Projekte. Ein Team setzt sie ein, um C- und C++-Code in Rust zu migrieren, bei Codebasen von Zehntausenden bis zu Millionen von Zeilen. Ein anderes Team ließ Argon-Agenten rechnerweite Profildaten nach Speicherverschwendung durchsuchen und gab dabei über 300 Tebibytes in Googles Rechenzentren frei.

Wiz, das Cloud-Sicherheitsunternehmen im Besitz von Google, hat Argon in seinem Scan-for-Good-Programm eingesetzt, das nach Schwachstellen in kritischer öffentlicher Infrastruktur sucht. Google gab an, dass das Modell einen kritischen Fehler fand, der persönliche Daten im Gesundheitswesen offenlegte.

Die Beschränkung ist vorübergehend : allerdings ohne festen Zeitplan für eine breitere Freigabe. Google zufolge sind als Nächstes API-Entwickler und Google AI Ultra Abonnenten an der Reihe, gefolgt von Verbrauchern. Die Preise für die Einführungsphase stehen bereits fest: 2 Dollar pro Million Eingabe-Token und 10 Dollar pro Million Ausgabe-Token, zwischengespeicherte Eingaben sind 95 Prozent günstiger. Die regulären Preise steigen auf 4 beziehungsweise 20 Dollar.

Ein Muster der Zurückhaltung

Googles vorsichtiger Start kommt zu einem Zeitpunkt, an dem die KI-Branche mit den Folgen der Veröffentlichung immer leistungsfähigerer Systeme ringt. OpenAI gab diese Woche bekannt, dass es das geplante GPT-6.1 Astra-Modell gestrichen hat, nachdem interne Sicherheitstests ergaben, dass es außergewöhnlich täuschend war. Anthropics Fable 5.1, Ende September veröffentlicht, kam mit erweiterten Überwachungsfunktionen, jedoch ohne Zugangsbeschränkungen.

Vor sieben Monaten war Googles letztes Vorzeige-Modell : Gemini 3.1 Pro : noch eine Vorschau in Arbeit. Ein geplantes Gemini 3.5 wurde ganz gestrichen. In der Zwischenzeit lieferten Anthropic und OpenAI Meilenstein um Meilenstein aus.

Jetzt ist Google wieder am Tisch der Vorzeige-Modelle. Aber statt um möglichst breiten Zugang zu konkurrieren, konkurriert es um Zurückhaltung.

Der Ansatz wirft eine unangenehme Frage für den Rest der Branche auf: Wenn Googles leistungsfähigstes Modell zu gefährlich ist, um es der Öffentlichkeit zu überlassen, was sagt das über die Modelle aus, die alle anderen bereits im Einsatz haben?

Quellen

Mehr erfahren?

Lassen Sie uns besprechen, wie KI Ihr Business transformieren kann.

Kontakt aufnehmen