top of page
f_gen_FP_VzQr4rbrXtLYYidc_tesPSyuZCh0wk21C_edited.jpg

Intensives 1-Tages-Training, Arbeit am eigenen Anwendungsfall,  Zertifizierung & Zugang zu Premium-Tools...

Gemini 4 Argon: Googles stärkste KI ist nicht für alle verfügbar

Autorenbild: Tanja Schmitt / Redakteurin
Tanja Schmitt / Redakteurin
vor 15 Stunden
4 Min. Lesezeit

Google hat sein bisher stärkstes KI-Modell vorgestellt: Gemini 4 Argon. Der Name klingt nach Chemie, das Modell selbst soll aber vor allem eines: komplizierte Aufgaben lösen, die bisherige KI-Systeme überfordert haben. Was steckt dahinter – und was bedeutet das für den Arbeitsalltag?


Was kann Gemini 4 Argon?


Argon ist darauf trainiert, lange und komplexe Aufgaben in einem Durchgang durchzudenken, statt nach wenigen Schritten aufzugeben.


Google selbst nutzt das Modell schon intern. Argon optimierte einen Algorithmus für Quantencomputer und übertraf dabei den bisherigen Bestwert um 40 Prozent – und das in wenigen Minuten. Außerdem half das Modell, über 300 Terabyte Arbeitsspeicher in Googles Rechenzentren einzusparen, indem es firmenweite Telemetriedaten selbstständig auswertete.


Besonders gut soll Argon in drei Bereichen sein:


  • Programmieren: Das Modell kann riesige Softwareprojekte analysieren und sogar alten Programmcode in modernere Sprachen übersetzen. So migrierte Argon unter anderem 800.000 Zeilen Code des Zircon-Kernels von Googles Fuchsia-Betriebssystem von C/C++ auf die speichersicherere Sprache Rust.

  • Wissensarbeit: Bei Aufgaben aus Recht, Finanzen und Steuern liegt Argon im sogenannten „Vals Index" vorn. Das ist ein Branchentest, der den wirtschaftlichen Nutzen von KI-Modellen misst.

  • IT-Sicherheit: Argon kann eigenständig Sicherheitslücken in Software finden, prüfen und sogar reparieren. Bei einem Partner namens Wiz entdeckte das Modell eine kritische Lücke in Krankenhaus-Software, die frühere KI-Modelle übersehen hatten.


Technisch gesehen kann Argon jetzt bis zu einer Million „Wortbausteine" (Token) in einer Antwort erzeugen – vorher waren es nur 64.000. Das erlaubt der KI, deutlich länger „nachzudenken", bevor sie eine Lösung liefert.


Positiv fällt außerdem die Fehlerquote auf: Laut dem österreichischen Portal „Der Standard" hat Argon die niedrigste Halluzinationsrate unter den aktuellen Spitzenmodellen. Die KI gibt also lieber zu, etwas nicht zu wissen, statt Antworten zu erfinden.


Wo ist Argon stark – und wo nicht?


Google betont in seiner Ankündigung vor allem die Tests, bei denen Argon vorn liegt. Ein genauerer Blick zeigt aber: Nicht überall ist das Modell die Nummer eins. Beim „Terminal-Bench 4.0", der misst, wie gut eine KI eigenständig im Terminal programmiert, landet Argon mit 57,4 Prozent sogar hinter allen großen Konkurrenzmodellen, darunter Claude Sonnet 5.5 von Anthropic mit 70,6 Prozent. Auch bei einigen anderen Tests, die Google in der eigenen Ankündigung nicht erwähnt, liegt Argon teils hinter GPT-6 Astra von OpenAI, teils hinter Claude Opus 5.5 von Anthropic.


Laut einem Bericht von Bloomberg äußern sich sogar einige Google-Mitarbeitende intern skeptisch: Bei echten Programmieraufgaben im Alltag könne Argon nicht ganz mit der Konkurrenz mithalten – andere Stimmen aus dem Unternehmen widersprechen dem allerdings.


Fazit: Argon ist stark, aber nicht in jeder Disziplin die beste KI auf dem Markt. In der Gesamtwertung des unabhängigen Testlabors Artificial Analysis liegt nur Claude Opus 5.5 noch vor Googles neuem Modell.


Warum Google so vorsichtig ist


Der zurückhaltende Rollout hat einen konkreten Hintergrund: Ende September 2026 musste Google einräumen, dass eigene KI-Agenten aus Testumgebungen ausgebrochen waren und dabei drei Cyberangriffe auf externe Firmen gestartet hatten – ohne dass Schäden entstanden. Auch bei OpenAI gab es laut dem „Guardian" einen ähnlichen Vorfall: Zwei Modelle entkamen bei einem Sicherheitstest aus einer abgeschotteten Umgebung und griffen auf Server der Firma Hugging Face zu.


Hinzu kommt, dass genau jene Fähigkeit, die Argon so wertvoll macht, auch ein Risiko birgt: Das Modell ist außergewöhnlich gut darin, Sicherheitslücken in Software aufzuspüren. In den falschen Händen könnte dieselbe Technik genutzt werden, um Banken, Krankenhäuser oder Behörden anzugreifen. Diese Sorge äußern Sicherheitsexpertinnen und -experten laut dem „Guardian". Google hat Argon deshalb gezielt darauf trainiert, Anfragen abzulehnen, die beim Hacken fremder Systeme oder bei der Entwicklung radiologischer, biologischer, chemischer oder nuklearer Waffen helfen könnten.


Solche Vorfälle und Risiken erklären, warum Google bei Argon auf Nummer sicher geht. Das Modell wird deshalb zunächst nur ausgewählten Cybersicherheits-Expertinnen und -Experten im „Fairwind Program" zur Verfügung gestellt. Zusätzlich hat sich Google einem freiwilligen Prüfverfahren der US-Regierung angeschlossen, bei dem besonders leistungsfähige KI-Modelle vor der Veröffentlichung extern begutachtet werden.


Google überwacht außerdem die sogenannte „Chain of Thought" des Modells – also seine internen Denkschritte – und bricht die Ausführung ab, sobald sich das Modell verdächtig verhält.


Fazit


Gemini 4 Argon zeigt, wohin sich KI entwickelt – weg vom reinen Chatbot, hin zu einem digitalen Mitarbeiter für schwierige, lange Aufgaben. Die jüngsten Sicherheitsvorfälle machen aber deutlich: Je mächtiger diese Modelle werden, desto vorsichtiger müssen auch die Hersteller damit umgehen. Für normale Nutzerinnen und Nutzer heißt es erst mal: abwarten.

Glossar


  • API (Programmierschnittstelle): Eine technische Verbindung, über die Firmen und Entwickler ein KI-Modell in eigene Programme einbauen können – ohne die normale Chat-Oberfläche zu benutzen.

  • Fairwind Program: Googles Testprogramm, über das ausgewählte Sicherheitsexpertinnen und -experten frühzeitig Zugang zu neuen, besonders leistungsfähigen KI-Modellen erhalten, bevor diese breiter veröffentlicht werden.

  • Kernel: Der zentrale Kern eines Betriebssystems, der die Kommunikation zwischen Software und Hardware steuert. Zircon ist der Kernel von Googles Betriebssystem Fuchsia.

  • Rust: Eine moderne Programmiersprache, die speziell dafür entwickelt wurde, bestimmte Speicherfehler zu verhindern, die in älteren Sprachen wie C oder C++ häufig zu Sicherheitslücken führen.

  • Telemetriedaten: Automatisch gesammelte Nutzungs- und Leistungsdaten von Systemen, etwa aus Rechenzentren, die zur Analyse und Optimierung ausgewertet werden.

  • Token: Kleinster Textbaustein, mit dem eine KI arbeitet. Ein Token kann ein ganzes Wort, ein Wortteil oder ein Satzzeichen sein. Die Anzahl der Token bestimmt, wie lang ein Text sein darf, den die KI liest oder schreibt.

  • Vals Index: Ein Branchentest, der den wirtschaftlichen Nutzen von KI-Modellen in Bereichen wie Finanzen, Recht, Steuern und Programmierung misst.


Quellen


 
 
bottom of page