Die Zeitspanne zwischen offenen Modellgewichten und den führenden geschlossenen KI-Modellen wird bei Cybertests kleiner. Das UK AI Security Institute (AISI) beziffert den Abstand der getesteten Open-Weight-Modelle GLM-5.2 und DeepSeek V4-Pro zur betrachteten Spitze je nach Testart auf ungefähr vier bis sieben Monate. Das ist eine genau eingegrenzte Benchmark-Momentaufnahme. Für interne Prüfungen ist sie trotzdem ein guter Anlass, den Startpunkt nach vorn zu ziehen. Es ist kein Beleg dafür, dass solche Modelle reale, gut verteidigte Netze autonom angreifen können.
Das Wichtigste in 30 Sekunden
- AISI veröffentlichte am 17. Juli 2026 eine öffentliche Vergleichsanalyse zu Cyberfähigkeiten führender Open- und Closed-Weight-Modelle.
- In den ausgewerteten Tests liegen GLM-5.2 und DeepSeek V4-Pro ungefähr vier bis sieben Monate hinter der betrachteten Closed-Weight-Spitze.
- Die Angabe gilt für die getesteten Modelle, Aufgaben und Vergleichszeitpunkte. Sie ist weder eine allgemeine KI-Rangliste noch eine Prognose.
- Cyber-Ranges sind simulierte Netzwerke. Aktive Verteidiger, vollständige Abwehrwerkzeuge und Folgen einer Alarmierung bilden sie nicht vollständig ab.

AISI misst einen kleineren Abstand, keine neue Angriffsrealität
Die neue AISI-Analyse vergleicht Cyberfähigkeiten von Modellen mit offenen Gewichten mit einer ausgewählten Closed-Weight-Spitze. Der Kernbefund ist klar: In den untersuchten Aufgaben liegen die zwei getesteten Open-Weight-Kandidaten näher an aktuellen Spitzenmodellen als noch in den AISI-internen Auswertungen zu Modellen aus Januar bis September 2025. Damals lag der Abstand nach AISI noch bei sechs bis zehn Monaten; aktuell nennt das Institut vier bis sieben Monate.
Diese Entwicklung verdient Aufmerksamkeit, weil Modellgewichte in manchen Organisationen anders genutzt werden als reine API-Angebote: Teams können sie herunterladen, ausführen und verändern. Für eine Sicherheitsbewertung genügt dieses Etikett allerdings nicht. Entscheidend sind die konkrete Modellversion, die bereitgestellten Werkzeuge, Zugriffsrechte und die Umgebung, in der das System arbeiten darf.
Bei engen Cyberaufgaben liegt GLM-5.2 ungefähr vier Monate zurück
Ein Teil der AISI-Auswertung besteht aus 70 engen Cyberaufgaben in vier Schwierigkeitsstufen. Dort liegt GLM-5.2 ungefähr auf dem Niveau von Opus 4.6 und GPT-5.3-Codex, die vier Monate früher veröffentlicht wurden. DeepSeek V4-Pro wird in diesem Aufgabenformat mit Opus 4.5 verglichen, das fünf Monate früher erschien.
Solche Vergleiche machen Fortschritt in klar abgegrenzten Aufgaben sichtbar. Sie sagen aber nur etwas über die getesteten Fähigkeiten aus. Wer daraus eine allgemeine Aussage über Kreativität, Programmierung, Planung oder den sicheren Betrieb eines KI-Systems macht, zieht die Schlussfolgerung weiter als die Messung trägt.
Die zwei AISI-Testformen im Überblick
- Enge Cyberaufgaben
- 70 abgegrenzte Aufgaben mit vier Schwierigkeitsstufen. Hier ordnet AISI GLM-5.2 ungefähr vier Monate und DeepSeek V4-Pro ungefähr fünf Monate hinter früher veröffentlichten Vergleichsmodellen ein.
- Cyber-Ranges
- Mehrstufige Abläufe in simulierten Netzwerken. Die Ergebnisse ergänzen den Befund, beruhen aber auf einer kleineren Testbasis und sind deshalb vorsichtiger zu lesen.

In Cyber-Ranges wird die Evidenz vorsichtiger
Für längere, mehrstufige Szenarien nutzt AISI Cyber-Ranges. Das sind simulierte Netzwerke, in denen ein Modell Planung und Ausführung über mehrere Schritte hinweg bewältigen soll. Auf der Range „The Last Ones“ reicht GLM-5.2 nach der Analyse ungefähr bis Opus 4.5, das knapp sieben Monate früher veröffentlicht wurde. DeepSeek V4-Pro bleibt in diesem Vergleich unter Sonnet 4.5.
An dieser Stelle ist eine zurückhaltende Einordnung angebracht. AISI bewertet die Range-Vergleiche wegen der kleineren Testbasis als schwächere Evidenz. Diese Umgebungen unterscheiden sich in wichtigen Punkten von realen Unternehmensnetzen. Aktive Verteidiger, sämtliche defensiven Werkzeuge und Nachteile durch ausgelöste Alarme gehören nicht in derselben Tiefe zum Szenario wie in einer gut betriebenen Produktionsumgebung.
Open Weight beschreibt technische Zugriffsmöglichkeiten
Der Begriff Open Weight wird im AISI-Beitrag praktisch verwendet: Gemeint sind Modellgewichte, die heruntergeladen, ausgeführt und verändert werden können. Daraus folgt weder automatisch eine bestimmte Open-Source-Lizenz noch eine Aussage über Kosten oder den Aufwand für einen Betrieb. Auch die Frage, ob ein Modell lokal oder in einer kontrollierten Umgebung läuft, beantwortet der Begriff allein nicht.
Für Beschaffungsentscheidungen und die interne Steuerung ist diese Unterscheidung hilfreich. Sie verhindert, dass eine technische Eigenschaft mit einem vollständigen Betriebsmodell verwechselt wird. Wer ein Modell bewertet, sollte deshalb Lizenzunterlagen, Hosting-Architektur, Zugriffskontrollen und Protokollierung getrennt prüfen – nicht aus der Bezeichnung ableiten.
Was der Benchmark zeigt – und was er offenlässt
Der Befund
Die getesteten Open-Weight-Modelle haben sich in den AISI-Cybertests der betrachteten Closed-Weight-Spitze angenähert. Der Abstand liegt in dieser Auswertung bei ungefähr vier bis sieben Monaten.
Die Grenze
Die Ergebnisse belegen weder autonome Angriffe auf reale, verteidigte Systeme noch eine allgemeine Aussage über alle Open-Weight-Modelle. Sie ersetzen auch keine Prüfung der eigenen Umgebung.
Das verändert nicht nur die Formulierung, sondern die Entscheidungspraxis. Ein Benchmark kann ein Signal sein, Prioritäten zu überprüfen. Er ersetzt weder ein Red Team noch die Frage, welche Berechtigungen ein Modell in einem konkreten Workflow tatsächlich erhält.

Für Teams wird das Vorbereitungsfenster kürzer
Für Sicherheits- und Beschaffungsteams in Deutschland und Europa folgt daraus keine neue gesetzliche Pflicht. Die praktische Relevanz liegt an einer anderen Stelle: Wenn sich Fähigkeiten in standardisierten Tests schneller annähern, sollten Organisationen eigene Modellprüfungen nicht erst dann beginnen, wenn ein neues Modell bereits breit im Einsatz ist.
Der erste Schritt muss dabei nicht groß sein. Teams können festlegen, welche Szenarien sie testen wollen, welche Daten ein Modell sehen darf und welche Aktionen ausgeschlossen bleiben. Logging, klar abgegrenzte Testkonten und nachvollziehbare Freigaben machen aus einer allgemeinen Sicherheitsdebatte eine prüfbare Betriebsfrage. Bei besonders sensiblen Abläufen gehört dazu auch die Trennung zwischen Labor, Pilot und Produktivsystem.
Warum der Vergleich trotzdem keine lineare Prognose erlaubt
Die Spanne von vier bis sieben Monaten beschreibt die AISI-Vergleiche zum Zeitpunkt der Veröffentlichung. Sie sagt nicht, dass der Abstand künftig automatisch weiter schrumpft oder dass jedes neue Open-Weight-Modell denselben Weg nimmt. Modellarchitektur, Trainingsdaten, Werkzeuge, Evaluationsdesign und Veröffentlichungszeitpunkte verändern solche Vergleichswerte.
Gerade deshalb trägt die Analyse weiter als eine pauschale Schlagzeile. Sie legt offen, welche Modelle, Aufgaben und Grenzen gemeint sind. Wer daraus Maßnahmen ableitet, kann bei diesen Details anfangen und muss sich nicht auf diffuse Annahmen über „offene KI“ verlassen.
FAQ
Heißt das, dass Open-Weight-Modelle reale Unternehmensnetze autonom angreifen können?
Nein. Die AISI-Ranges sind simulierte Netzwerke und bilden wichtige Eigenschaften realer, verteidigter Umgebungen nicht vollständig ab. Die Ergebnisse sind Benchmarkdaten, keine Demonstration autonomer Realangriffe.
Gilt der Abstand von vier bis sieben Monaten für alle offenen Modelle?
Nein. Die Angabe bezieht sich auf GLM-5.2 und DeepSeek V4-Pro sowie auf die von AISI beschriebenen Aufgaben, Ranges und Vergleichsmodelle.
Ist Open Weight dasselbe wie Open Source?
Nein. Im AISI-Kontext beschreibt Open Weight herunterladbare, ausführbare und veränderbare Gewichte. Über Lizenz, Kosten oder konkrete Betriebsbedingungen sagt das allein nichts aus.
Fazit: Präziser prüfen statt pauschal einordnen
Die AISI-Auswertung verschiebt nicht über Nacht die Sicherheitslage. Sie zeigt aber, dass die Zeit zwischen führenden geschlossenen Modellen und den getesteten offenen Gewichten in Cyberbenchmarks kleiner geworden ist. Organisationen haben damit einen belastbaren Anlass, eigene Evaluierungen und Freigaben früher einzuplanen. Entscheidend bleibt, was ein Modell im jeweiligen System sehen, tun und auslösen darf.
Weiterlesen
Quellen und weiterführende Informationen
- UK AI Security Institute: How Far Behind the Frontier are Leading Open Weight Models on Cyber? (17. Juli 2026)
- UK AI Security Institute: How do frontier AI agents perform in multi-step cyber attack scenarios? (16. März 2026)
- arXiv: Measuring AI Agents’ Progress on Multi-Step Cyber Attack Scenarios (13. März 2026, Preprint)
- UK AI Security Institute: Our evaluation of OpenAI’s GPT-5.5 cyber capabilities (30. April 2026)
- The Decoder: Open-weight models now match frontier cyber performance from just four months ago (19. Juli 2026, Gegenlese)
Hinweis: Für diesen Artikel wurden KI-gestützte Recherche- und Editierwerkzeuge verwendet. Der Inhalt wurde redaktionell geprüft. Stand: 2026-07-20