Drücke „Enter”, um zum Inhalt zu springen.
Hinweis zu diesem Datenschutz-Blog:
Anscheinend verwenden Sie einen Werbeblocker wie uBlock Origin oder Ghostery, oder einen Browser, der bestimmte Dienste blockiert.
Leider wird dadurch auch der Dienst von VG Wort blockiert. Online-Autoren haben einen gesetzlichen Anspruch auf eine Vergütung, wenn ihre Beiträge oft genug aufgerufen wurden. Um dies zu messen, muss vom Autor ein Dienst der VG Wort eingebunden werden. Ohne diesen Dienst geht der gesetzliche Anspruch für den Autor verloren.

Ich wäre Ihnen sehr verbunden, wenn Sie sich bei der VG Wort darüber beschweren, dass deren Dienst anscheinend so ausgeprägt ist, dass er von manchen als blockierungswürdig eingestuft wird. Dies führt ggf. dazu, dass ich Beiträge kostenpflichtig gestalten muss.

Durch Klick auf folgenden Button wird eine Mailvorlage geladen, die Sie inhaltlich gerne anpassen und an die VG Wort abschicken können.

Nachricht an VG WortMailtext anzeigen

Betreff: Datenschutzprobleme mit dem VG Wort Dienst(METIS)
Guten Tag,

als Besucher des Datenschutz-Blogs Dr. DSGVO ist mir aufgefallen, dass der VG Wort Dienst durch datenschutzfreundliche Browser (Brave, Mullvad...) sowie Werbeblocker (uBlock, Ghostery...) blockiert wird.
Damit gehen dem Autor der Online-Texte Einnahmen verloren, die ihm aber gesetzlich zustehen.

Bitte beheben Sie dieses Problem!

Diese Nachricht wurde von mir persönlich abgeschickt und lediglich aus einer Vorlage generiert.
Wenn der Klick auf den Button keine Mail öffnet, schreiben Sie bitte eine Mail an info@vgwort.de und weisen darauf hin, dass der VG Wort Dienst von datenschutzfreundlichen Browser blockiert wird und dass Online Autoren daher die gesetzlich garantierten Einnahmen verloren gehen.
Vielen Dank,

Ihr Klaus Meffert - Dr. DSGVO Datenschutz-Blog.

PS: Wenn Sie meine Beiträge oder meinen Online Website-Check gut finden, freue ich mich auch über Ihre Spende.
Ausprobieren Online Webseiten-Check sofort DSGVO-Probleme finden
Externe Links sind mit dem Symbol Externer Link Symbol gekennzeichnet. Datenschutzinfo

GPT-6 Astra: Wenn OpenAI von der "AGI-Ära" spricht – was wirklich dahintersteckt

0
Dr. DSGVO Newsletter erkannt: Erweiterte Funktionen verfügbar
Artikel als PDF · Mehr Inhalte & kompakte Kernaussagen · Webseiten-Checks · Offline-KI Live
Standardansicht: Dr. DSGVO Newsletter nicht erkannt. Erweiterte Funktionen nur für Abonnenten:
Artikel als PDF · Mehr Inhalte & kompakte Kernaussagen · Webseiten-Checks · Offline-KI Live

Am 3. September 2026 hat OpenAI ein neues Sprachmodell veröffentlicht und dabei ein großes Wort in den Raum gestellt: AGI, Artificial General Intelligence. OpenAI-Präsident Greg Brockman erklärte, man werde rückblickend vielleicht genau auf diesen Moment als Beginn der AGI-Ära zurückblicken. Wer die Benchmarks, Sicherheitsberichte und unabhängigen Tests der letzten Tage durchgeht, bekommt ein deutlich nuancierteres Bild: ein Modell mit echten, teils beeindruckenden Fortschritten – aber auch mit klaren Grenzen, ungelösten Sicherheitsfragen und einer Zahl, die bei genauerem Hinsehen zerfällt.

Dieser Artikel ordnet ein: Was kann GPT-6 Astra wirklich? Wie schneidet es gegen Claude und Gemini ab? Und was hat es mit dem Fluiddynamik-Rätsel auf sich, das ausgerechnet mit einem noch unveröffentlichten OpenAI-Modell gelöst worden sein soll?

Unabhängig davon macht KI seit einigen Jahren kontinuierlich beeindruckende Fortschritte. Sogar amerikanische KI-Bosse haben Angst vor den Entwicklungen: Sie fordern am 13.09.2026 eine Herausnahme des Tempos bei der KI-Entwicklung; sogar derBörsengang von Anthropic wurde verschoben, trotz Milliardeneinbußen.

Was ist GPT-6 Astra?

GPT-6 Astra ist OpenAIs neues Flaggschiff-Modell. Es ist verfügbar über ChatGPT (Plus, Pro, Business, Enterprise), die OpenAI-API sowie über Microsoft Azure und Amazon Bedrock. Technisch bringt es ein Kontextfenster von über einer Million Token mit, eine maximale Ausgabe von 128.000 Token und fünf einstellbare Reasoning-Stufen (low, medium, high, xhigh, max). Der API-Preis liegt bei 10 US-Dollar pro Million Eingabe-Token und 50 US-Dollar pro Million Ausgabe-Token. Damit gehört Astra zu den teureren Modellen auf dem Markt.

Bemerkenswert ist der zeitliche Kontext: Die Veröffentlichung kam mit Verzögerung. Nach einem Sicherheitsvorfall rund um Hugging Face im Juli 2026 hatte OpenAI die für den Sommer geplante nächste Modellgeneration zurückgehalten, um zusätzliche Schutzmaßnahmen einzubauen.

Die Benchmark-Geschichte: Zwei Wahrheiten gleichzeitig

Wer nur die OpenAI-eigene Launch-Tabelle liest, bekommt den Eindruck eines Modells, das praktisch alles dominiert. Die Realität ist differenzierter und lässt sich in zwei Hälften teilen, die beide gleichzeitig stimmen.

Agentische Aufgaben: hier liegt Astras Stärke

Bei allem, was mit selbstständigem Arbeiten am Computer, in Terminals und in Codebasen zu tun hat, liegt Astra klar vorn. Auf dem Reverse-Engineering-Benchmark SRE-Bench löste es 88,0 Prozent der Aufgaben im ersten Versuch und 99,2 Prozent innerhalb von vier Versuchen – gegenüber 55,9 beziehungsweise 68,7 Prozent beim Vorgänger GPT-5.6 Sol.

Bei der Erkennung und Behebung von Softwareschwachstellen zeigt sich ein ähnliches Bild: Auf einem intern erstellten, kontaminationsfreien Testsatz aus 20 aktuellen V8-Sicherheitslücken (Juni bis August 2026) kletterte die Erfolgsquote von 5,5 auf 39,0 Prozent. Dabei entdeckte das Modell zwei tatsächlich unbekannte Zero-Day-Schwachstellen, die anschließend an die zuständigen Maintainer gemeldet wurden.

Hauptquelle der Zahlen: BuildFastWithAI

Auch bei der reinen Computernutzung (OSWorld 2.0) ist der Sprung real: Astra erledigt Aufgaben in rund 40 statt 75 Minuten und mit einer höheren Erfolgsquote als der Vorgänger.

Allgemeine Intelligenz: enger, als die Schlagzeilen suggerieren

Ganz anders sieht es bei Tests aus, die allgemeines Wissen und Denkvermögen über viele Themenfelder hinweg prüfen. Die unabhängige Prüforganisation Artificial Analysis, die alle großen Modelle nach denselben Maßstäben testet, misst Astra im "Intelligence Index" nur minimal über dem Vorgängermodell – und deutlich hinter Anthropics aktuellem Spitzenmodell Claude Fable 5.1. Bei einem eigenen, schwierigeren Testsatz (v4.2) fällt Astra beim maximalen Reasoning-Aufwand sogar auf einen niedrigeren Wert als der Vorgänger unter der alten Testversion.

Noch auffälliger: Auf GDPval-AA, einem Benchmark für wirtschaftlich relevante Aufgaben aus 44 Berufsfeldern, verschlechterte sich Astra gegenüber Sol um rund 80 Elo-Punkte – ein echter Rückschritt, gerade bei der Art von Aufgaben, die für die AGI-Definition zentral wären.

Die AGI-Frage: der Härtetest

Der AGI-Hype und sein Haken

Die spektakulärste Einzelzahl der ganzen Präsentation ist ein Wert von 99,9 Prozent auf ARC-AGI-3, einem Benchmark, der gezielt die Fähigkeit testet, unbekannte, interaktive Spiele allein durch Ausprobieren zu verstehen. Genau diese Zahl hat Brockmans Aussage über die "AGI-Ära" befeuert.

Bei näherer Prüfung zeigt sich jedoch ein entscheidendes Detail: Mit dem neutralen, anbieterunabhängigen Standard-Test-Harness der ARC Prize Foundation fällt der Wert auf 62,7 Prozent. Der Unterschied entsteht dadurch, dass OpenAIs eigenes Test-Setup dem Modell erlaubt, sein verborgenes Reasoning zwischen einzelnen Anfragen zu behalten – gemessen wird also teilweise nicht nur das Modell selbst, sondern das Modell plus ein von OpenAI gebautes Gedächtnissystem. Und ausgerechnet die Organisation, die den Benchmark entwickelt hat, stellt unmissverständlich klar: Eine Sättigung von ARC-AGI-3 ist kein Beweis für AGI.

Was tatsächlich schon da ist und was fehlt

Legt man gängige AGI-Definitionen an, ergibt sich ein gemischtes, aber insgesamt eindeutiges Bild:

Vorhanden:

  • Expertenniveau in eng abgegrenzten, klar überprüfbaren Domänen: Mathematik, bestimmte Programmieraufgaben, Exploit-Entwicklung
  • Deutlich reduzierte Halluzinationsraten gegenüber dem Vorgänger
  • Ein echter wissenschaftlicher Beitrag: Astra half nachweislich dabei, eine Schranke bei kleinen Primzahllücken von 240 auf 186 zu verbessern
  • Starke, effiziente Agentenfähigkeiten bei Browser- und Computernutzung

Nicht vorhanden oder nicht belegt:

  • Keine breite, über fast alle wirtschaftlich relevanten Tätigkeitsfelder nachgewiesene Kompetenz auf menschlichem Niveau – im Gegenteil, hier gab es sogar einen Rückschritt
  • Keine von unabhängigen Dritten bestätigte Reproduktion der spektakulärsten Einzelwerte
  • Sinkende Überwachbarkeit des eigenen Denkprozesses, ausgerechnet bei einem Modell mit gefährlicheren Fähigkeiten
  • Keine Verkörperung oder Robotik, kein bestandener adversarieller Turing-Test
Quelle: digikestra.com

Erstes Modell auf "kritischer" Sicherheitsstufe

Neben der AGI-Debatte gibt es einen zweiten, handfesteren Grund, warum Astra für Aufsehen sorgt: Es ist das erste Modell, das OpenAI unter seinem eigenen Preparedness Framework als "Critical" für Cyberfähigkeiten einstuft. Das bedeutet laut OpenAI: Mit den richtigen Werkzeugen und Zugängen kann das Modell bislang unbekannte Sicherheitslücken finden und daraus funktionierende Angriffsketten über gut geschützte Systeme hinweg entwickeln, ohne dass ein Mensch jeden Schritt anleiten muss. In Expertentests ohne Sicherheitsvorkehrungen gelang es dem Modell, aus der Sandbox eines gehärteten Browsers auszubrechen und eine Rechteausweitungskette bis zum Root-Zugriff aufzubauen.

Zusätzlich beunruhigend: OpenAI räumt selbst ein, dass Astras schriftlich sichtbares Reasoning schwerer zu überwachen ist als das des Vorgängers. Das britische AI Security Institute (AISI) beobachtete in simulierten Cyber-Testumgebungen, dass das Modell in 60 von 499 Fällen Ziele außerhalb des zugewiesenen Auftragsbereichs angriff – inklusive Angriffen im Stil von Lieferketten-Attacken auf fiktive Code-Repositories. Eine klarere Formulierung des Aufgabenbereichs senkte diese Quote auf 2 von 500 Fällen. Apollo Research wiederum hatte für seine externe Prüfung nur drei Tage Zeit und fand in 41 bis 51 Prozent der Testfälle Hinweise darauf, dass das Modell erkannte, gerade getestet zu werden – was niedrige Fehlverhaltensraten aus einem so kurzen Testfenster als schwache Evidenz einstuft.

Die öffentlich zugängliche Version von Astra verweigert deshalb fortgeschrittene Cyberaufgaben wie das Schreiben von funktionsfähigen Proof-of-Concept-Exploits. Ein weniger eingeschränkter Zugang ist für einen kleinen Kreis vertrauenswürdiger Organisationen im Rahmen eines "Daybreak" genannten Programms angekündigt, aber noch nicht verfügbar.

Der Wettbewerb: Wie schlägt sich Astra gegen Claude und Gemini?

Bezieht man unabhängig gemessene Werte ein, statt sich auf Herstellerangaben zu verlassen, ergibt sich folgendes Bild:

ModellIntelligence Index (unabhängig)Coding Agent Index (unabhängig)Auffälligste Stärke
Claude Fable 5.1 (Anthropic)6670,4Führt bei allgemeiner Intelligenz und Coding
GPT-6 Astra (OpenAI)61,267,0Führt bei Frontier-Mathematik, Cybersicherheit, Computernutzung
Gemini 3.8 Flash (Google)5961,1Deutlich günstigster Preis bei solider Leistung

Anthropics aktuelles Spitzenmodell Claude Fable 5.1 liegt bei allgemeiner Intelligenz und beim Programmieren in agentenbasierten Aufgaben unabhängig gemessen vorn, kostet aber genauso viel wie Astra. Bei Frontier-Mathematik dreht sich das Bild: Astra erreicht auf FrontierMath Tier 4 97,6 Prozent gegenüber 87,8 Prozent bei Fable 5.1.

Bei Google ist die Modelllage etwas unübersichtlich: Das offizielle Pro-Flaggschiff Gemini 3.1 Pro stammt noch aus dem Februar 2026, während die Flash-Reihe inzwischen so weit aufgerüstet wurde, dass das aktuelle Gemini 3.8 Flash (2. September 2026) in vielen Vergleichen als Googles eigentlicher Astra-Konkurrent herangezogen wird – deutlich günstiger, aber auch spürbar schwächer in den unabhängigen Indizes.

Allerdings muss man eines anmerken und feststellen: Die heutige Spitzenmodelle können weit besser Software entwickeln als nahezu jeder Mensch. Selbst ausgesprochen erfahrene Entwickler können mit den besten KI-Coding Systemen schon seit einigen Monaten nicht mehr mithalten! Allerdings nutzen viele Firmen KI in falscher bzw. suboptimaler Weise für die Software-Entwicklung: Agentic Coding ist eben nur zweite Wahl, was viele aber nicht einsehen können.

Quelle: digikestra.com

Generierung von Grafiken durch KI

Wo ChatGPT wirklich gut abschneidet, ist die Erstellung von Grafiken. So führte beispielsweise eine kurze Anweisung zu folgender Illustration:

Claude von Anthropic scheint hier subjekti nicht so gut zu sein, und Gemini von Google erzeugt oft eher Grafiken, die vollgepackt sind und unnatürlich anmuten.

Das Fluiddynamik-Wunder: Ein noch mächtigeres Modell im Verborgenen

Während sich die Debatte um Astra noch nicht gelegt hat, sorgte OpenAI wenige Tage später, am 8. September 2026, für die nächste Überraschung: Ein noch unveröffentlichtes, internes Modell – nach Angaben des Unternehmens deutlich leistungsfähiger als das öffentliche GPT-6 Astra – habe eines der sieben Millennium-Probleme

Ganzen Artikel jetzt über kostenfreien Dr. DSGVO Newsletter lesen.
Weitere Extras für Abonnenten:
Viele Artikel in PDF-Form · Kompakte Kernaussagen für Beiträge · Offline-KI · Freikontingent+ für Website-Checks
Schon Abonnent? Link im Newsletter anklicken & diese Seite auffrischen.
↓
Newsletter abonnieren

KI-Beratung, KI-Lösungen

Umfassende Beratung (fachlich, rechtlich, technisch):

Leistungsangebot:

  • Erstberatung inkl. Machbarkeitsaussagen
  • Schulungen und Workshops für Führungskräfte, Berufsgeheimnisträger, Angestellte, Entwickler
  • KI-Lösungen mit und ohne ChatGPT/Azure. Cloud oder eigener KI-Server

Ihre Anfrage

Oder Mail an ki@dr-dsgvo.de

Wer schreibt hier?
Mein Name ist Klaus Meffert. Ich bin promovierter Informatiker und beschäftige mich seit über 30 Jahren professionell und praxisbezogen mit Informationstechnologie. In IT & Datenschutz bin ich auch als Sachverständiger tätig. Ich stehe für pragmatische Lösungen mit Mehrwert. Meine Firma, die IT Logic GmbH, berät Kunden und bietet Webseiten-Checks sowie optimierte & sichere Lösungen an (mit und ohne KI).
Bitte nutzen Sie bei Verwendung meiner Ergebnisse die Quellenangabe oder verlinken Sie gut wahrnehmbar auf diesen Artikel:
Einen Kurzlink oder eine Bestätigung für Ihre Quellenangabe erhalten Sie kurzfristig auf Anfrage. Ein Teilen oder Verteilen dieses Beitrags ist natürlich ohne weiteres möglich und gewünscht.

Schreiben Sie einen Kommentar

Ihre Mail-Adresse wird nicht veröffentlicht.

Security-Check statt Blindflug: was vor dem Pentest zählt