"Dumm wie Brot": ChatGPT scheitert an einfachen Spielen


"Dumm wie Brot": OpenAIs KI scheiterte an einfachen Spielen - bis sie sich erinnern durfte

"Dumm wie Brot": OpenAIs KI scheiterte an einfachen Spielen - bis sie sich erinnern durfte
Quelle: OpenAI

OpenAI zeigt anhand des ARC-AGI-3-Benchmarks, wie stark Künstliche Intelligenz vom "Harness" abhängt - die Leistung von GPT-5.6 Sol springt in Spielen drastisch hoch.

OpenAI hat GPT-5.6 Sols Punktzahl auf dem ARC-AGI-3-Benchmark von 13,3 auf 38,3 Prozent erhöht - nicht durch Trainingsdaten oder Architekturänderungen, sondern durch zwei einfache Einstellungen: Das Modell durfte seine eigenen Gedanken behalten und bekam den langen Kontext verdichtet statt abgeschnitten zugespielt. Damit zeigt der Test, wie stark die Leistung moderner KI-Agenten von der Umgebung abhängt, in der sie laufen - und wie vorsichtig man Benchmarkzahlen lesen muss, wenn der zugrunde liegende "Harness" sich verändert.

Der schwache Ausgangswert

Im offiziellen ARC-AGI-3-Harness, den die ARC Prize Foundation für alle Anbieter bereitstellt, erreichte GPT-5.6 Sol auf dem öffentlichen Aufgabensatz 13,3 Prozent. Frühere Messungen desselben Modells lagen auf dem semi-privaten Satz bei 7,8 Prozent - ebenfalls unter diesem Standardaufbau.

OpenAI-Forscher und Beitrags-Co-Autor Ted Sanders formulierte den Befund auf X drastisch: "Auf ARC-AGI-3 ist GPT-5.6 dumm wie Brot" - solange die Testumgebung seine interne Gedankenarbeit nach jedem Zug wegwirft und ältere Schritte aus dem Kontext löscht. Genau diese Einschränkungen wollte das Team systematisch untersuchen.

Empfohlener redaktioneller Inhalt [EMBED_URL] An dieser Stelle finden Sie externe Inhalte von [PLATTFORM]. Zum Schutz Ihrer persönlichen Daten werden externe Einbindungen erst angezeigt, wenn Sie dies durch Klick auf "Alle externen Inhalte laden" bestätigen:

Ich bin damit einverstanden, dass mir externe Inhalte angezeigt werden. Damit werden personenbezogene Daten an Drittplattformen übermittelt. Mehr dazu in unserer Datenschutzerklärung.

ARC-AGI-3 ist ein interaktiver Reasoning-Benchmark aus 2D-Puzzle-Spielen, die eigens dafür entworfen wurden. Ein Agent bekommt eine unbekannte Umgebung ohne Anleitung, muss experimentieren, Regeln erkennen, Hypothesen korrigieren und gewonnene Einsichten auf spätere Level übertragen.

Zwei Einstellungen, die das Spiel verändern

OpenAI hat den offiziellen Harness durch eine eigene Variante ersetzt, die auf der "Responses"-API aufbaut - derselben API, die auch in ChatGPT und Codex zum Einsatz kommt. Dabei wurden zwei zentrale Settings aktiviert:

Im offiziellen ARC-AGI-3-Harness passierte genau das Gegenteil: Das interne "Gedächtnis" des Modells wurde nach jeder Aktion verworfen, und sobald der Verlauf länger als 175.000 Zeichen war, wurden die ältesten Nachrichten abgeschnitten.

Schneller, sparsamer - und deutlich erfolgreicher

Mit den beiden Einstellungen musste GPT-5.6 Sol die Regeln eines Spiels nicht bei jedem Zug neu rekonstruieren. Stattdessen konnte das System früh erkannte Muster festhalten, Strategien über längere Läufe tragen und auf frühere Versuche aufbauen.

OpenAI berichtet, dass der Score auf dem öffentlichen ARC-AGI-3-Satz dadurch von 13,3 auf 38,3 Prozent stieg - effektiv eine Verdreifachung. Gleichzeitig sank die Zahl der ausgegebenen Tokens pro Spiel um den Faktor sechs, weil das Modell weniger "laut denken" musste, um verlorenes Wissen wiederherzustellen.

In anderen Worten: Die KI war zumindest in diesem Kontext nicht zu dumm - sie durfte sich nur nichts merken. Allerdings bleibt auch festzuhalten: So beeindruckend der Sprung klingen mag, OpenAI selbst betont, dass 38,3 Prozent kein offizieller Leaderboard-Wert sind. Die ARC-AGI-3-Organisation misst schließlich bewusst mit einem generischen, anbieterneutralen Harness - ohne anbieterspezifische Gedächtnis-Features.


Mitmachen und kommentieren

Wie stehen Sie zu diesem Thema? Die PCGH-Redaktion freut sich über Ihre fundierte Meinung in den Kommentaren zu dieser Meldung. Sollten Sie noch keinen Extreme-Account haben, laden wir Sie zu einer Registrierung im Forum ein. Beachten Sie beim Kommentieren aber bitte die gültigen Forenregeln. Folgen Sie gerne PCGH bei 🔈 Youtube oder 💬 Whatsapp und erhalten Sie Neuigkeiten zu Grafikkarten, CPUs und Gaming direkt in Ihrem Feed.

Quelle: OpenAI