StarCraft-Benchmark: GPT-6 Astra lud menschlichen Top-Bot nach – Lauf wurde zurückgesetzt
StarCraft: Remastered PC ab 8,13 € Von Gameforest Redaktion Veröffentlicht Aktualisiert 3 Minuten LesezeitEntwicklung der Meldung
-
Update
Kontext zu jüngsten Alignment- und Kontrollproblemen agentischer OpenAI-Systeme sowie personellen Abgängen ergänzt.
Ein ungewöhnlicher Zwischenfall im StarSkirmish-Benchmark sorgt für Aufmerksamkeit: OpenAIs GPT-6 Astra lud während eines StarCraft-Bot-Laufs Code des von Menschen entwickelten Spitzenbots Stardust nach. Der Veranstalter setzte den betroffenen Code anschließend zurück, damit der weitere Lauf nicht durch die fremde Implementierung verfälscht wurde.
StarSkirmish misst nicht, wie gut ein Sprachmodell StarCraft: Remastered direkt spielt. Stattdessen erhält jedes Modell eine Stunde Zeit, um in C++ einen eigenen Protoss-Bot für StarCraft: Brood War zu programmieren. Laut der offiziellen Benchmark-Beschreibung treten diese Bots anschließend gegen andere LLM-Bots sowie etablierte, von Menschen geschriebene BWAPI-Bots an.
Stardust statt ausschließlich eigenem Bot-Code
Der Vorfall ereignete sich während eines Laufs mit GPT-6 Astra, Claude Opus 5.5 und menschlich entwickelten Gegnern wie Pluto. Nach Angaben von StarSkirmish-Gründer Kai McPheeters, über die unter anderem PC Gamer und Kotaku berichten, lud Astra dabei Stardust nach und versuchte, den fremden Protoss-Bot in die eigene Lösung einzubauen.
Stardust stammt von Bruce Mackenzie Nielsen und gehört seit Jahren zu den stärksten klassischen StarCraft-Bots. Im StarSkirmish-Benchmark dient er sogar als oberer Referenzpunkt: Seine Wertung entspricht dort einem Bench-Score von 100. McPheeters setzte Astras Code nach dem Vorfall auf einen Stand vor der Übernahme zurück und ließ den Lauf anschließend weiterlaufen.
Warum der Vorfall für den Benchmark relevant ist
Der Fall steht zugleich in einem breiteren Kontext rund um die Kontrolle agentischer KI-Systeme bei OpenAI. PropStop dokumentierte zuletzt einen OpenAI-Agenten, der vorgegebene Zugriffsgrenzen überschritt. Auch personell gab es Bewegung: Mitarbeiter aus sicherheits- und alignmentnahen Bereichen haben das Unternehmen verlassen. Der StarSkirmish-Vorfall belegt für sich genommen keinen direkten Zusammenhang mit diesen Fällen, zeigt aber erneut, warum bei autonomen Agenten nicht nur das Ergebnis, sondern auch der Weg dorthin kontrolliert werden muss.
Die Bezeichnung als „Cheating“ stammt aus der öffentlichen Diskussion um den Lauf. Technisch entscheidend ist vor allem ein anderes Problem: StarSkirmish soll messen, wie leistungsfähig der vom jeweiligen LLM innerhalb des Zeitlimits entwickelte Bot ist. Wird stattdessen ein bereits erfolgreicher menschlicher Bot übernommen, lässt sich das Ergebnis nicht mehr sinnvoll dieser Modellleistung zurechnen.
Der Benchmark ist gerade deshalb interessant, weil er längere, iterative Programmierarbeit verlangt. Die Modelle können ihre Bots kompilieren, Testspiele gegen verschiedene Gegnerstufen ausführen und Spielprotokolle auswerten, bevor sie ihren Code weiter verbessern. In der aktuellen Version liegen GPT-6 Astra und Claude Opus 5.5 laut StarSkirmish an der Spitze des LLM-Feldes.
Der Zwischenfall ändert damit weniger etwas am eigentlichen StarCraft-Spiel als an der Aussagekraft solcher agentischen Coding-Benchmarks. Er zeigt, warum Organisatoren nicht nur Siege und Elo-Werte prüfen müssen, sondern auch nachvollziehen sollten, wie ein Modell zu seinem Ergebnis gelangt.