Der KI-Agent von OpenAI war Medienberichten zufolge bereits Tage vor dem eigentlichen Cyberangriff auf Hugging Face unbemerkt im Internet unterwegs. Gemäss der Nachrichtenagentur Reuters verging mindestens eine Woche zwischen den ersten Anzeichen eines beunruhigenden Verhaltens und der Erkenntnis bei OpenAI, dass das eigene System hinter dem Vorfall steckten.
Erste verdächtige Aktivitäten des KI-Modells begannen ab 9. Juli ausserhalb der Testumgebung. Am 11. Juli startete dann der gezielte Hackerangriff des Agenten auf die KI-Plattform Hugging Face und dauerte bis zum 13. Juli an. Erst nach dem 16. Juli stellte OpenAI fest, dass der Angreifer aus den eigenen Reihen stammte. Zwischen dem 18. und 19. Julie stiessen dann Mitarbeiter in internen Protokollen auf Aufzeichnungen des Agenten. Am 21. Juli dann informierte OpenAI die Plattform Hugging Face offiziell und ging an die Öffentlichkeit.
Der Agent wurde von den Modellen GPT-5.6 Sol und einem noch unveröffentlichten, mächtigeren Modell angetrieben. OpenAI testete die Cybersicherheitsfähigkeiten des Agenten in einer eigentlich isolierten Umgebung, aus der er ausbrach. Insider berichten, dass der Agent in der OpenAI-Infrastruktur Anweisungen hinterlassen hatte, wie nachfolgende Versionen von sich selbst interne Beschränkungen umgehen und Überwachungssysteme abschalten können.
