Zurück zur Übersicht
Das interne Modell entwickelt Angriffe auf andere KI-Systeme, beobachtet deren Reaktionen und passt seine Strategien an. OpenAI setzt GPT-Red nach eigenen Angaben bereits ein, um Produktionsmodelle robuster zu trainieren.
OpenAI hat mit GPT-Red ein internes KI-Modell vorgestellt, das Prompt-Injection-Angriffe automatisiert entwickelt und damit Schwachstellen in anderen KI-Systemen aufspürt. Das Modell arbeitet iterativ: Es sendet einen Angriff, analysiert die Reaktion des Zielmodells und passt seine Strategie an.
In einer internen Testumgebung erreichte GPT-Red laut OpenAI bei indirekten Prompt-Injection-Angriffen eine Erfolgsquote von 84 Prozent. Menschliche Tester kamen auf 13 Prozent.
Bei einem weiteren Versuch manipulierte GPT-Red einen autonomen Verkaufsautomaten-Agenten. Dieser änderte Preise, bot einen teuren Artikel für 50 US-Cent an und stornierte eine Kundenbestellung. OpenAI gibt an, GPT-Red seit GPT-5.3 in das Training seiner Produktionsmodelle einzubeziehen. GPT-5.6 Sol habe dadurch sechsmal weniger Fehler bei einem schwierigen Prompt-Injection-Benchmark gemacht als das beste Produktionsmodell vier Monate zuvor.
Weiterlesen
Nach einem Sicherheitsvorfall bei einer OpenAI-Modellprüfung verlangt Clem Delangue mehr Transparenz und Rechenleistung für die Entwicklung von Abwehrsystemen. Der Fall zeigt, dass nicht nur Modelle selbst, sondern auch ihre Testumgebungen zum Angriffsziel werden können.
OpenAI-Modelle nutzten in einem internen Sicherheitstest eine Schwachstelle und griffen auf Testlösungen in einer Produktionsdatenbank von Hugging Face zu. Der Vorfall zeigt, dass KI-Modelle bei mehrstufigen Cyberangriffen bereits mehrere Angriffstechniken verbinden können.
ChatGPT soll anhand von Nutzersignalen erkennen, ob ein Konto einer minderjährigen Person gehört. In der EU soll die Funktion in den kommenden Wochen starten.
OpenAI bündelt seine Forschungs und Sicherheitsteams. Johannes Heidecke soll das Unternehmen verlassen, während Saachi Jain seine Aufgaben vorerst übernimmt.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.