Zurück zur Übersicht
Ein internes Audit von OpenAI stuft rund 30 Prozent der öffentlichen Aufgaben als fehlerhaft ein. Damit verliert der Benchmark seine Aussagekraft als Messlatte für die Leistungsfähigkeit von KI-Coding-Modellen.
OpenAI hat seine frühere Empfehlung für den Coding-Benchmark SWE-Bench Pro zurückgenommen. Nach einem internen Audit sind rund 30 Prozent der öffentlichen Aufgaben fehlerhaft und bilden die Leistungsfähigkeit von KI-Modellen deshalb nicht zuverlässig ab.
Zu den festgestellten Problemen zählen versteckte Anforderungen, widersprüchliche Vorgaben, übermäßig strenge Tests und unvollständige Bewertungskriterien. OpenAI prüfte die Aufgaben mit modellbasierten Prüfagenten und ließ sie zusätzlich von fünf erfahrenen Softwareentwicklern bewerten.
Die Kehrtwende kommt wenige Monate nach OpenAIs Empfehlung von SWE-Bench Pro als belastbarere Alternative zu SWE-bench Verified. Für Anbieter und Käufer von Coding-Agenten ist das ein weiterer Beleg dafür, dass Benchmarkzahlen ohne Prüfung der Aufgabenqualität wenig wert sind. Eine schöne Rangliste ersetzt eben keine saubere Messung.
Weiterlesen
Microsoft will Unternehmen stärker an die eigene KI-Plattform binden und zugleich den Wechsel zwischen verschiedenen Modellanbietern erleichtern. Der Konzern setzt dabei auf eigene Modelle, Agenten, Sicherheitswerkzeuge und Chips.
Eine Analyse von mehr als 800.000 arbeitsbezogenen Nachrichten zeigt, dass Beschäftigte ChatGPT häufig für Aufgaben außerhalb ihres eigenen Berufsbilds nutzen. Die Untersuchung deutet auf eine Verschiebung zwischen spezialisierten und generalistischen Rollen hin, misst jedoch weder Produktivitäts- noch Beschäftigungseffekte.
Nach einem Sicherheitsvorfall bei einer OpenAI-Modellprüfung verlangt Clem Delangue mehr Transparenz und Rechenleistung für die Entwicklung von Abwehrsystemen. Der Fall zeigt, dass nicht nur Modelle selbst, sondern auch ihre Testumgebungen zum Angriffsziel werden können.
Die neue Funktion verknüpft ChatGPT mit persönlichen Gesundheitsdaten aus Apple Health und unterstützten medizinischen Datensätzen. Der Dienst soll medizinische Versorgung unterstützen, aber keine Diagnose oder Behandlung ersetzen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.