News
Signal und Rauschen bei Coding-Evaluierungen trennen
OpenAI verweist auf eine neue Analyse, die Zuverlässigkeits- und Genauigkeitsprobleme bei SWE-Bench Pro aufzeigt, einem viel genutzten Coding-Benchmark. Die Ergebnisse werfen Fragen dazu auf, wie gut aktuelle Tests die tatsächliche Modellleistung messen und wie stabil Benchmark-Ergebnisse wirklich sind.
OpenAI hat ein detailliertes Audit von SWE-Bench Pro durchgeführt, einem Coding-Benchmark, der die agentischen Softwareentwicklungsfähigkeiten anhand realistischer Aufgaben aus öffentlichen und privaten Repositories bewerten soll. Die Untersuchung zeigt, dass etwa 30 % der Aufgaben im Benchmark fehlerhaft sind und somit die tatsächliche Modellleistung nicht korrekt messen.
Für die Analyse wurde eine Datenpunkt-Pipeline eingesetzt, ergänzt durch von Menschen beaufsichtigte Agenten-Überprüfungen und eine Kampagne mit erfahrenen Software-Ingenieuren. Die automatisierte Pipeline markierte 27,4 % der Aufgaben als problematisch, während die menschliche Annotation 34,1 % des Datensatzes als fehlerhaft identifizierte.
Die Probleme lassen sich in vier Kategorien unterteilen: übermäßig strikte Tests, die Implementierungsdetails fordern, unzureichend spezifizierte Prompts, Tests mit geringer Abdeckung, die unvollständige Lösungen akzeptieren, sowie irreführende oder widersprüchliche Anweisungen.
OpenAI warnt Entwickler, dass diese Mängel die tatsächlichen Fähigkeiten von Modellen verfälschen und Forschungsprioritäten negativ beeinflussen können. Die Ergebnisse verdeutlichen die Schwierigkeit, faire und anspruchsvolle Benchmarks zu erstellen, und unterstreichen die Bedeutung von KI-Agenten für die skalierbare Qualitätssicherung von Daten.
Leserforum
Noch keine Beiträge — eröffne die Debatte.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Warte auf deinen Klick …
·