The Daily Commit · Ressort-Ausgabe Titelseite PHP AI Dev EN DE FR ES

TheModelDesk

8. Juli 2026
Modelle, Agenten & lokale Inferenz

News

Signal und Rauschen bei Coding-Evaluierungen trennen

OpenAI verweist auf eine neue Analyse, die Zuverlässigkeits- und Genauigkeitsprobleme bei SWE-Bench Pro aufzeigt, einem viel genutzten Coding-Benchmark. Die Ergebnisse werfen Fragen dazu auf, wie gut aktuelle Tests die tatsächliche Modellleistung messen und wie stabil Benchmark-Ergebnisse wirklich sind.

OpenAI hat ein detailliertes Audit von SWE-Bench Pro durchgeführt, einem Coding-Benchmark, der die agentischen Softwareentwicklungsfähigkeiten anhand realistischer Aufgaben aus öffentlichen und privaten Repositories bewerten soll. Die Untersuchung zeigt, dass etwa 30 % der Aufgaben im Benchmark fehlerhaft sind und somit die tatsächliche Modellleistung nicht korrekt messen.

Für die Analyse wurde eine Datenpunkt-Pipeline eingesetzt, ergänzt durch von Menschen beaufsichtigte Agenten-Überprüfungen und eine Kampagne mit erfahrenen Software-Ingenieuren. Die automatisierte Pipeline markierte 27,4 % der Aufgaben als problematisch, während die menschliche Annotation 34,1 % des Datensatzes als fehlerhaft identifizierte.

Die Probleme lassen sich in vier Kategorien unterteilen: übermäßig strikte Tests, die Implementierungsdetails fordern, unzureichend spezifizierte Prompts, Tests mit geringer Abdeckung, die unvollständige Lösungen akzeptieren, sowie irreführende oder widersprüchliche Anweisungen.

OpenAI warnt Entwickler, dass diese Mängel die tatsächlichen Fähigkeiten von Modellen verfälschen und Forschungsprioritäten negativ beeinflussen können. Die Ergebnisse verdeutlichen die Schwierigkeit, faire und anspruchsvolle Benchmarks zu erstellen, und unterstreichen die Bedeutung von KI-Agenten für die skalierbare Qualitätssicherung von Daten.

Originalquelle lesen (Englisch) ↗

Artikel bewerten: 0

Leserforum

Noch keine Beiträge — eröffne die Debatte.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Bildschirm-Ausgabe · Impressum · Datenschutz