OpenAI a réalisé un audit détaillé de SWE-Bench Pro, un benchmark de codage conçu pour évaluer les capacités d'agents de développement logiciel via des tâches réalistes issues de dépôts publics et privés. L'enquête révèle qu'environ 30 % des tâches du benchmark sont défectueuses, faussant ainsi la mesure des performances des modèles.
L'audit s'est appuyé sur un pipeline d'analyse de données, des examens supervisés par des agents et une campagne d'annotation menée par des ingénieurs logiciels expérimentés. Le pipeline automatisé a signalé 27,4 % de tâches problématiques, tandis que l'analyse humaine a identifié 34,1 % d'erreurs dans le jeu de données.
Les problèmes relevés se classent en quatre catégories : des tests excessivement stricts sur les détails d'implémentation, des prompts insuffisamment spécifiés, des tests à faible couverture laissant passer des corrections incomplètes, et des prompts trompeurs ou contradictoires.
OpenAI avertit les développeurs de modèles que ces défauts peuvent donner une image erronée des capacités réelles et influencer les priorités de recherche. Ces conclusions soulignent la difficulté de créer des benchmarks complexes mais équitables et démontrent l'utilité croissante des agents pour le contrôle qualité des données à grande échelle.
Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
En attente de ton clic …
·