The Daily Commit · Edición de sección Portada PHP AI Dev EN DE FR ES

TheModelDesk

8 de julio de 2026
modelos, agentes e inferencia local

Noticias

Separar la señal del ruido en las evaluaciones de código

OpenAI señala que un nuevo análisis detecta problemas de fiabilidad y precisión en SWE-Bench Pro, un benchmark de programación muy utilizado. Los hallazgos ponen en duda hasta qué punto las evaluaciones actuales reflejan el rendimiento real de los modelos y la estabilidad de los resultados obtenidos.

OpenAI ha llevado a cabo una auditoría detallada de SWE-Bench Pro, un benchmark de programación diseñado para evaluar capacidades de desarrollo de software mediante tareas realistas de repositorios públicos y privados. La investigación revela que aproximadamente el 30 % de las tareas del benchmark presentan fallos, lo que impide medir con precisión el rendimiento de los modelos.

La auditoría utilizó un pipeline de análisis de datos combinado con revisiones supervisadas por agentes y una campaña de anotación con ingenieros de software experimentados. El pipeline automatizado marcó el 27,4 % de las tareas como problemáticas, mientras que la revisión humana identificó errores en el 34,1 % del conjunto de datos.

Los problemas se dividen en cuatro categorías: pruebas excesivamente estrictas sobre detalles de implementación, prompts con especificaciones insuficientes, pruebas de baja cobertura que permiten el paso de soluciones incompletas y prompts engañosos o contradictorios.

OpenAI advierte a los desarrolladores que estos defectos pueden distorsionar la percepción de las capacidades reales de los modelos y afectar las prioridades de investigación. Los hallazgos subrayan la dificultad de crear benchmarks exigentes pero justos y resaltan la utilidad de los agentes de IA para la validación de datos a escala.

Leer la fuente original (en inglés) ↗

Valora este artículo: 0

Tribuna de lectores

Aún no hay aportaciones — abre el debate.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Edición de pantalla · Información legal · Política de privacidad