The Daily Commit · Edición de sección Portada PHP AI Dev EN DE FR ES

TheModelDesk

12 de julio de 2026
modelos, agentes e inferencia local

Noticias

Claude Code envía 33k tokens antes de leer el prompt; OpenCode envía 7k

Un estudio comparativo revela que Claude Code consume significativamente más tokens previos que OpenCode antes de procesar prompts del usuario. El análisis de llamadas API expone estrategias de caché ineficientes y mayor consumo de tokens harness, con sobrecargo aproximadamente 4,7× superior, impactando costos en flujos de trabajo de código agentic.

Los investigadores de Systima compararon Claude Code y OpenCode interceptando llamadas API entre cada framework y el endpoint del modelo, midiendo los tokens consumidos antes de que llegaran los prompts del usuario y durante la ejecución de tareas. Claude Code envió aproximadamente 33,000 tokens compuestos de prompts del sistema, esquemas de herramientas y andamiaje antes de procesar cualquier entrada del usuario, frente a 7,000 tokens para OpenCode—una diferencia de 4,7× que reduce directamente el contexto disponible para el trabajo real.

La eficiencia del caché reveló el contraste más marcado. El prefijo de solicitud de OpenCode se mantuvo byte-idéntico en todas las ejecuciones, permitiendo escrituras de caché únicas que las solicitudes posteriores podían releer a bajo costo. Claude Code reescribía decenas de miles de tokens de prompt-caché repetidamente dentro de la sesión, consumiendo hasta 54× más tokens de caché que OpenCode en tareas idénticas. Dado que las escrituras de caché se facturan a tarifas premium, este patrón impulsaba aumentos de costos visibles en paneles de control de producción.

Las configuraciones de producción amplificaban el sobrecargo de base. Un archivo de instrucciones típico de 72 KB (AGENTS.md o CLAUDE.md) añadía ~20,000 tokens por solicitud. Cinco servidores MCP modestos contribuían 5,000–7,000 tokens cada uno. Antes de que configuraciones realistas enviaran su primera solicitud, ya se habían consumido 75,000–85,000 tokens sin que los usuarios escribieran nada. Las arquitecturas con suagentes multiplicaban este costo: una tarea que costaba 121,000 tokens directamente se elevaba a 513,000 tokens cuando se distribuía entre dos suagentes, porque cada suagente relee independientemente su prompt del sistema completo y herramientas en cada turno.

Un escenario favoreció a Claude Code: en tareas multietapa, agrupar múltiples llamadas de herramientas por solicitud a veces reducía el número total de solicitudes en comparación con el sobrecargo por turno de OpenCode, generando costos generales más bajos. Sin embargo, al repetir la misma tarea en un modelo más reciente, Claude Code requería el doble de solicitudes y consumía ~298,000 tokens frente a 133,000 tokens de OpenCode—invirtiendo la ventaja. Los investigadores validaron todos los hallazgos en dos familias de modelos y utilizaron un proxy de registro para capturar payloads JSON exactos y datos de medición de la API, estableciendo la verdad definitiva sobre dónde se consumían los tokens.

Leer la fuente original (en inglés) ↗

Valora este artículo: 0

Tribuna de lectores

Aún no hay aportaciones — abre el debate.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Edición de pantalla · Información legal · Política de privacidad