The Daily Commit · Édition de rubrique La une PHP AI Dev EN DE FR ES

TheModelDesk

12 juillet 2026
modèles, agents & inférence locale

Actus

Claude Code envoie 33k tokens avant de lire le prompt ; OpenCode en envoie 7k

Une étude comparative révèle que Claude Code consomme nettement plus de tokens en amont qu'OpenCode avant de traiter les prompts utilisateur. L'analyse des appels API expose des stratégies de cache inefficaces et une consommation de tokens supérieure, avec un surcoût environ 4,7× plus élevé – impactant les coûts des workflows d'IA générative.

Les chercheurs de Systima ont comparé Claude Code et OpenCode en interceptant les appels API entre chaque framework et le point de terminaison du modèle, mesurant les tokens consommés avant l'arrivée des prompts utilisateur et tout au long de l'exécution des tâches. Claude Code envoyait environ 33 000 tokens composés de prompts système, schémas d'outils et échafaudage avant de traiter toute entrée utilisateur, contre 7 000 tokens pour OpenCode—une différence de 4,7× qui réduit directement le contexte disponible pour le travail réel.

L'efficacité du cache révélait le contraste le plus frappant. Le préfixe de requête d'OpenCode restait byte-identique sur tous les passages, permettant des écritures de cache uniques que les requêtes suivantes relisaient à bas coût. Claude Code réécrivait des dizaines de milliers de tokens de prompt-cache en mid-session de manière répétée, consommant jusqu'à 54× plus de tokens de cache qu'OpenCode sur des tâches identiques. Puisque les écritures de cache sont facturées à des tarifs premium, ce schéma entraînait des augmentations de coûts visibles dans les tableaux de bord de production.

Les configurations de production amplifiaient le surcoût de base. Un fichier d'instruction type de 72 KB (AGENTS.md ou CLAUDE.md) ajoutait ~20 000 tokens par requête. Cinq serveurs MCP modestes contribuaient chacun 5 000–7 000 tokens. Avant que des configurations réalistes envoient leur première requête, 75 000–85 000 tokens avaient déjà été consommés sans que les utilisateurs aient tapé quoi que ce soit. Les architectures avec sous-agents multipliaient ce coût : une tâche coûtant 121 000 tokens directement passait à 513 000 tokens lorsqu'elle était distribuée à deux sous-agents, car chaque sous-agent relit indépendamment son prompt système complet et ses outils à chaque tour.

Un scénario favorisait Claude Code : sur les tâches multi-étapes, le regroupement d'appels d'outils multiples par requête réduisait parfois le nombre total de requêtes par rapport au surcoût per-tour d'OpenCode, générant des coûts globaux plus faibles. Cependant, lors d'une nouvelle exécution de la même tâche sur un modèle plus récent, Claude Code nécessitait deux fois plus de requêtes et consommait ~298 000 tokens contre 133 000 tokens pour OpenCode—inversant l'avantage. Les chercheurs ont validé toutes les conclusions sur deux familles de modèles et utilisé un proxy de journalisation pour capturer les payloads JSON exacts et les données de facturation de l'API, établissant la vérité absolue sur l'endroit où les tokens étaient consommés.

Lire la source originale (en anglais) ↗

Évaluer cet article : 0

Tribune des lecteurs

Pas encore de contributions — lance le débat.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Édition écran · Mentions légales · Politique de confidentialité