La réponse courte
Une CLI coûte en général moins de tokens qu’un serveur MCP : elle n’ajoute aucune liste d’outils, et le modèle connaît déjà les commandes courantes. MCP l’emporte là où il n’y a pas de CLI, où il faut s’authentifier, ou sans shell. Dans les deux cas, chaque étape est une requête. Enchaîner les étapes dans du code supprime ce coût.
Dans ce guide
Que coûte chacun en tokens ?
Trois choses déterminent la facture : la liste d’outils, le nombre d’étapes, et ce qui revient de chaque étape. Les serveurs MCP et les CLI diffèrent sur les trois.
| Coût | Serveur MCP | CLI |
|---|---|---|
| La liste d’outils | Chaque outil a une définition que le modèle doit lire. Claude Code les reporte par défaut : seuls les noms d’outils entrent dans le contexte tant qu’un outil n’est pas utilisé. | Aucune. Le modèle connaît déjà les commandes courantes, ou lit --help une fois. |
| Chaque étape | Un appel d’outil est une requête sur toute la conversation. | Une commande est aussi une requête, mais une commande peut enchaîner plusieurs étapes avec des pipes et &&. |
| Ce qui revient | Le résultat entier entre dans la conversation. Claude Code avertit au-delà de 10 000 tokens et plafonne un résultat à 25 000 par défaut. | Vous pouvez le réduire avant que le modèle ne le voie (head, jq), ou l’enregistrer dans un fichier, comme le fait Playwright CLI. |
L’enchaînement et le filtrage viennent du shell, pas d’une CLI en particulier : c’est un petit programme qui exécute plusieurs étapes en une seule requête. Le mode code, plus bas, donne la même capacité à MCP.
Que disent les mesures ?
Trois sources, sous trois angles.
- AnthropicLe guide des coûts de Claude Code dit que des outils CLI comme
gh,aws,gcloudetsentry-clirestent plus économes en contexte que les serveurs MCP, parce qu’ils n’ajoutent aucune liste outil par outil. - MicrosoftLe README de Playwright CLI dit que les invocations CLI sont plus économes en tokens que son serveur MCP : elles évitent de charger dans le modèle de gros schémas d’outils et des arbres d’accessibilité verbeux. Il garde MCP pour l’automatisation exploratoire, les tests auto-réparateurs et les workflows de longue durée, où le contexte continu du navigateur compte plus que le coût en tokens.
- ScalekitUn benchmark de Scalekit, mars 2026 : cinq tâches GitHub en lecture seule, 75 exécutions, Claude Sonnet 4. La CLI
gha utilisé de 1 365 à 9 386 tokens par tâche et le serveur MCP de GitHub de 32 279 à 82 835, soit 4 à 32 fois plus. Le serveur MCP a aussi échoué sur 7 exécutions sur 25 à cause de délais d’attente dépassés ; la CLI a réussi à chaque fois.
Ce benchmark a chargé les 43 définitions d’outils de GitHub dans chaque conversation. Claude Code les reporte désormais par défaut, ce qui y supprime la part « liste d’outils » de cet écart, mais pas la part « par étape », et pas non plus dans les applications qui chargent encore toutes les définitions.
Quand une CLI l’emporte-t-elle, et quand MCP ?
Une CLI l’emporte quand…
- L’outil est bien connu, comme gh, aws ou gcloud.
- La sortie est longue et vous n’en avez besoin que d’une partie : réduisez-la avant que le modèle ne la lise.
- Vous travaillez dans un agent de code qui a un shell et un système de fichiers.
- Plusieurs étapes tiennent en une seule commande.
MCP l’emporte quand…
- Le service n’a pas de CLI, ou seulement un serveur distant avec sa propre authentification.
- Votre application d’IA n’a pas de shell que le modèle puisse utiliser, comme une application de chat.
- Vous voulez des entrées typées et une liste de ce que fait chaque outil, plutôt que des options que le modèle a retenues de son entraînement.
- Plusieurs personnes utilisent l’agent et chacune a besoin de sa propre autorisation : l’argument principal de Scalekit.
MCP est-il mort ?
Non. Le protocole fait toujours ce qu’une CLI ne peut pas : atteindre des services distants avec authentification, fonctionner dans des applications sans shell, et décrire chaque outil de façon typée. Le README de Microsoft garde lui-même MCP pour certains workflows.
Ce qui s’use, c’est un schéma : un appel d’outil par étape, sur toute la conversation. Une CLI en évite une partie en enchaînant les commandes. Anthropic et Cloudflare décrivent la solution générale, écrire du code qui appelle les outils, et la mesurent : l’exemple d’Anthropic est passé de 150 000 à 2 000 tokens, et Cloudflare a exposé plus de 2 500 points de terminaison en environ 1 000 tokens.
Delta MCP est cette solution, prête à l’emploi, pour les serveurs MCP que vous utilisez déjà : votre IA écrit chaque tâche sous la forme d’un programme. Nous l’avons mesuré face à l’appel direct de ces serveurs, sur Claude Code avec Tool Search activé :
Sonnet 5.5, deux à trois exécutions par variante, le résultat final vérifié dans chaque service.
| Tâche | Tokens | Appels au modèle | Mesuré |
|---|---|---|---|
| Corriger une release, en codeCerberus, 152 outils | 13,4× moins | 26 → 6,5 | 5 octobre |
| Nettoyer 20 tickets en retardUn gestionnaire de tickets | 4,8× moins | 5 → 2 | 2 octobre |
| Se connecter, ajouter 3 contacts, les listerMicrosoft Playwright MCP | 3,9× moins | 12,6 → 4 | 2 octobre |
Toutes les mesures et la méthode
Laquelle utiliser ?
Partez de votre situation, pas du protocole.
| Votre situation | À utiliser | Pourquoi |
|---|---|---|
| L’outil est bien connu et a une CLI : gh, aws, gcloud. | Une CLI | Pas de liste d’outils, et vous pouvez réduire la sortie. Le guide des coûts de Claude Code la recommande. |
| Le service n’a pas de CLI, ou vous l’atteignez via un serveur distant. | MCP | C’est la voie d’accès. Gardez les serveurs que vous utilisez et déconnectez les autres. |
| Votre application d’IA n’a pas de shell. | MCP | Une CLI a besoin d’un endroit où s’exécuter. |
| Une tâche traverse plusieurs étapes ou plusieurs services. | Du code, pas un appel par étape | Delta MCP le fait pour vos serveurs MCP. Un script le fait pour les CLI. |
Questions
MCP ou CLI : lequel choisir pour un agent IA ?
Aucun des deux dans tous les cas. Une CLI est en général moins chère là où il en existe une bien connue, parce qu’elle n’ajoute aucune liste d’outils et que sa sortie peut être réduite. MCP est la voie d’accès là où il n’y a pas de CLI, là où une authentification est nécessaire, ou quand l’application n’a pas de shell. Les deux paient une requête à chaque étape.
Une CLI coûte-t-elle moins de tokens qu’un serveur MCP ?
En général, par tâche. Scalekit a mesuré la CLI gh de 1 365 à 9 386 tokens par tâche, contre 32 279 à 82 835 pour le serveur MCP de GitHub, avec les 43 définitions d’outils chargées. Claude Code reporte désormais ces définitions, ce qui réduit l’écart.
MCP est-il mort ?
Non. Il couvre toujours les services distants, l’authentification et les applications sans shell, et le README de Playwright CLI de Microsoft garde lui-même MCP pour les workflows exploratoires et de longue durée. Ce qui coûte des tokens, c’est un appel par étape, que le code peut remplacer.
Dois-je remplacer mes serveurs MCP par des skills et des CLI ?
Seulement là où il existe une bonne CLI. Les skills aident aussi : Claude Code ne charge que leurs descriptions au départ et le texte complet quand l’un d’eux est invoqué, et un skill peut contenir du code à exécuter. Anthropic dit que les skills complètent les serveurs MCP plutôt que de les remplacer.
Pourquoi y a-t-il un Playwright CLI à côté du serveur MCP Playwright ?
Son README dit que les invocations CLI évitent de charger dans le modèle de gros schémas d’outils et des arbres d’accessibilité verbeux, et que CLI plus skills convient aux agents de code qui concilient automatisation du navigateur et grandes bases de code dans des fenêtres de contexte limitées. MCP reste pour l’automatisation exploratoire, les tests auto-réparateurs et les workflows de longue durée.
Delta MCP remplace-t-il une CLI ?
Non. Une bonne CLI, là où elle existe, est le bon outil. Delta MCP s’adresse aux serveurs MCP que vous avez déjà, sur des tâches en plusieurs étapes : 3,3–24,1× moins de tokens dans nos tests face à l’appel direct de ces serveurs.
Sources
- Claude Code, Manage costs effectively (documentation) Les outils CLI sont plus économes en contexte que les serveurs MCP ; les définitions d’outils MCP sont reportées par défaut.
- Claude Code, Connect Claude Code to tools via MCP (documentation) L’avertissement à 10 000 tokens et le plafond par défaut de 25 000 tokens sur un résultat d’outil.
- Microsoft, Playwright CLI (README on GitHub) La CLI face à MCP sur l’efficacité en tokens, et là où MCP reste la meilleure option.
- Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11 mars 2026) Le benchmark GitHub : tokens par tâche, fiabilité et les 43 définitions d’outils.
- Anthropic, Code execution with MCP: Building more efficient agents (4 nov. 2025) L’exemple de 150 000 à 2 000 tokens ; du code qui appelle les outils plutôt qu’un appel par étape.
- Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 févr. 2026) Plus de 2 500 points de terminaison en environ 1 000 tokens, contre 1,17 million avec un serveur MCP classique.
- Anthropic, Equipping agents for the real world with Agent Skills (16 oct. 2025) Les skills chargent d’abord leur nom et leur description, et le reste à la demande ; ils peuvent contenir du code ; ils complètent les serveurs MCP.
- Claude Code, Extend Claude with skills (documentation) Les descriptions des skills se chargent au départ ; le contenu complet seulement quand un skill est invoqué.
- Delta MCP, Benchmarks Chaque mesure de Delta MCP sur cette page, avec sa méthode.
À lire ensuite
- Comment réduire la consommation de tokens MCP, et pourquoiMesurez votre consommation de tokens MCP avec /context, voyez les deux coûts (liste d’outils, allers-retours) et comparez les solutions, Tool Search compris.
- Limite Claude Code atteinte ? Le coût de vos serveurs MCPLimite d’utilisation Claude Code atteinte : « You've hit your limit » (session, hebdomadaire, Opus, dépenses), ce que coûtent vos serveurs MCP et quoi couper.
- Fichier de configuration MCP : Claude, Cursor, VS CodeOù Claude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI et Codex gardent leur config MCP : chemin, clé JSON, serveurs distants, limites d’outils.