La respuesta corta
Una CLI suele costar menos tokens que un servidor MCP: no agrega lista de herramientas, y el modelo ya conoce los comandos comunes. MCP gana donde no existe una CLI, donde necesitas iniciar sesión o donde tu app no tiene shell. En ambos, cada paso es una solicitud. Encadenar los pasos en código elimina ese costo.
En esta guía
¿Cuánto cuesta cada uno en tokens?
Tres cosas determinan la factura: la lista de herramientas, el número de pasos y lo que regresa de cada paso. Los servidores MCP y las CLI difieren en las tres.
| Costo | Servidor MCP | CLI |
|---|---|---|
| La lista de herramientas | Cada herramienta tiene una definición que el modelo debe leer. Claude Code las aplaza por defecto: solo los nombres de las herramientas entran en el contexto hasta que se usa una. | Ninguna. El modelo ya conoce los comandos comunes, o lee --help una sola vez. |
| Cada paso | Una llamada a una herramienta es una solicitud sobre toda la conversación. | Un comando también es una solicitud, pero un comando puede encadenar varios pasos con pipes y &&. |
| Lo que regresa | Todo el resultado entra en la conversación. Claude Code avisa por encima de 10.000 tokens y limita un resultado a 25.000 por defecto. | Puedes recortarlo antes de que el modelo lo vea (head, jq), o guardarlo en un archivo, como hace Playwright CLI. |
Encadenar y recortar vienen del shell, no de una CLI concreta: es un programa pequeño que ejecuta varios pasos en una sola solicitud. El modo código, más abajo, le da a MCP la misma capacidad.
¿Qué dicen las mediciones?
Tres fuentes, desde tres ángulos.
- AnthropicLa guía de costos de Claude Code dice que las herramientas CLI como
gh,aws,gcloudysentry-clisiguen siendo más eficientes en contexto que los servidores MCP, porque no agregan ninguna lista por herramienta. - MicrosoftEl README de Playwright CLI dice que las invocaciones de CLI son más eficientes en tokens que su servidor MCP: evitan cargar en el modelo esquemas de herramientas grandes y árboles de accesibilidad extensos. Reserva MCP para la automatización exploratoria, las pruebas autorreparables y los flujos de trabajo de larga duración, donde el contexto continuo del navegador importa más que el costo en tokens.
- ScalekitUn benchmark de Scalekit, de marzo de 2026: cinco tareas de GitHub de solo lectura, 75 ejecuciones, Claude Sonnet 4. La CLI
ghusó de 1365 a 9386 tokens por tarea y el servidor MCP de GitHub de 32.279 a 82.835, es decir, de 4 a 32 veces más. El servidor MCP también falló en 7 de 25 ejecuciones por tiempos de espera agotados; la CLI funcionó siempre.
Ese benchmark cargó las 43 definiciones de herramientas de GitHub en cada conversación. Claude Code ahora las aplaza por defecto, lo que elimina allí la parte de la diferencia debida a la lista de herramientas, pero no la parte por paso, ni tampoco en las apps que siguen cargando todas las definiciones.
¿Cuándo gana una CLI y cuándo MCP?
Una CLI gana cuando…
- La herramienta es muy conocida, como gh, aws o gcloud.
- La salida es larga y solo necesitas una parte: recórtala antes de que el modelo la lea.
- Trabajas en un agente de programación que tiene un shell y un sistema de archivos.
- Varios pasos caben en un solo comando.
MCP gana cuando…
- El servicio no tiene CLI, o solo un servidor remoto con su propio inicio de sesión.
- Tu app de IA no tiene un shell que el modelo pueda usar, como una app de chat.
- Quieres entradas tipadas y una lista de lo que hace cada herramienta, en lugar de opciones que el modelo recuerda de su entrenamiento.
- Varias personas usan el agente y cada una necesita su propia autorización: el argumento principal de Scalekit.
¿Está muerto MCP?
No. El protocolo sigue haciendo lo que una CLI no puede: llegar a servicios remotos con inicio de sesión, funcionar en apps sin shell y describir cada herramienta de forma tipada. El propio README de Microsoft reserva MCP para algunos flujos de trabajo.
Lo que se está desgastando es un patrón: una llamada a una herramienta por paso, sobre toda la conversación. Una CLI evita parte de él encadenando comandos. Anthropic y Cloudflare describen la solución general, escribir código que llame a las herramientas, y la miden: el ejemplo de Anthropic bajó de 150.000 a 2000 tokens, y Cloudflare expuso más de 2500 endpoints en unos 1000 tokens.
Delta MCP es esa solución, lista para usar, para los servidores MCP que ya tienes: tu IA escribe cada tarea como un programa. Lo medimos frente a llamar directamente a esos servidores, en Claude Code con Tool Search activado:
Sonnet 5.5, de dos a tres ejecuciones por variante, el resultado final verificado en cada servicio.
| Tarea | Tokens | Llamadas al modelo | Medido |
|---|---|---|---|
| Corregir una release, en códigoCerberus, 152 herramientas | 13,4× menos | 26 → 6,5 | 5 de octubre |
| Limpiar 20 tickets atrasadosUn gestor de tickets | 4,8× menos | 5 → 2 | 2 de octubre |
| Iniciar sesión, agregar 3 contactos y listarlosMicrosoft Playwright MCP | 3,9× menos | 12,6 → 4 | 2 de octubre |
Todas las mediciones y el método
¿Cuál deberías usar?
Parte de tu situación, no del protocolo.
| Tu situación | Usa | Por qué |
|---|---|---|
| La herramienta es muy conocida y tiene una CLI: gh, aws, gcloud. | Una CLI | Sin lista de herramientas, y puedes recortar la salida. La guía de costos de Claude Code la recomienda. |
| El servicio no tiene CLI, o accedes a él mediante un servidor remoto. | MCP | Es la vía de entrada. Conserva los servidores que usas y desconecta el resto. |
| Tu app de IA no tiene shell. | MCP | Una CLI necesita un lugar donde ejecutarse. |
| Una tarea abarca varios pasos o varios servicios. | Código, no una llamada por paso | Delta MCP lo hace para tus servidores MCP. Un script lo hace para las CLI. |
Preguntas
¿Es mejor MCP o CLI para agentes de IA?
Ninguno es siempre el mejor. Una CLI suele ser más barata donde existe una muy conocida, porque no agrega lista de herramientas y su salida se puede recortar. MCP es la vía de entrada donde no existe una CLI, donde hace falta iniciar sesión o donde la app no tiene shell. Los dos pagan una solicitud por cada paso.
¿Una CLI es más barata que un servidor MCP en tokens?
Normalmente, por tarea. Scalekit midió que la CLI gh usa de 1365 a 9386 tokens por tarea, y el servidor MCP de GitHub de 32.279 a 82.835, con las 43 definiciones de herramientas cargadas. Claude Code ahora aplaza esas definiciones, lo que reduce la diferencia.
¿Está muerto MCP?
No. Sigue cubriendo servicios remotos, inicio de sesión y apps sin shell, y el propio README de Playwright CLI de Microsoft reserva MCP para flujos exploratorios y de larga duración. Lo que cuesta tokens es una llamada por paso, y el código puede reemplazarla.
¿Debo reemplazar mis servidores MCP por skills y CLI?
Solo donde exista una buena CLI. Las skills también ayudan: Claude Code carga solo sus descripciones al inicio y el texto completo cuando se invoca una, y una skill puede incluir código para ejecutar. Anthropic dice que las skills complementan a los servidores MCP en lugar de reemplazarlos.
¿Por qué hay una Playwright CLI junto al servidor MCP de Playwright?
Su README dice que las invocaciones de CLI evitan cargar en el modelo esquemas de herramientas grandes y árboles de accesibilidad extensos, y que CLI más skills encaja con los agentes de programación que equilibran la automatización del navegador con bases de código grandes en ventanas de contexto limitadas. MCP se reserva para la automatización exploratoria, las pruebas autorreparables y los flujos de trabajo de larga duración.
¿Delta MCP reemplaza a una CLI?
No. Una CLI es la herramienta adecuada donde existe una buena. Delta MCP es para los servidores MCP que ya tienes, en tareas de varios pasos: 3,3–24,1× menos tokens en nuestras pruebas frente a llamarlos directamente.
Fuentes
- Claude Code, Manage costs effectively (documentation) Las herramientas CLI son más eficientes en contexto que los servidores MCP; las definiciones de herramientas MCP se aplazan por defecto.
- Claude Code, Connect Claude Code to tools via MCP (documentation) El aviso de 10.000 tokens y el límite por defecto de 25.000 tokens en un resultado de herramienta.
- Microsoft, Playwright CLI (README on GitHub) CLI frente a MCP en eficiencia de tokens, y dónde MCP sigue siendo la mejor opción.
- Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11 mar 2026) El benchmark de GitHub: tokens por tarea, fiabilidad y las 43 definiciones de herramientas.
- Anthropic, Code execution with MCP: Building more efficient agents (4 nov 2025) El ejemplo de 150.000 a 2000 tokens; código que llama a herramientas en lugar de una llamada por paso.
- Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 feb 2026) Más de 2500 endpoints en unos 1000 tokens, frente a 1,17 millones como un servidor MCP normal.
- Anthropic, Equipping agents for the real world with Agent Skills (16 oct 2025) Las skills cargan primero su nombre y su descripción y el resto bajo demanda; pueden incluir código; complementan a los servidores MCP.
- Claude Code, Extend Claude with skills (documentation) Las descripciones de las skills se cargan al inicio; el contenido completo solo cuando se invoca una skill.
- Delta MCP, Benchmarks Cada medición de Delta MCP de esta página, con su método.
Sigue leyendo
- Cómo reducir el consumo de tokens de MCP y por qué es altoCómo reducir el consumo de tokens de MCP: mídelo con /context, entiende sus dos costos y compara cada solución, incluida Tool Search.
- Límite de uso de Claude Code: qué cuestan tus servidores MCPQué significa “You've hit your limit” en Claude Code (sesión, semanal, Opus, gasto), cómo /usage muestra el costo de tus servidores MCP y qué recortar primero.
- Archivo de configuración MCP: Claude, Cursor, VS Code y másDónde guardan su configuración MCP Claude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI y Codex: ruta, clave JSON, servidores remotos y límites.