A resposta curta
Uma CLI costuma custar menos tokens que um servidor MCP: não acrescenta lista de ferramentas, e o modelo já conhece os comandos comuns. O MCP vence onde não existe CLI, onde é preciso login ou onde seu app não tem shell. Nos dois, cada etapa é uma requisição. Encadear as etapas em código elimina esse custo.
Neste guia
Quanto cada um custa em tokens?
Três coisas movem a conta: a lista de ferramentas, o número de etapas e o que volta de cada etapa. Servidores MCP e CLIs diferem nas três.
| Custo | Servidor MCP | CLI |
|---|---|---|
| A lista de ferramentas | Cada ferramenta tem uma definição que o modelo precisa ler. O Claude Code as adia por padrão: só os nomes das ferramentas entram no contexto até que uma ferramenta seja usada. | Nenhuma. O modelo já conhece os comandos comuns, ou lê --help uma vez. |
| Cada etapa | Uma chamada de ferramenta é uma requisição sobre a conversa inteira. | Um comando também é uma requisição, mas um comando pode encadear várias etapas com pipes e &&. |
| O que volta | O resultado inteiro entra na conversa. O Claude Code avisa acima de 10.000 tokens e limita um resultado a 25.000 por padrão. | Você pode reduzir a saída antes que o modelo a veja (head, jq) ou salvá-la em um arquivo, como faz a Playwright CLI. |
Encadear e reduzir a saída vêm do shell, não de uma CLI específica: é um programa pequeno que roda várias etapas em uma única requisição. O modo de código, abaixo, dá ao MCP a mesma capacidade.
O que dizem as medições?
Três fontes, de três ângulos.
- AnthropicO guia de custos do Claude Code diz que ferramentas CLI como
gh,aws,gcloudesentry-cliainda são mais eficientes em contexto que os servidores MCP, porque não acrescentam listagem por ferramenta. - MicrosoftO README da Playwright CLI diz que as chamadas à CLI são mais eficientes em tokens que o servidor MCP dela: evitam carregar grandes esquemas de ferramentas e árvores de acessibilidade verbosas no modelo. Ele mantém o MCP para automação exploratória, testes que se autorreparam e fluxos de trabalho de longa duração, em que o contexto contínuo do navegador importa mais que o custo em tokens.
- ScalekitUm benchmark da Scalekit, de março de 2026: cinco tarefas de leitura no GitHub, 75 execuções, Claude Sonnet 4. A CLI
ghusou de 1.365 a 9.386 tokens por tarefa e o servidor MCP do GitHub de 32.279 a 82.835, ou seja, de 4 a 32 vezes mais. O servidor MCP também falhou em 7 de 25 execuções por timeout; a CLI teve sucesso todas as vezes.
Esse benchmark carregou todas as 43 definições de ferramentas do GitHub em cada conversa. O Claude Code agora as adia por padrão, o que elimina ali a parte da diferença ligada à lista de ferramentas, mas não a parte por etapa, e não nos apps que ainda carregam todas as definições.
Quando a CLI ganha, e quando o MCP ganha?
A CLI ganha quando…
- A ferramenta é conhecida, como gh, aws ou gcloud.
- A saída é longa e você só precisa de parte dela: reduza antes que o modelo a leia.
- Você trabalha em um agente de código que tem shell e sistema de arquivos.
- Várias etapas cabem em um único comando.
O MCP ganha quando…
- O serviço não tem CLI, ou só um servidor remoto com login próprio.
- Seu app de IA não tem shell para o modelo usar, como em um app de chat.
- Você quer entradas tipadas e uma lista do que cada ferramenta faz, em vez de flags que o modelo lembra do treinamento.
- Várias pessoas usam o agente e cada uma precisa da própria autorização: o ponto principal da Scalekit.
O MCP morreu?
Não. O protocolo ainda faz o que uma CLI não faz: alcançar serviços remotos com login, funcionar em apps sem shell e descrever cada ferramenta de forma tipada. O próprio README da Microsoft mantém o MCP para alguns fluxos de trabalho.
O que está perdendo força é um padrão: uma chamada de ferramenta por etapa, sobre a conversa inteira. Uma CLI evita parte disso encadeando comandos. A Anthropic e a Cloudflare descrevem a correção geral, escrever código que chama as ferramentas, e a medem: o exemplo da Anthropic caiu de 150.000 para 2.000 tokens, e a Cloudflare expôs mais de 2.500 endpoints em cerca de 1.000 tokens.
O Delta MCP é essa correção, pronta para usar, para os servidores MCP que você já tem: sua IA escreve cada tarefa como um programa. Medimos contra chamar esses servidores diretamente, no Claude Code com o Tool Search ativado:
Sonnet 5.5, de duas a três execuções por variante, o resultado final verificado em cada serviço.
| Tarefa | Tokens | Chamadas ao modelo | Medido em |
|---|---|---|---|
| Corrigir uma release, como códigoCerberus, 152 ferramentas | 13,4× menos | 26 → 6,5 | 5 de outubro |
| Limpar 20 tickets atrasadosUm gerenciador de tickets | 4,8× menos | 5 → 2 | 2 de outubro |
| Fazer login, adicionar 3 contatos e listar os trêsMicrosoft Playwright MCP | 3,9× menos | 12,6 → 4 | 2 de outubro |
Qual você deve usar?
Comece pela sua situação, não pelo protocolo.
| Sua situação | Use | Por quê |
|---|---|---|
| A ferramenta é conhecida e tem uma CLI: gh, aws, gcloud. | Uma CLI | Sem lista de ferramentas, e você pode reduzir a saída. O guia de custos do Claude Code recomenda. |
| O serviço não tem CLI, ou você o acessa por um servidor remoto. | MCP | É a porta de entrada. Mantenha os servidores que você usa e desconecte o resto. |
| Seu app de IA não tem shell. | MCP | Uma CLI precisa de um lugar onde rodar. |
| Uma tarefa passa por várias etapas ou vários serviços. | Código, não uma chamada por etapa | O Delta MCP faz isso para seus servidores MCP. Um script faz isso para as CLIs. |
Perguntas
MCP ou CLI: qual é melhor para agentes de IA?
Nenhum é sempre melhor. Uma CLI costuma ser mais barata onde existe uma conhecida, porque não acrescenta lista de ferramentas e a saída pode ser reduzida. O MCP é a porta de entrada onde não existe CLI, onde é preciso login ou onde o app não tem shell. Os dois pagam uma requisição por etapa.
Uma CLI é mais barata que um servidor MCP em tokens?
Em geral, por tarefa. A Scalekit mediu a CLI gh em 1.365 a 9.386 tokens por tarefa contra 32.279 a 82.835 do servidor MCP do GitHub, com as 43 definições de ferramentas carregadas. O Claude Code agora adia essas definições, o que reduz a diferença.
O MCP morreu?
Não. Ele ainda cobre serviços remotos, login e apps sem shell, e o próprio README da Playwright CLI da Microsoft mantém o MCP para fluxos exploratórios e de longa duração. O que custa tokens é uma chamada por etapa, que o código pode substituir.
Devo trocar meus servidores MCP por skills e CLIs?
Só onde existir uma boa CLI. As skills também ajudam: o Claude Code carrega só as descrições delas no início e o texto completo quando uma é invocada, e uma skill pode incluir código para rodar. A Anthropic diz que as skills complementam os servidores MCP, não os substituem.
Por que existe uma Playwright CLI ao lado do servidor MCP do Playwright?
O README dela diz que as chamadas à CLI evitam carregar grandes esquemas de ferramentas e árvores de acessibilidade verbosas no modelo, e que CLI mais skills combina com agentes de código que equilibram automação de navegador com grandes bases de código em janelas de contexto limitadas. O MCP fica para automação exploratória, testes que se autorreparam e fluxos de trabalho de longa duração.
O Delta MCP substitui uma CLI?
Não. Uma CLI é a ferramenta certa onde existe uma boa. O Delta MCP é para os servidores MCP que você já tem, em tarefas com várias etapas: 3,3–24,1× menos tokens nos nossos testes contra chamá-los diretamente.
Fontes
- Claude Code, Manage costs effectively (documentation) As ferramentas CLI são mais eficientes em contexto que os servidores MCP; as definições de ferramentas MCP são adiadas por padrão.
- Claude Code, Connect Claude Code to tools via MCP (documentation) O aviso de 10.000 tokens e o limite padrão de 25.000 tokens em um resultado de ferramenta.
- Microsoft, Playwright CLI (README on GitHub) CLI contra MCP em eficiência de tokens, e onde o MCP continua sendo a melhor opção.
- Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11 de mar. de 2026) O benchmark do GitHub: tokens por tarefa, confiabilidade e as 43 definições de ferramentas.
- Anthropic, Code execution with MCP: Building more efficient agents (4 de nov. de 2025) O exemplo de 150.000 para 2.000 tokens; código que chama ferramentas em vez de uma chamada por etapa.
- Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 de fev. de 2026) Mais de 2.500 endpoints em cerca de 1.000 tokens, contra 1,17 milhão como um servidor MCP comum.
- Anthropic, Equipping agents for the real world with Agent Skills (16 de out. de 2025) As skills carregam nome e descrição primeiro e o resto sob demanda; podem incluir código; complementam os servidores MCP.
- Claude Code, Extend Claude with skills (documentation) As descrições das skills são carregadas no início; o conteúdo completo só quando uma skill é invocada.
- Delta MCP, Benchmarks Cada medição do Delta MCP desta página, com seu método.
Continue lendo
- Como reduzir o consumo de tokens do MCP e por que é altoComo reduzir o consumo de tokens do MCP: meça com /context, veja os dois custos (lista de ferramentas e idas e voltas) e compare as soluções, até o Tool Search.
- Limite de uso do Claude Code atingido? O que os MCPs custamO que significa o “You've hit your limit” do Claude Code (sessão, semanal, Opus, gastos), o que seus servidores MCP custam no /usage e o que cortar primeiro.
- Arquivo de configuração MCP: Claude, Cursor, VS Code e maisOnde Claude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI e Codex guardam a configuração MCP: arquivo, chave JSON, servidor remoto e limite.