Guia

MCP vs CLI para agentes de IA: de onde vem a conta de tokens

6 min de leituraPela equipe do Delta MCP

Um terminal rodando gh pr list ao lado da lista de ferramentas de um servidor MCP, com um sinal de vs entre os dois.

A resposta curta

Uma CLI costuma custar menos tokens que um servidor MCP: não acrescenta lista de ferramentas, e o modelo já conhece os comandos comuns. O MCP vence onde não existe CLI, onde é preciso login ou onde seu app não tem shell. Nos dois, cada etapa é uma requisição. Encadear as etapas em código elimina esse custo.

Neste guia

Quanto cada um custa em tokens?

Três coisas movem a conta: a lista de ferramentas, o número de etapas e o que volta de cada etapa. Servidores MCP e CLIs diferem nas três.

Quanto cada um custa em tokens?
CustoServidor MCPCLI
A lista de ferramentas Cada ferramenta tem uma definição que o modelo precisa ler. O Claude Code as adia por padrão: só os nomes das ferramentas entram no contexto até que uma ferramenta seja usada. Nenhuma. O modelo já conhece os comandos comuns, ou lê --help uma vez.
Cada etapa Uma chamada de ferramenta é uma requisição sobre a conversa inteira. Um comando também é uma requisição, mas um comando pode encadear várias etapas com pipes e &&.
O que volta O resultado inteiro entra na conversa. O Claude Code avisa acima de 10.000 tokens e limita um resultado a 25.000 por padrão. Você pode reduzir a saída antes que o modelo a veja (head, jq) ou salvá-la em um arquivo, como faz a Playwright CLI.

Encadear e reduzir a saída vêm do shell, não de uma CLI específica: é um programa pequeno que roda várias etapas em uma única requisição. O modo de código, abaixo, dá ao MCP a mesma capacidade.

O que dizem as medições?

Três fontes, de três ângulos.

  • AnthropicO guia de custos do Claude Code diz que ferramentas CLI como gh, aws, gcloud e sentry-cli ainda são mais eficientes em contexto que os servidores MCP, porque não acrescentam listagem por ferramenta.
  • MicrosoftO README da Playwright CLI diz que as chamadas à CLI são mais eficientes em tokens que o servidor MCP dela: evitam carregar grandes esquemas de ferramentas e árvores de acessibilidade verbosas no modelo. Ele mantém o MCP para automação exploratória, testes que se autorreparam e fluxos de trabalho de longa duração, em que o contexto contínuo do navegador importa mais que o custo em tokens.
  • ScalekitUm benchmark da Scalekit, de março de 2026: cinco tarefas de leitura no GitHub, 75 execuções, Claude Sonnet 4. A CLI gh usou de 1.365 a 9.386 tokens por tarefa e o servidor MCP do GitHub de 32.279 a 82.835, ou seja, de 4 a 32 vezes mais. O servidor MCP também falhou em 7 de 25 execuções por timeout; a CLI teve sucesso todas as vezes.

Esse benchmark carregou todas as 43 definições de ferramentas do GitHub em cada conversa. O Claude Code agora as adia por padrão, o que elimina ali a parte da diferença ligada à lista de ferramentas, mas não a parte por etapa, e não nos apps que ainda carregam todas as definições.

Quando a CLI ganha, e quando o MCP ganha?

A CLI ganha quando…

  • A ferramenta é conhecida, como gh, aws ou gcloud.
  • A saída é longa e você só precisa de parte dela: reduza antes que o modelo a leia.
  • Você trabalha em um agente de código que tem shell e sistema de arquivos.
  • Várias etapas cabem em um único comando.

O MCP ganha quando…

  • O serviço não tem CLI, ou só um servidor remoto com login próprio.
  • Seu app de IA não tem shell para o modelo usar, como em um app de chat.
  • Você quer entradas tipadas e uma lista do que cada ferramenta faz, em vez de flags que o modelo lembra do treinamento.
  • Várias pessoas usam o agente e cada uma precisa da própria autorização: o ponto principal da Scalekit.

O MCP morreu?

Não. O protocolo ainda faz o que uma CLI não faz: alcançar serviços remotos com login, funcionar em apps sem shell e descrever cada ferramenta de forma tipada. O próprio README da Microsoft mantém o MCP para alguns fluxos de trabalho.

O que está perdendo força é um padrão: uma chamada de ferramenta por etapa, sobre a conversa inteira. Uma CLI evita parte disso encadeando comandos. A Anthropic e a Cloudflare descrevem a correção geral, escrever código que chama as ferramentas, e a medem: o exemplo da Anthropic caiu de 150.000 para 2.000 tokens, e a Cloudflare expôs mais de 2.500 endpoints em cerca de 1.000 tokens.

O Delta MCP é essa correção, pronta para usar, para os servidores MCP que você já tem: sua IA escreve cada tarefa como um programa. Medimos contra chamar esses servidores diretamente, no Claude Code com o Tool Search ativado:

Sonnet 5.5, de duas a três execuções por variante, o resultado final verificado em cada serviço.

O que medimos
TarefaTokensChamadas ao modeloMedido em
Corrigir uma release, como códigoCerberus, 152 ferramentas 13,4× menos 26 → 6,5 5 de outubro
Limpar 20 tickets atrasadosUm gerenciador de tickets 4,8× menos 5 → 2 2 de outubro
Fazer login, adicionar 3 contatos e listar os trêsMicrosoft Playwright MCP 3,9× menos 12,6 → 4 2 de outubro

Todas as medições e o método

Qual você deve usar?

Comece pela sua situação, não pelo protocolo.

Qual você deve usar?
Sua situaçãoUsePor quê
A ferramenta é conhecida e tem uma CLI: gh, aws, gcloud. Uma CLI Sem lista de ferramentas, e você pode reduzir a saída. O guia de custos do Claude Code recomenda.
O serviço não tem CLI, ou você o acessa por um servidor remoto. MCP É a porta de entrada. Mantenha os servidores que você usa e desconecte o resto.
Seu app de IA não tem shell. MCP Uma CLI precisa de um lugar onde rodar.
Uma tarefa passa por várias etapas ou vários serviços. Código, não uma chamada por etapa O Delta MCP faz isso para seus servidores MCP. Um script faz isso para as CLIs.

Perguntas

MCP ou CLI: qual é melhor para agentes de IA?

Nenhum é sempre melhor. Uma CLI costuma ser mais barata onde existe uma conhecida, porque não acrescenta lista de ferramentas e a saída pode ser reduzida. O MCP é a porta de entrada onde não existe CLI, onde é preciso login ou onde o app não tem shell. Os dois pagam uma requisição por etapa.

Uma CLI é mais barata que um servidor MCP em tokens?

Em geral, por tarefa. A Scalekit mediu a CLI gh em 1.365 a 9.386 tokens por tarefa contra 32.279 a 82.835 do servidor MCP do GitHub, com as 43 definições de ferramentas carregadas. O Claude Code agora adia essas definições, o que reduz a diferença.

O MCP morreu?

Não. Ele ainda cobre serviços remotos, login e apps sem shell, e o próprio README da Playwright CLI da Microsoft mantém o MCP para fluxos exploratórios e de longa duração. O que custa tokens é uma chamada por etapa, que o código pode substituir.

Devo trocar meus servidores MCP por skills e CLIs?

Só onde existir uma boa CLI. As skills também ajudam: o Claude Code carrega só as descrições delas no início e o texto completo quando uma é invocada, e uma skill pode incluir código para rodar. A Anthropic diz que as skills complementam os servidores MCP, não os substituem.

Por que existe uma Playwright CLI ao lado do servidor MCP do Playwright?

O README dela diz que as chamadas à CLI evitam carregar grandes esquemas de ferramentas e árvores de acessibilidade verbosas no modelo, e que CLI mais skills combina com agentes de código que equilibram automação de navegador com grandes bases de código em janelas de contexto limitadas. O MCP fica para automação exploratória, testes que se autorreparam e fluxos de trabalho de longa duração.

O Delta MCP substitui uma CLI?

Não. Uma CLI é a ferramenta certa onde existe uma boa. O Delta MCP é para os servidores MCP que você já tem, em tarefas com várias etapas: 3,3–24,1× menos tokens nos nossos testes contra chamá-los diretamente.

Fontes

  1. Claude Code, Manage costs effectively (documentation) As ferramentas CLI são mais eficientes em contexto que os servidores MCP; as definições de ferramentas MCP são adiadas por padrão.
  2. Claude Code, Connect Claude Code to tools via MCP (documentation) O aviso de 10.000 tokens e o limite padrão de 25.000 tokens em um resultado de ferramenta.
  3. Microsoft, Playwright CLI (README on GitHub) CLI contra MCP em eficiência de tokens, e onde o MCP continua sendo a melhor opção.
  4. Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11 de mar. de 2026) O benchmark do GitHub: tokens por tarefa, confiabilidade e as 43 definições de ferramentas.
  5. Anthropic, Code execution with MCP: Building more efficient agents (4 de nov. de 2025) O exemplo de 150.000 para 2.000 tokens; código que chama ferramentas em vez de uma chamada por etapa.
  6. Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 de fev. de 2026) Mais de 2.500 endpoints em cerca de 1.000 tokens, contra 1,17 milhão como um servidor MCP comum.
  7. Anthropic, Equipping agents for the real world with Agent Skills (16 de out. de 2025) As skills carregam nome e descrição primeiro e o resto sob demanda; podem incluir código; complementam os servidores MCP.
  8. Claude Code, Extend Claude with skills (documentation) As descrições das skills são carregadas no início; o conteúdo completo só quando uma skill é invocada.
  9. Delta MCP, Benchmarks Cada medição do Delta MCP desta página, com seu método.

Continue lendo

Experimente o Delta MCP nas suas próprias tarefas

Grátis, leva dois minutos para configurar e você deixa tudo como estava com um clique.

Grátis · Sem conta · Chip Apple ou Intel

Grátis · Sem conta

Grátis · Sem conta

Acompanhe o lançamento

Para Mac, Windows e Linux. Não precisa de conta.

Em breve

O Delta MCP está quase aqui

O app gratuito para Mac, Windows e Linux chega em breve. Deixe seu e-mail e saiba assim que ele sair. Não precisa de conta.

Seu e-mail serve só para avisar uma vez quando o Delta MCP sair. Sem newsletter. Privacidade