La risposta breve
Una CLI di solito costa meno token di un server MCP: non aggiunge un elenco di strumenti, e il modello conosce già i comandi comuni. MCP vince dove non esiste una CLI, dove serve un login o dove la tua app non ha una shell. In entrambi, ogni passaggio è una richiesta. Concatenare i passaggi nel codice elimina quel costo.
In questa guida
Quanto costa ciascuno in token?
Tre cose determinano il conto: l’elenco degli strumenti, il numero di passaggi e ciò che torna da ciascun passaggio. I server MCP e le CLI differiscono su tutti e tre.
| Costo | Server MCP | CLI |
|---|---|---|
| L’elenco | Ogni strumento ha una definizione che il modello deve leggere. Claude Code le rinvia di default: nel contesto entrano solo i nomi degli strumenti finché non ne viene usato uno. | Nessuno. Il modello conosce già i comandi comuni, oppure legge --help una volta. |
| Ogni passaggio | Una chiamata a uno strumento è una richiesta sull’intera conversazione. | Anche un comando è una richiesta, ma un comando può concatenare più passaggi con pipe e &&. |
| Cosa torna indietro | L’intero risultato entra nella conversazione. Claude Code avvisa sopra i 10.000 token e limita un risultato a 25.000 di default. | Puoi ridurlo prima che il modello lo veda (head, jq), oppure salvarlo in un file, come fa Playwright CLI. |
Concatenare e ridurre sono cose che vengono dalla shell, non da una singola CLI: è un piccolo programma che esegue più passaggi in una sola richiesta. La modalità codice, qui sotto, dà a MCP la stessa capacità.
Cosa dicono le misure?
Tre fonti, da tre angolazioni.
- AnthropicLa guida ai costi di Claude Code dice che strumenti CLI come
gh,aws,gcloudesentry-clisono comunque più efficienti per il contesto dei server MCP, perché non aggiungono alcun elenco per strumento. - MicrosoftIl README di Playwright CLI dice che le chiamate CLI sono più efficienti in token del suo server MCP: evitano di caricare nel modello grandi schemi di strumenti e verbosi alberi di accessibilità. Tiene MCP per l’automazione esplorativa, i test che si autoriparano e i workflow di lunga durata, dove il contesto continuo del browser conta più del costo in token.
- ScalekitUn benchmark di Scalekit, marzo 2026: cinque task GitHub in sola lettura, 75 esecuzioni, Claude Sonnet 4. La CLI
ghha usato da 1.365 a 9.386 token per task e il server MCP di GitHub da 32.279 a 82.835, cioè da 4 a 32 volte di più. Il server MCP è anche fallito in 7 esecuzioni su 25 per timeout; la CLI è riuscita ogni volta.
Quel benchmark caricava tutte le 43 definizioni di strumenti di GitHub in ogni conversazione. Claude Code ora le rinvia di default, il che elimina lì la parte di elenco di quel divario, ma non la parte per passaggio, e non nelle app che caricano ancora ogni definizione.
Quando vince una CLI, e quando MCP?
Una CLI vince quando…
- Lo strumento è molto noto, come gh, aws o gcloud.
- L’output è lungo e te ne serve solo una parte: riducilo prima che il modello lo legga.
- Lavori in un coding agent che ha una shell e un filesystem.
- Più passaggi stanno in un solo comando.
MCP vince quando…
- Il servizio non ha una CLI, o ha solo un server remoto con il proprio login.
- La tua app di IA non ha una shell che il modello possa usare, come in un’app di chat.
- Vuoi input tipizzati e un elenco di cosa fa ogni strumento, invece di flag che il modello ricorda dall’addestramento.
- Più persone usano l’agente e ognuna ha bisogno della propria autorizzazione: il punto principale di Scalekit.
MCP è morto?
No. Il protocollo fa ancora ciò che una CLI non può: raggiungere servizi remoti con login, funzionare in app senza shell e descrivere ogni strumento in modo tipizzato. Lo stesso README di Microsoft tiene MCP per alcuni workflow.
Ciò che si sta logorando è un modello: una chiamata a uno strumento per passaggio, su tutta la conversazione. Una CLI ne evita una parte concatenando i comandi. Anthropic e Cloudflare descrivono la soluzione generale, scrivere codice che chiama gli strumenti, e la misurano: l’esempio di Anthropic è sceso da 150.000 a 2.000 token, e Cloudflare ha esposto più di 2.500 endpoint in circa 1.000 token.
Delta MCP è quella soluzione, pronta all’uso, per i server MCP che usi già: la tua IA scrive ogni task come un unico programma. L’abbiamo misurato contro la chiamata diretta di quei server, su Claude Code con Tool Search attivo:
Sonnet 5.5, da due a tre esecuzioni per variante, risultato finale verificato in ogni servizio.
| Task | Token | Chiamate al modello | Misurato |
|---|---|---|---|
| Correggere una release, come codiceCerberus, 152 strumenti | 13,4× in meno | 26 → 6,5 | 5 ottobre |
| Sistemare 20 ticket in ritardoUn gestore di ticket | 4,8× in meno | 5 → 2 | 2 ottobre |
| Accedere, aggiungere 3 contatti, elencarliMicrosoft Playwright MCP | 3,9× in meno | 12,6 → 4 | 2 ottobre |
Quale dovresti usare?
Parti dalla tua situazione, non dal protocollo.
| La tua situazione | Usa | Perché |
|---|---|---|
| Lo strumento è molto noto e ha una CLI: gh, aws, gcloud. | Una CLI | Nessun elenco, e puoi ridurre l’output. La guida ai costi di Claude Code la raccomanda. |
| Il servizio non ha una CLI, o lo raggiungi tramite un server remoto. | MCP | È la strada d’ingresso. Tieni i server che usi e disconnetti il resto. |
| La tua app di IA non ha una shell. | MCP | Una CLI ha bisogno di un posto dove girare. |
| Un task attraversa più passaggi o più servizi. | Codice, non una chiamata per passaggio | Delta MCP lo fa per i tuoi server MCP. Uno script lo fa per le CLI. |
Domande
È meglio MCP o CLI per gli agenti IA?
Nessuno dei due sempre. Una CLI di solito costa meno dove ne esiste una molto nota, perché non aggiunge un elenco di strumenti e il suo output si può ridurre. MCP è la strada dove non esiste una CLI, dove serve un login o dove l’app non ha una shell. Entrambi pagano una richiesta per ogni passaggio.
Una CLI costa meno token di un server MCP?
Di solito, per task. Scalekit ha misurato la CLI gh a 1.365–9.386 token per task contro 32.279–82.835 per il server MCP di GitHub, con tutte le 43 definizioni di strumenti caricate. Claude Code ora rinvia quelle definizioni, il che riduce il divario.
MCP è morto?
No. Copre ancora i servizi remoti, il login e le app senza shell, e lo stesso README di Playwright CLI di Microsoft tiene MCP per i workflow esplorativi e di lunga durata. Ciò che costa token è una chiamata per passaggio, che il codice può sostituire.
Devo sostituire i miei server MCP con skill e CLI?
Solo dove esiste una buona CLI. Anche le skill aiutano: Claude Code carica all’inizio solo le loro descrizioni e il testo completo quando una viene invocata, e una skill può includere codice da eseguire. Anthropic dice che le skill completano i server MCP anziché sostituirli.
Perché c’è una Playwright CLI accanto al server MCP di Playwright?
Il suo README dice che le chiamate CLI evitano di caricare nel modello grandi schemi di strumenti e verbosi alberi di accessibilità, e che CLI più skill si adatta ai coding agent che bilanciano l’automazione del browser con grandi codebase in finestre di contesto limitate. MCP resta per l’automazione esplorativa, i test che si autoriparano e i workflow di lunga durata.
Delta MCP sostituisce una CLI?
No. Una CLI è lo strumento giusto dove ne esiste una buona. Delta MCP è per i server MCP che hai già, nei task con più passaggi: 3,3–24,1× token in meno nei nostri test rispetto a chiamarli direttamente.
Fonti
- Claude Code, Manage costs effectively (documentation) Gli strumenti CLI sono più efficienti per il contesto dei server MCP; le definizioni degli strumenti MCP sono rinviate di default.
- Claude Code, Connect Claude Code to tools via MCP (documentation) L’avviso a 10.000 token e il limite predefinito di 25.000 token su un risultato di strumento.
- Microsoft, Playwright CLI (README on GitHub) CLI contro MCP sull’efficienza in token, e dove MCP resta la scelta migliore.
- Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11 mar 2026) Il benchmark su GitHub: token per task, affidabilità e le 43 definizioni di strumenti.
- Anthropic, Code execution with MCP: Building more efficient agents (4 nov 2025) L’esempio da 150.000 a 2.000 token; codice che chiama gli strumenti invece di una chiamata per passaggio.
- Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 feb 2026) Più di 2.500 endpoint in circa 1.000 token, contro 1,17 milioni come semplice server MCP.
- Anthropic, Equipping agents for the real world with Agent Skills (16 ott 2025) Le skill caricano prima nome e descrizione e il resto su richiesta; possono includere codice; completano i server MCP.
- Claude Code, Extend Claude with skills (documentation) Le descrizioni delle skill si caricano all’inizio; il contenuto completo solo quando una skill viene invocata.
- Delta MCP, Benchmarks Ogni misura di Delta MCP in questa pagina, con il suo metodo.
Continua a leggere
- Come ridurre il consumo di token MCP, e perché succedeCome ridurre il consumo di token MCP: misuralo con /context, vedi i due costi (elenco degli strumenti e round trip) e confronta le soluzioni, anche Tool Search.
- Limite di Claude Code raggiunto? Cosa costano i server MCPLimite di utilizzo di Claude Code raggiunto: cosa significa «You've hit your limit» (sessione, settimanale, Opus, spesa), cosa mostra /usage e cosa tagliare.
- File di configurazione MCP: Claude, Cursor, VS Code e altriDove tengono la configurazione MCP Claude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI e Codex: percorso, chiave JSON, server remoti e limiti.