Het korte antwoord
Een CLI kost meestal minder tokens dan een MCP-server: er komt geen toollijst bij en het model kent gangbare commando’s al. MCP wint waar geen CLI bestaat, waar je moet inloggen of waar je app geen shell heeft. In beide is elke stap een verzoek. De stappen aan elkaar rijgen in code haalt die kosten weg.
In deze handleiding
Wat kost elk in tokens?
Drie dingen bepalen de rekening: de toollijst, het aantal stappen en wat elke stap teruggeeft. MCP-servers en CLI’s verschillen op alle drie.
| Kostenpost | MCP-server | CLI |
|---|---|---|
| De toollijst | Elke tool heeft een definitie die het model moet lezen. Claude Code laadt ze standaard pas bij gebruik: alleen toolnamen komen in de context tot een tool wordt gebruikt. | Geen. Het model kent gangbare commando’s al, of leest --help één keer. |
| Elke stap | Eén toolaanroep is één verzoek over het hele gesprek. | Eén commando is ook één verzoek, maar een commando kan meerdere stappen aan elkaar rijgen met pipes en &&. |
| Wat terugkomt | Het hele resultaat komt in het gesprek. Claude Code waarschuwt boven 10.000 tokens en kapt een resultaat standaard af op 25.000. | Je kunt het inkorten voordat het model het ziet (head, jq), of in een bestand opslaan, zoals Playwright CLI doet. |
Aan elkaar rijgen en inkorten komt van de shell, niet van één bepaalde CLI: het is een klein programma dat meerdere stappen in één verzoek uitvoert. Code mode, hieronder, geeft MCP dezelfde mogelijkheid.
Wat zeggen de metingen?
Drie bronnen, vanuit drie hoeken.
- AnthropicDe handleiding voor kostenbeheer van Claude Code zegt dat CLI-tools zoals
gh,aws,gcloudensentry-clinog steeds contextefficiënter zijn dan MCP-servers, omdat ze geen lijst per tool toevoegen. - MicrosoftDe README van Playwright CLI zegt dat CLI-aanroepen tokenefficiënter zijn dan de MCP-server: ze vermijden dat grote toolschema’s en uitgebreide accessibility trees in het model worden geladen. MCP blijft gereserveerd voor verkennende automatisering, zelfherstellende tests en langlopende workflows, waar continue browsercontext zwaarder weegt dan tokenkosten.
- ScalekitEen benchmark van Scalekit, maart 2026: vijf alleen-lezen GitHub-taken, 75 runs, Claude Sonnet 4. De
ghCLI gebruikte 1.365 tot 9.386 tokens per taak en de MCP-server van GitHub 32.279 tot 82.835, dat is 4 tot 32 keer meer. De MCP-server mislukte ook in 7 van de 25 runs door time-outs; de CLI slaagde elke keer.
Die benchmark laadde alle 43 tooldefinities van GitHub in elk gesprek. Claude Code laadt ze nu standaard pas bij gebruik, wat het deel van het verschil dat uit de toollijst komt daar wegneemt, maar niet het deel per stap, en niet in apps die nog elke definitie laden.
Wanneer wint een CLI, en wanneer MCP?
Een CLI wint als…
- De tool bekend is, zoals gh, aws of gcloud.
- De uitvoer lang is en je maar een deel nodig hebt: kort hem in voordat het model hem leest.
- Je werkt in een coding agent met een shell en een bestandssysteem.
- Meerdere stappen in één commando passen.
MCP wint als…
- De service geen CLI heeft, of alleen een remote server met eigen inlog.
- Je AI-app geen shell heeft die het model kan gebruiken, zoals in een chat-app.
- Je getypeerde invoer wilt en een lijst van wat elke tool doet, in plaats van flags die het model uit zijn training onthoudt.
- Meerdere mensen de agent gebruiken en ieder een eigen autorisatie nodig heeft: het hoofdpunt van Scalekit.
Is MCP dood?
Nee. Het protocol doet nog steeds wat een CLI niet kan: remote services bereiken met inlog, werken in apps zonder shell, en elke tool getypeerd beschrijven. De eigen README van Microsoft houdt MCP aan voor sommige workflows.
Wat slijt, is een patroon: één toolaanroep per stap, over het hele gesprek. Een CLI vermijdt een deel daarvan door commando’s aan elkaar te rijgen. Anthropic en Cloudflare beschrijven de algemene oplossing, code schrijven die de tools aanroept, en meten die: het voorbeeld van Anthropic daalde van 150.000 naar 2.000 tokens, en Cloudflare maakte meer dan 2.500 endpoints beschikbaar in ongeveer 1.000 tokens.
Delta MCP is die oplossing, kant-en-klaar, voor de MCP-servers die je al gebruikt: je AI schrijft elke taak als één programma. We hebben het gemeten tegenover het rechtstreeks aanroepen van die servers, in Claude Code met Tool Search aan:
Sonnet 5.5, twee tot drie runs per variant, het eindresultaat gecontroleerd in elke service.
| Taak | Tokens | Modelaanroepen | Gemeten |
|---|---|---|---|
| Een release repareren, als codeCerberus, 152 tools | 13,4× minder | 26 → 6,5 | 5 oktober |
| 20 achterstallige tickets opruimenEen ticketsysteem | 4,8× minder | 5 → 2 | 2 oktober |
| Inloggen, 3 contacten toevoegen, ze weergevenMicrosoft Playwright MCP | 3,9× minder | 12,6 → 4 | 2 oktober |
Welke moet je gebruiken?
Begin bij je situatie, niet bij het protocol.
| Je situatie | Gebruik | Waarom |
|---|---|---|
| De tool is bekend en heeft een CLI: gh, aws, gcloud. | Een CLI | Geen toollijst, en je kunt de uitvoer inkorten. De handleiding voor kostenbeheer van Claude Code raadt het aan. |
| De service heeft geen CLI, of je bereikt hem via een remote server. | MCP | Het is de manier om erbij te komen. Houd de servers die je gebruikt en koppel de rest los. |
| Je AI-app heeft geen shell. | MCP | Een CLI heeft een plek nodig om te draaien. |
| Een taak loopt over meerdere stappen of meerdere services. | Code, geen aanroep per stap | Delta MCP doet het voor je MCP-servers. Een script doet het voor CLI’s. |
Vragen
Is MCP of CLI beter voor AI-agents?
Geen van beide is altijd beter. Een CLI is meestal goedkoper waar een bekende bestaat, omdat er geen toollijst bijkomt en de uitvoer kan worden ingekort. MCP is de manier om erbij te komen waar geen CLI bestaat, waar ingelogd moet worden of waar de app geen shell heeft. Beide betalen een verzoek voor elke stap.
Is een CLI goedkoper dan een MCP-server in tokens?
Meestal wel, per taak. Scalekit mat de gh CLI op 1.365 tot 9.386 tokens per taak tegenover 32.279 tot 82.835 voor de MCP-server van GitHub, met alle 43 tooldefinities geladen. Claude Code laadt die definities nu pas bij gebruik, wat het verschil kleiner maakt.
Is MCP dood?
Nee. Het dekt nog steeds remote services, inloggen en apps zonder shell, en de eigen README van Microsoft voor Playwright CLI houdt MCP aan voor verkennende en langlopende workflows. Wat tokens kost is één aanroep per stap, en dat kan code vervangen.
Moet ik mijn MCP-servers vervangen door skills en CLI’s?
Alleen waar een goede CLI bestaat. Skills helpen ook: Claude Code laadt bij de start alleen hun beschrijvingen en de volledige tekst wanneer er een wordt aangeroepen, en een skill kan code bevatten om uit te voeren. Anthropic zegt dat skills MCP-servers aanvullen in plaats van vervangen.
Waarom is er een Playwright CLI naast de Playwright MCP-server?
De README zegt dat CLI-aanroepen vermijden dat grote toolschema’s en uitgebreide accessibility trees in het model worden geladen, en dat CLI plus skills past bij coding agents die browserautomatisering afwegen tegen grote codebases in beperkte contextvensters. MCP blijft voor verkennende automatisering, zelfherstellende tests en langlopende workflows.
Vervangt Delta MCP een CLI?
Nee. Een CLI is het juiste gereedschap waar een goede bestaat. Delta MCP is voor de MCP-servers die je al hebt, bij taken met meerdere stappen: 3,3–24,1× minder tokens in onze tests tegenover rechtstreeks aanroepen.
Bronnen
- Claude Code, Manage costs effectively (documentation) CLI-tools zijn contextefficiënter dan MCP-servers; MCP-tooldefinities standaard pas bij gebruik geladen.
- Claude Code, Connect Claude Code to tools via MCP (documentation) De waarschuwing bij 10.000 tokens en de standaardlimiet van 25.000 tokens op een toolresultaat.
- Microsoft, Playwright CLI (README on GitHub) CLI tegenover MCP qua tokenefficiëntie, en waar MCP de betere keuze blijft.
- Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11 mrt 2026) De GitHub-benchmark: tokens per taak, betrouwbaarheid en de 43 tooldefinities.
- Anthropic, Code execution with MCP: Building more efficient agents (4 nov 2025) Het voorbeeld van 150.000 naar 2.000 tokens; code die tools aanroept in plaats van één aanroep per stap.
- Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 feb 2026) Meer dan 2.500 endpoints in ongeveer 1.000 tokens, tegenover 1,17 miljoen als gewone MCP-server.
- Anthropic, Equipping agents for the real world with Agent Skills (16 okt 2025) Skills laden eerst hun naam en beschrijving en de rest op aanvraag; ze kunnen code bevatten; ze vullen MCP-servers aan.
- Claude Code, Extend Claude with skills (documentation) Skillbeschrijvingen laden bij de start; de volledige inhoud alleen wanneer een skill wordt aangeroepen.
- Delta MCP, Benchmarks Elke meting van Delta MCP op deze pagina, met de methode.
Lees verder
- MCP-tokenverbruik verminderen: waarom MCP zoveel tokens kostMCP-tokenverbruik verminderen: meet het met /context, zie de twee kostenposten (toollijst en roundtrips) en vergelijk elke oplossing, Tool Search inbegrepen.
- Claude Code-limiet bereikt? Wat je MCP-servers kostenWat “You've hit your limit” in Claude Code betekent (sessie, week, Opus, uitgaven), hoe /usage toont wat je MCP-servers kosten, en wat je eerst schrapt.
- MCP-configbestand: waar staat het? Claude, Cursor, VS CodeWaar Claude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI en Codex hun MCP-config bewaren: pad, JSON-sleutel, remote servers en toollimieten.