Guide

MCP vs. CLI für KI-Agenten: Woher die Token-Kosten kommen

6 Min. LesezeitVom Delta-MCP-Team

Ein Terminal, in dem gh pr list läuft, neben der Tool-Liste eines MCP-Servers, mit einem „vs“-Zeichen dazwischen.

Die kurze Antwort

Eine CLI kostet meist weniger Tokens als ein MCP-Server: Sie bringt keine Tool-Liste mit, und das Modell kennt gängige Befehle schon. MCP gewinnt, wo es keine CLI gibt, wo eine Anmeldung nötig ist oder wo Ihre App keine Shell hat. In beiden Fällen ist jeder Schritt eine Anfrage. Die Schritte in Code zu verketten, beseitigt diese Kosten.

In diesem Guide

Was kostet jedes von beiden in Tokens?

Drei Dinge treiben die Rechnung: die Tool-Liste, die Zahl der Schritte und das, was jeder Schritt zurückgibt. MCP-Server und CLIs unterscheiden sich in allen dreien.

Was kostet jedes von beiden in Tokens?
KostenMCP-ServerCLI
Die Tool-Liste Jedes Tool hat eine Definition, die das Modell lesen muss. Claude Code lädt sie standardmäßig erst bei Bedarf: Nur Tool-Namen gelangen in den Kontext, bis ein Tool benutzt wird. Keine. Das Modell kennt gängige Befehle schon oder liest einmal --help.
Jeder Schritt Ein Tool-Aufruf ist eine Anfrage über die ganze Unterhaltung. Ein Befehl ist ebenfalls eine Anfrage, aber ein Befehl kann mehrere Schritte mit Pipes und && verketten.
Was zurückkommt Das ganze Ergebnis gelangt in die Unterhaltung. Claude Code warnt ab 10.000 Tokens und begrenzt ein Ergebnis standardmäßig auf 25.000. Sie können es kürzen, bevor das Modell es sieht (head, jq), oder in eine Datei speichern, wie es die Playwright CLI tut.

Verketten und Kürzen kommen von der Shell, nicht von einer bestimmten CLI: Sie ist ein kleines Programm, das mehrere Schritte in einer Anfrage ausführt. Der Code-Modus unten gibt MCP dieselbe Fähigkeit.

Was sagen die Messungen?

Drei Quellen, aus drei Blickwinkeln.

  • AnthropicDer Kostenleitfaden von Claude Code sagt, dass CLI-Tools wie gh, aws, gcloud und sentry-cli weiterhin kontexteffizienter sind als MCP-Server, weil sie keine Auflistung pro Tool hinzufügen.
  • MicrosoftDie README der Playwright CLI sagt, CLI-Aufrufe seien tokeneffizienter als ihr MCP-Server: Sie vermeiden es, große Tool-Schemas und ausführliche Accessibility-Trees in das Modell zu laden. Für explorative Automatisierung, selbstheilende Tests und lang laufende Workflows, wo ein durchgehender Browserkontext wichtiger ist als die Token-Kosten, behält sie MCP bei.
  • ScalekitEin Benchmark von Scalekit, März 2026: fünf rein lesende GitHub-Aufgaben, 75 Durchläufe, Claude Sonnet 4. Die gh-CLI brauchte 1.365 bis 9.386 Tokens pro Aufgabe und der MCP-Server von GitHub 32.279 bis 82.835, also 4- bis 32-mal so viele. Der MCP-Server scheiterte außerdem in 7 von 25 Durchläufen an Timeouts; die CLI war jedes Mal erfolgreich.

Dieser Benchmark lud alle 43 Tool-Definitionen von GitHub in jede Unterhaltung. Claude Code lädt sie inzwischen standardmäßig erst bei Bedarf, was dort den Anteil der Tool-Liste an dieser Lücke beseitigt, nicht aber den Anteil pro Schritt, und auch nicht in Apps, die weiterhin jede Definition laden.

Wann gewinnt eine CLI, wann MCP?

Eine CLI gewinnt, wenn …

  • das Tool bekannt ist, etwa gh, aws oder gcloud.
  • die Ausgabe lang ist und Sie nur einen Teil brauchen: Kürzen Sie sie, bevor das Modell sie liest.
  • Sie in einem Coding-Agenten arbeiten, der eine Shell und ein Dateisystem hat.
  • mehrere Schritte in einen Befehl passen.

MCP gewinnt, wenn …

  • der Dienst keine CLI hat oder nur einen Remote-Server mit eigener Anmeldung.
  • Ihre KI-App keine Shell hat, die das Modell nutzen kann, etwa eine Chat-App.
  • Sie typisierte Eingaben und eine Liste dessen wollen, was jedes Tool tut, statt Flags, die das Modell aus dem Training kennt.
  • mehrere Personen den Agenten nutzen und jede eine eigene Autorisierung braucht: der Kernpunkt von Scalekit.

Ist MCP tot?

Nein. Das Protokoll leistet weiterhin, was eine CLI nicht kann: Remote-Dienste mit Anmeldung erreichen, in Apps ohne Shell arbeiten und jedes Tool typisiert beschreiben. Selbst die README von Microsoft behält MCP für manche Workflows bei.

Was sich abnutzt, ist ein Muster: ein Tool-Aufruf pro Schritt, über die ganze Unterhaltung. Eine CLI vermeidet einen Teil davon, indem sie Befehle verkettet. Anthropic und Cloudflare beschreiben die allgemeine Lösung, Code zu schreiben, der die Tools aufruft, und messen sie: Das Beispiel von Anthropic sank von 150.000 auf 2.000 Tokens, und Cloudflare machte mehr als 2.500 Endpunkte in etwa 1.000 Tokens zugänglich.

Delta MCP ist diese Lösung, fertig umgesetzt, für die MCP-Server, die Sie schon nutzen: Ihre KI schreibt jede Aufgabe als ein Programm. Wir haben es gegen den direkten Aufruf dieser Server gemessen, mit Claude Code bei eingeschaltetem Tool Search:

Sonnet 5.5, zwei bis drei Durchläufe pro Variante, das Endergebnis in jedem Dienst geprüft.

Was wir gemessen haben
AufgabeTokensModellaufrufeGemessen am
Ein Release korrigieren, als CodeCerberus, 152 Tools 13,4× weniger 26 → 6,5 5. Oktober
20 überfällige Tickets aufräumenEin Ticketsystem 4,8× weniger 5 → 2 2. Oktober
Anmelden, 3 Kontakte hinzufügen und auflistenMicrosoft Playwright MCP 3,9× weniger 12,6 → 4 2. Oktober

Alle Messungen und die Methode

Was sollten Sie nutzen?

Gehen Sie von Ihrer Situation aus, nicht vom Protokoll.

Was sollten Sie nutzen?
Ihre SituationNutzen SieWarum
Das Tool ist bekannt und hat eine CLI: gh, aws, gcloud. Eine CLI Keine Tool-Liste, und Sie können die Ausgabe kürzen. Der Kostenleitfaden von Claude Code empfiehlt sie.
Der Dienst hat keine CLI, oder Sie erreichen ihn über einen Remote-Server. MCP Es ist der Zugang. Behalten Sie die Server, die Sie nutzen, und trennen Sie den Rest.
Ihre KI-App hat keine Shell. MCP Eine CLI braucht einen Ort, an dem sie läuft.
Eine Aufgabe umfasst mehrere Schritte oder mehrere Dienste. Code, nicht ein Aufruf pro Schritt Delta MCP erledigt das für Ihre MCP-Server. Ein Skript erledigt es für CLIs.

Fragen

Ist MCP oder CLI besser für KI-Agenten?

Keines von beiden ist immer besser. Eine CLI ist meist günstiger, wo es eine bekannte gibt, weil sie keine Tool-Liste mitbringt und ihre Ausgabe sich kürzen lässt. MCP ist der Zugang, wo es keine CLI gibt, wo eine Anmeldung nötig ist oder wo die App keine Shell hat. Beide zahlen für jeden Schritt eine Anfrage.

Ist eine CLI bei den Tokens günstiger als ein MCP-Server?

Meist, pro Aufgabe. Scalekit hat die gh-CLI mit 1.365 bis 9.386 Tokens pro Aufgabe gemessen, gegenüber 32.279 bis 82.835 beim MCP-Server von GitHub, bei geladenen 43 Tool-Definitionen. Claude Code lädt diese Definitionen inzwischen erst bei Bedarf, was die Lücke verkleinert.

Ist MCP tot?

Nein. Es deckt weiterhin Remote-Dienste, Anmeldung und Apps ohne Shell ab, und die README der Playwright CLI von Microsoft behält MCP für explorative und lang laufende Workflows. Was Tokens kostet, ist ein Aufruf pro Schritt, den Code ersetzen kann.

Soll ich meine MCP-Server durch Skills und CLIs ersetzen?

Nur wo es eine gute CLI gibt. Auch Skills helfen: Claude Code lädt am Anfang nur ihre Beschreibungen und den vollen Text erst, wenn einer aufgerufen wird, und ein Skill kann Code zum Ausführen enthalten. Laut Anthropic ergänzen Skills MCP-Server, statt sie zu ersetzen.

Warum gibt es neben dem Playwright-MCP-Server eine Playwright CLI?

Die README sagt, CLI-Aufrufe vermeiden es, große Tool-Schemas und ausführliche Accessibility-Trees in das Modell zu laden, und dass CLI plus Skills zu Coding-Agenten passt, die Browser-Automatisierung mit großen Codebasen in begrenzten Kontextfenstern ausbalancieren. MCP bleibt für explorative Automatisierung, selbstheilende Tests und lang laufende Workflows.

Ersetzt Delta MCP eine CLI?

Nein. Wo es eine gute CLI gibt, ist sie die richtige Wahl. Delta MCP ist für die MCP-Server gedacht, die Sie schon haben, bei Aufgaben mit mehreren Schritten: 3,3–24,1× weniger Tokens in unseren Tests gegenüber dem direkten Aufruf.

Quellen

  1. Claude Code, Manage costs effectively (documentation) CLI-Tools sind kontexteffizienter als MCP-Server; MCP-Tool-Definitionen werden standardmäßig bei Bedarf geladen.
  2. Claude Code, Connect Claude Code to tools via MCP (documentation) Die Warnung bei 10.000 Tokens und die Standardgrenze von 25.000 Tokens für ein Tool-Ergebnis.
  3. Microsoft, Playwright CLI (README on GitHub) CLI gegen MCP bei der Token-Effizienz, und wo MCP die bessere Wahl bleibt.
  4. Scalekit, MCP vs CLI: Benchmarking AI Agent Cost & Reliability (11. März 2026) Der GitHub-Benchmark: Tokens pro Aufgabe, Zuverlässigkeit und die 43 Tool-Definitionen.
  5. Anthropic, Code execution with MCP: Building more efficient agents (4. Nov. 2025) Das Beispiel von 150.000 auf 2.000 Tokens; Code, der Tools aufruft, statt eines Aufrufs pro Schritt.
  6. Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20. Feb. 2026) Mehr als 2.500 Endpunkte in etwa 1.000 Tokens, gegenüber 1,17 Millionen als gewöhnlicher MCP-Server.
  7. Anthropic, Equipping agents for the real world with Agent Skills (16. Okt. 2025) Skills laden zuerst Name und Beschreibung und den Rest bei Bedarf; sie können Code enthalten; sie ergänzen MCP-Server.
  8. Claude Code, Extend Claude with skills (documentation) Die Beschreibungen von Skills werden am Anfang geladen; der volle Inhalt nur, wenn ein Skill aufgerufen wird.
  9. Delta MCP, Benchmarks Jede Messung von Delta MCP auf dieser Seite, mit ihrer Methode.

Weiterlesen

Probieren Sie Delta MCP an Ihren eigenen Aufgaben aus

Kostenlos, in zwei Minuten eingerichtet, und mit einem Klick ist alles wieder wie vorher.

Kostenlos · Kein Konto · Apple-Chip oder Intel

Kostenlos · Kein Konto

Kostenlos · Kein Konto

Den Start verfolgen

Für Mac, Windows und Linux. Kein Konto nötig.

Bald verfügbar

Delta MCP ist fast da

Die kostenlose App für Mac, Windows und Linux kommt bald. Hinterlassen Sie Ihre E-Mail, und Sie wissen sofort Bescheid, wenn es so weit ist. Kein Konto nötig.

Wir nutzen Ihre E-Mail nur für eine Nachricht zum Start von Delta MCP. Kein Newsletter. Datenschutz