Die kurze Antwort
Prüfen Sie, bevor Sie MCP die Schuld geben. Der Befehl /usage von Claude Code zeigt, welcher Anteil Ihrer jüngsten Plan-Nutzung auf jeden MCP-Server entfiel. Ist er klein, kosten lange Sitzungen und Ihre Modellwahl mehr. Ist er groß, trennen Sie die Server, die Sie nicht nutzen, und senken Sie dann die Zahl der Aufrufe.
In diesem Guide
Welches Limit haben Sie erreicht?
Claude Code nennt das Limit in seiner Meldung, und was Sie tun können, hängt davon ab, welches es ist. Bei einem Abo wird die Nutzung in einer rollierenden Fünf-Stunden-Sitzung und in einem Wochenfenster erfasst, und beide gelten gleichzeitig.
| Sie sehen | Was es bedeutet | Was Sie weiterbringt |
|---|---|---|
You've hit your session limit / You've hit your weekly limit | Ein rollierendes Kontingent, das alle Modelle teilen. Ein Modellwechsel bringt es nicht zurück. | Warten Sie bis zum Zeitpunkt des Zurücksetzens, der in der Meldung steht, oder fügen Sie mit /usage-credits Nutzungsguthaben hinzu. |
You've hit your Opus limit / You've hit your Sonnet limit | Ein Limit nur für diese Modellfamilie. | Wechseln Sie mit /model zu einem Modell außerhalb der Familie und arbeiten Sie weiter. |
You've hit your monthly spend limit | Ihr Nutzungsguthaben hat ein Ausgabenlimit erreicht. Es gibt Varianten der Meldung für Einzelpersonen, Organisationen und Teams. | Erhöhen Sie das Limit unter Einstellungen, Nutzung, auf claude.ai, oder fragen Sie Ihren Admin. |
Sie müssen nicht auf die Uhr schauen. Wenn Sie mit einem Abo angemeldet sind, zeigt Claude Code diese Zeile und macht nach dem Zurücksetzen weiter:
Continuing automatically at 3:45pm · esc to cancel
Das setzt Version 2.1.234 oder neuer voraus und ist standardmäßig aktiv.
Noch etwas aus der Dokumentation: Ein einzelner Schub intensiver Aktivität, etwa ein großes Workflow-Fanout, kann das Wochenkontingent aufbrauchen, bevor das Sitzungsfenster zurückgesetzt wurde.
Wie sehen Sie, was Ihre MCP-Server kosten?
Drei Befehle in Claude Code beantworten das. Beginnen Sie mit dem ersten.
/usagezeigt bei einem Abo die Limits Ihres Plans und schlüsselt die jüngste Nutzung nach Skill, Subagent, Plugin und einzelnem MCP-Server in Prozent auf. Drücken Sie d für die letzten 24 Stunden oder w für die letzten 7 Tage./contextzeigt, was Ihr Kontextfenster gerade füllt, MCP-Tool-Definitionen eingeschlossen./mcplistet Ihre Server auf und lässt Sie die abschalten, die Sie nicht nutzen.
Beachten Sie beim Lesen der Zahlen diese Einschränkungen
- Die Werte sind Näherungen und stammen aus dem Sitzungsverlauf dieses Computers. Nutzung von Ihren anderen Geräten oder von claude.ai ist darin nicht enthalten.
- In den Anteil eines Servers fließen nur Anfragen ein, die ein Tool-Ergebnis dieses Servers verwendet haben. Die Kosten für das Mitführen seiner Tool-Liste sind darin nicht enthalten: Sie finden sie in
/context. /usagemarkiert außerdem Verhaltensweisen, die 10 % oder mehr Ihrer jüngsten Nutzung ausmachen, etwa langen Kontext oder Cache-Misses, jeweils mit einem Tipp.
Lesen Sie dann die MCP-Zeile
Was kostet meist mehr als MCP?
Claude Code sendet Ihre ganze Unterhaltung mit jeder Anfrage. Am meisten fällt daher ins Gewicht, wie lang diese Unterhaltung ist, wie oft sie kalt neu beginnt und welches Modell sie liest.
-
Eine lange Sitzung
Jede Anfrage liest die ganze Unterhaltung erneut. Eine einzeilige Frage in einer Sitzung, die den ganzen Tag offen war, verbraucht trotzdem Ihr Nutzungskontingent, und zwar für die gesamte Unterhaltung.
Tun Sie dies
/clear, wenn Sie zu einer unabhängigen Arbeit wechseln. Das kostet nichts. -
Ein kalter Cache
Ihre erste Nachricht nach einer Pause, die länger als die Cache-Lebensdauer ist, verarbeitet Ihren gesamten Kontext neu. Die Lebensdauer beträgt bei einem Abo eine Stunde; sobald Sie Nutzungsguthaben verbrauchen, sind es fünf Minuten.
Tun Sie diesLassen Sie keine riesige Sitzung ungenutzt liegen und kehren Sie dann zu ihr zurück. Bei Pro und Max bietet Claude Code an, eine große Sitzung aus einer Zusammenfassung fortzusetzen, wenn Sie sie wieder aufnehmen.
-
Das Modell
Opus kostet pro Runde ein Mehrfaches von Sonnet, und Sonnet mehr als Haiku. Erweitertes Denken fügt ebenfalls Tokens hinzu.
Tun Sie dies
/modelfür Sonnet bei den meisten Programmieraufgaben, und/effort, um das Denken bei einfachen Aufgaben zu senken. -
Vergessene Arbeit
Eine geplante Aufgabe wird in ihrem Intervall ausgelöst, auch wenn die Sitzung ruht. Jeder Subagent sendet eigene Anfragen zusätzlich zu Ihren, und Agententeams brauchen etwa 7-mal so viele Tokens wie eine normale Sitzung, wenn Teammitglieder im Plan-Modus laufen.
Tun Sie diesPrüfen Sie die Loops und Subagenten in
/usageund beenden Sie, was Sie nicht mehr brauchen.
Was sollten Sie zuerst kürzen, der Reihe nach?
Wenn /usage MCP mit einem großen Anteil zeigt, arbeiten Sie diese Liste ab. Jeder Schritt erfordert mehr Aufwand als der vorherige.
- Nicht genutzte Server trennen2 Minuten
Führen Sie
/mcpaus und schalten Sie ab, was Sie diese Woche nicht angefasst haben. Der Kostenleitfaden von Claude Code rät dasselbe. Diese Tools fehlen Ihnen, bis Sie sie wieder einschalten. - Prüfen, ob Tool Search aktiv istEine Prüfung
Claude Code lädt MCP-Tool-Definitionen standardmäßig erst bei Bedarf, sodass nur Tool-Namen und Server-Anweisungen in Ihren Kontext gelangen, bis ein Tool benutzt wird. Es ist ausgeschaltet bei einer benutzerdefinierten
ANTHROPIC_BASE_URL, beiENABLE_TOOL_SEARCH=falseund bei Modellen vor der Generation Claude 4.5 auf der Agent Platform von Google Cloud. - Eine CLI nutzen, wo es eine gute gibtWo es eine gibt
gh,aws,gcloudundsentry-clifügen keine Auflistung pro Tool hinzu, und der Kostenleitfaden nennt sie kontexteffizienter als MCP-Server. Der Haken: Viele Dienste haben einen MCP-Server und keine CLI. - Große Ergebnisse im Blick behaltenLaufend
Claude Code warnt, wenn ein MCP-Tool mehr als 10.000 Tokens zurückgibt, und begrenzt ein Ergebnis standardmäßig auf 25.000. Alles, was zurückkommt, wird Teil der Unterhaltung, die Claude Code bei jeder späteren Anfrage erneut liest. Fragen Sie nach weniger Feldern oder einer kleineren Seite.
- Die Zahl der Aufrufe senken2 Minuten zum Installieren
Was bleibt, ist die Zahl der Anfragen. Jeder Tool-Aufruf ist eine weitere Anfrage, die die ganze Unterhaltung mitführt, und nur wenn man die Aufgabe als ein Programm schreibt, entfallen sie. Genau das tut Delta MCP.
Und wenn MCP weiter einen großen Anteil hat?
Dann liegen die Kosten in den Aufrufen. Jeder Tool-Aufruf ist eine weitere Anfrage, eine Aufgabe mit zehn Schritten sind also zehn Anfragen, jede mit der ganzen Unterhaltung. Tool Search ändert daran nichts.
Delta MCP ist eine kostenlose App zwischen Claude Code und Ihren MCP-Servern. Ihre KI schreibt jede Aufgabe als ein Programm statt eines Tool-Aufrufs pro Schritt, und Delta MCP prüft es, wendet es ganz oder gar nicht an und hält es in Activity fest, bereit zum Rückgängigmachen. Wir haben es mit Claude Code bei eingeschaltetem Tool Search gemessen:
Sonnet 5.5, zwei bis drei Durchläufe pro Variante, das Endergebnis in jedem Dienst geprüft.
| Aufgabe | Tokens | Modellaufrufe | Gemessen am |
|---|---|---|---|
| Ein Release korrigieren, als CodeCerberus, 152 Tools | 13,4× weniger | 26 → 6,5 | 5. Oktober |
| 20 überfällige Tickets aufräumenEin Ticketsystem | 4,8× weniger | 5 → 2 | 2. Oktober |
| Anmelden, 3 Kontakte hinzufügen und auflistenMicrosoft Playwright MCP | 3,9× weniger | 12,6 → 4 | 2. Oktober |
Alle Messungen und die Methode
Fragen
Warum habe ich mein Claude-Code-Limit so schnell erreicht?
Meist liegt es an der Unterhaltung, nicht an einem einzelnen Tool. Claude Code sendet Ihre ganze Unterhaltung mit jeder Anfrage, deshalb summieren sich eine lange Sitzung, ein kalter Cache nach einer Pause, ein teures Modell oder vergessene geplante Aufgaben und Subagenten. Führen Sie /usage aus: Es markiert jedes Verhalten ab 10 % Ihrer jüngsten Nutzung.
Hilft ein Modellwechsel bei „You've hit your session limit“?
Nein. Sitzungs- und Wochenlimit gelten für alle Modelle gemeinsam. Nur die Limits für Opus und Sonnet gelten pro Modellfamilie: Nach einem davon können Sie mit /model zu einem Modell außerhalb der Familie wechseln und weiterarbeiten.
Zählen MCP-Server zum Claude-Code-Limit?
Ja. Ihre Tool-Definitionen (standardmäßig bei Bedarf geladen), jeder Aufruf und jedes Ergebnis sind Teil der Anfragen, die Claude Code sendet, und jede Anfrage zählt. /usage zeigt den Anteil jedes Servers. Bei Pro und Max teilen sich Claude und Claude Code die Limits, der Chat nutzt also dasselbe Kontingent.
Wann wird mein Claude-Code-Limit zurückgesetzt, und macht Claude Code von selbst weiter?
Die Meldung nennt die Zeit des Zurücksetzens. Mit einem Abo laufen zwei Fenster gleichzeitig: eine rollierende Fünf-Stunden-Sitzung und eine wöchentliche. In einer interaktiven Sitzung wartet Claude Code seit Version 2.1.234 und setzt die unterbrochene Aufgabe nach dem Zurücksetzen fort. Es ist standardmäßig aktiv, und Esc bricht es ab. Mit /usage-credits können Sie sofort weitermachen.
Welcher MCP-Server verbraucht am meisten?
Führen Sie /usage aus und drücken Sie w für die letzten 7 Tage: Jeder Server hat einen Prozentwert. Die Werte sind Näherungen und stammen nur von diesem Computer. /context zeigt, was die Tools jedes Servers in Ihrem Fenster belegen.
Erhöht oder behebt Delta MCP mein Limit?
Nein. Das Limit gehört Anthropic. Delta MCP ändert, wie viele Anfragen eine Aufgabe mit mehreren Schritten macht: 3,3–24,1× weniger Tokens in unseren Tests.
Quellen
- Claude Code, Manage costs effectively (documentation) Die /usage-Aufschlüsselung nach MCP-Server und ihre 10-%-Markierungen; warum die Nutzung in einer langen Sitzung steigt; Cache-Lebensdauer; Modellwahl; MCP-Overhead; Agententeams.
- Claude Code, Error reference (documentation) Die Meldungen zu Sitzungs-, Wochen-, Opus-, Sonnet- und Ausgabenlimit, und welche Limits über Modelle hinweg geteilt werden.
- Claude Code, Interactive mode (documentation) Warten, bis ein Nutzungslimit zurückgesetzt wird, und automatisch fortfahren (Version 2.1.234).
- Claude Code, Connect Claude Code to tools via MCP (documentation) Tool Search standardmäßig aktiv und wann es ausgeschaltet ist; die Warnung bei 10.000 Tokens und die Standardgrenze von 25.000 Tokens für ein Tool-Ergebnis.
- Claude Help Center, Models, usage, and limits in Claude Code Opus kostet pro Runde ein Mehrfaches von Sonnet, und Sonnet mehr als Haiku; jede frühere Nachricht wird in jeder Runde erneut gesendet.
- Claude Help Center, Use Claude Code with your Pro or Max plan Nutzungslimits werden über Claude und Claude Code hinweg geteilt.
- Claude Help Center, Usage limit best practices Das Fünf-Stunden-Sitzungslimit und das Wochenlimit bei bezahlten Plänen.
- Delta MCP, Benchmarks Jede Messung von Delta MCP auf dieser Seite, mit ihrer Methode.
Weiterlesen
- MCP-Token-Verbrauch reduzieren und warum er so hoch istMCP-Token-Verbrauch reduzieren: mit /context messen, Tool-Liste und Roundtrips als Kostentreiber verstehen, jede Lösung vergleichen, auch Tool Search.
- Speicherort der MCP-Konfiguration: Claude, Cursor, VS CodeWo Claude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI und Codex ihre MCP-Konfiguration ablegen: Pfad, JSON-Schlüssel, Remote-Server, Tool-Limit.
- MCP vs. CLI für KI-Agenten: Woher die Token-Kosten kommenMCP oder CLI für Ihren KI-Agenten? Was jedes in Tokens kostet, was die Messungen zeigen, wann eine CLI gewinnt, wann MCP, und wo Code beide schlägt.