छोटा जवाब
MCP दो बार टोकन खर्च करवाता है। एक बार टूल सूची में: आपके पहले शब्द से पहले हर टूल की परिभाषा लोड होती है। दूसरी बार राउंड ट्रिप में: हर टूल कॉल पूरी बातचीत पर एक और दौर है, और हर नतीजा मॉडल से होकर लौटता है। Tool Search सूची छोटी करता है। राउंड ट्रिप सिर्फ़ कोड हटाता है।
इस गाइड में
MCP पर आपके कितने टोकन खर्च होते हैं, यह कैसे मापें?
कुछ भी बदलने से पहले देखें कि आपके टोकन कहाँ जाते हैं। Claude Code में तीन कमांड यह दिखाती हैं:
/contextदिखाती है कि आपकी कॉन्टेक्स्ट विंडो में क्या जगह ले रहा है, MCP टूल समेत।/mcpआपके सर्वर की सूची दिखाती है और जिन्हें आप इस्तेमाल नहीं करते, उन्हें बंद करने देती है।/usageसब्सक्रिप्शन पर, आपके प्लान के हाल के उपयोग को स्किल, सबएजेंट, प्लगइन और हर MCP सर्वर के हिसाब से बाँटकर दिखाती है।
दो संख्याएँ मायने रखती हैं: टूल की सूची कितनी बड़ी है, और एक आम काम कितनी टूल कॉल करता है। पहली /context में दिखती है। दूसरी आप ट्रांसक्रिप्ट में गिन सकते हैं: हर टूल कॉल मॉडल को भेजा गया एक और अनुरोध है।
MCP इतने ज़्यादा टोकन क्यों खर्च करता है? दो खर्च
टूल सूची का खर्च
कोई टूल चुनने के लिए मॉडल को उसकी परिभाषा पढ़नी पड़ती है। MCP सर्वर अपनी सारी परिभाषाएँ भेज देते हैं, इसलिए बड़े सेटअप में बातचीत शुरू होते ही भरी हुई होती है। Anthropic के माप में 58 टूल वाले पाँच सर्वर पहले संदेश से पहले ही लगभग 55,000 टोकन ले रहे थे; अकेले GitHub के 35 टूल लगभग 26,000 के थे। लंबी सूची सटीकता भी घटाती है: Anthropic के मुताबिक, 30–50 टूल के बाद Claude सही टूल चुनने में कमज़ोर पड़ने लगता है।
यह खर्च स्रोत पर ही घटाया जा रहा है। Claude Code डिफ़ॉल्ट रूप से MCP टूल परिभाषाएँ ज़रूरत पड़ने पर ही लोड करता है: जब तक कोई टूल इस्तेमाल न हो, कॉन्टेक्स्ट में सिर्फ़ नाम और सर्वर के निर्देश आते हैं। Cursor भी “Dynamic context discovery” से यही करता है, जिससे उसके अपने टेस्ट में, MCP टूल कॉल करने वाले रनों में, टोकन 46.9% घटे। Anthropic का Tool Search Tool 85% कम टोकन बताता है।
राउंड ट्रिप का खर्च
टूल कॉल मॉडल के अंदर होने वाली फ़ंक्शन कॉल नहीं है। यह एक नया अनुरोध है: मॉडल कॉल लिखता है, रनटाइम उसे चलाता है, नतीजा लौटता है, और अगली कॉल लिखने के लिए मॉडल पूरी बातचीत फिर से पढ़ता है। Claude Code का अपना डॉक्यूमेंटेशन यह साफ़ कहता है: वह हर अनुरोध के साथ आपकी पूरी बातचीत भेजता है, और जब भी Claude टूल इस्तेमाल करता है, वह टूल के नतीजों का वह बैच लेकर एक और अनुरोध भेजता है। प्रॉम्प्ट कैशिंग दोबारा पढ़ने को सस्ता बनाती है, मुफ़्त नहीं।
नतीजों की कीमत दूसरी बार चुकानी पड़ती है। Anthropic का उदाहरण: किसी मीटिंग का ट्रांसक्रिप्ट Google Drive से Salesforce में ले जाने का मतलब 50,000 अतिरिक्त टोकन प्रोसेस करना हो सकता है, क्योंकि टेक्स्ट रास्ते में मॉडल से होकर गुज़रता है।
टूल दर टूल
एक प्रोग्राम
Tool Search इनमें से किसी पर कुछ नहीं करता। हमारे अपने टेस्ट में, 152 टूल वाले सर्वर पर एक रिलीज़ ठीक करते हुए, Claude Code ने Tool Search चालू होने पर भी 26 मॉडल कॉल कीं।
MCP का टोकन उपयोग कैसे घटता है? उपायों की तुलना
हर उपाय एक खर्च घटाता है या दोनों। कोई भी मुफ़्त नहीं है, और सही उपाय इस पर निर्भर है कि आप MCP का इस्तेमाल कैसे करते हैं।
| उपाय | सूची घटाता है | राउंड ट्रिप घटाता है | मेहनत | कमी |
|---|---|---|---|---|
| जिन सर्वर को आप इस्तेमाल नहीं करते, उन्हें डिस्कनेक्ट करें | कुछ हद तकउन सर्वर के लिए | नहीं | कुछ मिनट | दोबारा जोड़ने तक आप वे टूल खो देते हैं। |
| Tool Search (टूल परिभाषाएँ ज़रूरत पर लोड) | हाँClaude Code और Cursor में पहले से मौजूद | नहीं | कुछ नहीं, डिफ़ॉल्ट रूप से चालू | हर खोज एक और कदम है, और कॉल ख़ुद नहीं बदलतीं। |
| MCP सर्वर की जगह एक CLI (gh, aws…) | हाँहर टूल की सूची नहीं | नहींफिर भी हर कॉल पर एक कमांड | सिर्फ़ जहाँ अच्छा CLI हो | आप MCP की पहुँच छोड़ देते हैं: कई सेवाओं का MCP सर्वर है, पर CLI नहीं। |
| एक MCP गेटवे | हाँआम तौर पर | कुछ हद तकसिर्फ़ कोड मोड के साथ | चलाने और सुरक्षित रखने के लिए एक सेवा | टीमों और गवर्नेंस के लिए बना है, एक लैपटॉप के लिए नहीं। |
| मॉडल से कोड लिखवाना (कोड मोड), ख़ुद बनाया हुआ | हाँसैकड़ों की जगह कुछ टूल | हाँहर काम के लिए एक प्रोग्राम | ज़्यादा: सुरक्षित सैंडबॉक्स, सीमाएँ और निगरानी | एनवायरनमेंट आप ख़ुद बनाते और संभालते हैं, और Anthropic चेतावनी देता है कि इससे ऑपरेशन का बोझ बढ़ता है। |
| Delta MCP | हाँहर सर्वर के लिए तीन टूल | हाँहर काम के लिए एक प्रोग्राम | इंस्टॉल करें: दो मिनट, मुफ़्त | कई कदमों वाले कामों के लिए बना है। |
कोड मोड वह तरीका है जिसका वर्णन Anthropic ने Code execution with MCP में और Cloudflare ने Code Mode में किया है। Delta MCP यही तरीका है, तैयार रूप में, उन सर्वर के लिए जिन्हें आप पहले से इस्तेमाल करते हैं।
Delta MCP क्या बदलता है?
Delta MCP एक मुफ़्त ऐप है जो आपके AI ऐप और उनके MCP सर्वर के बीच बैठता है। आपके AI को हर सर्वर का हर टूल नहीं, सिर्फ़ तीन टूल दिखते हैं, और वह हर काम एक टाइप्ड प्रोग्राम की तरह लिखता है। Delta MCP पहली कॉल से पहले प्रोग्राम जाँचता है, कम से कम कॉल करता है, उन्हें सब या कुछ नहीं के नियम से लागू करता है, नतीजा दोबारा पढ़कर मिलाता है और उसे Activity में रखता है, वापस लेने के लिए तैयार।
यह बिना मेहनत का कोड मोड है: जाँच, सब या कुछ नहीं वाला लागू करना और वापस लेना ऐप के साथ आते हैं, आपके कंप्यूटर पर। आपके सर्वर ठीक वैसे ही रहते हैं जैसे हैं, और हर मूल टूल अपने नाम से कॉल किया जा सकता है।
Delta MCP कितने टोकन बचाता है?
Tool Search चालू रखकर Claude Code, Sonnet 5.5, हर वैरिएंट के दो से तीन रन, आख़िरी नतीजा हर सेवा में जाँचा गया।
| काम | टोकन | मॉडल कॉल | माप की तारीख़ |
|---|---|---|---|
| एक रिलीज़ ठीक करना, कोड मेंCerberus, 152 टूल | 13.4× कम | 26 → 6.5 | 5 अक्टूबर |
| टेस्ट जोड़ना, टेक्स्ट मेंCerberus, 152 टूल | 15.8× कम | 16.6 → 4 | 2 अक्टूबर |
| देर से चल रहे 20 टिकट निपटानाएक टिकट मैनेजर | 4.8× कम | 5 → 2 | 2 अक्टूबर |
| लॉग इन करना, 3 संपर्क जोड़ना, उनकी सूची देखनाMicrosoft Playwright MCP | 3.9× कम | 12.6 → 4 | 2 अक्टूबर |
| डॉक्यूमेंटेशन से जुड़ा एक सवालContext7 | 1.2× कम | 4 → 3 | 5 अक्टूबर |
किसी काम में जितने ज़्यादा कदम होते हैं, Delta MCP उतना ज़्यादा बचाता है।
Tool Search इस्तेमाल करते हुए भी क्या Delta MCP की ज़रूरत है?
हाँ, जब आपके काम में कई कदम हों। Tool Search सूची छोटी रखता है, पर हर कदम फिर भी एक दौर है। Delta MCP उन दौरों को हटाता है: आपका AI काम को एक प्रोग्राम की तरह लिखता है। हमारे माप Tool Search चालू रखकर लिए गए थे, इसलिए Delta MCP की बचत Tool Search की बचत के अलावा है।
सवाल
MCP इतने ज़्यादा टोकन क्यों इस्तेमाल करता है?
दो वजहें। मॉडल कोई टूल चुनने से पहले हर टूल की परिभाषा पढ़ता है, और हर टूल कॉल एक अलग अनुरोध है जो पूरी बातचीत दोबारा पढ़ता है, और हर नतीजा मॉडल से होकर लौटता है। पहला टूल सूची का खर्च है, दूसरा राउंड ट्रिप का खर्च।
MCP टूल कितने टोकन इस्तेमाल करते हैं?
यह आपके सर्वर पर निर्भर है। Anthropic के माप में 58 टूल वाले पाँच सर्वर पहले संदेश से पहले लगभग 55,000 टोकन ले रहे थे, और अकेले GitHub के 35 टूल लगभग 26,000। Claude Code की /context कमांड आपकी अपनी संख्या दिखाती है।
क्या Tool Search से MCP का टोकन उपयोग ठीक हो जाता है?
यह सूची ठीक करता है, राउंड ट्रिप नहीं। Anthropic सूची के लिए 85% कम टोकन बताता है, और Cursor के इसी तरह के उपाय ने MCP टूल कॉल करने वाले रनों में टोकन 46.9% घटाए। लेकिन हर टूल कॉल फिर भी पूरी बातचीत पर अपना अलग अनुरोध है।
क्या MCP के साथ कोड चलाना सच में सस्ता है?
कई कदमों वाले कामों पर, अक्सर हाँ। Anthropic का उदाहरण 1,50,000 से घटकर 2,000 टोकन पर आ गया, और Cloudflare ने 2,500 से ज़्यादा API एंडपॉइंट लगभग 1,000 टोकन में दिखाए। दोनों के साथ एक कीमत जुड़ी है: कोड चलाने के लिए एक सुरक्षित जगह चाहिए। हमारे अपने मापों में Delta MCP ने कई कदमों वाले कामों पर 3.3–24.1× कम टोकन इस्तेमाल किए।
क्या Delta MCP टोकन बचाता है?
हाँ, कई कदमों वाले कामों पर: हमारे टेस्ट में 3.3–24.1× कम टोकन, क्योंकि आपका AI हर कदम के लिए एक कॉल की जगह एक प्रोग्राम लिखता है।
क्या मुझे अपने MCP सर्वर बदलने होंगे?
नहीं। Delta MCP उन्हें ठीक वैसे ही इस्तेमाल करता है जैसे वे हैं, और हर मूल टूल अपने नाम से कॉल किया जा सकता है: जिस सबसे बड़े सर्वर पर हमने आज़माया, उसके 152 में से 152।
अपने MCP सर्वर के टोकन कितने हैं, यह कैसे जाँचूँ?
Claude Code में /context दिखाता है कि आपकी कॉन्टेक्स्ट विंडो में क्या भरा है, MCP टूल की परिभाषाओं समेत। /mcp आपके सर्वर की सूची दिखाता है और जो आप इस्तेमाल नहीं करते, उन्हें बंद करने देता है, और सब्सक्रिप्शन पर /usage हाल के उपयोग को हर MCP सर्वर के हिसाब से बाँटकर दिखाता है।
स्रोत
- Anthropic, Code execution with MCP: Building more efficient agents (4 नवंबर 2025) सीधी टूल कॉल की दो समस्याएँ; 1,50,000 से 2,000 टोकन वाला उदाहरण; 50,000 टोकन वाले ट्रांसक्रिप्ट का उदाहरण; सैंडबॉक्स की चेतावनी।
- Anthropic, Advanced tool use (24 नवंबर 2025) पाँच सर्वर पर 58 टूल, लगभग 55,000 टोकन; Tool Search Tool से 85% कम टोकन।
- Anthropic, Tool search tool (documentation) 30–50 टूल के बाद सही टूल चुनने में Claude की सटीकता घटती है।
- Claude Code, Manage costs effectively (documentation) MCP टूल परिभाषाएँ डिफ़ॉल्ट रूप से ज़रूरत पर लोड; /context, /mcp और /usage; हर अनुरोध के साथ पूरी बातचीत भेजी जाती है; CLI और MCP का अतिरिक्त बोझ।
- Cursor, Dynamic context discovery (6 जनवरी 2026) MCP टूल कॉल करने वाले रनों में 46.9% कम टोकन, Cursor के अपने A/B टेस्ट में।
- Cloudflare, Code Mode: give agents an entire API in 1,000 tokens (20 फ़रवरी 2026) 2,500 से ज़्यादा एंडपॉइंट लगभग 1,000 टोकन में, जबकि सामान्य MCP सर्वर के रूप में 11.7 लाख।
- Delta MCP, Benchmarks इस पेज पर Delta MCP का हर माप, उसके तरीके के साथ।
आगे पढ़ें
- Claude Code की यूसेज लिमिट खत्म? देखें MCP सर्वर का खर्चClaude Code के “You've hit your limit” का मतलब (सेशन, साप्ताहिक, Opus, खर्च), /usage से अपने MCP सर्वर का खर्च कैसे देखें, और पहले क्या घटाएँ।
- AI एजेंट के लिए MCP vs CLI: टोकन का बिल कहाँ से आता हैआपके AI एजेंट के लिए MCP या CLI? टोकन में किसका कितना खर्च होता है, माप क्या दिखाते हैं, कब CLI जीतता है, कब MCP, और कहाँ कोड दोनों से आगे निकलता है।
- MCP कॉन्फ़िग फ़ाइल कहाँ है: Claude, Cursor, VS Code और बाकीClaude Desktop, Claude Code, Cursor, VS Code, Windsurf, Gemini CLI और Codex अपनी MCP कॉन्फ़िग कहाँ रखते हैं: फ़ाइल का पाथ, JSON कुंजी, रिमोट सर्वर और टूल लिमिट।