फ़ाइल टोकन काउंटर

PDF टोकन काउंटर

किसी PDF, Word दस्तावेज़, TXT, Markdown, JSON या CSV फ़ाइल के टोकन गिनें — और देखें कि उसे भेजने पर कितना खर्च आएगा। यह PDF टोकन कैलकुलेटर टेक्स्ट निकालकर पूरी तरह आपके ब्राउज़र में ही टोकनाइज़ करता है, इसलिए कुछ भी अपलोड नहीं होता और साइन-अप की ज़रूरत नहीं।

आपके ब्राउज़र में प्रोसेस — कोई अपलोड नहीं

PDF, DOCX, TXT, MD या JSON फ़ाइल यहाँ छोड़ें

या ब्राउज़ करने के लिए क्लिक करें — कई फ़ाइलें भी चलेंगी

PDFDOCXTXTMDJSONCSVXMLHTMLYAML
टोकन
0
शब्द
0
अक्षर
0
इनपुट लागत
$0.0000
कॉन्टेक्स्ट विंडो0%
0 टोकन उपयोग1M सीमा

OpenAI मॉडलों की गिनती सटीक है — इसमें वही BPE टोकनाइज़र इस्तेमाल होता है जो API इस्तेमाल करता है। Anthropic, Google, xAI, DeepSeek और Meta अपने टोकनाइज़र प्रकाशित नहीं करते, इसलिए उन मॉडलों के लिए आपका टेक्स्ट एक BPE आधार टोकनाइज़र से गिना जाता है और नतीजे को उस मॉडल के टोकनाइज़र के अनुपात में समायोजित किया जाता है। इसी वजह से Claude Opus 5 और Claude Sonnet 4.6 अब एक ही संख्या नहीं दिखाते।

चरण दर चरण

PDF में टोकन कैसे गिनें

  1. 1

    अपनी फ़ाइल जोड़ें

    ऊपर दिए काउंटर पर PDF, DOCX, TXT, Markdown, JSON या CSV फ़ाइल छोड़ें, या ब्राउज़ करने के लिए क्लिक करें। एक साथ कई फ़ाइलें भी चलेंगी।

  2. 2

    टेक्स्ट आपके ही डिवाइस पर निकाला जाता है

    PDF को pdf.js से पेज-दर-पेज पढ़ा जाता है; .docx आर्काइव को अनज़िप करके उसका WordprocessingML पढ़ने के क्रम में देखा जाता है। कुछ भी कहीं नहीं भेजा जाता।

  3. 3

    वह मॉडल चुनें जिसका बिल आपको मिलता है

    गिनती उसी मॉडल के टोकनाइज़र से दोबारा की जाती है — OpenAI के लिए बिल्कुल सटीक, और जो कंपनियाँ अपना टोकनाइज़र सार्वजनिक नहीं करतीं उनके लिए स्पष्ट रूप से चिह्नित अनुमान।

  4. 4

    गिनती, लागत और कॉन्टेक्स्ट देखें

    टोकन, शब्द, अक्षर और इनपुट लागत — साथ ही यह भी कि दस्तावेज़ मॉडल की कॉन्टेक्स्ट विंडो का कितना हिस्सा भर देगा।

समर्थित फ़ॉर्मैट

यह टोकन कैलकुलेटर हर वह फ़ाइल टाइप पढ़ता है

दस्तावेज़, सामान्य लेखन और स्ट्रक्चर्ड डेटा — सबके लिए एक ही टूल। टेक्स्ट निकालने का तरीका फ़ॉर्मैट के हिसाब से बदलता है; टोकनाइज़र नहीं।

PDF

PDF टोकन काउंटर

टेक्स्ट लेयर को pdf.js से पेज-दर-पेज निकाला जाता है, हर फ़ाइल में 500 पेज तक। जिसमें असली टेक्स्ट है, वह सब चलेगा — रिपोर्ट, कॉन्ट्रैक्ट, शोध-पत्र, एक्सपोर्ट की गई स्लाइड्स। स्कैन के लिए पहले OCR चाहिए, और स्कैन मिलने पर काउंटर आपको बता देता है।

DOCX

DOC और DOCX टोकन काउंटर

.docx असल में एक ZIP आर्काइव है, इसलिए काउंटर उसे ब्राउज़र में ही अनज़िप करके सीधे word/document.xml पढ़ता है — पैराग्राफ़, टेबल और लाइन ब्रेक दस्तावेज़ के क्रम में, फ़ील्ड कोड और ट्रैक किए गए विलोपन छोड़ते हुए। पुराने बाइनरी .doc को पहले .docx या PDF में सेव करना होगा।

TXT

TXT टोकन काउंटर

सादा टेक्स्ट सबसे आसान मामला है: UTF-8 में पढ़ा जाता है और जैसा डिस्क पर है वैसा ही टोकनाइज़ होता है। प्रॉम्प्ट फ़ाइलें, ट्रांसक्रिप्ट, कॉपी किया गया टेक्स्ट और लॉग के हिस्से जाँचने के लिए उपयोगी।

MD

Markdown (MD) टोकन काउंटर

Markdown जैसा लिखा है वैसा ही गिना जाता है, सिंटैक्स सहित — क्योंकि मॉडल को यही मिलता है। हेडिंग के हैश, लिस्ट के बुलेट, टेबल की पाइप और कोड फ़ेंस — ये सब टोकन हैं जिनके पैसे लगते हैं। इसीलिए README की गिनती उसके शब्दों से ज़्यादा निकलती है।

JSON

JSON टोकन काउंटर

ब्रेसेस, ब्रैकेट, कोट्स, कोलन और इंडेंटेशन — सब टोकनाइज़ होते हैं। स्ट्रक्चर्ड डेटा सामान्य लेखन से कहीं ज़्यादा घना होता है, अक्सर हर दो अक्षर पर लगभग एक टोकन। इसलिए प्रॉम्प्ट में JSON डालने से पहले दस सेकंड की गिनती फ़ायदे की है। JSONL भी समर्थित है।

CSV

CSV, XML, YAML और HTML

डेटा और मार्कअप फ़ॉर्मैट टेक्स्ट की तरह पढ़े और अक्षरशः गिने जाते हैं। बार-बार आने वाले टैग, सेपरेटर और कोट्स ही गिनती पर हावी रहते हैं — यानी स्प्रेडशीट एक्सपोर्ट उतने ही डेटा को सामान्य वाक्यों में लिखने से कई गुना महँगा पड़ सकता है।

टोकन कीमतें

एक दस्तावेज़ की लागत, हर मॉडल के लिए

सिर्फ़ इनपुट दरें — आउटपुट का बिल अलग बनता है और वह आम तौर पर तीन से पाँच गुना महँगा होता है।

हर मॉडल की इनपुट टोकन कीमत — 1,000 टोकन, 200,000 टोकन और 1,000,000 टोकन की लागत तथा एक अमेरिकी डॉलर में मिलने वाले टोकन
मॉडलप्रति 1M टोकन1,000 टोकन200,000 टोकन$1 में टोकन
GPT-5.6 TerraOpenAI$2.00$0.00200$0.400500,000
GPT-5.6 LunaOpenAI$0.200$0.00020$0.0405,000,000
GPT-5.5OpenAI$5.00$0.00500$1.00200,000
Claude Sonnet 5Anthropic$2.00$0.00200$0.400500,000
Claude Haiku 4.5Anthropic$1.00$0.00100$0.2001,000,000
Gemini 3.1 ProGoogle$2.00$0.00200$0.400500,000
Gemini 3.7 FlashGoogle$0.750$0.00075$0.1501,333,333
Grok 4.6xAI$2.00$0.00200$0.400500,000
DeepSeek V4 FlashDeepSeek$0.440$0.00044$0.0882,272,727

टोकन, शब्द और पेज साथ-साथ

आम टोकन मात्राओं के लिए अनुमानित शब्द संख्या, पेज संख्या और GPT-5.6 Terra इनपुट लागत
टोकन≈ शब्द≈ पेजGPT-5.6 Terra इनपुट
1,0007501.5$0.00200
10,0007,50015$0.020
100,00075,000150$0.200
200,000150,000300$0.400
1,000,000750,0001,500$2.00

अनुमान अंग्रेज़ी लेखन पर आधारित है — लगभग 0.75 शब्द प्रति टोकन और 500 शब्द प्रति पेज। कोड, JSON और देवनागरी जैसी ग़ैर-लैटिन लिपियाँ काफ़ी अधिक घनी पड़ती हैं।

FAQ

अक्सर पूछे जाने वाले सवाल

गिनती और लागत

टोकन कैसे गिनें?

टेक्स्ट को उसी टोकनाइज़र से गुज़ारें जिसे मॉडल इस्तेमाल करता है। OpenAI अपना टोकनाइज़र सार्वजनिक करता है, इसलिए GPT-5.6, GPT-5.4, GPT-4.1 और GPT-4o की गिनती बिल्कुल सटीक है — यह पेज असली BPE वोकैबुलरी (o200k_base) आपके ब्राउज़र में लोड करके उसी से गिनता है। Anthropic, Google, xAI, DeepSeek और Meta अपने टोकनाइज़र प्रकाशित नहीं करते, इसलिए वे आँकड़े अनुमान हैं और उन पर "est." लिखा रहता है। अंग्रेज़ी लेखन के लिए मोटे अंदाज़ के लिए अक्षरों की संख्या को 4 से भाग दें।

PDF फ़ाइल में टोकन कैसे गिनें?

टोकनाइज़ करने से पहले PDF को वापस टेक्स्ट में बदलना पड़ता है। फ़ाइल को इस पेज के सबसे ऊपर बने काउंटर में छोड़ दें: वह pdf.js से टेक्स्ट लेयर पेज-दर-पेज निकालकर नतीजे को टोकनाइज़ करता है — पूरी तरह आपके ब्राउज़र में, बिना किसी अपलोड के। अगर गिनती खाली आती है, तो वह PDF लगभग निश्चित रूप से बिना टेक्स्ट लेयर वाला स्कैन है और उसके लिए पहले OCR चाहिए।

1,000,000 टोकन कितने होते हैं?

लगभग 750,000 शब्द, यानी सामान्य लेखन के करीब 1,500 पेज — पाँच-छह पूरे उपन्यास। (10 लाख टोकन।) पैसे में यह पूरी तरह मॉडल पर निर्भर है: 1,000,000 इनपुट टोकन GPT-5.6 Terra पर $2.00, GPT-5.6 Luna पर $0.200 और GPT-5.5 पर $5.00 पड़ते हैं। आउटपुट टोकन का बिल अलग बनता है और वह तीन से पाँच गुना महँगा होता है।

200,000 टोकन कितने होते हैं?

लगभग 150,000 शब्द, यानी करीब 300 पेज — एक पूरा उपन्यास। सालों तक यही कॉन्टेक्स्ट विंडो की आम सीमा थी, और छोटे मॉडलों में अब भी यही है; मौजूदा बड़े मॉडल इससे कहीं ज़्यादा लेते हैं — GPT-5.6 Terra में करीब 1,050,000 टोकन आते हैं, इसलिए इतना बड़ा दस्तावेज़ अब अकेले पूरी रिक्वेस्ट नहीं भरता। GPT-5.6 Terra की इनपुट दर पर इसकी लागत $0.400 है।

1,000 टोकन की कीमत कितनी है?

1,000 इनपुट टोकन GPT-5.6 Terra पर $0.00200, GPT-5.6 Luna पर $0.00020, Claude Sonnet 5 पर $0.00200 और Gemini 3.1 Pro पर $0.00200 पड़ते हैं। कंपनियाँ कीमतें प्रति दस लाख (1M) टोकन बताती हैं, इसलिए प्रति 1,000 का आँकड़ा निकालने के लिए बताई गई दर को 1,000 से भाग दें।

टोकन की कीमत कैसे निकालें?

कीमत = (इनपुट टोकन ÷ 1,000,000) × इनपुट दर + (आउटपुट टोकन ÷ 1,000,000) × आउटपुट दर। दोनों दिशाएँ अलग-अलग गिनें, क्योंकि हर कंपनी मॉडल के लिखे हुए का पैसा उससे ज़्यादा लेती है जो आप भेजते हैं। अगर आप कई रिक्वेस्ट में प्रॉम्प्ट की वही शुरुआत दोहराते हैं, तो देखें कि कैश्ड इनपुट दर लागू होती है या नहीं — वह आम तौर पर सामान्य दर का 10% से 50% होती है।

टोकन के पैसे क्यों लगते हैं?

कंपनियाँ टोकन के हिसाब से बिल बनाती हैं क्योंकि मॉडल असल में टोकन ही प्रोसेस करता है: आपके प्रॉम्प्ट का हर टोकन और जवाब का हर टोकन कंप्यूट खर्च करता है। हर रिक्वेस्ट में दोनों दिशाओं का पैसा लगता है — इसीलिए बातचीत के हर मोड़ पर फिर से भेजा गया लंबा दस्तावेज़ जल्दी महँगा हो जाता है, क्योंकि वही पेज हर बार दोबारा चुकाने पड़ते हैं।

एक टोकन कैसे नापा जाता है?

टोकन मॉडल की बाइट-पेयर-एन्कोडिंग वोकैबुलरी की एक उप-शब्द इकाई है — न अक्षर, न पूरा शब्द। आम अंग्रेज़ी शब्द ज़्यादातर एक टोकन होते हैं; लंबे या दुर्लभ शब्द कई हिस्सों में बँटते हैं, जैसे "tokenization" बनता है "token" + "ization"। विराम चिह्न और शुरुआती स्पेस भी गिने जाते हैं। अंग्रेज़ी में औसतन लगभग 4 अक्षर या 0.75 शब्द प्रति टोकन होते हैं, लेकिन कोड, JSON, इमोजी और देवनागरी जैसी लिपियाँ बहुत घनी पड़ती हैं — हिंदी टेक्स्ट में मात्राओं और संयुक्त अक्षरों के कारण अक्सर हर अक्षर पर एक टोकन तक लग सकता है, इसलिए वही बात हिंदी में लिखने पर अंग्रेज़ी से कई गुना टोकन ले सकती है।

$1 में कितने टोकन मिलते हैं?

एक डॉलर के इनपुट में GPT-5.6 Terra पर लगभग 500,000 टोकन, GPT-5.6 Luna पर 5,000,000, GPT-5.5 पर 200,000 और Claude Sonnet 5 पर 500,000 टोकन मिलते हैं। ऊपर की तालिका के किसी भी मॉडल का आँकड़ा निकालने के लिए 1,000,000 को उसकी प्रति-मिलियन इनपुट कीमत से भाग दें।

फ़ाइलें अपलोड करना

टोकन कैलकुलेटर में कौन-कौन सी फ़ाइलें डाल सकते हैं?

PDF, DOCX, TXT, Markdown (.md), JSON, JSONL, CSV, TSV, XML, HTML, YAML और सादे लॉग फ़ाइलें। PDF को pdf.js से पढ़ा जाता है, .docx को अनज़िप करके उसके WordprocessingML से पढ़ा जाता है, और बाकी सब UTF-8 टेक्स्ट की तरह। पुराना बाइनरी .doc समर्थित नहीं है — उसे पहले .docx या PDF में सेव करें।

मेरी अपलोड की गई फ़ाइलें निजी रहती हैं?

यहाँ "अपलोड" का मतलब सिर्फ़ इतना है कि आपका ब्राउज़र फ़ाइल आपकी ही डिस्क से पढ़ता है। PDF पढ़ना, .docx अनज़िप करना और टोकनाइज़ करना — सब आपके डिवाइस पर JavaScript के रूप में चलता है, और टोकनाइज़र वोकैबुलरी किसी बाहरी CDN से नहीं, इसी साइट से आती है। कोई भी सामग्री न भेजी जाती है, न लॉग होती है, न सहेजी जाती है — इसलिए गोपनीय कॉन्ट्रैक्ट और आंतरिक दस्तावेज़ भी बेझिझक जाँच सकते हैं।

सबसे बड़ी फ़ाइल कितनी हो सकती है?

प्रति फ़ाइल 10 MB, और PDF के पहले 500 पेज तक पढ़े जाते हैं। दोनों सीमाएँ आपके ही ब्राउज़र टैब की सुरक्षा के लिए हैं — टेक्स्ट क्रम से निकाला जाता है, और बहुत बड़े दस्तावेज़ के सारे पेज एक साथ मेमोरी में रखने पर टैब जम जाएगा। जब किसी PDF को सीमित किया जाता है, तो फ़ाइल की पंक्ति बताती है कि कितने पेज पढ़े गए।

स्कैन किए गए PDF में टोकन गिन सकते हैं?

सीधे नहीं। स्कैन टेक्स्ट की तस्वीर होती है, उसमें टेक्स्ट लेयर नहीं होती, इसलिए निकालने के लिए कुछ नहीं होता और काउंटर बता देता है कि कोई टेक्स्ट नहीं मिला। फ़ाइल को पहले OCR से गुज़ारें — ज़्यादातर PDF टूल में "टेक्स्ट पहचानें" विकल्प होता है — और उससे बनी सर्च-योग्य PDF डालें।

क्या एक बार में कई फ़ाइलें डाल सकते हैं?

हाँ। कई फ़ाइलें चुनें या छोड़ें — हर एक को अपनी पंक्ति और अपनी टोकन गिनती मिलती है, जबकि आँकड़ों के कार्ड कुल जोड़ दिखाते हैं। अगर आप दस्तावेज़ों को जोड़कर एक ही प्रॉम्प्ट बनाने वाले हैं, तो वही कुल जोड़ मायने रखता है।

Word दस्तावेज़ (.docx) में टोकन गिन सकते हैं?

हाँ, .docx और .docm में। काउंटर आर्काइव को अनज़िप करता है, word/document.xml पढ़ता है और उसके पैराग्राफ़, टेबल तथा लाइन ब्रेक पढ़ने के क्रम में देखता है, फ़ील्ड कोड और ट्रैक किए गए विलोपन छोड़ते हुए। हेडर, फ़ुटर और फ़ुटनोट आर्काइव के अलग हिस्सों में होते हैं और गिनती में शामिल नहीं हैं।

क्या PDF टोकन काउंटर पासवर्ड से सुरक्षित PDF पर काम करता है?

नहीं। एन्क्रिप्टेड PDF को उसके पासवर्ड के बिना पढ़ा नहीं जा सकता, और काउंटर अंदाज़ा लगाने के बजाय उसे सुरक्षित बता देता है। उसे पासवर्ड से खोलकर दोबारा सेव करें, या अपने PDF टूल का "सुरक्षा हटाएँ" विकल्प इस्तेमाल करें, और फिर बिना सुरक्षा वाली कॉपी डालें।

टोकन गिनती कितनी सटीक है?

OpenAI मॉडलों के लिए बिल्कुल सटीक, क्योंकि इसमें वही BPE वोकैबुलरी इस्तेमाल होती है जो API इस्तेमाल करता है — GPT-5.6 के लिए 12,431 टोकन की गिनती का मतलब है कि उस टेक्स्ट पर आपसे यही संख्या वसूली जाएगी। Anthropic, Google, xAI, DeepSeek और Meta के लिए आँकड़ा अनुमान है, जिस पर "est." लिखा होता है, और अंग्रेज़ी लेखन में यह आम तौर पर 10–15% के दायरे में रहता है। टेक्स्ट निकालने में फ़र्क़ टोकनाइज़ करने से ज़्यादा आता है: PDF का पढ़ने का क्रम, टेबल और कॉलम तय करते हैं कि कौन-सी ख़ाली जगह टेक्स्ट में पहुँचेगी — और ख़ाली जगह भी टोकन बनती है।

मेरे PDF की टोकन गिनती उम्मीद से ज़्यादा क्यों है?

आम तौर पर लेआउट की वजह से। टेबल, कई कॉलम वाले पेज, हर पेज पर दोहराए गए हेडर और ज़बरदस्ती डाले गए लाइन ब्रेक — ये सब टेक्स्ट निकालने के बाद भी बचे रहते हैं, और इनमें से हर लाइन ब्रेक और फ़ालतू स्पेस एक टोकन है। दूसरी तरफ़, टेक्स्ट वाले PDF में मिले-जुले स्कैन किए गए पेज पूरी तरह छूट जाते हैं और गिनती घटा देते हैं। ठीक-ठीक क्या टोकनाइज़ हुआ, यह देखने के लिए काउंटर के नीचे "निकाला गया टेक्स्ट" पैनल खोलें।

इसके लिए अकाउंट या API की चाहिए?

नहीं। कोई साइन-अप नहीं, कोई API की नहीं, कोई सीमा नहीं। टोकनाइज़र आपके ब्राउज़र में ही चलते हैं, इसलिए न किसी सेवा में लॉगिन करना है और न कुछ मापा जाता है।

पेस्ट किया हुआ टेक्स्ट गिनना है?

मुख्य टोकन कैलकुलेटर टाइप करते-करते टोकन दिखाता है, आपका टेक्स्ट किस तरह बँटा है इसका रंगों वाला ब्यौरा देता है, और हर मॉडल की कीमत साथ-साथ रखकर तुलना करता है।