इमेज के टोकन क्यों लगते हैं
भाषा मॉडल इमेज सीधे नहीं पढ़ सकता। मॉडल तक पहुँचने से पहले इमेज को हिस्सों में काटा जाता है,
हर हिस्सा एक वेक्टर में बदला जाता है, और वे वेक्टर कॉन्टेक्स्ट विंडो में उन्हीं जगहों पर बैठते हैं
जो टेक्स्ट टोकन लेते। इसीलिए इमेज का बिल टोकन में बनता है: वे सचमुच कॉन्टेक्स्ट खर्च करती हैं और
प्रति इकाई उतनी ही गणना लेती हैं जितनी शब्द।
टेक्स्ट से फ़र्क इस बात में है कि आँकड़ा कहाँ से आता है। एक वाक्य बाइट-पेयर एनकोडिंग टोकनाइज़र से
गुज़रता है, इसलिए जिसके पास शब्दावली फ़ाइल है वह उसकी गिनती ठीक-ठीक निकाल सकता है। इमेज की गिनती
उसके डाइमेंशन पर की गई गणित से निकलती है, और किसी और चीज़ से नहीं। फ़ाइल का आकार बेमानी है, वैसे ही
फ़ॉर्मैट, कलर डेप्थ और JPEG कितना कंप्रेस्ड है। 40 KB का स्क्रीनशॉट और 12 MB की PNG, अगर
डाइमेंशन एक हैं, तो कीमत भी बिल्कुल एक। इमेज बिलिंग के बारे में यही सबसे काम की बात है, क्योंकि
इसका मतलब है कि आपके हाथ में एक ही लीवर है — रेज़ोल्यूशन।
OpenAI, ChatGPT और Azure OpenAI
OpenAI दो तरीके इस्तेमाल करता है, और कौन लागू होगा यह मॉडल की पीढ़ी तय करती है, आपका कोई
सेटिंग नहीं। GPT-5.x परिवार पैच गिनता है: इमेज
को 32×32 पिक्सेल के वर्गों की ग्रिड में काटा जाता है और हर वर्ग एक
टोकन लेता है, 1,536 पैच की सख़्त सीमा तक। 1,024×1,024 की
इमेज GPT-5.6 Terra पर 1,024 टोकन है —
$0.00205 इनपुट, यानी एक हज़ार इमेज के
$2.05।
यही सीमा ऊपरी छोर पर पैच तरीके को उदार बनाती है। 1080p स्क्रीनशॉट और 4K स्क्रीनशॉट, दोनों का
बिल 1,536 टोकन बनता है, क्योंकि 4K फ़्रेम गिने जाने से पहले
पैच बजट तक घटा दिया जाता है। बड़ी फ़ाइल भेजने से आपको कुछ मिलता नहीं, और लगता भी कुछ नहीं।
GPT-4o और GPT-4.1 पैच से पहले के हैं और टाइलें
इस्तेमाल करते हैं: 85 टोकन का आधार शुल्क, और दो बार रीसाइज़ के बाद हर
512px टाइल पर 170। वही चौकोर इमेज वहाँ
765 टोकन है। ये OpenAI के एकमात्र मॉडल हैं जो
detail पैरामीटर पढ़ते हैं: उसे low करने पर इमेज कितनी भी बड़ी हो,
शुल्क 85 टोकन पर तय हो जाता है — जब आपको सिर्फ़ मोटी तस्वीर चाहिए तो यह असली
बचत है। GPT-5.x मॉडलों पर यह पैरामीटर स्वीकार होकर नज़रअंदाज़ हो जाता है, इसलिए ऊपर का काउंटर
कंट्रोल को धुँधला कर देता है और वजह भी बता देता है।
अगर आप Azure OpenAI से कॉल करते हैं, तो
संबंधित OpenAI पंक्ति देखें। Azure वही मॉडल उसी इमेज हिसाब-किताब के साथ होस्ट करता है, इसलिए
Azure OpenAI इमेज टोकन कैलकुलेटर और OpenAI कैलकुलेटर एक ही आँकड़ा देते हैं; फ़र्क सिर्फ़ आपकी
अनुबंधित दर में हो सकता है। ChatGPT खुद उपभोक्ता प्लान पर प्रति टोकन बिल नहीं करता, लेकिन उसके
पीछे का मॉडल इमेज को ठीक API की तरह गिनता है — और इसीलिए ये आँकड़े ChatGPT जैसा फ़ीचर बनाने की
लागत आँकने में काम आते हैं।
Gemini टाइलें गिनता है, और रुकता नहीं
Google के तरीके की दो शाखाएँ हैं। जो इमेज दोनों भुजाओं में 384px या उससे कम
है, वह 258 टोकन की एक फ़्लैट-दर इकाई है। उससे बड़ी हर इमेज
768px की टाइलों में बँटती है, और हर टाइल भी 258 टोकन
की।
इसका नतीजा पहले से सोचने लायक है: Gemini कोई छत नहीं
लगाता। जहाँ OpenAI 1,536 पैच पर और Anthropic लगभग
1,534 टोकन पर रुक जाता है, Gemini जब तक आप पिक्सेल जोड़ते रहें, टाइलें
जोड़ता रहता है। 1,024×1,024 इमेज पर वह प्रतिस्पर्धी
1,032 टोकन है; फ़ोन से सीधे आई
3,024×4,032 तस्वीर पर 6,192, जबकि
GPT-5.6 Terra पर 1,452 और Claude Sonnet 5 पर
1,534। Gemini सबसे सस्ते से सबसे महँगे विकल्प में सिर्फ़ उस
रेज़ोल्यूशन की वजह से बदल जाता है जो आपने उसे दिया।
दूसरा पहलू यह है कि छोटी इमेज पर Gemini को हराना मुश्किल है। 256×256 पर
Gemini 3.7 Flash की कीमत प्रति इमेज $0.00019 है, और
फ़्लैट दर दोनों भुजाओं में 768px तक सब कुछ ढक लेती है: जो थंबनेल पाइपलाइन
768px या उससे कम पर रीसाइज़ करती है, वह एक टाइल का, एक ही बार भुगतान करती है।
Claude पिक्सेल को 750 से भाग देता है
Anthropic ग्रिड को पूरी तरह छोड़ देता है: टोकन कुल पिक्सेल क्षेत्र में
750 का भाग है। पहले दो सीमाएँ लगती हैं — बड़ी भुजा
1,568px तक घटाई जाती है, फिर कुल क्षेत्र लगभग
1,150,000 पिक्सेल तक — और Claude की प्रति इमेज लगभग
1,534 टोकन की असल छत भुजा वाली सीमा नहीं, क्षेत्र वाली सीमा बनाती है।
फ़ॉर्मूला पूरी तरह ज्यामितीय है, इसलिए Claude के सभी टियर एक ही गिनती बताते हैं।
1,024×1,024 इमेज Opus, Sonnet और Haiku — तीनों पर
1,399 टोकन है: मॉडलों में फ़र्क सिर्फ़ इतना है कि एक टोकन की
कीमत क्या है। इससे विज़न काम के लिए टियर चुनना असामान्य रूप से साफ़ हो जाता है — वही इमेज
Claude Opus 5 पर $0.00700 और Claude Haiku 4.5 पर
$0.00140 पड़ती है, यानी पाँच गुना अंतर, और मॉडल को इमेज
का जितना हिस्सा मिलता है उसमें कोई बदलाव नहीं।
इमेज पर कम खर्च कैसे करें
भेजने से पहले रीसाइज़ करें। चूँकि गिनती सिर्फ़
डाइमेंशन से होती है, स्केल घटाना ही पूरी ऑप्टिमाइज़ेशन है। जिन तरीकों में ऊपरी सीमा है, वहाँ आप
सीमा से ऊपर की हर चीज़ बेझिझक फेंक सकते हैं: प्रोवाइडर उसे घटाएगा ही, और खुद घटाने से अपलोड का
समय भी बचता है। Gemini पर, जहाँ कोई सीमा नहीं है, रीसाइज़ करना
6,192 टोकन और
1,032 के बीच का फ़र्क है।
रेज़ोल्यूशन को काम के हिसाब से रखें। स्क्रीनशॉट
में घना टेक्स्ट पढ़ने के लिए पिक्सेल चाहिए। यह तय करने के लिए कि तस्वीर में बिल्ली है या नहीं,
नहीं चाहिए। GPT-4o और GPT-4.1 पर detail: low यह काम तय 85
टोकन में कर देता है; बाकी मॉडलों पर 512×512 पर रीसाइज़ करने से वही नतीजा
मिलता है।
रिक्वेस्ट नहीं, पूरी बातचीत गिनें। इमेज जब तक
थ्रेड चलता है कॉन्टेक्स्ट विंडो में बनी रहती है, और ज़्यादातर चैट इंप्लीमेंटेशन हर टर्न पर पूरा
इतिहास दोबारा भेजते हैं। जो इमेज एक बार में $0.00205 की है,
वह बीस टर्न में $0.041 की पड़ती है — और यह टेक्स्ट का
एक शब्द गिनने से पहले। देखें कि आपके प्रीफ़िक्स पर कैश्ड इनपुट दर लागू होती है या नहीं: वह
आम तौर पर मानक दर का एक हिस्सा ही होती है।
ये आँकड़े कितने सटीक हैं
जिन मॉडलों का टोकनाइज़र निजी है, उनके लिए इमेज टोकन की गिनती टेक्स्ट के अनुमानों से ज़्यादा
भरोसेमंद है, क्योंकि यहाँ के फ़ॉर्मूले प्रकाशित गणित हैं, कोई पुनर्निर्माण नहीं। OpenAI के टाइल
तरीके को 512×512 इमेज दें और वह 255 टोकन देता है,
जो OpenAI के अपने दस्तावेज़ का आँकड़ा है; 1,024×1,024 पर
765 — वही बात।
दो चेतावनियाँ। प्रोवाइडर ये फ़ॉर्मूले बिना ख़ास सूचना बदल देते हैं, इसलिए आँकड़ों पर वह तारीख़ दर्ज
है जब उन्हें मूल दस्तावेज़ों से आख़िरी बार मिलाया गया। और इमेज की गिनती पूरी रिक्वेस्ट नहीं है:
आपके प्रॉम्प्ट का टेक्स्ट, सिस्टम मैसेज और मॉडल का जवाब अलग से बिल होते हैं। दस्तावेज़ों के लिए
फ़ाइल टोकन काउंटर इस्तेमाल करें और
प्रॉम्प्ट के लिए टेक्स्ट कैलकुलेटर; यह पेज पिक्सेल संभालता है।