Compteur de tokens par fichier

Compteur de tokens PDF

Comptez les tokens d’un PDF, d’un document Word, TXT, Markdown, JSON ou CSV — et voyez ce que son envoi coûtera. Ce calculateur de tokens PDF extrait le texte et le tokenise entièrement dans votre navigateur : rien n’est envoyé, aucune inscription n’est requise.

Traité dans votre navigateur — aucun envoi

Déposez un fichier PDF, DOCX, TXT, MD ou JSON

ou cliquez pour parcourir — plusieurs fichiers acceptés

PDFDOCXTXTMDJSONCSVXMLHTMLYAML
Tokens
0
Mots
0
Caractères
0
Coût d’entrée
$0.0000
Fenêtre de contexte0%
0 tokens utiliséslimite 1M

Le comptage des modèles OpenAI est exact : il utilise le même tokenizer BPE que l’API. Anthropic, Google, xAI, DeepSeek et Meta ne publient pas les leurs — pour ces modèles, votre texte passe par un tokenizer BPE de référence et le résultat est mis à l’échelle du tokenizer du modèle. C’est pourquoi Claude Opus 5 et Claude Sonnet 4.6 n’affichent plus le même nombre.

Étape par étape

Comment compter les tokens d’un PDF

  1. 1

    Ajoutez votre fichier

    Déposez un fichier PDF, DOCX, TXT, Markdown, JSON ou CSV sur le compteur ci-dessus, ou cliquez pour parcourir. Plusieurs fichiers à la fois ne posent aucun problème.

  2. 2

    Le texte est extrait sur votre appareil

    Les PDF sont lus page par page avec pdf.js ; les archives .docx sont décompressées et leur WordprocessingML parcouru dans l’ordre de lecture. Rien n’est transmis.

  3. 3

    Choisissez le modèle que vous facturez

    Le comptage est recalculé avec le tokenizer de ce modèle — exact pour OpenAI, estimation signalée pour les fournisseurs qui gardent le leur privé.

  4. 4

    Lisez le total, le coût et l’occupation du contexte

    Tokens, mots, caractères et coût d’entrée, ainsi que la part de la fenêtre de contexte du modèle que le document occuperait.

Formats pris en charge

Tous les types de fichiers que ce calculateur de tokens lit

Un seul outil pour les documents, la prose et les données structurées. L’extraction diffère selon le format ; le tokenizer, non.

PDF

Compteur de tokens PDF

La couche de texte est extraite page par page avec pdf.js, jusqu’à 500 pages par fichier. Fonctionne avec tout document contenant du vrai texte — rapports, contrats, articles, présentations exportées. Les scans nécessitent d’abord un OCR, et le compteur vous le signale.

DOCX

Compteur de tokens DOC et DOCX

Un .docx est une archive ZIP : le compteur la décompresse dans le navigateur et lit directement word/document.xml — paragraphes, tableaux et sauts de ligne dans l’ordre du document, les codes de champ et les suppressions suivies étant ignorés. L’ancien .doc binaire doit être réenregistré en .docx ou en PDF.

TXT

Compteur de tokens TXT

Le texte brut est le cas le plus simple : lu en UTF-8 et tokenisé exactement tel qu’il est sur le disque. Pratique pour les fichiers de prompts, les transcriptions, les textes récupérés et les extraits de journaux que vous allez coller dans un modèle.

MD

Compteur de tokens Markdown (MD)

Le Markdown est compté tel qu’il est écrit, syntaxe incluse — car c’est bien ce que reçoit le modèle. Les dièses de titres, les puces de listes, les barres de tableaux et les délimiteurs de blocs de code sont autant de tokens facturés, d’où un README dont le total dépasse ce que son nombre de mots laisse croire.

JSON

Compteur de tokens JSON

Accolades, crochets, guillemets, deux-points et indentation sont tous tokenisés. Les données structurées sont beaucoup plus denses que la prose — souvent près d’un token pour deux caractères — donc compter avant d’insérer un bloc JSON dans un prompt vaut ces dix secondes. JSONL est également pris en charge.

CSV

CSV, XML, YAML et HTML

Les formats de données et de balisage sont lus comme du texte et comptés à l’identique. Balises répétées, séparateurs et guillemets dominent le total : un export de tableur peut coûter plusieurs fois ce que les mêmes données coûteraient en prose.

Tarifs des tokens

Ce qu’un document coûte, modèle par modèle

Tarifs d’entrée uniquement — la sortie est facturée séparément et coûte généralement trois à cinq fois plus.

Tarifs des tokens d’entrée par modèle, avec le coût pour 1 000 tokens, 200 000 tokens et 1 000 000 de tokens, ainsi que le nombre de tokens par dollar américain
ModèlePar 1 M de tokens1 000 tokens200 000 tokensTokens pour $1
GPT-5.6 TerraOpenAI$2.00$0.00200$0.400500 000
GPT-5.6 LunaOpenAI$0.200$0.00020$0.0405 000 000
GPT-5.5OpenAI$5.00$0.00500$1.00200 000
Claude Sonnet 5Anthropic$2.00$0.00200$0.400500 000
Claude Haiku 4.5Anthropic$1.00$0.00100$0.2001 000 000
Gemini 3.1 ProGoogle$2.00$0.00200$0.400500 000
Gemini 3.7 FlashGoogle$0.750$0.00075$0.1501 333 333
Grok 4.6xAI$2.00$0.00200$0.400500 000
DeepSeek V4 FlashDeepSeek$0.440$0.00044$0.0882 272 727

Tokens, mots et pages côte à côte

Nombre approximatif de mots, de pages et coût d’entrée GPT-5.6 Terra pour les volumes de tokens courants
Tokens≈ Mots≈ PagesEntrée GPT-5.6 Terra
1 0007501,5$0.00200
10 0007 50015$0.020
100 00075 000150$0.200
200 000150 000300$0.400
1 000 000750 0001 500$2.00

Sur la base d’une prose anglaise d’environ 0,75 mot par token et de 500 mots par page. Le code, le JSON et les écritures non latines sont nettement plus denses.

FAQ

Questions fréquentes

Comptage et coût

Comment compter des tokens ?

Passez le texte dans le tokenizer que le modèle utilise. OpenAI publie le sien, donc les totaux pour GPT-5.6, GPT-5.4, GPT-4.1 et GPT-4o sont exacts — cette page charge le véritable vocabulaire BPE (o200k_base) dans votre navigateur et compte avec lui. Anthropic, Google, xAI, DeepSeek et Meta ne publient pas leurs tokenizers : ces totaux sont des approximations, signalées par « est. ». Pour une vérification manuelle rapide en prose anglaise, divisez le nombre de caractères par 4.

Comment compter les tokens d’un fichier PDF ?

Un PDF doit d’abord être reconverti en texte avant de pouvoir être tokenisé. Déposez le fichier dans le compteur en haut de cette page : il extrait la couche de texte page par page avec pdf.js et tokenise le résultat, entièrement dans votre navigateur et sans envoi. Si le total revient vide, le PDF est presque certainement un scan sans couche de texte et nécessiterait d’abord un OCR.

Combien font 1 000 000 de tokens ?

Environ 750 000 mots, soit à peu près 1 500 pages de prose ordinaire — cinq à six romans complets. En argent, tout dépend du modèle : 1 000 000 de tokens d’entrée coûtent $2.00 sur GPT-5.6 Terra, $0.200 sur GPT-5.6 Luna et $5.00 sur GPT-5.5. Les tokens de sortie sont facturés séparément et coûtent trois à cinq fois plus.

Combien font 200 000 tokens ?

Environ 150 000 mots, soit à peu près 300 pages — un roman complet. Pendant des années, c’était le plafond habituel de la fenêtre de contexte, et il l’est encore sur les petits modèles ; les modèles de pointe actuels en acceptent bien plus — GPT-5.6 Terra prend environ 1 050 000 tokens, donc un document de cette taille ne remplit plus à lui seul une requête entière. Au tarif d’entrée de GPT-5.6 Terra, cela coûte $0.400.

Combien coûtent 1 000 tokens ?

1 000 tokens d’entrée coûtent $0.00200 sur GPT-5.6 Terra, $0.00020 sur GPT-5.6 Luna, $0.00200 sur Claude Sonnet 5 et $0.00200 sur Gemini 3.1 Pro. Les fournisseurs affichent leurs prix par million de tokens : divisez le tarif annoncé par 1 000 pour obtenir le prix des 1 000 tokens.

Comment calculer le prix des tokens ?

Prix = (tokens d’entrée ÷ 1 000 000) × tarif d’entrée + (tokens de sortie ÷ 1 000 000) × tarif de sortie. Comptez les deux sens séparément, car tous les fournisseurs facturent plus ce que le modèle écrit que ce que vous envoyez. Si vous réutilisez le même début de prompt d’une requête à l’autre, vérifiez si un tarif d’entrée en cache s’applique — généralement 10 % à 50 % du tarif standard.

Pourquoi les tokens coûtent-ils de l’argent ?

Les fournisseurs facturent au token parce que le token est ce que le modèle traite réellement : chaque token de votre prompt et chaque token de la réponse consomme du calcul. Vous payez les deux sens à chaque requête, ce qui explique qu’un long document renvoyé à chaque tour d’une conversation devienne vite coûteux — les mêmes pages sont repayées chaque fois.

Comment mesure-t-on un token ?

Un token est une unité sous-lexicale issue du vocabulaire byte-pair encoding du modèle — ni un caractère, ni un mot. Les mots anglais courants font généralement un token ; les plus longs ou plus rares se découpent en plusieurs, « tokenization » devenant « token » + « ization ». La ponctuation et les espaces initiales comptent aussi. L’anglais tourne autour de 4 caractères ou 0,75 mot par token ; le français, avec ses accents et ses élisions, est un peu plus dense, et le code, le JSON, les écritures non latines et les emojis beaucoup plus, parfois un token par caractère.

Combien de tokens pour $1 ?

Un dollar d’entrée achète environ 500 000 tokens sur GPT-5.6 Terra, 5 000 000 sur GPT-5.6 Luna, 200 000 sur GPT-5.5 et 500 000 sur Claude Sonnet 5. Divisez 1 000 000 par le prix d’entrée par million pour obtenir le chiffre de n’importe quel modèle du tableau ci-dessus.

Chargement de fichiers

Quels types de fichiers puis-je charger dans le calculateur de tokens ?

PDF, DOCX, TXT, Markdown (.md), JSON, JSONL, CSV, TSV, XML, HTML, YAML et fichiers journaux en texte brut. Les PDF sont analysés avec pdf.js, les .docx décompressés et lus depuis leur WordprocessingML, et tout le reste lu en texte UTF-8. L’ancien .doc binaire n’est pas pris en charge — enregistrez-le d’abord en .docx ou en PDF.

Mes fichiers chargés restent-ils privés ?

« Charger » signifie seulement ici que votre navigateur lit le fichier sur votre disque. L’analyse PDF, la décompression .docx et la tokenisation s’exécutent en JavaScript sur votre appareil, et les vocabulaires de tokenizer sont servis par ce site, pas par un CDN tiers. Aucun contenu de fichier n’est transmis, journalisé ou stocké : vous pouvez donc vérifier sans risque des contrats confidentiels et des documents internes.

Quelle est la taille maximale d’un fichier ?

10 Mo par fichier, et les PDF sont lus jusqu’à leurs 500 premières pages. Ces deux limites protègent votre propre onglet — l’extraction est séquentielle, et garder en mémoire toutes les pages d’un très gros document le figerait. Quand un PDF est tronqué, la ligne du fichier indique combien de pages ont été lues.

Puis-je compter les tokens d’un PDF scanné ?

Pas directement. Un scan est une image de texte sans couche de texte : il n’y a rien à extraire, et le compteur indique qu’aucun texte n’a été trouvé. Passez d’abord le fichier par un OCR — la plupart des outils PDF proposent une option « reconnaître le texte » — puis chargez le PDF interrogeable obtenu.

Puis-je charger plusieurs fichiers à la fois ?

Oui. Sélectionnez ou déposez plusieurs fichiers : chacun obtient sa ligne et son propre total, tandis que les cartes de statistiques affichent le cumul. C’est ce cumul qui compte si vous prévoyez de concaténer les documents en un seul prompt.

Puis-je compter les tokens d’un document Word (.docx) ?

Oui, pour .docx et .docm. Le compteur décompresse l’archive, lit word/document.xml et parcourt ses paragraphes, tableaux et sauts de ligne dans l’ordre de lecture, en ignorant les codes de champ et les suppressions suivies. En-têtes, pieds de page et notes de bas de page se trouvent dans d’autres parties de l’archive et ne sont pas comptés.

Le compteur de tokens PDF fonctionne-t-il avec les PDF protégés par mot de passe ?

Non. Un PDF chiffré ne peut pas être analysé sans son mot de passe, et le compteur le signale comme protégé plutôt que de deviner. Ouvrez-le avec le mot de passe et réenregistrez-le, ou utilisez l’option « supprimer la sécurité » de votre outil PDF, puis chargez la copie non protégée.

Quelle est la précision du comptage ?

Exacte pour les modèles OpenAI, car le vocabulaire BPE utilisé est celui de l’API — un total de 12 431 tokens pour GPT-5.6 est bien le nombre qui vous sera facturé pour ce texte. Pour Anthropic, Google, xAI, DeepSeek et Meta, le chiffre est une estimation, marquée « est. », généralement à 10–15 % près en prose anglaise. L’extraction varie plus que la tokenisation : l’ordre de lecture d’un PDF, ses tableaux et ses colonnes déterminent quels espaces se retrouvent dans le texte — et les espaces sont tokenisés aussi.

Pourquoi le total de tokens de mon PDF est-il plus élevé que prévu ?

Le plus souvent, c’est la mise en page. Tableaux, pages multicolonnes, en-têtes répétés à chaque page et sauts de ligne forcés survivent à l’extraction, et chacun de ces retours à la ligne et espaces superflus est un token. À l’inverse, des pages scannées glissées dans un PDF par ailleurs textuel disparaissent complètement et font baisser le total. Ouvrez le panneau du texte extrait sous le compteur pour voir exactement ce qui a été tokenisé.

Faut-il un compte ou une clé API ?

Non. Aucune inscription, aucune clé API, aucune limite de débit. Les tokenizers tournent localement dans votre navigateur : il n’y a aucun service auprès duquel s’authentifier et rien à facturer.

Plutôt du texte collé ?

Le calculateur de tokens principal affiche les tokens au fil de la saisie, avec un découpage en couleurs de votre texte et une comparaison de prix côte à côte sur tous les modèles.