Contador de tokens por archivo

Contador de tokens PDF

Cuenta los tokens de un PDF, documento de Word, TXT, Markdown, JSON o CSV — y comprueba cuánto costará enviarlo. Esta calculadora de tokens PDF extrae el texto y lo tokeniza íntegramente en tu navegador: nada se sube y no hace falta registrarse.

Procesado en tu navegador — sin subida

Suelta un archivo PDF, DOCX, TXT, MD o JSON

o haz clic para buscarlo — varios archivos bienvenidos

PDFDOCXTXTMDJSONCSVXMLHTMLYAML
Tokens
0
Palabras
0
Caracteres
0
Coste de entrada
$0.0000
Ventana de contexto0%
0 tokens usadoslímite de 1M

Los recuentos de los modelos de OpenAI son exactos, hechos con el mismo tokenizador BPE que usa la API. Anthropic, Google, xAI, DeepSeek y Meta no publican los suyos, así que para esos modelos tu texto pasa por un tokenizador BPE de referencia y el resultado se escala al tokenizador del modelo. Por eso Claude Opus 5 y Claude Sonnet 4.6 ya no muestran la misma cifra.

Paso a paso

Cómo contar tokens en un PDF

  1. 1

    Añade tu archivo

    Arrastra un archivo PDF, DOCX, TXT, Markdown, JSON o CSV al contador de arriba, o haz clic para buscarlo. Varios archivos a la vez no son problema.

  2. 2

    El texto se extrae en tu dispositivo

    Los PDF se leen página a página con pdf.js; los archivos .docx se descomprimen y su WordprocessingML se recorre en orden de lectura. Nada se envía a ningún sitio.

  3. 3

    Elige el modelo con el que facturas

    El recuento se recalcula con el tokenizador de ese modelo — exacto en OpenAI y una estimación señalada en los proveedores que no publican el suyo.

  4. 4

    Lee el recuento, el coste y el ajuste al contexto

    Tokens, palabras, caracteres y coste de entrada, además de qué parte de la ventana de contexto del modelo ocuparía el documento.

Formatos admitidos

Todos los tipos de archivo que lee esta calculadora de tokens

Una sola herramienta para documentos, prosa y datos estructurados. La extracción cambia según el formato; el tokenizador no.

PDF

Contador de tokens PDF

La capa de texto se extrae página a página con pdf.js, hasta 500 páginas por archivo. Funciona con cualquier documento con texto real — informes, contratos, artículos, presentaciones exportadas. Los escaneos necesitan OCR primero, y el contador te avisa cuando encuentra uno.

DOCX

Contador de tokens DOC y DOCX

Un .docx es un archivo ZIP, así que el contador lo descomprime en el navegador y lee word/document.xml directamente — párrafos, tablas y saltos de línea en orden del documento, omitiendo códigos de campo y eliminaciones con control de cambios. El antiguo .doc binario hay que volver a guardarlo como .docx o PDF.

TXT

Contador de tokens TXT

El texto plano es el caso más simple: se lee como UTF-8 y se tokeniza exactamente tal como está en el disco. Útil para archivos de prompts, transcripciones, texto copiado y extractos de logs que vayas a pegar en un modelo.

MD

Contador de tokens Markdown (MD)

El Markdown se cuenta tal como está escrito, con la sintaxis incluida — porque es lo que recibe el modelo. Las almohadillas de los títulos, las viñetas, las barras de las tablas y los delimitadores de bloques de código son tokens que pagas, y por eso un README suele contar más de lo que sugiere su número de palabras.

JSON

Contador de tokens JSON

Llaves, corchetes, comillas, dos puntos y sangrías se tokenizan todos. Los datos estructurados son mucho más densos que la prosa — a menudo cerca de un token por cada dos caracteres — así que contar antes de insertar un bloque JSON en un prompt merece esos diez segundos. JSONL también es compatible.

CSV

CSV, XML, YAML y HTML

Los formatos de datos y marcado se leen como texto y se cuentan literalmente. Las etiquetas repetidas, los delimitadores y las comillas dominan el recuento, así que una exportación de hoja de cálculo puede costar varias veces lo que costarían los mismos datos en prosa.

Precios por token

Lo que cuesta un documento, modelo a modelo

Solo tarifas de entrada — la salida se factura aparte y suele costar entre tres y cinco veces más.

Precio de los tokens de entrada por modelo, incluido el coste de 1.000 tokens, 200.000 tokens y 1.000.000 de tokens, y los tokens por dólar estadounidense
ModeloPor 1 M de tokens1.000 tokens200.000 tokensTokens por $1
GPT-5.6 TerraOpenAI$2.00$0.00200$0.400500.000
GPT-5.6 LunaOpenAI$0.200$0.00020$0.0405.000.000
GPT-5.5OpenAI$5.00$0.00500$1.00200.000
Claude Sonnet 5Anthropic$2.00$0.00200$0.400500.000
Claude Haiku 4.5Anthropic$1.00$0.00100$0.2001.000.000
Gemini 3.1 ProGoogle$2.00$0.00200$0.400500.000
Gemini 3.7 FlashGoogle$0.750$0.00075$0.1501.333.333
Grok 4.6xAI$2.00$0.00200$0.400500.000
DeepSeek V4 FlashDeepSeek$0.440$0.00044$0.0882.272.727

Tokens, palabras y páginas en paralelo

Número aproximado de palabras, páginas y coste de entrada en GPT-5.6 Terra para las cantidades de tokens más habituales
Tokens≈ Palabras≈ PáginasEntrada GPT-5.6 Terra
10007501,5$0.00200
10.000750015$0.020
100.00075.000150$0.200
200.000150.000300$0.400
1.000.000750.0001500$2.00

Se asume prosa en inglés con unas 0,75 palabras por token y 500 palabras por página. El código, el JSON y las escrituras no latinas son bastante más densos.

FAQ

Preguntas frecuentes

Recuento y coste

¿Cómo puedo contar tokens?

Pasa el texto por el mismo tokenizador que usa el modelo. OpenAI publica el suyo, así que los recuentos de GPT-5.6, GPT-5.4, GPT-4.1 y GPT-4o son exactos: esta página carga el vocabulario BPE real (o200k_base) en tu navegador y cuenta con él. Anthropic, Google, xAI, DeepSeek y Meta no publican sus tokenizadores, por lo que esos recuentos son aproximaciones y se marcan como «est.». Para una comprobación rápida a mano en prosa inglesa, divide el número de caracteres entre 4.

¿Cómo contar tokens en un archivo PDF?

Un PDF hay que convertirlo de nuevo en texto antes de poder tokenizarlo. Arrastra el archivo al contador del principio de esta página: extrae la capa de texto página a página con pdf.js y tokeniza el resultado, todo en tu navegador y sin subir nada. Si el recuento sale vacío, el PDF es casi con seguridad un escaneo sin capa de texto y necesitaría OCR primero.

¿Cuánto es 1.000.000 de tokens?

Unas 750.000 palabras, o aproximadamente 1500 páginas de prosa corriente — cinco o seis novelas completas. En dinero depende por completo del modelo: 1.000.000 de tokens de entrada cuestan $2.00 en GPT-5.6 Terra, $0.200 en GPT-5.6 Luna y $5.00 en GPT-5.5. Los tokens de salida se facturan aparte y cuestan de tres a cinco veces más.

¿Cuánto es 200.000 tokens?

Unas 150.000 palabras, o aproximadamente 300 páginas — una novela completa. Durante años fue el techo habitual de la ventana de contexto, y en los modelos más pequeños lo sigue siendo; los modelos punteros actuales admiten mucho más — GPT-5.6 Terra acepta unos 1.050.000 tokens, así que un documento de ese tamaño ya no llena una petición entera por sí solo. A las tarifas de entrada de GPT-5.6 Terra cuesta $0.400.

¿Cuánto cuestan 1.000 tokens?

1.000 tokens de entrada cuestan $0.00200 en GPT-5.6 Terra, $0.00020 en GPT-5.6 Luna, $0.00200 en Claude Sonnet 5 y $0.00200 en Gemini 3.1 Pro. Los proveedores publican los precios por millón de tokens, así que divide la tarifa anunciada entre 1.000 para obtener el precio de 1.000 tokens.

¿Cómo se calcula el precio de los tokens?

Precio = (tokens de entrada ÷ 1.000.000) × tarifa de entrada + (tokens de salida ÷ 1.000.000) × tarifa de salida. Cuenta los dos sentidos por separado, porque todos los proveedores cobran más por lo que el modelo escribe que por lo que tú envías. Si reutilizas el mismo comienzo de prompt en varias peticiones, comprueba si se aplica una tarifa de entrada en caché — normalmente entre el 10 % y el 50 % de la tarifa estándar.

¿Por qué cuestan dinero los tokens?

Los proveedores facturan por token porque los tokens son lo que el modelo procesa de verdad: cada token de tu prompt y cada token de la respuesta consume cómputo. Pagas ambos sentidos en cada petición, y por eso un documento largo reenviado en cada turno de una conversación se encarece rápido — las mismas páginas se pagan otra vez cada vez.

¿Cómo se mide un token?

Un token es una unidad subléxica del vocabulario byte-pair encoding del modelo — no es un carácter ni una palabra. Las palabras inglesas comunes suelen ser un token; las más largas o raras se parten en varios, así que «tokenization» se convierte en «token» + «ization». La puntuación y los espacios iniciales también cuentan. El inglés promedia unos 4 caracteres o 0,75 palabras por token; el español, con sus tildes y palabras algo más largas, sale un poco más denso, y el código, el JSON, las escrituras no latinas y los emojis mucho más, a veces un token por carácter.

¿Cuántos tokens son $1?

Un dólar de entrada da para unos 500.000 tokens en GPT-5.6 Terra, 5.000.000 en GPT-5.6 Luna, 200.000 en GPT-5.5 y 500.000 en Claude Sonnet 5. Divide 1.000.000 entre el precio de entrada por millón para obtener la cifra de cualquier modelo de la tabla de arriba.

Subir archivos

¿Qué tipos de archivo puedo subir a la calculadora de tokens?

PDF, DOCX, TXT, Markdown (.md), JSON, JSONL, CSV, TSV, XML, HTML, YAML y archivos de log en texto plano. Los PDF se analizan con pdf.js, los .docx se descomprimen y se leen de su WordprocessingML, y todo lo demás se lee como texto UTF-8. El antiguo .doc binario no es compatible — guárdalo primero como .docx o PDF.

¿Son privados los archivos que subo?

«Subir» aquí solo significa que tu navegador lee el archivo de tu disco. El análisis del PDF, la descompresión del .docx y la tokenización se ejecutan como JavaScript en tu dispositivo, y los vocabularios del tokenizador se sirven desde este sitio, no desde un CDN de terceros. No se transmite, registra ni almacena ningún contenido, así que puedes comprobar contratos confidenciales y documentos internos sin riesgo.

¿Cuál es el archivo más grande que puedo subir?

10 MB por archivo, y de los PDF se leen sus primeras 500 páginas. Ambos límites protegen tu propia pestaña — la extracción es secuencial, y mantener en memoria todas las páginas de un documento muy grande la congelaría. Cuando un PDF se recorta, la fila del archivo indica cuántas páginas se leyeron.

¿Puedo contar tokens en un PDF escaneado?

No directamente. Un escaneo es una imagen de texto sin capa de texto, así que no hay nada que extraer y el contador informa de que no se encontró texto. Pasa primero el archivo por un OCR — casi todas las herramientas de PDF tienen la opción «reconocer texto» — y sube después el PDF con texto buscable que produce.

¿Puedo subir más de un archivo a la vez?

Sí. Selecciona o arrastra varios archivos y cada uno tendrá su fila con su propio recuento, mientras las tarjetas de estadísticas muestran el total combinado. Ese total es el que importa si piensas concatenar los documentos en un único prompt.

¿Puedo contar tokens en un documento de Word (.docx)?

Sí, en .docx y .docm. El contador descomprime el archivo, lee word/document.xml y recorre sus párrafos, tablas y saltos de línea en orden de lectura, omitiendo códigos de campo y eliminaciones con control de cambios. Los encabezados, pies de página y notas al pie están en otras partes del archivo y no se incluyen en el recuento.

¿Funciona el contador de tokens PDF con PDF protegidos con contraseña?

No. Un PDF cifrado no se puede analizar sin su contraseña, y el contador lo señala como protegido en lugar de adivinar. Ábrelo con la contraseña y vuelve a guardarlo, o usa la opción «quitar seguridad» de tu herramienta de PDF, y sube después la copia sin protección.

¿Qué precisión tiene el recuento de tokens?

Exacta en los modelos de OpenAI, porque usa el mismo vocabulario BPE que la API — un recuento de 12.431 tokens para GPT-5.6 es el número que te facturarán por ese texto. En Anthropic, Google, xAI, DeepSeek y Meta la cifra es una estimación, marcada como «est.», y suele quedar dentro del 10–15 % en prosa inglesa. La extracción varía más que la tokenización: el orden de lectura de un PDF, sus tablas y su maquetación por columnas determinan qué espacios acaban en el texto, y los espacios también se tokenizan.

¿Por qué el recuento de tokens de mi PDF es mayor de lo esperado?

Casi siempre es la maquetación. Tablas, páginas a varias columnas, encabezados repetidos en cada página y saltos de línea forzados sobreviven a la extracción, y cada uno de esos saltos y espacios sueltos es un token. En cambio, las páginas escaneadas mezcladas en un PDF por lo demás textual desaparecen del todo y empujan el recuento a la baja. Abre el panel del texto extraído bajo el contador para ver exactamente qué se tokenizó.

¿Necesito una cuenta o una clave de API?

No. No hay registro, ni clave de API, ni límite de uso. Los tokenizadores se ejecutan localmente en tu navegador, así que no hay ningún servicio en el que autenticarse ni nada que medir.

¿Prefieres contar texto pegado?

La calculadora de tokens principal muestra los tokens mientras escribes, con un desglose por colores de cómo se divide tu texto y una comparación de precios en paralelo entre todos los modelos.