Sobre esta herramientaContar tokens de imagen: qué se factura realmente
Toda petición de visión se mide en tokens, pero una imagen no es texto y no existe ningún
tokenizador por el que pasarla. En su lugar, cada proveedor convierte píxeles en un recuento de
tokens con su propia fórmula publicada, y esas fórmulas difieren lo bastante como para que la
misma fotografía cueste cuatro veces más en una API que en otra.
Por qué una imagen cuesta tokens
Un modelo de lenguaje no puede leer una imagen directamente. Antes de llegar al modelo, la
imagen se divide en regiones, cada región se codifica como un vector y esos vectores entran
en la ventana de contexto ocupando los mismos huecos que ocuparían los tokens de texto. Por
eso las imágenes se facturan en tokens: ocupan contexto de verdad y consumen el mismo
cómputo por unidad que las palabras.
Lo que cambia respecto al texto es cómo se obtiene la cifra. Una frase pasa por un
tokenizador de codificación por pares de bytes, así que su recuento puede calcularlo con
exactitud cualquiera que tenga el archivo de vocabulario. El recuento de una imagen sale de
una operación aritmética sobre sus dimensiones y de nada más. El tamaño del archivo es
irrelevante, igual que el formato, la profundidad de color y lo comprimido que esté el
JPEG. Una captura de 40 KB y un PNG de 12 MB con dimensiones idénticas cuestan exactamente
lo mismo. Es lo más útil que se puede saber sobre la facturación de imágenes, porque
significa que la única palanca que tienes es la resolución.
OpenAI, ChatGPT y Azure OpenAI
OpenAI usa dos métodos, y cuál se aplica depende de la generación del modelo, no de nada
que tú controles. La familia GPT-5.x cuenta
parches: la imagen se divide en una
cuadrícula de cuadrados de 32×32 píxeles y cada cuadrado cuesta
un token, hasta un tope estricto de 1536 parches. Una imagen de
1024×1024 son 1024 tokens en
GPT-5.6 Terra — $0.00205 de entrada, o
$2.05 por mil de ellas.
El tope es lo que hace indulgente al método de parches en el extremo alto. Una captura
1080p y una captura 4K facturan las dos 1536 tokens,
porque el fotograma 4K se reduce al presupuesto de parches antes de contarse. Enviar el
archivo más grande no te aporta nada y tampoco te cuesta nada.
GPT-4o y GPT-4.1 son anteriores a los parches y usan
mosaicos: un cargo base de
85 tokens más 170 por cada mosaico de
512px tras dos pasadas de redimensionado. La misma imagen cuadrada son allí
765 tokens. Son además los únicos modelos de OpenAI que leen el
parámetro detail: ponerlo en low fija el cargo en
85 tokens por grande que sea la imagen, lo que supone una optimización
real cuando solo necesitas la idea general. En los modelos GPT-5.x el parámetro se acepta y
se ignora, y por eso el contador de arriba atenúa el control y explica el motivo.
Si llamas a través de Azure OpenAI, usa la
fila de OpenAI correspondiente. Azure aloja los mismos modelos con la misma contabilidad de
imágenes, así que una calculadora de tokens de imagen para Azure OpenAI y una para OpenAI
devuelven la misma cifra; lo único que puede variar es tu tarifa contratada. ChatGPT en sí
no se factura por token en un plan de consumidor, pero el modelo que hay detrás cuenta las
imágenes exactamente igual que la API, y eso es lo que hace útiles estas cifras para
estimar cuánto costará construir una función al estilo de ChatGPT.
Gemini cuenta mosaicos, y no se detiene
El método de Google tiene dos ramas. Una imagen que mide 384px o menos
en ambos lados es una única unidad de tarifa plana de 258
tokens. Todo lo mayor se divide en mosaicos de 768px, cada uno también de
258 tokens.
La consecuencia merece planificarse: Gemini no aplica
ningún techo. Donde OpenAI corta en 1536 parches y Anthropic
en unos 1534 tokens, Gemini sigue sumando mosaicos mientras tú
sigas sumando píxeles. Una imagen de 1024×1024 son unos competitivos
1032 tokens; una foto de
3024×4032 recién salida del móvil son
6192, frente a
1452 en GPT-5.6 Terra y
1534 en Claude Sonnet 5. Gemini pasa de ser la opción
más barata a la más cara únicamente por la resolución que le has entregado.
La otra cara es que Gemini resulta imbatible con imágenes pequeñas. A
256×256, Gemini 3.7 Flash cuesta
$0.00019 por imagen, y la tarifa plana cubre todo hasta
768px en ambos lados: una cadena de miniaturas que redimensione a
768px o menos paga un mosaico, una sola vez.
Claude divide los píxeles entre 750
Anthropic se salta las cuadrículas por completo: los tokens son el área total de píxeles
dividida entre 750. Antes se aplican dos límites —el lado largo se
reduce a 1568px y después el área total a unos
1.150.000 píxeles— y es el límite de área, no el del lado, el que
produce el techo efectivo de Claude de unos 1534 tokens por
imagen.
Como la fórmula es puramente geométrica, todos los niveles de Claude informan del mismo
recuento. Una imagen de 1024×1024 son
1399 tokens tanto en Opus como en Sonnet y Haiku: los
modelos solo se diferencian en lo que cuesta un token. Eso vuelve inusualmente limpia la
elección de nivel para trabajar con visión — la misma imagen cuesta
$0.00700 en Claude Opus 5 y
$0.00140 en Claude Haiku 4.5, una diferencia
de cinco veces sin que cambie cuánto de la imagen recibe el modelo.
Cómo gastar menos en imágenes
Redimensiona antes de enviar. Como solo
cuentan las dimensiones, reducir la escala es toda la optimización. En los métodos con tope
puedes descartar sin miedo todo lo que sobrepase el límite: el proveedor lo va a reducir de
todas formas, y hacerlo tú además ahorra tiempo de subida. En Gemini, donde nada tiene
tope, redimensionar es la diferencia entre
6192 tokens y
1032.
Ajusta la resolución a la tarea. Leer texto
denso en una captura necesita píxeles. Decidir si una foto muestra un gato, no. En GPT-4o y
GPT-4.1, detail: low lo resuelve con 85 tokens fijos; en
los demás modelos, redimensionar a 512×512 consigue lo mismo.
Cuenta la conversación, no la petición. Una
imagen permanece en la ventana de contexto tanto como dure el hilo, y la mayoría de las
implementaciones de chat reenvían todo el historial en cada turno. Una imagen que cuesta
$0.00205 una vez cuesta
$0.041 a lo largo de veinte turnos, antes de contar
una sola palabra de texto. Comprueba si a tu prefijo le corresponde una tarifa de entrada
en caché: suele ser una fracción de la tarifa estándar.
Qué precisión tienen estas cifras
Los recuentos de tokens de imagen son más fiables que las estimaciones de texto para los
modelos con tokenizador privado, porque las fórmulas de aquí son aritmética publicada y no
una reconstrucción. Dale al método de mosaicos de OpenAI una imagen de
512×512 y devuelve 255 tokens, que es la cifra
de la propia documentación de OpenAI; 1024×1024 devuelve
765, igualmente.
Dos advertencias. Los proveedores cambian estas fórmulas sin mucho aviso, así que las
cifras van fechadas según cuándo se comprobaron por última vez contra la documentación
original. Y el recuento de la imagen no es la petición completa: el texto de tu prompt, el
mensaje de sistema y la respuesta del modelo se facturan aparte. Para documentos usa el
contador de tokens de archivos y para
prompts la calculadora de texto; esta página cubre los píxeles.