Generación actual
Unas 200.000 fusiones, y la codificación detrás de todos los modelos actuales de OpenAI — la familia GPT-5, GPT-4.1 y GPT-4o incluidos. Su vocabulario más amplio comprime el texto no inglés mucho mejor que su predecesor: el hindi, el chino y el japonés cuestan aproximadamente la mitad de tokens que con cl100k_base. La entrada más reciente del registro, o200k_harmony, reutiliza exactamente estos rangos y solo añade tokens de control, así que en texto plano los recuentos son idénticos.