Génération actuelle
Environ 200 000 fusions, et l’encodage derrière tous les modèles OpenAI actuels — la famille GPT-5, GPT-4.1 et GPT-4o compris. Son vocabulaire plus large compresse bien mieux le texte non anglais que son prédécesseur : le hindi, le chinois et le japonais coûtent à peu près la moitié des tokens qu’ils coûtaient sous cl100k_base. La dernière entrée du registre, o200k_harmony, réutilise exactement ces rangs et n’ajoute que des tokens de contrôle : pour du texte brut, les décomptes sont identiques.