Aktuelle Generation
Rund 200.000 Merges und das Encoding hinter jedem aktuellen OpenAI-Modell — einschließlich der GPT-5-Familie, GPT-4.1 und GPT-4o. Das größere Vokabular komprimiert nicht-englische Texte deutlich besser als sein Vorgänger: Hindi, Chinesisch und Japanisch kosten etwa halb so viele Tokens wie unter cl100k_base. Der neueste Eintrag im Verzeichnis, o200k_harmony, übernimmt genau diese Ranks und ergänzt lediglich Steuertokens — bei reinem Text sind die Werte identisch.