Simon Willison 7小时前 · 2026-10-09 13:13:22 · 9 阅读
ttok 1.0 发布:适配 GPT-5/6 Tokenizer
发布
ttok 1.0
— 根据 token 统计数量并截断文本
我发布了 ttok 0.4,运行了 uv tool upgrade ttok,把一个文件传入新版本……结果发现它默认使用的竟然是 GPT-4 的 tokenizer,而实际上显然应该默认使用 GPT-5/GPT-6!
我觉得以更改默认设置为契机,正好可以正式推出 1.0 版本。
OpenAI 实际上尚未确认 GPT-6 是否使用了与 GPT-5 系列相同的 tokenizer——有一个关于此的激烈讨论 issue——但我找到了 William Liu 的这个 commit,其中报告了他所做实验的结果,证实这些 tokenizer 很可能相同:
所有七个 GPT 模型(5.5、5.6 Sol/Terra/Luna、6 Astra/Sol/Luna)均报告为 44,794 个 token,并且在全部 31 个测试文件上彼此一致。在此语料库中,GPT-6 没有引入任何输入计数的变化。
原始来源: Simon Willison