切换工具
浏览全部工具

大模型生成速度计算器

按 tokens/s 吞吐估算生成时长与吞吐上限

生成耗时(估)
20.0 秒
每分钟产出
3,000 字/分
连续生成一小时产能
180.0 千字
体感档位
很流畅
60~100 tokens/s,多数人阅读已跟不上
常见速度参考区间(tokens/s)
旗舰 API(长思考型) 20~60
旗舰 API(标准模式) 60~150
轻量模型 API 100~500
本地 7B(4090 / llama.cpp) 60~120
本地 70B INT4(双 3090) 8~20
体感由两件事决定:TTFT(首字延迟,长提示词 Prefill 可达数秒)决定"多久开始出字",吞吐决定"出得多快"。本工具估算吞吐部分;思考型模型(o 系列等)的思考过程也计入总耗时。

使用说明

填入模型的输出速度(可参考厂商或第三方实测,常见区间:轻量模型 100~500 tokens/s、旗舰模型 20~100 tokens/s、本地小模型受显卡限制差异极大),再输入目标产出内容的中文字数,工具按 1 字 ≈ 1.2 Token 折算出总耗时与平均每千字耗时。

结果同时给出产能视角:按该速度连续生成,每小时/每天最多能产出多少千字,适合评估批量文案、数据集合成这类离线任务的工期;也给出体验视角——低于 10 tokens/s 时打字机效果会明显卡顿,30 tokens/s 以上接近人眼舒适阅读速度。

注意区分两个指标:TTFT(首 Token 延迟,决定"多久开始出字")和吞吐(tokens/s,决定"出得多快")。长提示词、推理型模型(o 系列的思考过程)与高并发限流都会显著拖慢实际体感速度。

常见问题

对聊天场景,20~30 tokens/s 以上时打字机效果已经比较流畅;60 tokens/s 接近快速打字;超过 100 tokens/s 多数人阅读速度跟不上,边际体验提升很小。低于 10 tokens/s 用户会明显感到"在等"。流式输出(SSE)+ 较低的 TTFT 比 raw 吞吐更能改善体感。

相关 AI 产品

全部产品 →

相关阅读

全部文章 →

AI 开发的其他工具