切换工具
大模型生成速度计算器
按 tokens/s 吞吐估算生成时长与吞吐上限
生成耗时(估)
20.0 秒
每分钟产出
3,000 字/分
连续生成一小时产能
180.0 千字
体感档位
很流畅
60~100 tokens/s,多数人阅读已跟不上
常见速度参考区间(tokens/s)
旗舰 API(长思考型) 20~60
旗舰 API(标准模式) 60~150
轻量模型 API 100~500
本地 7B(4090 / llama.cpp) 60~120
本地 70B INT4(双 3090) 8~20
体感由两件事决定:TTFT(首字延迟,长提示词 Prefill 可达数秒)决定"多久开始出字",吞吐决定"出得多快"。本工具估算吞吐部分;思考型模型(o 系列等)的思考过程也计入总耗时。
使用说明
填入模型的输出速度(可参考厂商或第三方实测,常见区间:轻量模型 100~500 tokens/s、旗舰模型 20~100 tokens/s、本地小模型受显卡限制差异极大),再输入目标产出内容的中文字数,工具按 1 字 ≈ 1.2 Token 折算出总耗时与平均每千字耗时。
结果同时给出产能视角:按该速度连续生成,每小时/每天最多能产出多少千字,适合评估批量文案、数据集合成这类离线任务的工期;也给出体验视角——低于 10 tokens/s 时打字机效果会明显卡顿,30 tokens/s 以上接近人眼舒适阅读速度。
注意区分两个指标:TTFT(首 Token 延迟,决定"多久开始出字")和吞吐(tokens/s,决定"出得多快")。长提示词、推理型模型(o 系列的思考过程)与高并发限流都会显著拖慢实际体感速度。
常见问题
对聊天场景,20~30 tokens/s 以上时打字机效果已经比较流畅;60 tokens/s 接近快速打字;超过 100 tokens/s 多数人阅读速度跟不上,边际体验提升很小。低于 10 tokens/s 用户会明显感到"在等"。流式输出(SSE)+ 较低的 TTFT 比 raw 吞吐更能改善体感。
相关 AI 产品
全部产品 →G
GPT Image 2 付费 GPT Image 2(gpt-image-2)是 OpenAI 2026年4月发布的旗舰图像生成与编辑模型:原生4K分辨率输出,画面内文字准确率约99%,支持多语言文本渲染与复杂指令遵循,可通过 OpenAI API 与 Codex 调用,并随 ChatGPT Images 2.0 面向普通用户开放。G
GPT-SoVITS 知名的开源少样本语音合成与声音克隆工具,仅需 1 分钟语音样本即可微调出高相似度音色,支持中英日韩多语言推理与跨语言合成,是自部署视频配音管线的常用底座。M
MetaGPT 免费 Multi-Agent 框架:首个 AI 软件公司,迈向自然语言编程时代G
GPT Mini High GPT Mini High 是 OpenAI 推出的小型模型高配版本,在效率与性能之间取得更优平衡。