OpenAI推Ultrafast模式:GPT-5.6 Sol提速14倍、最高每秒750个Token,目标直指企业客户

· 科技资讯

OpenAI 正在用”速度”重新定义前沿模型的卖点。8 月 13 日,OpenAI 推出 Ultrafast 预览模式,让旗舰模型 GPT-5.6 Sol 以 14 倍的速度运行,最高可达每秒 750 个 Token。TechCrunch 直接点破意图:这是在”讨好企业用户”。

OpenAI推Ultrafast模式:GPT-5.6 Sol提速14倍、最高每秒750个Token,封面

快意味着什么

每秒 750 Token 是什么概念?一篇 1000 字的英文报告大约 1500 Token,理论上两秒出头就能生成完;一个需要 20 轮工具调用的 Agent 任务,等待时间可以压缩到原来的零头。对企业来说,延迟就是钱——客服机器人、代码审查、批量文档处理这类场景,提速直接换算成更低的算力占用和更高的吞吐。

OpenAI 官方的说法更直白:Ultrafast 模式下,同样的活儿干得更快,硬件利用率更高。配合 Cerebras 的算力,预览版已经在部分客户手里跑起来了,后续会逐步扩容。根据 OpenAI 公布的数据,内部研究人员的日均输出 Token 数已经达到 GPT-5.5 时期的两倍以上,效率提升是实打实的。

两个容易被忽略的信号

1. API 模式改名:Fast 模式取代了原来的 Priority Processing,和 Codex 里的 `/fast` 对齐。也就是说,OpenAI 正在把”加速”从一次性功能变成产品主线,而不是临时折扣。

2. 不是降智的捷径:Ultrafast 不是简单砍推理深度换速度——GPT-5.6 Sol 本身在编程、知识工作、网络安全、科学任务上已经登顶多项榜单,这次是”又快又强”的组合拳。官方还透露,Sol 在内部用自己写的 speculator 模型做推测解码,把生成效率又抬高了 15% 以上。

对企业部署的实际影响

如果你在跑 GPT-5.6 系列,Ultrafast 意味着三件事:第一,同样的任务量,硬件成本下降;第二,用户体验提升,对话响应从”等几秒”变成”几乎即时”;第三,计费模型会变化——快版很可能比标准版贵,企业需要重新算账。建议先拿非核心业务做压测,对比标准模式的成本和吞吐,再决定是否全量切换。一个参考做法:把 20% 的流量切到 Ultrafast 跑一周,对比响应延迟、成功率、Token 消耗三个指标,用数据说话。

另外一个常被忽略的点:速度提升对 Agent 类应用的影响远大于单轮问答。一个 30 轮的工具调用任务,如果每轮省 80% 时间,总耗时可能从 10 分钟压到 2 分钟,用户体感是”从能用到好用”的质变。所以优先把 Ultrafast 用在多步 Agent 任务上,而不是简单的聊天补全。

谁该关注,谁可以忽略

企业开发者:如果你们的应用跑在 GPT-5.6 系列 API 上,建议立刻申请 Ultrafast 预览,尤其是客服、代码生成、文档处理这类高吞吐场景。

个人用户:Ultrafast 目前面向企业预览,普通 ChatGPT 用户暂时用不到,不必着急。

值得警惕的人:提速之后,OpenAI 很可能把”速度”变成定价分层的新依据——快版贵、慢版便宜,成本模型会变得更复杂。

这轮”速度战”和谷歌 Gemini 3.7 Flash 半价几乎是同一天发生,说明头部大厂已经默认:模型能力的边际差距在缩小,谁能让企业更便宜、更快地用上 AI,谁才能抢到预算。对下游开发者,这是好消息——选择更多,谈判筹码也更足了。

🔥 关注LC智趣厅,AI 圈每一条大动作都帮你拆明白。

👇 关注不错过,明天还有更多硬核解读。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅