如果你曾经希望 ChatGPT 的反应能再快一点,#OpenAI 现在满足了你的愿望。这家人工智能实验室刚刚推出了一项名为 Ultrafast 的全新模式,旨在大幅提升其最新、最强大的旗舰模型 GPT-5.6 Sol 的运行速度。
官方表示,Ultrafast 的运行速度可达到标准处理速度的 14倍,每秒可提供高达 750个输出Token。OpenAI 在官方博客中表示:“在过去,想要获得实时响应速度通常意味着必须妥协去选择更小或更特定领域的模型。而 #Ultrafast 预示着一个新方向的突破:在每秒内完成更多、更有价值的工作。”
尽管 Anthropic 等竞争对手此前也推出过其模型的加速版本(例如 Claude 的快速模式),但其速度表现仍无法与 OpenAI 此次展示的极致性能相提并论。OpenAI 建议,这一高吞吐量版本的 GPT-5.6 Sol 可以广泛部署于各类企业级工作流中,特别是 事件响应、客户服务与支持、金融市场分析以及电子商务等对实时性要求极高的领域。
目前,Ultrafast 正在以预览版的形式发布,其底层技术得到了 OpenAI 与晶圆级芯片制造商 Cerebras 深度合作的支持。现阶段该预览版仅对少数特定客户开放,但 OpenAI 承诺,随着“算力容量的提升”,未来将逐步扩大这一功能的访问权限。
此次 OpenAI 联手 Cerebras 推出的 Ultrafast 模式,代表着大模型推理从“可用”向“实时智能”的范式转变。在 AI Agent 生态中,高延迟一直是阻碍多Agent协同和复杂反思工作流(Reflection Loop)落地的关键痛点。14倍的速度提升和 750 tokens/s 的极高吞吐,意味着 Agent 可以在瞬时完成复杂的内部思维链(CoT)推理和多轮工具调用,而用户端几乎无感知。横向对比 Anthropic 及 Groq 等硬件加速方案,OpenAI 通过定制化芯片架构直接赋能其最强旗舰模型 GPT-5.6 Sol,打破了“高智商必然高延迟”的传统铁律。这将极大加速具身智能、实时金融决策代理等强实时、强逻辑场景的爆发,推动 Agent 从慢思考的“离线助理”向快反应的“实时数字员工”演进。