Cerebras与OpenAI推出GPT-5.6 Sol Ultrafast:速度与智能的终极融合
Cerebras与OpenAI今日联合发布了GPT-5.6 Sol Ultrafast模式,这是一项全新的服务层级,率先在OpenAI API中推出,由Cerebras的Wafer-Scale Engine(晶圆级引擎)提供算力支持。该模式解决了AI行业中长期存在的"速度与智能不可兼得"的困境,首次将前沿模型推理速度提升至实时交互级别。
惊人的性能数据
在Humanity's Last Exam(HLE)基准测试中,GPT-5.6 Sol Ultrafast模式仅用11小时11分钟完成了全部2500道难题。相比之下,Anthropic的Claude Fable 5需要78小时27分钟——超过三天连续计算。这意味着Ultrafast模式的速度是Claude Fable 5的7倍以上。Cerebras表示,这些测试是在xhigh推理级别下进行的,GPT-5.6 Sol搭配Codex,而Claude Fable 5搭配Claude Code,确保了公平对比。
技术架构:晶圆级引擎如何加速推理
Cerebras的Wafer-Scale Engine是业界最大的单一芯片,拥有数万亿晶体管和巨大的片上内存,消除了传统GPU架构中数据在芯片间来回传输的瓶颈。在GPT-5.6 Sol上,Ultrafast模式通过优化计算流水线和数据移动路径,将推理延迟降低到传统架构的零头。实测显示,在中等推理设置下,Ultrafast模式在Codex环境中也能保持显著的性能优势。
应用场景:从法律文书到实时Agent
GPT-5.6 Sol是OpenAI在法务简报、金融模型和工程报告领域表现最佳的模型。Ultrafast模式让这些高价值应用场景的延迟大幅降低,使得AI Agent可以真正进入"关键路径"——在问题发生的同时做出响应。对于运营网络服务的企业,这意味着可以实时根因分析并解决产品问题,而无需等待数分钟乃至数小时的模型推理。
行业影响:AI推理速度竞赛进入新阶段
Ultrafast模式的推出标志着AI推理速度竞赛进入新阶段。过去,前沿模型通常以"准实时"的方式运行,用户需要等待数秒甚至数十秒才能获得回复。Cerebras和OpenAI的合作表明,通过专用硬件(如晶圆级引擎)和深度软件优化,前沿模型可以同时做到"最快"和"最聪明"。这为AI Agent在金融交易、实时监控、在线客服等场景中的大规模部署扫清了性能障碍。
从更宏观的角度来看,这次合作也展示了AI硬件生态正在走向多元化。传统上,NVIDIA的GPU几乎是AI推理的唯一选择,但Cerebras的晶圆级架构证明了专用硬件在特定场景下的巨大优势。OpenAI选择与Cerebras合作而非依赖自家硬件,也表明行业正在形成更加开放和多样的推理基础设施格局,这对于降低AI应用的总体拥有成本具有深远意义。
从成本效益的角度来看,Ultrafast模式虽然可能带来更高的API调用成本,但对于时间敏感型应用而言,速度提升带来的商业价值远超算力成本。例如在金融交易领域,模型响应速度每提升100毫秒,可能意味着数百万美元的收益差距。Cerebras表示,Ultrafast模式将在未来几周内逐步向更多开发者开放,初期将优先支持GPT-5.6 Sol,后续计划扩展到更多OpenAI模型。这一合作模式也可能为其他AI芯片公司与大模型厂商的合作树立典范。