Qwen 3.8 27B登陆Cerebras:每秒1500 token刷新开源模型推理速度纪录

Qwen 3.8 27B登陆Cerebras:每秒1500 token刷新开源模型推理速度纪录

每秒1500 token意味着什么

Cerebras本周宣布其推理云平台正式上线阿里系开源模型Qwen 3.8 27B,输出速度达到每秒1500 token。这个数字是OpenRouter平台上Qwen 3.8最快供应商(约80 token每秒)的近二十倍,也让「开源模型跑出旗舰速度」从口号变成了现实。有开发者在试玩后形容:「屏幕上的文字不是逐字蹦出来的,而是一整段一整段地闪现,你必须重新适应一种阅读节奏。」对于编程智能体等需要高频往返调用的场景,这种速度提升可以直接改写产品体验。

晶圆级芯片的硬实力

这一速度背后是Cerebras独特的晶圆级引擎架构。与传统GPU集群不同,Cerebras把整片晶圆做成一颗巨大的芯片,单片集成44GB的SRAM,模型参数全部驻留片上,从而消除了显存带宽这个传统瓶颈。社区中有人追问为何不托管更大的模型,技术讨论给出了答案:单晶圆的SRAM容量决定了模型规模上限,更大的模型(比如Cerebras为OpenAI特别加速的GPT-5.6 Sol版本)需要多晶圆流水线方案,层间数据交换的开销会明显拉低速度优势。这也解释了为什么27B是这个公开端点上「他们托管过的最强模型」。

定价与上下文的争议

速度惊艳,账单却让部分用户冷静下来。Cerebras对Qwen 3.8 27B的定价为每百万输入token一美元、输出1.5美元,而OpenRouter上最便宜的供应商输入只要0.24美元。重度智能体用户算了一笔账:智能体编程场景下输入token占据成本大头,每次工具调用都要重发整个上下文,若没有缓存折扣,Cerebras的实际开销可能是OpenRouter的十五倍左右。好消息是Cerebras支持提示缓存且不加价,缓存命中与否都按标准输入价计费,这种不收额外费用的策略在业内算是少见的诚意,部分对冲了单价劣势。

另一个槽点是上下文窗口。Cerebras目前为Qwen 3.8 27B只开放了128k上下文,而有用户实测该模型在本地环境中可以一次性处理25万token的任务并交出高质量结果,「这甚至不够某些一次性任务的体量」。也有用户指出Qwen 3.8尚未登陆OpenRouter的Cerebras节点,希望官方尽快接入以方便统一计费。对此Cerebras方面暂无明确回应,但社区普遍预期接入只是时间问题。

27B尺寸的黄金分割点

社区讨论中一个反复出现的观点是:27B可能正是速度与智能之间的最佳平衡点。有资深用户评价:「27B其实相当聪明,激活参数量与各家flash级模型相当甚至更多,推理能力很好,只是知识储备不足,配合一个本地检索索引,它能做的远超预期。」这也让「小模型加大数据库」的组合被重新审视:与其堆参数,不如给一个足够快的模型配上足够的知识。此前Cerebras的PayGo计划中,Gemma4 31B被Qwen 3.8取代,侧面印证了27B在真实负载中的竞争力。

生态位之争才刚开始

有趣的是,竞争对手的反应也很快。有新兴供应商在讨论帖中直接打广告:用投机解码技术搭配代码专精的DFlash2草稿模型,在H200集群上跑到每秒150到200 token,编程场景可突破300 token每秒。本地部署阵营同样不甘示弱:有用户在RTX 5090上用开源推理框架跑到约200 token每秒,并发场景超过400。1500 token每秒的纪录还能保持多久尚无定论,但可以确定的是,推理速度正在成为模型能力之外的第二战场,对于把智能体编排做得越来越重的开发者生态而言,这是最实在的福利。