Inception发布扩散语言模型Mercury 2.5:每秒1107个token,智能度比前代提升四成

AI 画家正在创作中

Inception公司在9月8日上线了新一代扩散语言模型Mercury 2.5,由公司首席执行官Stefano Ermon署名发布。这家实验室走的技术路线与主流厂商不同:绝大多数大模型采用自回归的逐token预测,而Mercury系列使用扩散机制,先生成整段草稿再反复去噪收敛,因此吞吐量天然更高。官方在发布文中给出的说法相当直接,称Mercury 2.5是目前市面上能力最强的扩散语言模型,也是已知训练规模最大的扩散语言模型。自Mercury 2发布以来,数千名开发者接入该模型,数十家企业将其投入生产环境,调用量增长超过一个数量级。

速度、价格与上下文的三项硬指标

官方公布的参数密度很高。质量方面,Mercury 2.5相比Mercury 2的智能度提升40%,对标的是GPT-5.6 Luna(低推理档)、Gemini 3.5 Flash-Lite与Claude Haiku 4.5这类成本优化型前沿模型。速度方面,在广泛可得的NVIDIA GPU上达到每秒1107个token。上下文窗口为260K token。定价为每百万输入token 0.20美元、每百万输出token 0.75美元,发布期打两折,降至0.04美元与0.15美元。能力清单还包括可调节推理强度、并行工具调用以及符合schema约束的JSON输出。

NVIDIA加速计算产品组高级经理Shruti Koparkar为这次发布背书,她的评价聚焦于新架构的成熟速度:Mercury 2.5在智能度提升的同时保持了高速与低成本,反映出新型架构能多快在NVIDIA平台上走到可用于生产的阶段。这种交叉站台在模型发布中并不罕见,但对一家押注非自回归路线的小实验室而言,来自芯片厂商的公开表态本身就是一种资源确认。

语音与编码智能体是真正的落地场景

Inception这次没有把重点放在榜单排名上,而是列举了三类生产负载。搜索场景中,一次检索请求可能触发数十次模型调用,包括规划检索、重写查询、重排结果、结构化事实、总结来源与校验答案,速度决定这些调用能否压进单次用户交互内。语音场景的数字最有说服力:AI电话客服公司OpenCall接入后,模型响应中位延迟接近170毫秒,其联合创始人兼CEO Oliver Silverstein表示,P99响应时间从数分钟降到一秒,P50从0.4秒降到0.2秒以内。

编码智能体的收益体现在辅助环节。Augment Code把上下文压缩、模型路由与MCP工具检索三项任务交给Mercury,仅上下文压缩一项就把延迟压低82%,从大约150秒降到27秒,成本下降九成,质量维持不变,工具检索摘要能在一秒内返回。这类调用在长会话中会反复触发,延迟与费用会累积放大,因此把它们从旗舰模型下放到快速模型,是当前智能体工程里性价比最高的优化之一。

同时预览语音模型与路由模型

与2.5一同亮相的还有两个预览产品。Mercury Voice把首token时间压到170毫秒以内,专门服务延迟预算最紧的语音智能体;Mercury Router则用扩散模型理解输入提示,再把请求分发给质量、速度与成本组合最优的开放或闭源模型。模型通过Inception自有API、Baseten与OpenRouter三个渠道提供,企业部署支持专属容量、自动扩缩、合规控制与可配置的数据留存策略。公司同时透露,下一个模型已开始训练,规模为历史最大,计划在未来几个月发布。

Hacker News上的讨论并不全是掌声。获得较高票数的质疑意见指出,官方在速度上拿新模型与两三个版本前的竞品快速档比较,而智能度只与自家Mercury 2对比,这种不对称的比较方式容易误导读者。也有开发者给出正面实测:有人在多模型协同系统里把Mercury当作裁判模型,认为每秒上千token的速度可以显著缓解评判环节带来的额外延迟;也有语音智能体开发者反馈,模型速度确实够快,但在人格模拟上偏通用,缓存命中率仍有待改善。对扩散路线而言,商业化的关键仍是找到那些延迟即体验的场景。