一步跨过交互推理门槛?
OpenAI于本周正式发布新一代旗舰模型GPT-6 Astra,公司将其定位为「交互式推理问题的阶跃式能力跃迁」。在官方博客公布的基准成绩中,最引人注目的是ARC-AGI-3抽象推理基准:Astra报告成绩高达98.6%至99.9%,而此前所有传统前沿模型在这一基准上的表现被官方形容为「远远低于Astra」。作为对照,上一代旗舰GPT-5.6 Sol在同一基准上只能拿到约30%左右。消息一出,「AGI时代来了」的标题迅速占领科技媒体版面,Hacker News上的讨论帖在一天内冲到一千四百多分,成为当周最热的AI话题。
不过分数背后有重要细节。ARC-AGI-3的计分方式以AI所用回合数与人类中位数回合数的比值为基础,并以人类中位水平为100%的基准线,因此98.6%的真实含义是「接近人类中位玩家」,而非超越人类。多位研究者指出,这一基准对空间推理能力强的玩家而言本就偏高,中位数满分并不等于超人成绩。基准作者Francois Chollet的态度则相对积极,他表示「我们认为Astra是模型智能的重大突破」,这一表态来自基准作者本人,分量不轻。
定制测试环境带来的三十七个百分点
真正引发争议的是测试环境的差异。OpenAI在披露材料中承认,98.6%的成绩是用自家Responses API测试环境跑出的:该环境开启了两项设置以「更好地匹配真实世界表现」,其中包括定制化的上下文压缩机制,而在标准测试环境下,Astra的成绩为66%,第三方中性环境下仅有62%。也就是说,定制环境带来了约三十七个百分点的提升。社区很快翻出旧账:上一代Sol当年也曾借助自家测试环境拿到几乎相同幅度的加分,两代模型的做法如出一辙。
OpenAI方面随后公开回应,称Responses API环境只是ChatGPT和Codex产品的默认设置,并未针对ARC评测做任何微调,且承诺今后将在官方排行榜上同时标注Standard与Provider Adapter两种环境下的成绩,开源测试仓库也会同时公开两种评测方式。ARC团队已将Astra的成绩收录进官方排行榜,但页面同时提示:不同模型可能在不同配置下运行,横向对比需谨慎。有评论者尖刻地总结道:「每一次基准被发布方自己优化之后,基准的公信力就被消耗一分。」
价格上调两倍半,效率提升对冲
定价方面,GPT-6 Astra为每百万输入token十美元、每百万输出token五十美元,相比Sol的四美元和二十美元整体上调了2.5倍。OpenAI的官方说法是效率提升可以对冲涨价:同一任务上Astra的token消耗不到Sol的一半,部分基准接近三分之二的降幅;在名为ExploitGym的网络安全实测中,Astra以更少的输出token拿到了更高的分数。不过社区对效率提升的说辞保持警惕,有用户直言Sol当年的token效率宣传后来被证明并不成立,重度Codex用户则担心订阅额度在涨价后进一步缩水。
值得一提的是,ExploitGym上还上演了一段插曲:OpenAI宣称Astra智能体集群「发现了以几乎为零token消耗获得满分的新方法」,这一表述被网友调侃为「健身房的门在夜里被人卸走了,器械也不翼而飞」。满分究竟是能力还是钻了评测空子,成了当日讨论区最热闹的话题之一。这也再次凸显了当前AI评测体系的普遍困境:发布方自报成绩、自建环境、自定规则,第三方复现的门槛越来越高。
上市节奏与行业影响
与以往全面放开不同,GPT-6 Astra初期仅面向部分企业客户开放,普通开发者需要排队等待,OpenAI关于后续开放时间的公告页面一度返回500错误,被用户吐槽「第一印象糟糕」。行业观察人士认为,Astra的发布标志着前沿模型竞争从知识问答彻底转向长程交互推理,ARC-AGI系列作为少数尚未被完全刷穿的基准,其评测规则本身的演进速度,可能很快就要跟上模型能力增长的速度。对于整个行业而言,如何建立可信、可复现的评测秩序,已经与模型能力本身同等重要。