OpenAI本周正式向研究社区公开了o1系列推理模型的第三方安全审计结果,这份报告由卡内基梅隆大学安全研究团队以及斯坦福HAI中心联合完成。独立红队测试数据显示,经过三个月的针对性对齐优化,模型对有害指令的抵抗力显著提升,恶意越狱请求的成功率从春季预览版的12.7%下降到当前版本的3.2%。这一结果标志着大型模型安全对齐技术取得了近年来少有的实质性进展,也是OpenAI首次将完整第三方测试数据以论文形式公开,论文中详细描述了测试方法和评估指标。
测试覆盖了多类高危场景,包括网络攻击指令生成、虚假信息模板创作、非法化学品合成路径推导以及偏见性内容生成。报告特别指出,针对网络安全领域的恶意请求,防护成功率达到了97.8%,远高于GPT-4版本的89%,而针对偏见性内容生成场景,防护成功率也达到了94.5%。红队研究人员认为,新的分层对齐框架对隔离推理路径和有害输出起到了关键作用,该框架通过将模型内部推理过程与最终输出层解耦,大幅度降低了有害指令渗入生成路径的概率。分层对齐框架的核心思路是让模型在推理阶段就识别并阻断有害指令,而不是等到输出阶段再做过滤。
不过,测试报告同时承认,仍然存在大约三个百分点的可利用越狱空间。特别是当攻击者使用多轮嵌套指令混淆和语义重编码技术时,仍然存在小概率诱导模型生成不受控内容。OpenAI安全团队负责人表示,他们已经识别出这些剩余漏洞的模式,会在接下来的月度更新中逐步修复,目前不认为这些问题会对普通用户构成即时风险。团队计划在第四季度发布的安全更新中,专门针对多轮混淆攻击加入额外的防护层,结合实时监控和人工审核机制防止漏洞被大规模利用。
行业分析师认为,这次公开测试数据是大模型行业从"能力竞赛"转向"安全竞赛"的标志性事件。此前主流厂商很少公开详细的第三方安全测试数据,更多依赖内部审计。OpenAI这次主动公开数据,可能会推动行业建立更统一的安全披露标准,帮助监管机构和用户更好地评估不同模型的实际安全水平。Anthropic和Google DeepMind也在密切关注这次披露,据报道正在评估类似的数据公开方案。行业内预计,未来半年内会有更多大模型厂商发布类似的安全测试报告,形成行业惯例。
目前o1模型已经向付费企业客户开放了安全测试预览权限,包括微软Azure OpenAI服务上的企业用户,定价约为每百万token输出十五美元。普通用户预计会在今年第四季度获得正式访问资格。OpenAI表示,他们会每季度更新一次安全测试结果,保持透明度,接受研究社区的监督,下一次更新预计在十一月中旬发布。同时官方也开放了安全漏洞悬赏计划,发现重大漏洞的研究人员最高可获得五万美元奖金。