人工智能安全公司Anthropic本周发布了其旗舰大语言模型Claude的安全对齐框架第二版,并宣布将该框架的核心组件在阿帕奇二点零许可证下开源。这一举措被视为AI行业在安全基础设施建设方面迈出的重要一步,旨在为企业级AI部署提供标准化的安全评估和对齐工具,弥补了行业在AI安全工具层面的重大空白。
Claude安全对齐框架第二版包含三个核心模块:宪法AI评估工具集、红队自动化测试平台和实时安全监控中间件。其中,宪法AI评估工具集能够自动检测模型输出中的有害内容、偏见倾向和合规风险,测试覆盖面从第一版的五十八类风险扩展到第二版的一百二十七类,新增了针对多模态模型的图像安全检测和针对代理型AI的工具调用安全审计。红队自动化平台则能够模拟数千种攻击场景,包括越狱提示注入、间接提示注入和社会工程攻击,测试效率相比手动红队提升约四十倍。实时监控中间件则提供了应用程序编程接口级别的安全防护,能够在模型返回结果之前进行实时检测和拦截,有效降低了生产环境中的安全风险。
Anthropic首席执行官达里奥阿莫迪在发布演讲中强调,AI安全不应当是任何一家企业的独有优势,而应当成为整个行业的基础设施。"当越来越多的企业开始部署AI代理,安全问题的规模已经超出了单一企业能够应对的范围。通过开源安全工具,我们希望帮助整个行业建立统一的安全底线。"他还透露,已有超过两百家企业和研究机构参与了框架的预览测试,其中包括多家大型跨国科技企业和知名学术机构。
多家科技企业对Anthropic的开源举措表示欢迎。谷歌深度思维安全研究负责人称这是"AI安全领域期待已久的突破",并表示正在评估将该框架集成到双子座模型的安全测试流程中。微软云计算人工智能部门则宣布将在云计算AI平台中集成Claude安全框架的实时监控中间件,为平台用户提供开箱即用的AI安全监控能力。梅塔公司也表态将参考该框架改进其拉玛模型的安全评估标准。这些反应显示了行业对标准化AI安全工具的迫切需求。
也有声音对开源安全框架的实际效果提出质疑。卡内基梅隆大学的AI安全研究团队指出,开源安全工具在提供透明度的同时,也可能被恶意行为者用于了解安全检测的边界条件,从而针对性地规避检测。该团队建议Anthropic在开源过程中对检测规则的细节进行一定程度的模糊化处理,以平衡透明度与安全性。行业分析师则认为,开源安全框架的长期影响取决于社区维护和持续更新的能力,只有建立起活跃的开源社区,该框架才能在快速变化的AI安全威胁面前保持有效性。