哈萨比斯提出分层验证加国际协作的AI安全治理方案
谷歌旗下人工智能实验室负责人哈萨比斯公开阐述了他对人工智能安全治理的完整构想。核心主张是通过分层能力评估、可验证的安全测试以及跨国协作机制,在继续推进前沿模型能力的同时把风险控制在可接受范围。这套方案直接回应了业界对通用人工智能可能失控的持续担忧。
哈萨比斯的出发点与部分主张彻底暂停研发的声音明显不同。他认为人工智能带来的科学突破潜力过于巨大,从新药研发到材料科学再到气候建模,完全停下来的代价难以承受。他的立场是继续推进但必须建立与能力增长同步的安全保障体系,而不是在能力和安全之间二选一。
分层能力评估是这套方案的技术核心。哈萨比斯提议为前沿模型建立类似生物安全等级的分级制度,根据模型在特定高风险领域的能力设定不同的部署门槛。一个在网络攻击或生物武器设计上表现出危险能力的模型,即便整体智能水平不高,也应当受到最严格的管控。
可验证的安全测试是另一个支柱。哈萨比斯强调,安全不能只靠开发公司的自我声明,需要建立独立的第三方评估机构,用标准化的红队测试和能力探测来验证模型的实际风险水平。这一主张实际上是在呼吁行业接受外部监督,放弃部分商业上的不透明。
国际协作机制则是方案中最难落地的部分。哈萨比斯承认,如果只有部分国家和公司遵守安全规范,而其他玩家继续无约束推进,整体风险并不会下降。他呼吁建立类似核不扩散框架的国际协调机制,但也坦承在当前地缘政治格局下,达成这类共识的难度极高。
这套方案在业界引发了不同反应。支持者认为哈萨比斯提供了一条兼顾发展与安全的务实路径,比单纯的加速或减速主张更具操作性。批评者则指出,分层评估和第三方验证在技术上仍然缺乏成熟的实现方法,当前的评测手段难以可靠地预测模型的真实风险边界。
值得注意的是哈萨比斯本人的双重身份。作为前沿实验室的负责人,他既是安全治理的倡导者,也是能力竞赛的主要参与者之一。这种身份让他的方案天然带有平衡商业利益的色彩,如何在推进自家模型和呼吁行业约束之间保持一致,是外界持续审视的焦点。
无论方案能否落地,哈萨比斯的公开表态本身就反映了前沿人工智能公司高管对安全议题态度的转变。当行业领军人物开始系统性地讨论治理框架,说明技术风险已经从抽象担忧变成需要具体应对的现实问题。