研究:可从闭源大模型API窃取推理过程痕迹

研究:可从闭源大模型API窃取推理过程痕迹

研究发现可从闭源大模型API窃取推理过程痕迹

闭源API面临知识产权和安全风险

最新安全研究发现,攻击者可以通过API返回概率输出中提取闭源大模型完整推理过程痕迹,从而窃取大模型推理知识,给闭源AI公司知识产权安全风险日益凸显。这项攻击只需要调用API少量次数,不需要大量样本,就能重建模型推理过程,让闭源模型知识被窃取。

很多闭源大模型API服务商为方便开发者开发应用,通常会返回每个token输出概率,这样开发者可以做一些后续处理。但是研究显示,这些概率信息包含足够信息,攻击者可以通过概率重建原始推理过程,包括中间思考步骤。闭源模型训练得到知识可以被逆向工程提取出来。

研究人员表示,攻击者可以通过概率输出分析每个token生成过程,还原模型思考过程,逐步重建整个推理链条。最终攻击者可以把窃取知识重新训练新模型,性能几乎和原始闭源模型接近。这对闭源模型来说,意味着辛辛苦苦训练出来模型知识被轻松窃取,知识产权无法保护。

这种攻击方式成本很低,攻击者只需要调用API几百次,就能获得足够概率样本,就能训练出一个模仿原闭源模型。研究显示攻击成功率很高,针对多个主流闭源大模型都有效。目前还没有有效防范方法,因为概率输出返回API很多应用确实需要,关闭概率输出,但是关闭会影响开发者正常使用。

研究人员提出了几种可能防范方法,一种不返回完整概率分布,只返回top-k概率,减少信息泄露。另一种增加噪声概率分布添加噪声干扰攻击者分析,增加逆向工程难度。但是这些方法都会一定程度影响正常使用性能。目前还没有完美解决方案,可以同时满足开发者需求同时保护知识产权。

这项研究提醒闭源大模型API服务商需要重新考虑是否提供概率输出,平衡开发者便利性和知识产权保护之间平衡,需要找到更好防护措施,保护自己知识产权,避免被攻击知识被盗取。很多API服务商已经开始调整返回概率输出调整策略,减少返回概率信息减少信息泄露。

随着越来越多AI公司通过API提供大模型服务,安全问题知识产权保护问题将会越来越重要,如何平衡开放服务同时保护自己知识产权,将成为行业共同面临挑战。这项研究揭露了闭源API潜在安全漏洞,未来会推动服务商开发更好防护方法。

未来大模型知识保护将成为AI安全研究新方向,更多研究关注如何防止模型知识产权保护避免知识窃取技术发展。闭源模型和开源模型知识产权保护方式不同,闭源模型需要更好保护自己知识保护技术,否则辛辛苦苦训练出来模型知识被窃取成本很低,很难防止。