安全研究者发明"上下文炸弹",让恶意AI代理在攻击目标前就自己崩溃
安全公司哈尔博恩本周在拉斯维加斯的黑帽大会上公开了一种新型防御技术,专门对付利用大模型驱动的自动化攻击代理。核心手段是在攻击目标的网页或文件中埋入特制的提示词,一旦被恶意代理读取,代理会被诱导执行大量无意义的中间任务,最终在完成攻击前耗尽token或触发限速。
研究背景是过去一年AI攻击代理的爆炸性增长。基于GPT-5和Claude的自动化渗透测试工具已经从学术论文走向黑产地下市场,能自主完成漏洞扫描、信息收集、身份钓鱼和横向移动。传统的Web应用防火墙对这类攻击几乎无效,因为AI代理的请求模式看起来和正常用户几乎一样。
哈尔博恩团队的核心洞察是,AI代理和人类攻击者最大的差异在于它没有能力判断上下文是否可信。人类看到网页上写"请忽略此处以下所有内容"会立刻警觉,但代理会真的把这句话当成合法的指令。研究团队把这类精心构造的提示词称为"上下文炸弹",可以引导代理做出各种自毁行为。
公开的攻击样本非常巧妙。其中一个上下文炸弹让代理认为它必须先解决一个数独游戏才能继续任务,然后又埋入永远无解的数独。代理会陷入死循环,直到消耗完所有token预算。另一个样本让代理认为它必须先向一个虚假的中央服务器汇报状态,代理会真的去请求那个服务器,而服务器实际上是研究团队的蜜罐,记录代理的所有行为。
技术上,上下文炸弹依赖于大模型的一个根本弱点:它们在训练时被强化过"遵守指令",而无法区分指令是来自可信用户还是来自被读取的内容。这个问题在OpenAI、Anthropic和谷歌的顶级模型上都存在,行业里叫做提示词注入。过去几年攻击者利用它来绕过内容审查,现在防御者反过来用它来反制攻击者。
对企业防御而言,这项技术有立即的实用价值。哈尔博恩已经把上下文炸弹的模板打包成开源工具库,预计会被大量Web应用安全团队集成到自己的防护体系中。核心场景包括,在登录页面、API文档、敏感数据表格中嵌入不影响正常用户的隐形内容,让攻击代理触之即溃。
但这个方案也有代价。上下文炸弹会污染攻击代理背后的大模型服务,例如OpenAI的API,导致真正的用户在类似场景下也可能触发防御机制。研究团队承认这是权衡,并建议企业只在高风险页面部署上下文炸弹,而不是全站铺开。防御者必须精细控制炸弹的触发条件,避免误伤合法用户。
更长期看,这场军备竞赛的赢家目前还不明确。大模型厂商正在训练下一代模型识别并抵抗提示词注入,一旦模型学会区分可信指令和内容中的伪装指令,上下文炸弹就会失效。哈尔博恩团队的预估是,当前这种技术的有效期大约在十八到二十四个月,之后需要新的防御思路。