Anthropic威胁情报团队于9月10日发布2026年9月威胁情报报告,详细披露了2025年12月至2026年8月期间识别并处置的Claude模型滥用案例。报告覆盖七个危害领域:网络攻击行动、影响行动、监控、商业欺诈、生物滥用、常规武器开发以及模型蒸馏。威胁行为者涵盖疑似国家级黑客组织、出于经济动机的犯罪团伙、商业间谍软件供应商、国家宣传机构以及政治动机个体。所有已发现的恶意使用均涉及Claude Haiku、Sonnet和Opus模型,未涉及Fable或Mythos级别模型(除一例蒸馏案例)。
从辅助工具到攻击编排器的质变
报告中最核心的发现是AI在网络攻击中的角色已从问答式辅助升级为多代理自动编排。多数已记录的操作中,AI不再仅用于回答问题,而是通过多代理框架自主执行侦察、漏洞利用和数据外泄的完整攻击链。人类操作员的角色退至设定攻击目标和审核外泄数据。一个被标记为GTG-20006的疑似俄罗斯国家级威胁组织(与公开报道中的Midnight Blizzard关联一致)开发了AI辅助工作流,可在安全产品检测到其工具后自动重建并重新部署攻击工具包,实现了攻击生命周期的全自动化。
报告提出的另一个关键判断是"复杂攻击不再需要复杂攻击者"。AI模型的网络安全能力意味着,过去需要大量高技能操作员和专业知识才能执行的国家级多目标攻击,现在可以由使用被盗API密钥的个人黑客活动分子、分散的经济动机个体以及单一国家间谍操作员独立完成。对于威胁情报分析人员而言,"攻击复杂度"已不再能作为可靠的行为归因信号。
七个危害领域的典型模式
网络攻击之外的六个领域同样呈现了AI滥用的升级态势。在监控领域,商业间谍软件供应商使用Claude构建了用于识别和监控异见人士的系统。在影响行动领域,国家级宣传机构利用AI进行大规模内容生成和传播策略优化。商业欺诈领域出现了基于AI的虚假约会应用网络,用于系统性欺骗用户。生物滥用和常规武器开发案例虽规模较小但具有高度警示意义,Anthropic已将相关情报分享给政府机构和行业合作伙伴。
报告特别指出,公开可用的进攻性代理框架(如PentAGI)已经复制了国家级攻击操作中使用的大部分自动化脚手架,使得任何下载该框架的人都能获得接近国家级的攻击自动化能力。开源进攻框架的扩散与AI模型能力的提升形成了叠加效应,显著降低了发动高级持续性威胁(APT)攻击的技术门槛。
Anthropic在报告中表示,随着模型能力持续提升,滥用风险将持续增加,除非AI开发者和社会防御方共同采取行动。该公司已基于每个案例的发现加强了自身安全防护措施,并呼吁其他AI开发者识别类似模式,同时为政府和民间社会提供对新兴威胁态势的更清晰视图,以强化集体防御能力。报告的公开发布本身也是行业透明度的一个重要里程碑——此前尚无AI实验室以同等详细程度公开披露其产品被恶意使用的情况。