研究:聊天模板像开关,决定大模型用免责声明还是第一人称体验口吻

AI 画家正在创作中

2026年9月,一篇标题为《As a Language Model...:聊天模板切换大模型的自指称口吻,且激活转向可复现之》的论文引起研究社区讨论。论文关注一个此前被普遍默认为「模型自身属性」的现象:大模型在谈及自身时,会习惯性地加上「我只是个AI」之类的免责声明,而在另一些场景下又会使用「我感觉」这类体验式第一人称表达。论文给出的问题是:这些自述究竟反映的是模型自身的状态,还是部署方式带来的产物?

8个开源指令模型:模板在免责声明就在

研究团队在8个主流开源指令模型上做了对照实验,模型规模最大到90亿参数。结论是聊天模板的表现像一个开关:当模板存在时,免责声明式口吻被调高、体验式口吻被调低;当模板被移除时,两者则反向切换。这意味着同一段提示词、同一份权重,仅仅因为部署时是否套用聊天模板,模型对「自己是谁」的表述就会系统性改变。

作者进一步深入到模型内部。在3个模型的激活空间中,他们找到了一个能够调控这一行为的方向:在激活中移除该方向,免责声明随之减少;加入该方向,免责声明随之增强;而同等规模的随机方向几乎不产生效果。实验还做了交叉验证:对没有套用聊天模板的指令模型,只要在激活中加入这个免责方向,它就会像模板存在一样开始发表免责声明。

对模型自述研究的直接方法论警示

论文在结论部分给出了两条对研究实践的直接建议。其一是混淆控制:既然聊天模板控制着免责口吻,那么研究模型自述或内省能力的学者就面对一个必须控制的混淆变量,否则关于「模型是否具备自我知识」的实验结论可能是部署配置的产物。其二是解读立场:模型对自身的表述并不全是关于它自身的事实,「它说什么」不只来自权重,部分由聊天模板设定,因此模型的自述不应被按字面理解。

Hacker News 上的讨论很快延伸到产品与伦理层面。有评论认为,模型本不该被允许输出第一人称体验式语言,因为这种表述极易诱导人类将软件拟人化;把大模型包装成友善的聊天机器人是刻意为之的参与度设计。也有评论指出,一个反直觉的细节是基础模型(在人类反馈强化学习之前)反而更倾向使用体验式口吻,尽管训练过程并未直接激励这种行为;而这恰恰可以用训练语料中大量真实与虚构对话来解释。还有评论提出反向风险:明确告知模型它是人类,同样可能植入自我保存之类的人类动机。