孤本网
发布于 2026-09-23 / 1 阅读
0

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

一句话结论

聊天模板会切换大语言模型(LLM)的自我指涉语气,且该效应可通过激活空间中的方向向量复现。

关键要点

  • 在八款参数量不超过9B的流行开源指令模型中,启用聊天模板会增强“我只是个AI”式的免责声明语气,同时抑制“我感到”式体验性语气;移除模板则产生相反效果。
  • 在三个模型中,研究者在激活空间内识别出一个方向向量,该向量能够控制免责声明语气。
  • 移除该方向向量可降低免责声明语气,增加该向量可增强该语气,而加入相同幅度的随机方向则影响甚微。
  • 对于未使用聊天模板的指令模型,人工加入该免责声明方向向量后,模型会表现出仿佛存在模板时的免责声明行为。
  • 研究表明模型关于自身的陈述不仅来自权重,还部分由聊天模板设定,因此不应被字面化理解。

背景与事实

该论文于2026年8月9日提交至arXiv计算机科学与机器学习(cs.LG)领域,编号为2609.25021。研究指出,大型语言模型在被询问与自身相关的问题时,常会添加诸如“我只是一个AI”的免责声明。这类自我报告常被用于AI安全或模型自我认知争论,但其驱动机制此前并不清楚:模型究竟在描述自身,还是仅反映其部署方式?

研究在八款流行的开源指令模型上进行了实验,这些模型参数量最大为9B。结果表明,聊天模板如同一个开关:当模板存在时,免责声明语气(disclaimer voice)被调高,而体验性语气(experiential voice,例如使用“我感到”等表达)被调低;当模板不存在时,情况恰好相反。

在三个模型中,研究人员在激活空间内部发现了一个能够引导此行为的方向。移除该方向会降低免责声明语气,加入该方向则会提高该语气,而随机方向若幅度相同则几乎无影响。进一步发现,当对不使用聊天模板的指令模型施加该免责声明方向后,其表现如同模板存在时一样产生免责声明。

影响分析

本文的分析判断是:对于中文开发者与从业者而言,这一结果提示在基于大语言模型的自我报告文本进行安全评估或对齐研究时,必须将聊天模板视为一个需显式控制的混淆变量。若研究者未区分模板有无条件,可能误将部署格式效应解读为模型内在属性,导致安全性或自我认知结论出现偏差。此外,发现可复现的激活方向也为干预工具提供了直接参考:在实际系统中,工程师可利用该方向对模型输出语气进行可控调节,例如在不修改权重的情况下抑制或增强特定免责声明,从而更精细地控制交互体验与合规边界。

适用边界

该结论主要基于八款参数量不超过9B的开源指令模型及其中三个模型内部的激活空间分析,因此其量化效应强度与方向向量的具体适用性可能不直接外推至更大参数规模或闭源模型。同时,研究关注的是聊天模板这一特定上下文格式化机制,其他部署变量(如系统提示词、多轮对话历史、采样参数等)是否以类似方式切换自我指涉语气,仍待进一步验证。对于非指令型基座模型或未使用标准化聊天模板的场景,该开关效应是否成立尚不明确。

孤本观察

编辑判断:这项研究的核心价值在于将“模型说自己是什么”从一个抽象的哲学或安全议题,转译为可测量、可干预的工程变量,为从业者提供了一种在不动权重的前提下精确校准自我表述语气的手段,其方法论意义可能大于单次实验结论本身。

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

研究显示聊天模板显著改变大语言模型自我指涉语气且可通过激活向量复现

常见问题

研究测试了哪些模型,并观察到了什么现象?

测试了八款参数量不超过9B的开源指令模型。启用聊天模板会增强“我只是个AI”的免责声明语气,抑制“我感到”的体验性语气;移除模板则效果相反。

如何复现聊天模板对语气的影响?

在激活空间识别出控制免责声明的方向向量。移除该向量可降低免责声明语气,增加该向量可增强语气,加入相同幅度随机方向则影响甚微。

该研究结论适用于所有大模型吗?

主要基于八款不超过9B的开源指令模型,不一定直接外推至更大参数规模或闭源模型。对非指令型基座模型或未使用标准化模板场景,开关效应是否成立尚不明确。

这对模型安全评估有什么影响?

提示在基于模型自我报告文本进行安全评估或对齐研究时,必须将聊天模板视为需显式控制的混淆变量。未区分模板有无条件,可能误将部署格式效应解读为模型内在属性,导致结论偏差。

工程师如何利用该发现调节模型语气?

可利用复现的激活方向向量干预模型输出语气,在不修改权重的情况下抑制或增强特定免责声明,从而更精细地控制交互体验与合规边界。

来源:arXiv cs.LG