一句话结论
论文证明仅靠余弦相似度无法证明量化模型的可解释性特征保留,必须报告采样噪声底数才能给出可靠结论。
关键要点
- 对于均值差方向估计量,半数分割噪声底由无量纲参数 κ = nρ²/d 唯一决定,期望余弦相似度的闭式解为 E[cos] ≈ (1+4/κ)⁻¹。
- 在 Qwen2.5-1.5B-Instruct 真实激活上测得类间隔 ρ = 33–61,跨深度分布,两个独立运行仅靠采样即可吻合到 0.978–0.994。
- 已知全精度与量化拒绝方向间余弦值为 0.996 的已发表结果,因未报告其计算的 n 值,无法直接解读为特征保留。
- 在 INT4 量化下方向发生旋转且偏移量超过估计器自身噪声;在 INT8 下未检测到移动,但这不等于等价性声明。
- 尺度不变统计量无法区分转移决策变量的平移与衰减,而这两者需要相反的修复方案。
背景与事实
该论文提交于 2026 年 8 月 12 日,归入计算机科学机器学习分类,核心论点是:一个未附带必要解释量的统计量不构成证据。作者将该主张落实到 AI 安全的具体实践中,即可以解释性工件在全精度权重上标定、在量化权重上部署、并用尺度不变统计量(余弦相似度、相关性、AUROC)证明其穿越该变化后的存续性,而这些统计量在报告时未附噪声底。
对于均值差方向估计量,作者建立了一个关键量化关系:其半数分割噪声底由单一无量纲数 κ = nρ²/d 支配。闭式期望余弦 E[cos] ≈ (1+4/κ)⁻¹ 属经典结果,但缺失的输入——类间隔 ρ——此前没有任何压缩传输研究在真实激活上报告过。本文首次通过实测补上了这一环,在 Qwen2.5-1.5B-Instruct 模型上测得 ρ 在跨深度范围内为 33 至 61。这一实测意味着两个独立运行的估计器仅靠采样方差即可达到 0.978 至 0.994 的一致度。
基于该噪声底,作者重新审视了已发表数据中全精度与量化拒绝方向之间 0.996 的余弦相似度。由于原研究未报告该余弦所基于的样本量 n,无法判断 0.996 是否超出噪声范围,因而不能直接解读为方向保留。当 n 已知时,作者主张应以量化模型内部的半数分割零假设来评判每个低比特余弦值,而非沿用全精度零假设。这一做法的核心理由是:全精度零假设隐含了低比特估计器具有相同方差,而该假设恰恰是零假设本应检验的内容。
最终结论在两个量化层级间呈鲜明反差。在 INT4 下,方向确实发生了旋转,且其偏移幅度超过估计器自身噪声,表明可解释性特征未完整保留;在 INT8 下,未检测到显著移动,但作者明确强调这是“未检测到”而非“等价”声明。此外,论文还展示了一个理论局限:尺度不变统计量无法区分转移决策变量的平移与衰减,而这两种失效模式需要截然相反的修复路径。作者据此给出了仅需一次前向传播的报告建议,并发布了代码、数据与单格复现材料。
影响分析
本文对中文 AI 安全与模型部署从业者有直接的方法论影响。当前大量量化部署实践沿用“量化前后余弦相似度大于 0.99 即视为特征保留”的粗糙判据,本文证明该判据在未报告样本量与类间隔的情况下不具判别力。团队在发布可解释性审计结果时,必须同时给出 n、ρ 或 κ 值,并附上半数分割零假设,否则其结论在统计上不可信。
对使用 INT4 等极低比特宽部署场景的工程团队而言,本文提供了可操作的检测门槛:若实测余弦低于由 κ 决定的噪声底,则方向已实质改变,不能以“全精度与量化模型余弦高达 0.996”作为存续证明。这要求量化部署流水线在上线前增加一次前向传播即可完成的统计核查步骤,成本极低但显著降低可解释性失效被误判为安全的风险。
适用边界
本文结论依赖均值差方向估计量与半数分割零假设,对基于其他估计方法(如基于激活模式匹配或注意力头探针)的可解释性分析未必直接成立。同时,论文中 ρ 的实测基于 Qwen2.5-1.5B-Instruct 的拒绝方向任务,在其他任务类型(如多类别生成、多语言对齐、非拒绝向量的安全约束)中类间隔的数值与深度分布可能显著不同,κ 与噪声底的映射需重新校准。INT8 层“未检测到移动”的结论同样不能推广为 INT8 量化对所有可解释性工件的等价性声明,它仅表明在本检测精度下偏移未超过估计器噪声。
孤本观察
从本文编辑视角看,可解释性研究的发布规范存在一个尚未被广泛注意的缺口:尺度不变统计量在量化场景下不仅可能掩盖平移与衰减的区别,还可能因未报告 n 而让 0.996 这样的数字在统计上毫无意义。本文以一次前向传播的成本提出了可落地的报告要求,对行业实践具有直接的纠偏价值。
![]()
![]()
![]()



常见问题
在均值差方向估计量中,半数分割噪声底由哪个无量纲参数唯一决定?
由无量纲参数 κ = nρ²/d 唯一决定。
Qwen2.5-1.5B-Instruct 模型上实测的类间隔 ρ 范围是多少?
在跨深度分布下,实测类间隔 ρ 为 33 至 61。
为什么已发表的 0.996 余弦相似度值无法直接解读为特征保留?
因原研究未报告该余弦计算所基于的样本量 n 值,无法判断其是否超出噪声范围。
INT4 量化下可解释性特征的保留情况如何?
方向发生旋转且偏移量超过估计器自身噪声,表明可解释性特征未完整保留。
本文结论是否适用于基于激活模式匹配的可解释性分析方法?
未必直接成立,因结论依赖均值差方向估计量与半数分割零假设,其他方法需重新校准。
来源:arXiv cs.LG