OpenAI发布了一套新的思维链可监控性(chain-of-thought monitorability)框架与评测套件,覆盖24种环境下的13项评估。该框架关注的是对模型内部推理过程的可监控程度,而非仅对其输出进行监控。
OpenAI表示,其研究结果显示,监控模型的内部推理远比仅监控输出更为有效,这为人工智能系统能力不断增强后的可扩展控制(scalable control)提供了一条有前景的路径。
孤本观察:若“监控内部推理优于监控输出”这一结论在更多场景中成立,可监控性将可能从模型的附属特性上升为部署前的核心评估维度;不过此次公布的是框架、评测套件规模与结论概述,13项评估的具体指标与跨环境一致性仍有待后续披露来验证。
来源:OpenAI News