孤本网
发布于 2026-03-05 / 0 阅读
0
0

OpenAI 发布 CoT-Control:推理模型难以控制自身思维链,可监控性由此获得支持

OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(chain of thought,CoT),这一结果强化了可监控性作为人工智能安全保障的定位。

据 OpenAI 介绍,CoT-Control 用于检验推理模型对自身思维链的控制能力。测试结果显示,这类模型在控制思维链方面表现不佳,难以按照意愿改写或抑制推理过程中的内容。

OpenAI 将这一现象视为积极信号:若模型无法自如地操纵自己的思维链,那么对思维链进行外部监控(monitorability)就仍然是一种可行的 AI 安全防护手段。

孤本观察:思维链的可监控性此前更多被视为一种假设性的安全前提,此次测试把讨论落到了可检验的层面。不过,该结论覆盖的模型范围与测试条件尚未在来源中说明,其能否推广到更复杂的部署场景仍需观察。

来源:OpenAI News


评论