OpenAI 正借助思维链监控研究内部编程智能体的失准问题。该公司表示,这一做法通过分析真实部署场景来识别风险,并强化人工智能安全防护措施。
据 OpenAI 新闻(OpenAI News)发布的信息,思维链监控(chain-of-thought monitoring)被用于研究公司内部编程智能体(coding agents)的失准(misalignment)现象。与实验室环境下的测试不同,相关工作针对的是真实部署中的智能体运行情况,从中发现潜在风险。
OpenAI 将这一监控机制的用途归纳为两点:一是检测风险,二是加强人工智能安全保障。就目前公开的概要信息而言,该公司未披露具体的监控方法、覆盖范围、已发现的问题案例及相关数据。
孤本观察:把安全研究放在自家真实运行的编程智能体上,意味着对齐监控正从受控实验走向生产环境中的持续观察;这类做法的实际价值,取决于监控信号能否在不干扰正常开发流程的前提下被及时发现
来源:OpenAI News