OpenAI正持续加固ChatGPT Atlas以抵御提示注入攻击,手段是以强化学习训练的自动化红队。据OpenAI News消息,这套机制构成一个主动的“发现—修补”循环:自动化红队负责寻找新的攻击手法,从而尽早识别出此前未知的漏洞利用方式,并加固该浏览器代理的防御。
按照OpenAI的说法,这一循环的价值在于前瞻性——不是等攻击出现后再补救,而是在AI日益具备代理能力(agentic)的趋势下,持续强化浏览器代理的安全防线。
孤本观察:将红队测试自动化并交给强化学习驱动,实质是把安全攻防变成可批量迭代的工程流程,有望缩短从漏洞出现到补丁落地的时间窗;但这类防御的实际效果,仍取决于其能否跟上真实攻击手法的演化速度。
来源:OpenAI News