孤本网
发布于 2026-07-15 / 0 阅读
0
0

GPT-Red:解锁面向稳健性的自我改进

据 OpenAI News 消息,OpenAI 介绍了其自动化红队(red teaming)系统 GPT-Red。该系统通过自我博弈(self-play)来提升 AI 安全性、对齐(alignment)以及应对提示注入(prompt injection)的稳健性。

按来源标题所述,GPT-Red 的定位是“解锁面向稳健性的自我改进”,即借助自动化红队与自我博弈机制,在安全与对齐方向上探索模型的自我改进能力,并增强其对提示注入攻击的抵抗力。

来源:OpenAI News


评论