OpenAI 提出 IH-Challenge,通过训练让前沿大语言模型(LLM)优先执行可信指令,以提升指令层级、安全可引导性以及抵御提示注入攻击的能力。
按照 OpenAI 资讯中的表述,IH-Challenge 的核心在于训练模型“优先处理可信指令”。所谓指令层级(instruction hierarchy),指向的是当不同来源、不同可信度的指令同时出现时,模型应当以哪一条为准的问题。
该训练方式被描述为可同时带来三方面改善:一是指令层级本身的表现,二是安全可引导性(safety steerability),三是对提示注入(prompt injection)攻击的抵抗力。OpenAI 将 IH-Challenge 定位为面向前沿大语言模型(frontier LLMs)的改进工作。
提示注入通常指外部内容中夹带指令,诱导模型偏离使用者原本意图的行为。让模型区分可信与不可信指令,是应对这类风险的思路之一。
孤本观察:把“可信指令优先”直接做成训练目标,等于把过去依赖输入过滤与规则约束的问题,部分转移到了模型自身的对齐环节,这在工程路径上更具通用性。但效果能走多远,取决于“可信来源”如何界定、训练数据如何构造,这些关键细节在现有信息中尚未披露。
来源:OpenAI News