孤本网
/ 1 阅读
0
0

OpenAI 安全团队震荡:透明度负责人 David Robinson 离职,三名研究人员因分享敏感信息被解雇

一句话结论

OpenAI 安全体系出现重大人事变动,透明度负责人离职且三名研究员因泄密被解雇,加剧了公司安全治理的不稳定性。

关键要点

  • OpenAI Safety Systems 团队内负责“安全透明度”的 David Robinson 离职,继任者尚未公布。
  • 三名从事安全与模型对齐研究的员工 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 因分享公司敏感信息被解雇。
  • 被解雇的信息内容涉及 OpenAI 基础设施架构,且接收方为一家外部 AI 安全机构。
  • David Robinson 是 OpenAI《Preparedness Framework 2.0》的主要起草人,负责撰写模型“风险说明书”(System Card)。
  • 离职前,Robinson 在社交媒体上公开表达对 OpenAI 应对高能力 AI 风险速度不足的担忧,并呼吁员工利用内部影响力推动更严肃的风险应对。

背景与事实

根据 BI 报道,David Robinson 是 OpenAI Safety Systems 团队内“安全透明度”职能的负责人。截至目前,Robinson 本人尚未公开说明其离职的具体原因,OpenAI 官方也未公布该职位的继任者。尽管该职位名称显得较为抽象,但其在 OpenAI 的运作中占据核心地位。几乎在每次 OpenAI 发布重要模型时,Robinson 及其团队都会负责撰写一份“System Card”(系统卡片/风险说明书)。

用 Robinson 自己的定义,他和团队扮演着技术部门与公众之间的“翻译器”角色。Safety Systems 团队负责模型评估、红队测试、安全措施部署及模型上线决策,这些工作的过程和结果通常极其复杂,外界难以仅凭一组测试数据判断模型的安全性。安全透明度团队的核心任务,是将内部的技术发现、风险判断和部署决定,整理成外界能够看懂的公开材料。该项工作归属于 Safety Systems 内部的 Trustworthy AI 团队,其产出包括 System Card、Deployment Safety Hub(部署安全中心)、安全研究博客以及公开治理文件。其中与公众见面频率最高的是 System Card,它详细记录了模型训练方法、接受的安全评估、在生物和网络攻击等高风险领域达到的能力水平、内部采取的安全措施以及采取措施后残留的风险。虽然被称为“卡片”,但篇幅往往长达几十页。Robinson 表示,这是 OpenAI 向外界提供的关于公司技术安全工作最详细、最全面的说明。

此外,Robinson 还是 OpenAI《Preparedness Framework 2.0》(准备度框架 2.0)的主要起草人。该框架用于追踪前沿模型可能带来的严重风险,并预设了模型达到特定能力后所需执行的评估与防护措施。在 2.0 版本中,新增了三类需追踪的能力:生物与化学能力、网络安全能力以及 AI 自我改进能力。框架规定,若追踪发现模型能力达到“High”(高)级别,意味着其可能显著放大现有的严重危害路径,必须在部署前配置足够的安全措施;若达到“Critical”(临界)级别,则代表模型可能凭空创造严重危害路径,继续开发将面临重大争议。例如,在 Deep Research 模型的 System Card 中,其生物学评估显示该模型“接近”High 能力门槛,即开始接近能够实质帮助非专业人士制造已知生物威胁的水平。如何向公众准确描述这种安全领域的阈限空间,正是 Robinson 负责的工作。值得注意的是,在离职前,Robinson 还在招聘 OpenAI 的首位 Safety Transparency Editor(安全透明度编辑),该岗位负责重要安全材料的编辑质量,但目前该职位仍在招募中,而负责人已先行离职。

在 Robinson 离职消息曝光之前,OpenAI 的安全部门已出现严重状况。据《华尔街日报》报道,OpenAI 解雇了三名安全方向的员工:Jasmine Wang、Tomek Korbak 和 Mikita Balesni。三人主要从事安全与模型对齐研究。OpenAI 给出的官方理由是,内部调查发现三人将公司敏感信息分享给了一家外部 AI 安全机构,其中包含了 OpenAI 基础设施架构的内容。这一事件具有特殊的背景:Tomek Korbak 此前曾担任 OpenAI 与第三方评估机构 METR 和 Redwood Research 之间的技术联系人。这两家机构是在此前 Hugging Face 事件后,由 OpenAI 邀请进驻公司进行调查的三方机构,Korbak 是负责与这些外部研究人员对接的关键人员。

回顾 OpenAI 的安全团队历史,自 Dario Amodei 时期起,该部门就一贯变动频出,近期更是“地震”连连。最近的变动包括 OpenAI 解散“灾难风险应急”团队,GPU 大神 Scott Gray 离职;一个月内四名高管出走,前 COO 离场,安全线高管几乎被全员替换;以及 GPT-5.6 发布后,OpenAI 安全主管随即跑路。由于离职人数众多,量子位制作了一张图表展示这一现象。

在离职之前,Robinson 曾在 X(原 Twitter)上多次公开谈论高能力 AI 带来的风险。9 月初,他表示 OpenAI 内部人员正在逐渐意识到高能力 AI 模型可能产生的影响,但他直言:“OpenAI 的确每天都在发生重大变化,但我不知道这种变化是否足够快。”在最新的一则 X 动态中,Robinson 转发了另一名研究人员的帖子并表示完全赞同,他认为竞相研发递归自我改进(RSI, Recursively Self-Improving)AI 并非囚徒困境,而是“既疯狂又傲慢”。他向留任的 AI 研究人员(AI staff)喊话,如果选择继续留在公司,就应该思考如何利用自己在公司内部的影响力,推动公司更认真地应对 AI 风险。

影响分析

对于中文开发者与 AI 从业者而言,OpenAI 安全团队的剧烈动荡传递出明确的信号:前沿 AI 公司的内部治理正在承受巨大的压力,且安全与商业节奏之间存在深层矛盾。首先,安全透明度负责人的离职及后续招聘的停滞,意味着 OpenAI 在模型发布时的风险披露机制可能出现短期真空。对于依赖 OpenAI API 或集成其模型的应用开发者来说,System Card 不仅是合规文件,更是评估模型在特定高风险领域(如生物、网络安全)残留风险的重要依据。负责人更替可能导致披露标准或详略程度的波动,增加了下游应用进行风险评估的不确定性。

其次,因向外部安全机构分享信息而解雇三名核心研究员的事件,折射出 OpenAI 对“敏感信息”边界的定义正在收紧。在 AI 安全研究界,与外部独立机构(如 METR、Redwood Research)的技术交流被视为确保客观性和对抗性测试的重要环节。OpenAI 此举可能会向全球 AI 安全社区释放寒蝉效应,阻碍独立安全研究的开展,进而影响整个行业对大模型安全风险的客观评估体系。对于正在构建自身安全评估体系的国内大模型厂商及开发者而言,这是一个重要的参照案例:如何在保持内部机密与进行必要的外部安全审计之间划定红线,将是未来安全团队建设的核心难题。

适用边界

本文结论主要基于 OpenAI 官方立场及现有媒体报道,不适用于评估 OpenAI 未披露的潜在内部补救措施或未来人事调整计划。关于“泄密”定性的事实认定,基于 OpenAI 内部调查结论,未考虑外部安全机构对信息分享性质的潜在异议。此外,对行业影响的分析侧重于安全治理流程,不涵盖 OpenAI 在模型性能、价格或功能更新方面的业务影响。

孤本观察

Robinson 在离职前公开呼吁员工利用内部影响力对抗“傲慢”的研发节奏,这一行为本身构成了对 OpenAI 内部安全文化现状的最直接注脚。在 AI 安全团队频繁出现“一锅端”式离职的当前背景下,安全透明度职能的失守可能预示着前沿 AI 公司在风险管控与快速迭代之间的平衡点已发生显著偏移。

常见问题

被解雇的三名 OpenAI 研究员姓名及解雇原因是什么?

Jasmine Wang、Tomek Korbak 和 Mikita Balesni。因内部调查发现三人向外部 AI 安全机构分享了包含 OpenAI 基础设施架构的公司敏感信息。

David Robinson 离职前在招聘什么岗位?该岗位目前状态如何?

他在招聘 OpenAI 首位 Safety Transparency Editor(安全透明度编辑),负责重要安全材料的编辑质量。目前该职位仍在招募中,而负责人已先行离职。

Preparedness Framework 2.0 新增了哪三类需追踪的能力?

生物与化学能力、网络安全能力以及 AI 自我改进能力。

OpenAI《Preparedness Framework 2.0》中“Critical”级别代表什么含义?

代表模型可能凭空创造严重危害路径,继续开发将面临重大争议。

Tomek Korbak 此前在 OpenAI 安全评估中担任什么角色?

他是 OpenAI 与第三方评估机构 METR 和 Redwood Research 之间的技术联系人,负责与外部研究人员对接。

来源:量子位


评论