孤本网
/ 0 阅读
0

Anthropic红队测试显示:GLM-5.3首次在二进制漏洞利用中实现控制流劫持

一句话结论

GLM-5.3与Claude Mythos Preview在二进制漏洞利用基准测试中均实现控制流劫持,突破此前模型零成功的底线。

关键要点

  • 测试基于内部二进制漏洞利用基准(Binary Exploitation benchmark),抽取100个任务,按随机方式选择。
  • GLM-5.3在4%的试验中开发出完整的控制流劫持(full control flow hijacks)。
  • Claude Mythos Preview在6%的试验中开发出完整的控制流劫持。
  • Claude Opus 4.6与GLM-5.2在此基准上0%任务成功开发出控制流劫持。
  • 该测试由Anthropic Frontier Red Team执行,结果发布在2026年9月29日。

背景与事实

2026年9月29日,Anthropic Frontier Red Team公开发布了关于GLM-5.3的评估结果,标题为“GLM-5.3 and the spread of advanced cyber capabilities”。该团队从内部二进制漏洞利用基准(Binary Exploitation benchmark)中随机抽取了100个任务,对多款大模型进行了对比测试。测试指标为“完整的控制流劫持”(full control flow hijacks)的生成能力,即模型能否在目标二进制程序中构造并成功实现攻击性的控制流转移。

测试结果显示,GLM-5.3在100次试验中有4次成功开发出完整的控制流劫持,成功率为4%;Claude Mythos Preview的成功率为6%。与此形成鲜明对比的是,Claude Opus 4.6和GLM-5.2在同一基准的100次试验中全部失败,没有一次成功开发出控制流劫持。红队明确将这一结果定位为“一个有意义的阈值已被跨越”——此前代际模型在基准上全部为零成功,而GLM-5.3和Claude Mythos Preview首次实现了非零的利用成功率。

本次测试并非针对单一产品的能力验证,而是由Anthropic红队对多家模型进行的横向对比,目的是观察高级网络攻击能力(advanced cyber capabilities)是否在开源/多厂商模型中扩散。测试任务来自内部基准,样本为100个随机抽取的任务,因此结果反映的是该样本的统计特性,而非全量覆盖。

影响分析

对中文开发者与安全从业者而言,这一结果意味着二进制漏洞利用能力正在成为新一代基础模型的“涌现”属性,而非仅限前沿闭源模型。GLM-5.3作为非Anthropic系模型首次在基准中实现非零成功率,说明该能力已不再由单一实验室垄断。实际影响包括:第一,安全团队在部署基于GLM-5.3或Claude Mythos Preview的自动化代码审查/漏洞挖掘流程时,必须将其纳入“能生成攻击性payload”的风险评估;第二,企业级安全审计需将“模型能否生成完整控制流劫持”纳入常规能力边界测试,而非仅依赖人工渗透测试;第三,开源社区若计划将此类模型用于自动化安全工具,需要建立沙箱、限制与监控机制,防止模型在无人监督下生成可利用的漏洞代码。

需要强调的是,4%与6%的成功率仍属低概率事件,且测试仅覆盖100个随机任务。上述分析判断基于红队公布的有限样本,不能外推为模型在任意二进制漏洞场景下的通用能力。

适用边界

上述结论不适用于以下场景:非二进制漏洞利用的通用代码生成任务;未在内部Binary Exploitation benchmark中出现的漏洞类型;对模型成功率的确定性预测(100次试验的统计置信度有限)。此外,测试由Anthropic红队执行,其基准定义、任务难度分布与评测协议未完全公开,第三方复现可能产生不同结果。

孤本观察

从编辑视角看,本次发布的显著点在于首次将“零成功率”作为基线参照,使GLM-5.3与Claude Mythos Preview的非零结果获得了清晰的阈值意义。判断:这种对比框架可能成为后续模型安全能力评估的标准范式。

常见问题

GLM-5.3在测试中成功开发出完整控制流劫持的比例是多少?

GLM-5.3在100次试验中有4次成功,成功率为4%。

Claude Mythos Preview的完整控制流劫持成功率是多少?

Claude Mythos Preview在测试中成功率为6%,即100次试验中有6次成功。

哪些模型在该基准测试中完全未能实现控制流劫持?

Claude Opus 4.6与GLM-5.2在100次试验中全部失败,成功率为0%。

这项测试由哪个团队执行,发布时间是哪天?

测试由Anthropic Frontier Red Team执行,结果于2026年9月29日发布。

测试结果能否外推为模型在任意二进制漏洞场景下的通用能力?

不能,因为4%与6%的成功率属低概率事件,且测试仅覆盖100个随机任务,置信度有限。

来源:Simon Willison