Write:
OpenAI与 Paradigm联合发布 EVMbench,这是一项用于评测 AI智能体(AI agent)在高危智能合约漏洞上检测、修补与利用能力的基准测试。据 OpenAI新闻栏目披露的信息,该基准把智能合约安全中的三类关键任务——发现漏洞(detect)、修补漏洞(patch)以及利用漏洞(exploit)——纳入同一评测框架,目标对象为高危(high-severity)级别的智能合约漏洞。
从任务设置看,EVMbench关注的不只是模型能否识别安全问题,还包括其能否给出修复方案,以及在受控条件下能否复现攻击路径。OpenAI与 Paradigm以联合发布的形式推出该基准,双方分别是通用人工智能模型开发商与加密领域投资机构,此次合作指向智能合约安全这一细分场景。
目前公开来源未披露该基准的题目规模、评分方式、覆盖的漏洞类型分布,以及是否开源等信息。
孤本观察:把“修补”和“利用”与“检测”并列为同一基准的考核项,意味着评测方更想衡量智能体在真实攻防链条上的完整能力,而不只是分类准确率;这也让此类基准天然带有双重用途属性,如何防止评测能力外溢为攻击工具,将是后续需要回答的问题。
来源:OpenAI News