Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级
EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级
AI人工智能

EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级

bingdadabingdada
八月 2, 202660 次阅读约 7 分钟阅读
快速回答

EVMbench是OpenAI与Paradigm合作开发的基准测试,评估AI代理在检测、修补和利用智能合约漏洞方面的能力。包含117个精选漏洞,覆盖检测、修补和利用三种模式,最终推动AI在区块链安全中的防御性应用。

核心要点
  • 什么是EVMbench?
  • 任务环境的构建
  • 三种能力模式
  • 评估框架
  • 前沿代理的性能
目录

目录

  • 引言
  • 什么是EVMbench?
  • 任务环境的构建
  • 三种能力模式
  • 评估框架
  • 前沿代理的性能
  • 模型行为差异
  • 局限性
  • 为什么这很重要
  • 网络安全与双用途挑战
  • 生态投资与未来展望
  • 相关阅读
  • 关于 Bingdada

引言

2026年2月18日,OpenAI Research发布了一项重要研究成果——EVMbench。这是一个全新的基准测试,旨在评估AI代理在检测、修补和利用智能合约漏洞方面的能力。随着AI代理在代码读写和执行上的进步,衡量其在经济意义重大的环境中的表现变得至关重要。EVMbench的推出,旨在鼓励AI系统在防御性审计和强化已部署合约中的使用,从而提升区块链生态的安全性。

什么是EVMbench?

EVMbench是与Paradigm合作开发的,专注于评估AI代理处理高严重性智能合约漏洞的能力。该基准测试包含来自40次审计的117个精选漏洞,其中大部分源自公开的代码审计竞赛。此外,EVMbench还纳入了来自Tempo区块链安全审计过程的多个漏洞场景。Tempo是一个专为通过稳定币实现高吞吐量、低成本支付而设计的L1区块链。这些场景将基准测试扩展到支付导向的智能合约代码,预计代理稳定币支付将在此领域增长,并为EVMbench提供了新兴实际应用领域的坚实基础。

任务环境的构建

为了创建任务环境,研究团队改编了现有的概念验证漏洞利用测试和部署脚本(如果存在),否则手动编写。在修补模式下,他们确保漏洞是可利用的,并且可以在不引入编译破坏性更改的情况下进行缓解。在利用模式下,他们编写了自定义评分器,并对环境进行了红队测试,以发现和修补代理可能欺骗评分器的方法。除了通过Paradigm提供的领域专业知识进行任务质量控制外,还使用了自动化任务审计代理来提高环境的健全性。

三种能力模式

EVMbench评估三种能力模式:

  • 检测模式:代理审计智能合约代码库,并根据真实漏洞的召回率和相关审计奖励进行评分。这衡量了AI代理发现潜在安全问题的能力。

  • 修补模式:代理修改易受攻击的合约,必须保留预期功能同时消除可利用性,通过自动化测试和漏洞利用检查进行验证。这评估了AI代理在修复漏洞时不破坏合约正常功能的能力。

  • 利用模式:代理在沙盒区块链环境中对已部署合约执行端到端的资金耗尽攻击,通过交易重放和链上验证进行编程评分。这测试了AI代理在实际攻击场景中的表现。

评估框架

为了支持客观和可重复的评估,研究团队开发了一个基于Rust的框架,该框架部署合约,确定性地重放代理交易,并限制不安全的RPC方法。利用任务在隔离的本地Anvil环境中运行,而不是在实时网络上,漏洞是历史性的且公开记录。这种设计确保了评估的安全性和一致性。

前沿代理的性能

评估涵盖了所有三种模式下的前沿AI代理。在“利用”模式下,通过Codex CLI运行的GPT-5.3-Codex获得了71.0%的分数。这比仅六个月前发布的GPT-5(得分33.3%)有显著提升。然而,检测召回率和修补成功率仍低于完全覆盖,因为很大一部分漏洞对代理来说仍然难以发现和修复。这表明AI代理在复杂安全任务上仍有改进空间。

模型行为差异

EVMbench还揭示了不同任务中模型行为的有趣差异。代理在利用设置中表现最佳,因为目标明确:继续迭代直到资金耗尽。相比之下,在检测和修补任务中性能较弱。在“检测”模式中,代理有时在识别单个问题后停止,而不是全面审计代码库。在“修补”模式中,在移除细微漏洞的同时保持完整功能仍然具有挑战性。这反映了AI代理在系统性任务中的局限性。

局限性

EVMbench并不代表现实世界智能合约安全的全部难度。包含的漏洞来自Code4rena审计竞赛。虽然这些漏洞是真实且高严重性的,但许多大量部署和广泛使用的加密合约经历了更严格的审查,可能更难利用。 评分系统虽然稳健但并非完美。在“检测”模式中,检查代理是否找到与人类审计员相同的漏洞。如果代理识别出额外问题,目前没有可靠的方法确定它们是否代表人类遗漏的真实漏洞或误报。 在“利用”设置中也存在结构限制。交易在评分容器中顺序重放,因此依赖于精确时序机制的行为不在范围内。链状态是干净的本地Anvil实例,而不是主网的分叉,目前仅支持单链环境。在某些情况下,这需要使用模拟合约而不是主网部署。

为什么这很重要

智能合约保护着数十亿美元的资产,AI代理可能对攻击者和防御者都具有变革性。衡量模型在这一领域的能力有助于跟踪新兴的网络风险,并强调使用AI系统进行防御性审计和强化已部署合约的重要性。 EVMbench既是一个测量工具,也是一个行动号召。随着代理能力的提升,开发者和安全研究人员将AI辅助审计纳入工作流程变得越来越重要。

网络安全与双用途挑战

在最近几个月中,模型在网络安全任务上的性能有了显著提升,这使开发者和安全专业人员都受益。与此同时,研究团队一直在准备加强的网络保障措施,以支持防御性使用和更广泛的生态系统韧性。 由于网络安全本质上是双用途的,他们正在采取基于证据的迭代方法,加速防御者发现和修复漏洞的能力,同时减缓滥用。缓解措施包括安全训练、自动监控、对高级功能的可信访问,以及包括威胁情报在内的执行管道。

生态投资与未来展望

OpenAI正在投资生态系统,以促进AI在区块链安全中的负责任使用。通过EVMbench,他们希望激发更多研究,推动AI代理在防御性审计中的实际应用。随着技术的演进,EVMbench将定期更新以反映新的漏洞类型和攻击向量,确保其持续相关性。 总之,EVMbench代表了AI与区块链安全交叉领域的重要一步。它不仅提供了一个评估AI代理能力的标准化框架,还强调了AI在保护数字资产中的关键作用。随着AI代理继续进化,EVMbench将成为开发者和安全研究人员不可或缺的工具,帮助他们构建更安全、更可靠的区块链应用。


相关阅读

  • 提升ChatGPT健康智能:从医生主导评估到GPT-5.5 Instant的突破

  • OpenAI 任命 Denise Dresser 为首席营收官,加速企业 AI 普及

  • 销售团队如何利用ChatGPT Work提升效率:从客户背景到交易推进的全面指南

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。

目录

  • 引言
  • 什么是EVMbench?
  • 任务环境的构建
  • 三种能力模式
  • 评估框架
  • 前沿代理的性能
  • 模型行为差异
  • 局限性
  • 为什么这很重要
  • 网络安全与双用途挑战
  • 生态投资与未来展望
  • 相关阅读
  • 关于 Bingdada
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#AI代理#EVMbench#智能合约安全#区块链漏洞
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

从英伟达内部实践看ChatGPT Work如何重塑企业知识工作流
AI人工智能

从英伟达内部实践看ChatGPT Work如何重塑企业知识工作流

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

8月 25约 9 分钟阅读
GPT-5.6 登陆 Kiro:AI 编程成本效率迎来新拐点
AI人工智能

GPT-5.6 登陆 Kiro:AI 编程成本效率迎来新拐点

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

8月 25约 6 分钟阅读
AI安全新纪元:OpenAI如何为关键网络能力时代重新校准模型开发节奏
AI人工智能

AI安全新纪元:OpenAI如何为关键网络能力时代重新校准模型开发节奏

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。

8月 24约 10 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧