
OpenAI Codex助力税务代理自我进化:Thrive Holdings与OpenAI联合开发Tax AI
本文深入解析OpenAI与Thrive Holdings如何利用Codex联合开发Tax AI,实现税务代理系统的自我进化。通过紧密对接一线从业者、构建可追溯的生产系统以及Codex驱动的迭代循环,Tax AI在六周内将75%字段完成率从25%提升至86%,为会计师节省三分之一准备时间,准确率高达97%。
- 引言:从实验室到生产环境的鸿沟
- 项目背景:税务申报的瓶颈与机遇
- Tax AI的核心成果:可量化的自我进化
- 核心方法论:自我进化的三大支柱
- 实践中的挑战与应对
目录
引言:从实验室到生产环境的鸿沟
真实世界的系统在投入生产后的表现,往往与实验室环境大相径庭。那些在部署前难以预见的故障,通常要在系统上线后才暴露出来。团队常常在发布后才发现问题,随后花费数周时间排查边缘案例、调整提示词,并将生产反馈转化为可持续的产品改进。传统的反馈循环不仅缓慢且高度依赖人工,只有当工程师介入时才能推动改进。 然而,借助精心设计的评估基础设施、直接对接一线从业者与真实环境的能力,以及Codex前沿的智能体功能,我们如今可以构建能够自我进化的智能体。本文将深入解析我们如何利用Codex打造这类智能体,并分享在税务领域的成功实践。
项目背景:税务申报的瓶颈与机遇
过去六个月,OpenAI的前沿部署工程师与研究人员,携手Thrive Holdings的工程师团队,为Crete(克里特)地区30多家会计师事务所共同开发了Tax AI系统。该系统的目标是帮助会计师应对日益复杂的税务申报工作。 Crete的会计师们每个报税季需要处理数万份纳税申报单,涉及数百万份底层文档。对于中高复杂度的申报,仅数据录入一项就可能耗费每份申报8小时,过程中往往要处理混乱的数据源、历年文档,并进行手动提取和计算。在报税季最繁忙的时期,税务申报准备成为了显著的瓶颈。
Tax AI的核心成果:可量化的自我进化
在本报税季的试点中,Tax AI处理了参与试点的Crete事务所的7,000份纳税申报单。该系统自动化了1040和1041表格申报准备中大量耗时的工作。但比效率提升更令人瞩目的是,系统本身相比三个月前首次部署的版本,实现了可量化的显著进步。
效率与准确性的双重提升
-
时间节省:为会计师节省了约三分之一的税务准备时间。
-
准确率:草拟的申报单准确率高达97%。
-
吞吐量提升:处理能力提升约50%,为会计师留出更多时间与客户沟通。
自我改进的量化证据
我们通过评估申报单在无需后续修正的情况下,字段完成的准确率来衡量改进效果。具体来看:
-
75%字段完成率:上线初期仅25%的申报单达到此标准,六周内这一比例跃升至86%。
-
90%与100%字段完成率:系统在这两个更高标准上的进步更为迅速,表明需要会计师后续跟进的申报单大幅减少。 初期,Tax AI主要处理简单任务(如W-2和1099表格)。随着报税季推进,系统逐步攻克更复杂的申报,涉及K-1表格、各种附表和棘手边缘案例。每项新能力的获得,都比前一次节省更多时间,因为系统接手的是更耗时、更复杂的手动任务。这一进步势头至今仍在持续。
核心方法论:自我进化的三大支柱
Tax AI之所以能够实现自我进化,关键在于围绕以下三个支柱进行协同工程开发:
支柱一:紧密对接一线从业者
真正做实际工作的人,必须能引导系统的学习方向。他们的直觉和判断力能够揭示哪些错误真正重要,并帮助确定工作流中哪些环节值得优先优化。
支柱二:构建能产生证据的生产系统
产品不仅要记录输入和输出,还必须捕捉完整的路径:从源材料,到提取的字段及来源,再到下游提交和专家修正。这种完整的可追溯性是后续自动改进的基础。
支柱三:Codex驱动的迭代循环
一旦生产问题变得可见且结构化,它们就能转化为发现、定制化评估和明确的工程任务。Codex可以协助调查问题、提出修改方案、验证修改是否通过针对性评估和回归测试,从而比纯手动迭代周期更快地推动产品进步。
实践中的挑战与应对
随着Tax AI扩展到更复杂的申报领域(如K-1表格、租赁房地产附表,以及需要跨多个源文件对账的税务表格),团队面临的核心挑战是:如何让复杂的生产故障变得可见、可理解且可操作。 在产品早期,大部分修正依赖手动操作。会计师可以纠正系统错误,但产品未能捕获完整的上下文信息:在提交前修改某个值,可能反映的是真正的提取错误、映射问题、产品功能缺失,或是工作流中的正常波动。要区分这些情况,仍需要工程团队跟进。虽然工程师可以使用编码智能体,但系统在设计上尚未能在改进循环中有意义地利用AI——我们缺乏识别正确改进方向的信号。
结语:对构建者的启示
Tax AI的成功实践表明,将领域专家知识与AI智能体能力深度融合,可以构建出能够自我进化的系统。对于其他领域的构建者,尤其是那些从业者专业知识对系统质量和数据质量至关重要的领域,我们的经验或许能提供有价值的参考: 1. 让专家参与闭环:系统学习的方向应由一线从业者引导。
- 设计可追溯的生产系统:完整捕获从源到最终输出的路径。
- 利用AI加速迭代:让Codex这样的智能体参与问题发现、方案提出和验证。 通过这三个支柱的结合,我们不仅解决了税务申报的具体问题,更开创了一种构建持续自我改进AI系统的新范式。
相关阅读
关于 Bingdada
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
bingdada
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。
相关文章

从英伟达内部实践看ChatGPT Work如何重塑企业知识工作流
英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

GPT-5.6 登陆 Kiro:AI 编程成本效率迎来新拐点
OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

AI安全新纪元:OpenAI如何为关键网络能力时代重新校准模型开发节奏
OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
订阅我们的 Newsletter
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。
