最佳AI模型在会计任务中仍有20%失败率
DualEntry公司对19款主流AI模型进行了101项真实会计工作流测试。结果显示,最佳模型Claude Opus 4.7准确率为79.2%,GPT-5.4为77.3%,GPT-4仅为39.8%。尽管模型能力提升显著,但最佳模型仍有约五分之一的任务出错,尤其在银行对账和月末结账等关键操作环节。作者呼吁CFO关注任务级准确率而非整体分数,并重视AI输出的人工复核与系统控制。

本文为客座文章,作者为DualEntry公司首席财务官Woosung Chun。文中观点仅代表作者个人。
我们正在构建由人工智能驱动的会计软件。正因如此,我们更需要弄清楚AI在会计领域的短板究竟在哪里。
我们对19款主流AI模型进行了101项真实会计工作流测试。测试内容并非常识问答,也不是“应付账款是什么”这类选择题,而是真实的会计场景:对这笔交易进行分类、为该场景创建会计分录、核对这份银行对账单、完成月末结账——这些正是每个财务团队日常工作中都会遇到的任务类型。
测试中表现最佳的模型准确率为79.2%,是Claude Opus 4.7。排名第二的是OpenAI GPT-5.4,准确率为77.3%。作为对比,GPT-4在同一批任务中仅得分39.8%。无论你对AI持何种看法,这一进步轨迹都不容忽视。
但有一个数字始终萦绕在我心头:全球最强的模型,在会计任务中仍有五分之一会出错。
在大多数场景下,80%算是不错的成绩。但在会计领域,这远远不够。一笔错误分类的交易不会只停留在原地,它会流入损益表、资产负债表、税务申报材料,甚至进入交给审计师的文档。月末结账时的一个错误,影响的绝不仅仅是一个科目,它会不断累积放大。
最让我意外的并非整体准确率,而是模型在哪些环节出了问题。那些在会计概念知识题(如“你是否理解权责发生制”)上表现尚可的模型,往往在银行对账和月末结账任务上溃不成军。最困难的操作性工作——那些真正让财务团队夜不能寐的内容——恰恰是AI表现下滑最明显的地方。
“懂会计”和“会做会计”之间存在本质区别。这一点我在测试前就清楚,但没想到数据上的差距会如此直观。
另外值得指出的是:目前市面上向CFO推销的大多数AI工具,并没有经过这样的评估。供应商展示的演示和输出看起来正确,但他们不会展示在代表性真实工作流样本上的任务级失败率。目前业内尚无统一标准,这也是我们构建并公开发布2026年会计AI基准测试的原因——完整的方法论和结果集均已开放获取。
那么这在实践层面意味着什么?有几点值得关注。
第一,任何考虑在财务运营中引入AI的CFO,都应要求供应商提供其特定工作流类别下的任务级准确率,而非整体基准分数。我们的数据显示,不同类别之间的差异相当显著。一个在交易分类上表现合理的模型,可能在银行对账上严重失误。这两者的风险特征完全不同。
第二,模型出错后的应对机制,与模型正确的频率同样重要。20%的错误率并非不可控——前提是你在AI输出与账簿之间设置了验证层、复核流程和控制措施。如果没有这些,20%的错误率将难以承受。但答案并非在会计中回避AI,而是要审慎设计模型在工作流中的位置。AI负责起草和提示,嵌入具备确定性验证、审计追踪和异常处理等核心功能的系统之中,与将AI简单附加在遗留系统上、或通过API裸调而缺乏任何基础设施,两者之间存在本质差异。前者可行,后者则会让错误悄然累积,直到某天集中爆发。
第三,任何无法告知你其错误率的财务AI工具,都值得怀疑。并非因为供应商不诚实,而是因为大多数供应商确实没有以这种方式进行过测试。针对真实会计工作流的任务导向评估,比搭建产品演示要困难得多。这不是批评——任务导向评估确实很难构建。
但眼下差距是真实存在的。从GPT-4到如今顶级模型,两年间的进步令人瞩目。我不认为79.2%的准确率是天花板,它更接近前沿模型在12个月后的起点下限。
然而,模型能力与部署就绪是两回事。让AI在真实会计环境中安全运行所需的控制措施、验证流程和审计追踪,需要时间构建和测试。目前,模型能力跑在了用于捕捉其错误的系统之前。
这一差距,正是CFO们需要密切关注的地方。
该基准测试由DualEntry公司高级软件工程师Ignacio Brasca设计并构建。