为何你的AI总是算错数?
金融AI项目失败常因数据规模超出模型处理能力,导致错误答案。本文分析原因并提出四项原则与三个采购前必问问题。

以下为亚马逊数据科学家Sarthak Gupta的客座文章,观点仅代表作者本人。
金融领域的人工智能项目大多并非因技术薄弱而停滞,而是因为我们交给模型超出其处理能力的数据,然后轻信其输出。
MIT对300个企业AI部署的研究发现,约95%的项目对损益(P&L)未产生可衡量的影响。每位CFO看到这个数字都想知道哪5%成功了,多数答案指向战略或人才。但一个更隐蔽的原因,恰恰藏在你自己的数据中。
领导层被灌输了一个简单的故事:将AI指向所有数据,就能得到答案。但金融数据并不配合这个叙事。它庞大、相互关联、跨越多年——总账、其下的子账、再往下的交易明细、申报文件、合同、引用所有这些的董事会报告。一次对账可能同时触及其中一半内容。
当交给模型超出其处理能力的数据时,它不会停下来请求更多空间。它只处理能容纳的那部分,并以同样自信的语气作答,仿佛已读遍每一行。屏幕上没有任何提示告诉你它只读了其中一部分。
为何规模会破坏模型
把模型的工作记忆想象成一张书桌。你只能摊开有限的文件。超过这个限度,文件就会滑落桌边,而模型从不告诉你哪些被遗漏了。
研究人员将这一现象称为“迷失在中间”:给模型一份长文档,它会偏向开头和结尾的内容,而对中间部分变得不可靠。你需要的数字往往出现在200页10-K文件的第44页,恰好在模型处理最差的位置。
这在金融领域是可测量的,而不仅限于实验室。一个基于真实10-K、10-Q和财报构建的金融专用基准测试发现,即使领先的模型,在拿到相关页面后,也约有五分之四的问题回答错误或拒绝回答。这些问题即使是初级分析师打开文件也能轻松回答。模型此后有所改进,但结构性限制未变:对当今前沿模型的独立测试发现,随着输入变长,每个模型的准确率都下降。超过某一点后,更多数据并不会带来更高准确性,只会带来更自信的错误。
供应商对此的标准答案是更大的上下文窗口:加载整个数据室,问题就会消失。但事实并非如此。同样的测试在更大的窗口上运行,结果显示模型虽然技术上能接受百万级token,但中间部分读取依然糟糕,而且现在成本更高、速度更慢,却仍给出同样不可靠的答案。更大的书桌无济于事,如果习惯仍是把所有东西堆上去。成功的团队会减少模型面前的输入,而非增加。
还有第二个问题,对金融团队的影响比对工程师更严重。对同一份文件问同一个问题两次,可能得到两个不同答案。在电子表格中,公式每次返回相同结果,这正是控制的关键。模型并不承诺这一点。无法复现的数字,就是无法签署的数字,也无法交给审计师作为证据。
错误数字的代价
如果错误能自我暴露,这一切或许无关紧要。但它们不会。电子表格中的坏数字会被发现,因为有人负责该标签页并检查。而AI工具产生的坏数字则干净、格式整齐、语气自信,往往能绕过手工数字会受到的审查。
假设FP&A团队加载三年交易数据,要求进行驱动因素预测。模型无法全部容纳,只能悄悄基于一部分运行,最终提交给董事会的预测建立在一个无人知晓的切片上。或者,交易团队让模型从90页合同中提取终止和赔偿责任条款,而关键条款恰好在它略过的那一页。
代价不是尴尬,而是触发契约违约、错过业绩指引、以亏损价格赢得竞标。在金融领域,错误数字不会停留于错误,有人会据此行动。
应对之道
数据规模是设计约束,应围绕其规划,而非幻想消除。以下四项原则行之有效。
1. 像结账那样分解工作
你不会用一张巨大电子表格对全公司进行对账。你会先关闭每个子账,核对平衡,再汇总。AI也需要同样处理:将大问题和大数据集拆分成可检查的小部分,逐一验证,再合并。这是换了个名字的严谨结账纪律。
2. 拉取,而非倾倒
你不会把整栋楼的文件交给分析师,然后问DSO趋势。你会拉取应收账款账龄和收入明细。界定问题范围,只给模型相关记录,它才有机会。若喂给它整个档案库,它只会淹没。成功的试点通常从这里开始:针对一份报告、一个问题,而非整个数据湖。
3. 先修复数据,再指向AI
模型无法推理出被困在四十个不一致电子表格中的数字。清理和集中数据是前提,而非事后补救。这是项目中最不激动人心的环节,却决定项目成败。
4. 为重要数字指定负责人,并提前划定界限
任何提交给董事会、贷款方、客户或超过你设定的重要性阈值的数字,在流转前必须通过验证检查和签名。低于该线的可无人值守。这正是工程领域已有的习惯:影响生产的变更在发布前会触发标记。
采购前要问的3个问题
能力是供应商推销的,而你能捍卫的数字才是你真正获得的。在下一次部署前,向供应商提出三个问题,不要接受幻灯片式的回答。
1. 你们如何拆分我的数据?
如果答案是“我们有大型上下文窗口,直接加载所有数据”,那你找到的是问题,而非解决方案。
2. 你们如何只拉取问题所需的数据?
能检索正确记录的工具,每次都胜过吞下整个档案库的工具。
3. 你们如何证明数字正确且可复现?
相同问题、相同数据、相同答案,且有可追溯的轨迹。如果他们无法展示这一点,你买的不是控制,而是演示。
真正从AI中获得实际收益的团队,并非运行最大模型的团队,而是接受“数据比任何模型都大”这一事实,并为此构建系统的团队。