18个模型统计108次财报,谁最快、最准、最便宜?

来源 | 《财经》杂志 文|《财经》主笔  吴俊宇 编辑 | 刘以秦  

2026年08月07日 15:03  

本文8325字,约12分钟

选择模型,不是寻找一个“万能冠军”,更多是根据不同任务形成组合,在成本、效率和准确率之间找到最优平衡

每逢财报季,研究员、分析师都会重复一项耗时但不可避免的工作:下载上市公司财报,提取数十个关键财务数据,计算同比增速等指标,并整理成表格。

一份财报可能超过100页。研究员需要逐季、逐页阅读、反复核对,再从数字变化中挖掘一家公司的经营趋势。过去三年,这项工作始终没有完全自动化,主要有两个限制。

Wind(万得)等金融数据库无法覆盖所有研究需求。它虽然能提供标准化数据,但很多公司的细分数据(如微软云计算业务的营收、增速)没收录。

DeepSeek、豆包等AI(人工智能)聊天工具虽然能够解析财报并回答问题,但在处理多份财报、连续计算、转换复杂口径时,仍频繁出现错误。

2026年,智能体(Agent)和大模型能力提升,它已经能够持续数小时编写代码。我们想验证一个问题——在重度办公场景中,它能否完成类似任务?

为此,《财经》进行了一项试验:通过开源智能体框架OpenCode接入全球主流模型,让18款模型完成同一项财报统计任务。具体任务是:阅读谷歌2020年-2025年的24份财报,统计2021年-2025年20个季度的10个财务指标共200个数据,并生成表格。

OpenCode的优势在于,能公平接入全球绝大部分模型,降低不同模型的测试环境差异。由于Claude限制OpenCode等第三方智能体工具接入,Claude系列模型9次任务通过Claude Code完成。

为降低随机因素、任务并行干扰测试结果,《财经》对18款模型分别进行了两轮测试,每轮每款模型独立执行3次,共完成108次任务。所有测试任务均采用串行方式逐一执行。

第一轮54次测试,仅提供任务目标,不提供执行路径。模型需要自主拆解任务、选择工具并规划执行流程。

第二轮54次测试,在保持其他条件不变的情况下,根据第一轮测试结果增加执行建议写入新的提示词,观察模型能否进一步提升效率。

《财经》最终记录了这18个模型108次任务的准确率、Token(词元)消耗量、任务时长、API(应用接口)折算成本。看谁用时最短、结果最准、成本最低。

选择财报统计作为测试任务,有三个原因。

第一,它有标准答案,结果能被客观验证。相比一句话生成游戏、一句话生成研究报告等任务,门槛较高。

第二,它是开放任务。模型要自主规划执行路径、选择工具、编写代码,从PDF文件中提取整理、计算、复核数据。

第三,它的Token消耗大且任务时间跨度大。不同的模型一次完整任务要消耗数百万甚至千万Token,耗时3分钟-120分钟。

这个测试更贴近真实办公任务,也会考验模型的一部分代码能力。以上因素叠加,不同模型的统计准确率、任务时长、Token成本差距会显著拉大。

不过,需要说明,这不是严格意义上的性能基准测试。测试结果仅代表模型在财报统计这种重度办公场景中的表现。本文中讨论的成本均按照官网API列表价折算,并不等于用户在Token Plan(Token订阅套餐)中的实际账单。

那么,这108次测试中有哪些有趣发现?

国产模型执行任务速度慢,但价格更便宜

(第一轮54次测试结果)

第一轮测试中,《财经》仅向18款模型设定任务目标,不提供执行路径。模型需要自主理解任务、寻找财报、调用工具、编写代码并生成表格。

结果显示,共有7款在三次重复测试中均达到100%准确率。其中海外模型3款,国产模型4款,分别是:Claude Opus 5、GPT-5.6 Sol、GPT-5.5、阿里Qwen 3.8-Max(预览版)、阿里Qwen 3.8-Max(正式版)、月之暗面Kimi K3、DeepSeek-V4-Flash(正式版)。

海外旗舰模型整体任务完成速度更快。

Anthropic旗舰模型Claude Opus 5平均耗时3分36秒,OpenAI旗舰模型GPT-5.6 Sol平均耗时4分33秒,GPT-5.5平均耗时5分49秒。三者均在6分钟内完成任务。

相比之下,国产模型完成同一任务耗时更长。其中,月之暗面Kimi K3平均耗时10分29秒,阿里Qwen 3.8-Max(正式版)18分46秒,DeepSeek-V4-Flash(正式版)20分44秒,阿里Qwen 3.8-Max(预览版)25分45秒。

但从完成一次任务的平均成本看,国产模型优势明显。

按照各家官网API价格折算,Claude Opus 5单次任务平均成本9.38元,GPT-5.6 Sol为7.06元,GPT-5.5为10.16元。

国产模型中,阿里Qwen 3.8-Max(预览版)为7.74元,Qwen 3.8-Max(正式版)为6.21元,月之暗面Kimi K3为2.89元,DeepSeek-V4-Flash(正式版)仅0.25元。

至少在财报统计这一重度办公场景,国产模型已经具备接近海外旗舰模型的能力,同时Token成本更低。DeepSeek-V4-Flash(正式版)成本甚至只有Claude Opus 5的不到3%。

在哪些地方容易出错?

第一轮测试中,11款模型未能实现100%的统计准确率。

复盘错误结果可以发现,模型真正容易踩坑的,并非复杂的财务分析,更多出现在单位、统计口径和数据核验等基础环节。

第一类陷阱,是单位换算时错了一位小数点。财报中的单位通常是百万美元,统计要求使用亿美元。Claude Sonnet 5在第三次测试中,把553.1亿美元的季度营收写成5531.4亿美元。五项金额指标均被整体放大10倍,一次单位错误便污染了100个单元格。

第二类陷阱,是生成了表格,却没有完成有效检查。小米MiMo V2.5 Pro第三次测试虽然成功输出文件,但200个目标单元格全部为空,准确率为零。文件能够打开,并不等于任务已经完成。

第三类陷阱,是把累计数据误认为单季度数据。谷歌财报中的资本支出通常采用年初至今累计口径。计算单季度数据时,二季度、三季度需要减去此前季度的累计值,四季度则需要用全年数据减去前三季度。小米MiMo V2.5 Pro曾直接把累计资本支出填入季度表格,资本支出及其占营收比例因此连续出错。

第四类陷阱,是计算过程中过早四舍五入。MiniMax M3、DeepSeek-V4-Flash(预览版)、DeepSeek-V4-Pro和Doubao-Seed-2.1-Turbo均出现过类似问题。例如,59.4亿美元被提前四舍五入为59.0亿美元。单个数字偏差看似不大,但它后续会传导至资本支出率计算过程中,导致错误被放大。

这些错误说明,财报统计考察的不只是模型能否识别数字,更考察它能否在一条完整的工作流中同时做到理解统计口径、算清小数点精度、输出Excel表格并且最终检查验收。模型的差距,是在这些基础环节被拉开的。中间一旦出错,错误会像滚雪球一样放大。

那些能够快速交付100%准确结果的模型,通常具备四个共同特点。

其一,尽快确定工具路线。它们不会逐页阅读24份PDF,而是把PDF格式的文件批量转换为TXT文本,再针对10个指标相关的文字进行检索。

其二,识别财报数据的统计口径。谷歌财报中资本支出数据往往是季度累计值,需要拆分数据并且重新计算,谷歌第四季度也通常需要使用全年数据减去前三季度。能否识别这些财务口径的陷阱,直接决定整张表格是否正确。

其三,把重复工作交给代码脚本。高效模型通常会用简洁的方式编写代码脚本,统一完成数据提取、季度差分、单位换算、增长率计算和Excel生成等任务。较慢的模型则可能在不同年份、不同指标之间反复切换工具,产生大量重复调用。

其四,知道什么时候应该停止任务。完成Excel之后,一些模型会核验季度数量、公式、负数、单位和关键单元格,确认结果正确后便结束任务。另一些模型即使已经接近答案,仍会继续搜索、重写代码或重复读取文件,由此拉长任务时长,消耗更多Token。

定价低的模型,不等于使用成本低

模型厂商通常以每百万Token的输入、缓存和输出价格计算API价格。

但在实际使用中,决定成本的并不只是Token单价,还包括Token消耗量——这些消耗包括,模型为完成任务调用了多少轮、重复读取了多少上下文、是否反复更换工具,以及失败后是否需要重新执行。

同一项任务,有的模型很快找到正确路径,用很少的Token解决问题。但有的模型不断搜索文件、重复读取上下文、修改脚本。后者即使Token单价较低,也可能因为Token消耗量导致最终的账单更贵。

第一轮测试中,MiniMax M3平均每次消耗约1063万Token,是Kimi K3约47万Token的22倍以上。虽然MiniMax M3定价低于Kimi K3,但低价并没有完全抵消冗长执行路径带来的Token消耗,最终导致单次平均成本明显更高。

另一类成本来自数据错误造成的返工成本。DeepSeek-V4-Pro单次成本只有约0.52元,但平均准确率只有93%。如果在对准确率高的场景,将人工核验、数据修正和重新运行的费用计算在内,它的真实交付成本会远高于账单数字。

对企业来说,百万Token定价只有参考价值。正确完成一次任务要付多少钱,才是真实成本。真实的有效任务成本=API成本+失败重跑成本+人工核验与返工成本+时间成本。

Token消耗多,不等于完成了更多工作

Token消耗量记录的是模型消耗了多少算力。

但它既不能代表实际工作价值,也不能代表实际成本。不同模型,Token价值不同。性能强的模型,可以用更少Token完成更多工作。性能弱的模型,用更多Token也可能无法准确交付工作。

以谷歌2025年四季度报告为例,这份接近100页财报包含约4.8万个英文单词。把表格、数字、标点符号等内容计算在内,有超过5.2万个文本,大约相当于7万-8.6万Token。若按相近规模估算,24份财报合计可超过160万Token。

在智能体任务中,每一轮工具调用,系统都可能重新向模型发送任务说明、历史对话、工具返回结果和PDF文件内容。

能力强的模型不一定消耗更多Token,它们反而能快速找到正确路径,减少无效行动。

它们可以只用少量Token思考路径、生成代码,再调用pdftotext、Python和Excel等软件批量完成数万次文本读取和200个Excel单元格的计算。

相反,能力弱的模型容易浪费Token,它们会反复打开PDF,频繁调用工具或在错误路径上来回尝试,或者调用多个子智能体。同一批文件被多次传回模型,相同的内容被读取十次,Token消耗就可能增长10倍,但其中大部分Token都被用于重复读取和试错。

这轮测试中,最好的案例是月之暗面 Kimi K3,三次任务平均Token消耗量47万,是18款模型中Token消耗最少的。其次是GPT-5.6 Sol,三次任务平均Token消耗量78万。它们都保持了100%的准确率。

但反例是Claude Sonnet 5,它的三次任务平均Token消耗1144万,是所有模型中最高的,是Kimi K3的24倍。但三次任务的平均准确率只有83.3%,综合表现排名倒数第4。

旗舰模型“想太多”时,表现还不如入门模型

第一轮测试中也出现了一些出人意料的结果:部分参数规模并不占优的模型,表现出了更高的性价比。部分定位高端的模型,由于把简单问题复杂化,反而最终表现不佳。

腾讯Hy3在本轮测试中,三次任务平均准确率达到99.5%,单次任务成本仅0.91元,平均耗时7分54秒,平均Token消耗288万。Hy3平均任务时长、Token消耗量接近海外旗舰模型,但Hy3的参数规模仅为2980亿。

它的定位是办公,并不适合用于解决复杂代码工程问题。这次任务主要考察财报理解、数据整理、表格生成能力。这与它的能力范围很匹配,因此Hy3取得了较好的测试结果。

Hy3较早识别出这项任务的标准处理路径。它将PDF转换、季度拆分、公式计算和Excel检查快速串成一条工作流,减少了工具试错。与此同时,较高的缓存占比和较低的API单价进一步压低了成本。

定位中高端的Claude Sonnet 5综合表现排名倒数第4。三次任务中,它的平均成本达到56.64元,是所有测试模型中最高的一款。其中一次任务准确率甚至下降至50%。

Claude Sonnet 5虽然代码能力强,但打开三次测试记录发现,它在执行任务时,经常主动开启多智能体(Sub-Agent)模式,将任务拆解为多个子任务并行执行。

这种“想太多”的做法,导致了更长的任务时长,更大的Token消耗。Claude Sonnet 5三次任务平均耗时13分50秒,平均Token消耗1144万,远高于腾讯Hy3。

“想太多”的策略在复杂软件开发中可能可以应付Bug(程序错误),但在财报数据提取这类流程相对明确的任务中,反而把简单问题复杂化,甚至导致最终结果出错。

提示词优化,能提升性价比模型的下限

为验证优化提示词能否改善模型表现,《财经》观察了第一轮54次任务中,准确率100%的模型工具使用路径的相似之处:先批量把PDF文件转成TXT格式,再用代码统一提取数据,用累计值分拆单季度数据,用全年数据倒算四季度,最后检查表格数据。

在第二轮54次任务中,《财经》把这个方法总结成一段86字的执行建议,写进新的提示词,继续观察模型表现变化。

结果显示,提示词优化能够整体改善大部分模型的表现。

(第二轮54次测试结果)

18款模型54次任务总耗时下降39.7%,总成本降34.9%,Token总消耗从2.1亿下降至1.71亿,降幅18.7%。整体准确率从91.2%提升至93.2%,提高2个百分点。

提升最明显的是小米MiMo V2.5 Pro。它在第一轮三次平均准确率42.7%,其中一次200个数据全部出错。写入执行建议后,平均准确率升至95.5%,最低一次也有95%,平均耗时从59分36秒降至29分10秒。

Claude Sonnet 5和Doubao-Seed-Evolving同样有所提升。前者平均准确率从83.3%升至100%,最低单次从50%升至100%。后者则从93.8%升至100%。

一些上一轮测试就交出满分答卷的模型,执行时间大幅下降。阿里Qwen 3.8-Max(预览版)的平均耗时下降42.6%,平均成本下降31%。DeepSeek-V4-Flash(正式版)平均耗时下降67.7%。

提示词无法改变模型的智力上限,但能提升模型的下限——提前规划路径,帮模型省掉选工具、试错和返工的成本。

提示词优化,也可能束缚旗舰模型的能力

提示词优化之后,并没有改善所有模型的表现。一些旗舰模型的表现甚至有所退步。

能力较强的模型往往已经具备纠错能力。路径被规划后,它需要先满足步骤要求,纠错空间随之收窄。尤其是过长、过细、控制过多的提示词,反而会增加服从成本,反而导致更多的错误、更高的时间成本。

对能力较弱的模型,详细的提示词是一套防止走偏的护栏。但对足够强的模型来说,过多限制也可能变成束缚,这甚至会放大错误。

第二轮测试中,GPT-5.6 Sol、Qwen 3.8-Max(正式版)都出现了Token消耗变多、任务时长变长的情况。GPT-5.6 Sol平均任务时长从第一轮约4分28秒增加至第二轮约5分32秒,Token消耗同步增长约10%;Qwen 3.8-Max正式版平均任务时长从约13分钟增加至约17分钟,Token消耗增长约47%。

更极端的情况是,GPT-5.5的平均准确率从100%降至83.3%,智谱GLM-5.2从99.8%降至83.3%,GPT-5.5和智谱GLM-5.2都出现了一次只有50%准确率的结果。

有算法工程师对《财经》表示,模型需要花费更多注意力满足步骤要求,而不是根据现场情况重新规划。因此提示词该写到什么程度,也是技巧。足够强的模型来说,只需要给出目标和验收标准。能力不稳定的模型,才需详细的提示词当作护栏。

做好后训练,模型能力可以大幅提升

108次测试历时10天,主要在7月23日-28日完成。测试过程中,DeepSeek-V4-Flash、阿里Qwen 3.8-Max分别于7月31日、8月3日从预览版更新到正式版。

《财经》在这个窗口期捕捉到了DeepSeek-V4-Flash、阿里Qwen 3.8-Max正式版和预览版的能力变化。第一轮测试中,DeepSeek-V4-Flash、阿里Qwen 3.8-Max的正式版相比预览版效果均明显提升。

DeepSeek-V4-Flash正式版的任务准确率从98%提升至100%。平均Token消耗从508.9万下降至344.2万,减少32.4%。平均任务时长从47分20秒缩短至20分44秒,下降56.2%。单次任务成本从0.29元下降至0.25元,降低13.8%。

阿里Qwen 3.8-Max(预览版)的准确率就已经是100%,正式版进一步降低了执行成本。平均Token消耗从316.5万下降至179.1万,减少43.4%。平均任务时长从25分45秒缩短至18分46秒,下降27.1%。单次任务成本从7.74元下降至6.21元,降低19.8%。

这两轮测试中,DeepSeek-V4-Flash、阿里Qwen 3.8-Max(正式版)的性能提升,与开发者社区反馈基本一致。

一位算法工程师向《财经》表示,“预训练通常决定模型知识边界,但后训练决定模型如何完成具体任务。”模型从预览版升级到正式版的过程中,通常会继续优化后训练流程,包括优化工具调用能力、推理策略。通过后训练,模型厂商可以充分挖掘模型的潜力。

成本、效率、准确率,不可能的三角

两轮108次测试中,并不存在一个模型能在成本、效率、准确率三个维度同时绝对领先。

这就像是一个“不可能的三角”:最快、最准的模型通常并不便宜,价格更低的模型往往需要用更长的时间完成任务。

第一轮测试中,Claude Opus 5和GPT-5.6 Sol均实现100%准确率,平均耗时分别约3分36秒和4分33秒,但单次任务成本达到9.38元和7.06元,分别约为Kimi K3的3.2倍和2.4倍,是DeepSeek-V4-Flash(正式版)的38倍和28倍。

DeepSeek-V4-Flash(正式版)同样实现了100%准确率,单次平均成本只有0.25元,但平均耗时约20分44秒,分别是Claude Opus 5和GPT-5.6 Sol的5.8倍和4.6倍。低价格换来的,是更长的等待时间。

相对而言,月之暗面Kimi K3表现出了较好的综合平衡:三次任务准确率均为100%,平均耗时约10分29秒,单次成本2.89元。它虽然没有海外旗舰模型快,但将任务控制在10分钟左右,成本仅相当于Claude Opus 5的31%、GPT-5.6 Sol的41%。

在财报统计这种重度办公任务中,DeepSeek-V4-Flash(正式版)看似和Claude Opus 5、GPT-5.6 Sol差距不大,但在应付更难的工作时,它会显得力不从心。

《财经》测试发现,在复杂的代码任务,比如面对半个月都难以彻底修复的Bug时,DeepSeek-V4-Flash(正式版)和Claude Opus 5、GPT-5.6 Sol的差距会被迅速拉大。

没有最完美的模型,只有最合适的模型

模型评测容易陷入一个误区:只看准确率榜、耗时榜、价格榜,从三张榜单中寻找各自的冠军。但真实企业场景并非如此。

企业采购AI时,通常不会寻找某一个维度的绝对第一。相比每百万Token价格,企业更关心的是:完成一次正确任务,需要付出多少综合成本。

如何选择模型,取决于任务特点——究竟更看重成本、时效,还是准确性。这两轮108次测试表明,模型选择并不存在唯一答案。

对于时间敏感型任务,企业可能愿意为更快响应支付溢价;对于大规模批量任务,较低的单次任务成本更加重要;而对于财报分析、审计、合规等高风险任务,准确率和稳定性则是不可妥协的底线。

在高风险任务中,准确率应当成为第一道门槛。只有达到100%准确率交付要求的模型,才有资格进一步比较效率和成本。从测试结果看,GPT-5.6 Sol、Claude Opus 5、Kimi K3等模型更适合这类对准确率要求较高的场景。

而对于客户服务、内容创作、一般的行业研究等场景,成本和响应速度的重要性会上升。DeepSeek-V4-Flash(正式版)、腾讯Hy3成本更低,在这类场景中明显有优势。

因此在现实中,选择模型不是寻找一个“万能冠军”。更多是根据不同任务建立模型组合,在成本、效率和准确率之间找到最优平衡。

216.73.216.237