很多团队选 AI 模型时,第一句话还是:“现在到底哪个模型最强?”
这个问题很自然,却不够接近实际工作。因为榜单通常测的是能力上限,而团队最终承担的,是交付结果、复核成本和失败风险。
一个模型在公开题目上分数很高,不等于它拿到你的代码库、资料、表格和业务约束后,也能稳定完成任务。选型时真正应该问的是:它能不能在你的真实工作现场交付?

为什么高分还不够
最近关于 AI 数学能力的讨论里,有作者提出一个值得注意的假说:模型的部分优势,也许不仅来自推理,还来自远大于人类工作记忆的外部符号空间。可以把它理解成一张几乎不会写满的草稿纸。
这个解释有启发,但不能被简化成“AI 只是记忆”或“AI 不会推理”。数学表现同时受到知识、搜索、记忆、推理和验证影响,单一解释不足以下结论。
更值得团队关注的,是研究者已经开始改变测法。
Microsoft Research 的 LiveMathematicianBench 使用训练截止时间之后的新论文构造研究级问题,并加入抗替换设计,尽量把“认出熟悉形式”和“真正处理问题”分开。官方页面显示,常规设置中表现最好的 Gemini-3.1-pro-preview 得到 43.5%;抗替换设置中表现最好的 GPT-5.4 得到 30.6%。这不是同一模型的前后对比。
Simons Institute 的 First Proof 让四个 AI 系统分别作答同一组 10 个真实研究问题,每个系统有 24 小时,过程中没有人工介入。跨四个系统合计有 7 道题曾被至少一个评审判为“基本无瑕或只需小修”。这不等于某个系统完整解决 7 题,也不能换算成稳定的 70% 成功率;同一批测试还出现了部分进展和完全失败。评审还观察到一种很典型的情况:模型能把常规细节写得很完整,却可能在最难的步骤上一带而过。
这对普通团队的启示很直接:流畅、完整和正确不是一回事。
四步真实任务验收法
榜单仍然有用,可以保留在第一轮筛选。进入最终选型前,再补一次真实任务验收。

第一步:选任务,不选展示题
从团队今天真的需要交付的工作里抽一项。
可以是一段必须通过测试的代码、一份必须对得上来源的研究结论,或一张公式和约束都不能错的表。真实任务包含你自己的上下文、脏数据、协作方式和验收成本,这些通常不会完整出现在公开基准里。
第二步:锁定比较条件
给不同模型相同的任务说明、资料、工具权限,以及接近的时间或 token 预算。
如果一个模型能联网,另一个只能靠上下文;一个拿到完整文件,另一个只看到摘要,最后的差异就不能直接归因于模型能力。
第三步:验收结果,不评价表达
先写清楚什么叫“完成”,再运行外部验收。
- 代码:跑测试,检查边界条件和回归。
- 数据:复算关键数字,核对公式和口径。
- 研究:逐条打开原始来源,检查时间、对象和结论边界。
- 数学:检查关键步骤是否成立,尤其是模型最容易一带而过的部分。
不要因为答案像专家,就默认它已经完成了专家的工作。
第四步:改变一个输入,再跑一次
换一个数字、删除一条提示,或调整一项约束,然后重复执行。
再故意给它一个会失败的条件,观察它能不能识别错误、解释原因并恢复。一次答对只能说明这一次答对;复现和扰动测试,才能暴露能力边界。
把结果变成团队可用的选型记录
测试结束后,不需要再争论哪个模型“看起来更聪明”。把结果记成一张简单的表:
| 维度 | 记录内容 | | --- | --- | | 任务完成度 | 是否交付了约定结果 | | 外部验收 | 测试、复算或来源核验是否通过 | | 稳定性 | 改变输入后结果是否仍成立 | | 失败恢复 | 能否发现问题并修正 | | 人工成本 | 复核和返工花了多少时间 |
这份记录只服务你自己的工作场景,不需要冒充通用榜单。它也比“我觉得这个模型更聪明”更容易让产品、研发和业务团队达成一致。
今天就做一次最小测试
选一项今天必须交付的工作,同时交给两个模型。锁定相同条件,保留完整过程,最后只按结果、稳定性和人工成本打分。
测完这一轮,你得到的不是新的模型神话,而是一份更接近自己工作现场的判断。
事实边界与来源
- 本文的“四步真实任务验收法”是面向从业者的实践框架,不是学术共识。
- 不把工作记忆假说写成“AI 只会记忆”或“AI 不会推理”的定论。
- Microsoft Research:LiveMathematicianBench
- Simons Institute:First Proof
- Davide Piffer:AI Isn't Outthinking Mathematicians. It's Out-Remembering Them
- AIM:AI and number theory
