AI 编程工具已经多到一张图都快放不下了。
这份天梯图从 S+++、S++、S+ 一路排到 F-,编程 Agent、CLI 和 IDE 密密麻麻挤在一起。最容易引发争议的一点,是 Cursor 只被放在 S 档。
先说清楚:这份排名没有提供作者、日期和统一评测口径,也不是我的独立实测。因此,它适合当工具雷达,不适合当权威选型表。
图里哪些位置最值得讨论
最顶端的 S+++ 只有两个工具。S++ 里出现了 Hermes Agent、OpenAI、Claude 和 Amp。
OpenClaw、Reasonix、Kilo Code CLI 被放进 S+;Droid、Cursor、Continue、Tau、CodeMachine、SWE-agent 则集中在 S 档。
从 A+ 往下,Free Code、QQCode、Neovate、PicoCode、LettaBot、Plandex、MiMo Code、Trae Agent、Codebuff、OpenHands、Groq Code CLI 等工具快速铺开。
它们不再只争同一个“最强”位置,而是在 IDE、终端、自主执行、开源、自托管和团队协作等不同场景里分化。
Cursor 排在 S,说明它不够好吗
不一定。
任何天梯图都依赖评测口径。有人把模型能力放在第一位,有人看任务是否能自动跑完,有人在意开源和自托管,有人只看日常 IDE 体验,还有人必须考虑价格、稳定性、权限和人工接管。
如果这些条件没有被固定,同一个工具在不同人的榜单里相差两三档都不奇怪。
这张图最实用的用法
第一,把它保存下来,用来发现自己还没见过的工具。
第二,不要只看档位,先标出真正符合自己场景的候选。
第三,用一个真实任务做小范围验证。比较任务完成质量、返工次数、执行时间、成本和人工接管体验。
第四,保留自己的使用记录。对个人和团队来说,真实工作流里的稳定结果,比任何通用总榜都更有价值。
用六个条件重新排一次
真正选工具时,可以逐项问自己:
- 模型能力是否能稳定完成我的真实任务?
- 我需要 IDE、终端、后台代理,还是远程自动化?
- 是否需要开源、自托管或灵活切换模型?
- 订阅、调用、等待、返工和维护的总成本是多少?
- 重复任务里的稳定性和失败率如何?
- 高风险操作时,我能否随时暂停、复核和回退?
我的判断是:这张图值得看,也值得讨论;但最后的工具选择,还是要回到自己的任务、约束和证据。
如果只能调整一个工具,你最想把谁升档,又最想把谁降档?
