别再看"我们最强"了。一份可复现的评测方法,把话语权还给事实。
"我们最强""行业领先"——这类形容词,评测报告里一个字都不该有。评一个 AI 编程 Agent 好不好,只有一条路:把方法交代清楚,让任何人拿同样的设置复现出同样的量级。下面这套方法,来自我们对 XunOPC 与另一款主流 AI 编程助手做的一次同模型对照实测。竞品在此匿名为"对照组"——因为这篇讲的是怎么评,不是谁赢。
第一条铁律:同模型,中途不换
评 Agent 最常见的作弊,是两端偷偷用了不同的底座模型,最后比出来的是模型强弱,不是 Agent 强弱。所以第一条:两端都锁死同一个模型 deepseek-v4-flash,从检查到修复全程不换。模型这个变量被钉死之后,剩下的差异才干净——才是任务编排、工具调用、工程判断的差异,也就是"Agent 本身"的差异。这一步做不到,后面所有数字都没有意义。
第二条:真实项目、真实闭环、零人工介入
玩具样例骗不了人也证明不了人。我们用的是一个 826 个文件的真实多模块工程(Java 后端 + Vue3 前端),任务是完整的一条链:检查 BUG → 确认高危 → 修复 → 验证,不是"找出这段代码的错"这种单点。更关键的是全程 0 人工介入——中途不提示、不纠偏、不喂答案。因为企业真正要买的,是"我把任务描述清楚,它能不能自己跑完整条链",而不是"我全程盯着它、它才不出错"。人一旦介入,考的就不再是 Agent,是操作 Agent 的人。
第三条:八项指标,逐条有定义
只报一个总分是耍流氓。我们把能力拆成八项、各自满分打分:完成率(闭环是否真的跑完)、总耗时、人工介入次数、结果质量(修复是否正确、有无引入新问题)、可追溯性、可控性(高危动作能否拦下)、可复用性、使用成本。其中最容易被忽略、却往往决定企业敢不敢上生产的,是可追溯性:出了事,你能不能完整回放它当时"想了什么、调了什么工具、改了哪个文件"?本次实测里,一端以编译产物和字节码为证,另一端带思考链、工具调用和时间戳可逐帧回放——两种不同维度的可追溯,都比"它说它改好了"强得多。评测要把这一维单列出来,而不是塞进"结果质量"里含糊过去。
第四条:并行盲测,数字说话
两端必须并行跑、互不知晓彼此的产出,避免抄答案和相互对齐。这样得到的清单才是各自独立的判断。本次同模型对照实测的原始数字可以直接摆出来:一端检查出 20 项、其中高危 4 项,另一端检查出 14 项、高危 3 项,两端重叠仅 2–3 项——说明它们的注意力落点根本不同,一个偏前端一个偏后端,合起来才是这个项目真实的 30 多个问题。八项加总,一端 37、另一端 38,微弱之差。这个"微弱",本身就是最诚实的结论:n=1,一次实测,谁也没资格外推成"永远更强"。
说到底,评测该由方法和事实说话,不由形容词说话。把模型钉死、把项目做真、把介入清零、把指标拆开、把两端隔离——做到这五点,谁的报告都可以被复现、被质疑、被推翻。这才是我们愿意把评测方法公开的原因:XunOPC 不怕被这样量。