最近我在各大社群发现一个挺有意思的现象。
同样是 Claude,有人觉得它是现在最强的代码模型,写代码、读长文档、做 Agent 都很稳。
但也有人觉得它没有传得那么神。
经常跑偏,输出不稳定,Tool Call 也会翻车。
一开始我以为这只是使用场景不同。
后来我把它接入到我的工作流里面,我开始觉得,事情可能没这么简单。
我一开始以为,只要模型名字一样,结果就应该差不多。
但实际用下来会发现,同样写着 Claude,最后体验出来的效果,可能真的不一样。
问题不一定在 Claude 本身
我这里先说一下,不同人用 Claude,体验有差异是正常的。
Prompt 不一样,任务不一样,参数不一样,结果肯定会有区别。
有人拿它写代码,有人拿它写文案,有人拿它做摘要,有人拿它跑 Agent,这些场景本来就不是一回事。
但我想说的不是这个
我关心的是:
如果我们尽量把任务、提示词、评分标准都固定下来,同一个模型名称下,表现还会不会有明显差异?
这其实就是模型一致性的问题。说白了就是:
同一个模型,在面对同一类任务时,能不能持续稳定地给出符合预期的结果。
它不是问模型某一次能不能答得很好。
而是问它能不能反复稳定地做好。
这个区别很重要。
因为真实使用里,尤其是开发场景里,一个模型偶尔表现惊艳没有那么关键。更关键的是,它能不能在十次、几十次、上百次调用里,尽量保持稳定。就像我们考试的时候,一两次考分不厉害,厉害的是每次考试都可以出高分。
为什么一致性比单次能力更重要?
我再举一个很常见的列子
比如你让 Claude 帮你改一个登录接口:
“把这个用户登录接口改成支持手机号验证码登录,同时不要影响原来的账号密码登录。”
同样是这个任务,不同环境下的表现可能差很多。
有的 Claude 会先理解原来的代码结构,再判断应该改哪些文件,最后给出比较稳的修改方案。
有的 Claude 会直接开始改代码,看起来很积极,但可能把原来的账号密码登录逻辑也一起改乱了。
有的 Claude 能只改登录模块。
有的 Claude 会顺手重构一堆无关代码。
有的 Claude 会正确调用工具去读取文件。
有的 Claude 会在没看完整项目结构的情况下直接开始猜。
用到最后感受到的就是:
“为什么别人说 Claude 写代码很强,我用起来却一般?”
但这里面不一定是 Claude 本身变差了。
也可能是推理过程、参数配置、系统提示词、工具调用策略、上下文处理方式都不一样。
这些差异叠在一起,就会让同一个模型名字,最后呈现出完全不同的体验。
普通聊天不明显,真实工作流里会放大
如果只是聊天,其实很多差异感知不到。
比如问一个概念解释,写一段文案,做一个简单总结,模型稍微自由发挥一点,也能接受。
但到了开发和自动化场景,就不一样了。
比如 JSON 输出。
你要求模型固定返回:
{
"title": "",
"content": "",
"tags": []
}
一次输出正确。
一次少了字段。
一次字段名变了。
一次前后多了一段解释。
对不是非专业的人来说,这可能只是小问题。
但对程序来说,后面的流程可能直接报错。
Tool Call 也是一样。
真正麻烦的不是模型完全不会调用工具,而是它有时候能调用,有时候不能调用;有时候参数传对,有时候参数乱传。
这种不稳定最难排查。
因为你很难判断到底是 Prompt 问题、模型问题、工具问题,还是上下文处理出了问题。
所以我现在越来越觉得,模型一致性不是一个很虚的指标。
它在真实业务里其实很具体。
具体到一次接口报错,一次工作流中断,一次 Agent 死循环,一次人工返工。
所以后来我做了一次测试
一开始我还是考体感来判断“这个 Claude 好用”或者“这个 Claude 不行”,其实意义不大。
因为每个人的任务不同,使用习惯也不同,最后很容易变成主观争论。
所以我更想看一个相对可控的结果。
在相同模型名称、相同任务、相同输出要求、相同评分标准下,不同调用结果到底稳不稳。
所以在我的测试中主要看几个方向:
-
格式遵循能力。
比如能不能稳定输出可解析的 JSON,是否漏字段,是否污染结构。
-
Tool Call 能力。
比如是否能正确选择工具,是否能传对参数,是否会出现幻觉调用。
-
长上下文稳定性。
比如上下文变长之后,会不会漏信息,会不会忘记前面的要求,会不会后半段开始跑偏。
-
多轮任务执行能力。
比如一个任务拆成多步以后,模型能不能持续跟住目标,而不是中途偏掉。
这部分我整理了一个测试页面,主要是方便后面持续观察模型一致性变化: Oken.ai
这里不是想说某个结果一定代表最终结论,因为模型评测本身就很复杂。
我更想用它观察一个问题:
模型名称相同,不代表实际表现完全一致。
测完之后,我最大的感受不是谁第一
测试下来,我最明显的感受不是哪个模型最强。而是差异确实存在。
有些结果在普通问答里看不出来。
但一到结构化输出、Tool Call、长上下文、多轮任务这些场景里,稳定性差异就开始明显了。

这也解释了为什么很多人对 Claude 的评价会完全不一样。
有人只是拿它写文章、做总结、改表达,觉得非常好用。
有人拿它写代码、接 API、跑 Agent,就会遇到更多稳定性问题。
不是谁的感受错了。
而是大家对模型的要求不一样,使用的场景也不一样
对普通用户来说,模型一次回答不够好,大不了重新问一次。
但对开发者来说,一次不稳定可能意味着整个流程都要兜底。
这也是为什么我觉得,讨论模型能力的时候,不能只看“它最强的时候能做到什么”。
还要看它在重复任务里,能不能稳定做到。我们要看的是综合实力。
以后选模型,我会多看一个指标
以前我看模型简单粗暴,看哪个模型更聪明,哪个模型更便宜,这是最直观的判断方式。
但现在我会多看一个东西:
一致性。
尤其是在代码、Agent、Tool Call、自动化工作流这些场景里,一致性的重要性会被放大。
因为真实业务不是做一次 Demo。
真实业务是每天调用很多次。
我需要的不是模型偶尔答出一个 120 分的答案。而是它大多数时候都能稳定交付 80 分以上的结果。
因为真正落地 AI 的时候,很多成本都不是 Token 本身。
而是重试、排查、兜底、人工修正、流程中断。
这也是为什么最近会有人觉得AI越用越累,那是因为它一出错我们的排查成本就会很高
最后
我现在对 Claude 的看法还是很明确。
它依然是很强的模型,尤其在代码、长文本、复杂任务理解上,优势很明显。
但“Claude 很强”是一回事。
“你实际用到的 Claude 是否稳定”是另一回事。
模型名字一样,不代表体验一定一样。
单次表现不错,也不代表长期可用。
如果只是聊天,一致性问题可能没那么明显。但是话又说回来如果只是单纯聊天我可能都不太会用到它。
但只要进入代码、Agent、Tool Call、API 集成和自动化工作流,模型一致性就会变成一个绕不开的问题。
所以以后再讨论哪个模型更好,我可能不会只问:
这个模型强不强?
我会多问一句:
它稳不稳?
在复杂的工作流里面跑得咋样?稳不稳?

