人工智能公司Anthropic最近发了一份技术复盘报告,承认产品的三项近期调整确实导致了Claude模型性能下降,但明确否认了那种“为了省算力故意降智”的说法。目前相关的漏洞和限制已经修复了。



这段时间,AI圈里关于Anthropic的旗舰模型Claude“偷偷缩水”的质疑声挺多的。大量开发者和资深用户在各个技术社区反映,Claude不仅在处理复杂工程任务时推理能力断崖式下跌、幻觉变多,在Token消耗上也变得非常低效。面对外界的质疑,Anthropic在官方博客里回应说,公司非常重视关于性能退化的反馈,绝对不会故意去降低模型性能。经过排查确认,API和推理层都没有受到影响。

报告指出,底层的模型权重并没有改变,问题出在模型外围的“封装框架”上的三项独立调整:

第一项是默认推理力度下调。3月4日,为了缓解用户界面延迟和无响应的问题,Anthropic把Claude Code的默认推理力度从“高”调到了“中”。这个调整直接导致模型在处理复杂任务时的逻辑分析能力受到了限制。

第二项是缓存逻辑有漏洞。3月26日部署的缓存优化方案存在代码缺陷。这个方案本来是计划在会话闲置一小时后清理历史的“思考过程”,但实际运行中,清理动作在每次对话轮次后就被触发了。这就导致模型丢了上下文的“短期记忆”,输出内容出现重复或者遗忘的情况。

第三项是系统提示词做了冗余限制。4月16日,为了减少Opus 4.7版本输出太啰嗦的问题,系统新增了指令,把工具调用之间的文本和最终回复分别限制在25个和100个单词以内。结果这个限制适得其反,导致模型在编程质量评估里的得分下降了3%。

以上这些问题主要影响的是Claude Code命令行界面、Claude智能体软件开发工具包以及Claude Cowork,没有波及到Claude API业务。

Anthropic承认这些调整让模型显得“智力下降了”,也坦言这不符合用户对体验的预期。为了恢复市场信任并防止类似的事情再发生,公司宣布要实施几项运营机制的改革:一是扩大内部测试范围,要求更大比例的员工强制使用公众版的Claude Code来统一体验;二是在修改系统提示词之前,强制运行更广泛的单模型评估和消融实验,以便精准隔离特定指令的影响;三是优化提示词变更的审计流程,确保对特定模型的变更能做到精准控制。

另外,针对上述Bug导致的Token浪费和性能摩擦,Anthropic已经在4月23日重置了所有订阅用户的额度,并且计划后续通过X和GitHub上的官方账号,提供产品决策背后的深层逻辑,以便和开发者群体保持更透明的沟通。