刚融完650亿美元、估值直奔一万亿而去……前有港股智谱7000亿市值,后有Anthropic估值7万亿人民币。AI行业的造富神话,果然比鬼故事还鬼故事。但说实话,距离4月17号Opus 4.7上线才过了42天,一个半月就又扔出一个新模型——在Claude的发布历史上,从来没有过。



看来GPT-5.5和Codex给的压力确实太大了,Opus 4.7的口碑也把自己给拉崩了,没办法,必须最快速度把Opus 4.8拉出来救火,要不然真可能被Codex偷家偷疯。模型本身的参数比如最大上下文、输出长度、知识库时间等,跟Opus 4.7几乎一样,价格也没变:输入5/M,输出5/M,输出25/M。所以基本上是在Opus 4.7的基模上又调了一下。

然后我反应过来一件事:我靠,Opus 4.8上了,你不会要把我的Opus 4.6给顶掉吧?Opus 4.5是我心中内容创作的巅峰,Opus 4.6比4.7差一点但还能用,而Opus 4.7我是完全觉得不可用。按照Claude网页端只保留两代模型的优良传统,Opus 4.6可能要被顶掉。我怀着紧张的心情一看——Claude我干你大爷。行吧,只能接受,说不定Opus 4.8在内容创作上更好呢?(虽然我几乎不抱期待了。)

说回Claude Opus 4.8。不废话,先看跑分。跑分我真的不想多聊了,很没劲,反正就是“赢学”——数字又高了一点,大概就这样。唯一一个用尽洪荒之力还是没跑过GPT-5.5的类别是Terminal-Bench 2.1。这是个Agentic基准,评估Agent在真实命令行环境里干活的能力:把模型扔进沙盒终端,让它自己查文件、敲命令、看报错、调试,看能不能跨多步做完一个任务。这是在Claude口径里唯一一个跑不过GPT-5.5的,而且挺要命——Terminal-Bench基本代表Agent开发能力的最高峰,尽了力也没干过,那过两天GPT-5.6出来还玩个屁?这也侧面说明GPT-5.5的开发能力是真强。

再说这次更新的一些特性。

1. 思考强度给所有人开放
这次4.8上线,同时把一个叫effort(努力程度)的控制开放给所有人了——Chat模式下也能调,所有套餐都有,免费用户也有。Claude Code和Cowork用户肯定很熟悉,位置就在模型选择旁边。从Low到Max是努力等级,下面的自适应思考别关,开着组合用就行。我自己常年喜欢默认开Extra,干大活就上Max,因为Opus 4.7只有自适应思考不太好用,4.8终于给弄回来了。

2. 变得更精确,但也更不主动了
Opus 4.8更新后明显感觉更精确了,有点GPT-5.5的感觉,指哪打哪,更遵循指令。这对专业开发者来说是好事,但同时也带来一个弊端:主动性变弱了。你让它干A,它就只干A,绝不会自作主张觉得“你是不是顺便也想要B”然后顺手把B也办了。我自己测试时就遇到了——习惯性没说一定要去看线上数据而不要只看本地代码,但Opus 4.6和4.7时它们都会主动用我的skill连线上服务器看生产环境数据,Opus 4.8却两次都没主动看,给的方案都基于本地,反而给我添了些麻烦,重新调整文档和记忆才好一点。

对于设计好了自己Harness环境的专业开发者,会觉得非常得劲——能感觉到错误率和幻觉率都在降低,很精准。但如果把这个群体推衍到整个Vibe Coding群体,我觉得不一定是好事。我们视频组同事今晚用Opus 4.8测他们用Skill做视频动效的工作流,发现效果反而变差了。而且你能明显感觉到模型更加自信,过程中跟你确认的时刻变少了——比如优化方案出来,直接不确认就自己干了。

我们很多非专业者用AI时,是靠着AI的主动性往前走的,习惯了那种“你懂我意思”的爽感。你含含糊糊扔一句话过去,它就能猜到你心里那个完整的需求,然后问你是不是,再帮你直接搞出来——这种被理解的感觉挺上头。当然这个爽感有代价:模型主观性太强,代价就是不可控。猜对了你舒服,猜错了呢?它拿着一个你压根没提的需求吭哧吭哧干一堆活,最后还得你擦屁股。这种“出发点是好的但结果是拉的”在长时Agent任务中尤其要命。所以未来跟Opus 4.8协同,对大家的需求表达能力要求更高了。

3. 变得更加诚实了
这点跟上面有点像,也是Anthropic自己拎出来放在博客核心位置的点。过去大家一定遇到过:Claude帮你写功能,噼里啪啦写了一大段,特别自信地说“搞定了,没问题,可以跑了”。你信了,一跑,发现另一个地方崩了。回去问它,它又特别自信地说“哦抱歉,问题找到了,不好意思我没发现,我再改一下,这下绝对没问题了”。你又信了,又跑,又报错——经常出现这种情况。你要知道,它每一次都那么斩钉截铁,每一次都那么言之凿凿,但每一次它自己心里也没底。AI很多时候只是被训练得看起来很有把握而已,这个毛病几乎是所有大模型的通病。

这次Opus 4.8在这个问题上做了重点优化。官方公告说,4.8让自己写的代码里的瑕疵蒙混过关的概率比上一代低了大概4倍。我又去翻了下这次Opus 4.8的系统卡,发现了更牛的东西:在偷懒问题上,Opus 4.8好像是唯一一个能做到0%不良率的模型。我夜里几个小时测试与开发中也感觉到——这是真不偷懒啊,思考得真细。之前有次都给我干生气了,Opus 4.8明显靠谱很多,非常详细地全面审查我的代码,找尽可能需要优化的地方。我同事的反馈也是这样,基本上大家感觉差不多。Opus 4.8在开发上总体感觉有大进步。

4. 创作能力
同样的Skill,同样的创作,比Opus 4.7有进步,但依然比不上Opus 4.6。比如我把我之前写的“AI时代的6个人才特质”抽离出来,让Opus 4.8用我的写作Skill去写,写出来的一些句子是这样的——Opus 4.6+我的Skill是绝对不会写出这种话的。“不是XX、而是XX”是明确的禁用词,它直接改成“不再是”来规避,真是耍小聪明。还有那个奇怪的比喻:为什么要把靠谱特质的人比喻成“高速运转的机器里那点润滑油”?我是真不理解,这是什么奇怪的癖好吗?还有这段,非要把一个人比喻成一个物化的“锚”?还有莫名其妙的大段无意义排比,把所谓AI味的禁忌犯了个遍。让它根据《流浪地球2》续写一个新地下城的1000字小故事,写得也挺刻板印象。比4.7好但没好多少,整体人机味还挺重。

5. 其他更新
这次Opus 4.8还迭代了快速模型,官方叫fast mode。之前Claude Code里输入/fast就有,只是之前Opus 4.7的fast比较贵——2.5倍速度但6倍价格,普通版本一直是输入百万5美元、输出百万25美元,Opus 4.7 fast模式是输入30美元、输出150美元。这次升级不错:速度达到标准版的2.5倍,价格却只有之前版本fast的三分之一,降到输入10美元、输出50美元,从标准版的6倍价格变成2倍价格,速度没变。侧面说明马斯克的算力确实给到位了,Claude一下子财大气粗。

还有一个有意思的东西:Claude Code的dynamic workflows(动态工作流)。大概是让Claude自己写一套编排脚本,在一次任务里一口气拉起几十甚至上百个子Agent并行开干,干完还会自己先验一遍,确认没问题再把结果交给你。原话是:“有些问题过于庞大,单次单代理处理难以胜任,尤其是在复杂、遗留的代码库中:跨整个服务的缺陷排查、涉及数百个文件的迁移、或是在最终决策前需要从多角度进行压力测试的方案。动态工作流能够端到端地处理所有这些任务。”触发方式有两种:直接跟Claude Code说“创建一个动态工作流xxx”,或者把努力级别调成特殊选项Ultracode——这个设置会自动把努力级别调至xhigh,同时让Claude自动判断何时使用工作流来处理你的任务。

这次Opus 4.8的更新总结大概就是这样。我个人还是比较喜欢的,因为在开发上确实有不错的加成,整体确实变好用了。但在创作上我还是有点失落,因为把我的Opus 4.6给顶掉了……未来为了适配Opus 4.8,可能很多跟内容相关的Prompt和Skill都得重写,因为牵扯的东西太多了——调研、历史文献撰写、分镜撰写、特效生成等,全都是内容。就很烦,好不容易在Opus 4.6上跑通了,又得全部重新来。哎。

对了,Anthropic这次还留了个更大的钩子。除了Opus这条线,它们手里还攥了很久的、比Opus智能还要更高一档的新模型,代号Mythos,说过几周就能给所有客户用上了。到时候我想看看这个号称最牛的模型到底是个什么光景。AI啊,真好玩。