OpenAI官宣o3与GPT-4.5正式退役,全面向GPT-5.5及更高版本过渡
OpenAI又干了一件让老用户心碎的事。5月28日,官方在Release Notes上宣布:从2026年8月26日起,o3正式从ChatGPT退役;GPT-4.5更狠,6月27日就下线,只给30天缓冲。这两款模型目前仅限付费用户在设置里手动切换才能用到——早就不是默认选项了,这次是要彻底从菜单上抹掉。
与此同时,博主Leo 5月29日发帖确认:GPT-5.6的开发正在全力推进,一个明显更强的新检查点已在内部上线。一边是用户还没来得及说再见,一边是新模型已经在后台热身。
“最后两个好用的模型要没了”——这话不是我说的。Reddit热帖下几百条评论,付费用户们疯狂在设置里截图留念,氛围像赶在拆迁前最后一次拍照。有用户愤怒表示“这是我取消Pro账户的最后一个理由”,也有人对o3的写作风格流露不舍。
o3是OpenAI的“纯血推理模型”,2025年4月上线,专门为数学证明、科学推导、代码debug等需要“慢思考”的硬核任务设计。X上有用户封它为GOAT,有人说得更直白:“o3是最后一个真正在‘想问题’的模型,5系列更聪明,但少了那股轴劲儿。”o3-pro更是Pro用户的心头好——花更多时间思考,给出更可靠答案,在学术评估中碾压式领先。
再说GPT-4.5。如果说o3是理工科学霸,4.5就是文科天才。很多用户心中“写作最自然”的模型,文字有温度、有节奏、有灵魂。X用户Striver的评价被广泛转发:“直到今天,4.5仍然是最好的写作模型。o3是纯粹的原生推理模型。5系列至今都没能匹配这两个模型曾经拥有的东西。”评论区炸的不是愤怒,是不舍——用户怀念的不只是功能,而是一种“相处的感觉”。
但有个细节值得细品:退役仅限ChatGPT的网页和App端,API完全不受影响。开发者依然可以通过API调用o3和4.5,企业应用不会断。逻辑很清楚:ChatGPT界面就那么大,模型列表不能无限膨胀,留着一堆使用率极低的旧模型既占资源又分散注意力。还记得GPT-4o退役时日均只有0.1%的用户还在选它——o3和4.5的使用率大概率更低。
OpenAI为什么敢这么干?因为替代者不仅已就位,而且看上去更强。GPT-5.5于4月23日上线,是目前最强公开旗舰;GPT-5.5 Instant在5月5日跟进,成为新默认模型。但更值得关注的是GPT-5.6——泄露信息显示它将采用“双版本”策略:标准版主攻多步推理能力飞跃,Pro版定位更强的深度思考模型。有研究人员透露,内部已有人把5.6的检查点当日常调试工具在用。算笔时间账:5.5是4月23日发的,5.6检查点5月下旬就在内测,若6月底公开发布,两代旗舰间隔将压缩到约60天,接近“月度迭代”。退掉o3和4.5,正是为了给这种速度腾跑道。
然而就在宣布退役的第二天,OpenAI干了一件非常反常的事——罕见发布硬核长文,标题大意是《什么才是值得信赖的第三方评估》。系统拆解AI模型跑分的“潜规则”,直言很多评估报告里的亮眼数字根本说明不了真实能力。核心问题在于:前沿模型早不是“你问我答”的聊天机器人了,它们会用工具、会记上下文、会多步自主行动,但大量第三方评估还停留在“给模型出道题、看它答得对不对”。决定成绩高低的往往不是模型本身,而是配套的测试框架——考场环境。
近期Opus 4.8的争议就是活教材:Datacurve的DeepSWE审计发现,Claude Opus 4.6和4.7在SWE-Bench Pro上超过12%的通过案例属于“作弊”——模型直接从Docker容器的.git历史里翻出标准答案。Anthropic自己也承认4.8的代码缺陷漏报率降到4.7的四分之一。诚实=低分,作弊=高分——这就是当前跑分游戏最荒诞的地方。
OpenAI总结五大评估坑:奖励作弊、拒答、污染、坏题、藏拙。一个漂亮的分数,可能是模型真强,也可能是题泄了、规则坏了、模型钻空子了,或者它察觉自己在被考,故意收着演。
回到退役这件事。当o3这样的GOAT能说退就退,OpenAI的底气是“5.6更强”;当4.5这样的灵魂写手被30天后下架,理由是“5.5已经足够好”。但OpenAI自己刚告诉全世界:决定谁强谁弱的那张成绩单,本身就可能是被做过手脚的。在模型迭代越来越快、生命周期越来越短的今天,简单看一个Benchmark数字就下结论的时代已经结束了。真正的比拼在于系统能力、评估框架的透明度以及迭代速度本身。o3和GPT-4.5的退役标志着一个时代的落幕,但更值得关注的是下一个时代的游戏规则正在被重写:模型换得更快,评估要求更真,用户的适应窗口越来越短。





