过去两年里,靠肉眼分辨一张图是人画的还是AI生成的,已经越来越不靠谱了。以前AI最怕的就是图里带大量文字,比如菜单,动不动就把单词拼错。早期的模型在生成墨西哥餐厅菜单时,经常把常见菜名搞成“enchuita”“churiros”“burrto”“margartas”这种样子,一看就不对劲。



但现在拿最新的ChatGPT Images 2.0去生成一份墨西哥菜菜单,出来的结果已经可以直接拿去店里用了,普通顾客光看文字几乎看不出什么毛病。唯一可能让人嘀咕的反而是价格,比如“13.50美元的酸橘汁腌鱼”,让人稍微琢磨一下这鱼够不够好。作者还对比了两年前DALL·E 3生成的菜单,那时候ChatGPT还没内置生图功能,旧模型在文字呈现上非常不稳定,跟新模型比起来反差特别大。

AI图像生成器在拼写方面长期表现不好,主要跟主流技术路线有关。过去的图像模型大多用扩散模型,就是在噪声里一步步“重建”图像。Lesan AI的创始人兼CEO曾在2024年接受TechCrunch采访时解释过,扩散模型本质上是在还原一整幅图像,而图像上的文字通常只占非常小的一块像素区域,所以模型更倾向于优先学习覆盖面积更大的视觉模式,而不是精细的文字形状。在这种情况下,研究人员开始探索自回归模型这类新机制,让图像生成更像大语言模型那样,通过逐步预测、理解结构来构建画面。

对于ChatGPT Images 2.0到底用了什么底层架构,OpenAI在本周的媒体简报会上没有正面回应。不过他们在介绍中强调,新模型具备所谓的“思考能力”,能够联网检索信息,从一次提示生成多张图片,还能对自己的输出进行复查。这意味着Images 2.0不只是单次出图,而是可以围绕同一个创意生成多种物料,比如不同尺寸的营销素材、适配多平台的广告图,甚至一组多格漫画分镜。

OpenAI还表示,新模型在非拉丁文字的渲染上也有明显进步,日文、韩文、印地语和孟加拉语等语言的文字呈现能力都得到了加强。模型的知识截止时间是2025年12月,所以如果提示里涉及最近的新闻或最新事件,生成的内容可能会有时效性上的局限。在官方新闻稿里,OpenAI把Images 2.0描述为在细节和逼真度上实现了前所未有的提升,强调它可以构思和落地更复杂的图像,精准遵循指令并且保留用户提出的细节要求。尤其是在以往图像模型最容易崩坏的环节,比如小号文字、图标、界面UI元素、密集构图以及细腻风格约束等方面,Images 2.0都能在最高2K分辨率下稳定输出。

能力的提升也带来了速度上的权衡。相比直接在ChatGPT里输入问题拿到文本回答,生成一幅复杂的、多分镜的漫画或者多尺寸物料,确实需要更长时间。但从目前的产品表现来看,完成这类复杂图像任务通常也就几分钟,已经能覆盖大部分实际应用场景了。

在访问权限方面,OpenAI表示,所有ChatGPT和Codex用户都会从周二起逐步获得Images 2.0的使用权。不同层级的付费用户可以在生成质量和输出复杂度上解锁更高级的结果,比如更高分辨率、更复杂构图或者更多版本的图像输出。同时,OpenAI还会通过gpt-image-2向开发者开放相关API,按生成图像的质量和分辨率分级计价,让第三方应用可以在自己的产品里集成这个图像生成能力。

ChatGPT Images 2.0体现了图像生成模型在文字理解与排版能力上的一次大跃升,让曾经被认为是弱项的文字区域,变成了可以放心交给AI处理的设计环节。随着OpenAI开始全面开放和商业化接口,这一代文生图模型有望迅速进入营销设计、产品UI、游戏与漫画创作等多个行业的生产流程,进一步模糊人类和AI视觉内容之间的界线。