MAI-Image-2.5 局部编辑 vs 对话改图:2026 该怎么选
你已经有一张能用的商品图。客户只要把货架换成浅灰影棚,海报上那行「夏季特惠」改成「会员日」,再在右下角加一个不挡脸的小图标。如果你让模型「重新生成一张」,人会漂、排版会重排、上一轮好不容易对齐的光也没了。真正要买的不是「更能画」,是改你点名的那一块,其余冻结。
2026 年 6 月 2 日,微软把这件事写成了 MAI-Image-2.5 的公开卖点:场景感知的局部编辑。同一天它自己贴出的 Arena 快照里,图像编辑榜第二、文生图第三。第二不是失败,是把战场从「谁更能从零画一张海报」挪到了「谁更能改你已经有的那张」。
这篇不重写昨天那张产品说明页。说明书回答「模型发了什么」;这里只回答三问:局部编辑到底验收哪三条任务;对话改图和选区工具差在交互,不差在模型名;海报、改一处、连改几轮该怎么选。
目录
- 6 月 2 日发了什么:场景感知,不是新画风
- 三条任务怎么验收:换背景、换字、加物体
- 对话式改图:不学选区的那条路
- 按任务选:局部编辑、区域工具、对话迭代
- Arena 快照怎么用、怎么误用
- 可打脸预判
- 常见问题
6 月 2 日发了什么:场景感知,不是新画风
官方稿日期是 2026 年 6 月 2 日。入口是 MAI Playground、Microsoft Foundry,以及 PowerPoint 里的生图、OneDrive 里滚动上线的编辑。同系列还有更快更便宜的 Flash 变体。API 文档把能力写成:文生图 + 对已有图做可控编辑。
微软点名的三件事,没有一条是「新画风」:
| 官方说法 | 实际买的是 |
|---|---|
| Complex visual reasoning | 加物体时透视、比例、阴影跟得上场景,而不是贴一张贴纸 |
| Fine-grained edit control | 换物体、改字、去运动模糊,其余画面不动 |
| Face and identity consistency | 改姿势、表情、机位时,人还是同一个人 |
微软稿把任务动词写得很直:替换物体、更新文字、去掉运动模糊,同时「其余画面不动」;加物体时要带着正确的透视和阴影。这和「重新摇一张更漂亮的图」是反义词。
下面这张对照图方便把 MAI-Image-2.5 放进同一张桌子——它不是又一个文生图名,是编辑动词。
封面用既有模型对比图,把局部编辑放进同一张桌子。来源:ChatIMG。
事件落地页见 MAI-Image-2.5 是什么。那页讲发布事实和「同一份工作在对话框里怎么做」;本文只把局部编辑从文生图、区域魔棒、对话迭代三条路上切开。想看官方 21 秒能力片,微软自己的介绍在下面。
演示:微软官方 21 秒介绍。来源:YouTube · Microsoft,对照 6 月 2 日公告。
实用规则: 读新模型稿,先数「编辑类能力」条数。条数 ≥ 文生图卖点,这篇才值得写对比,而不是再写一篇发布会摘要。
三条任务怎么验收:换背景、换字、加物体
InstructPix2Pix 把指令式图像编辑定义成:一句人话改已有的图,不必先画 mask。MAI-Image-2.5 把这条做成了「场景感知」——模型要懂结构、光线、尺度和空间关系,而不是只懂抠一块。
验收不要看 Arena 分。只看这三张你自己的图:
- 换背景:货架换成浅灰影棚。主体边缘有没有毛边,地面投影有没有跟着变,脸上高光有没有漂。
- 换字:海报上一行促销改成另一行,字号和字距尽量贴原版。邻近图标、条形码、免责声明小字有没有被重排。
- 加物体:右下角加一个不挡脸的小图标。透视和阴影是否像本来就在那儿,还是像贴了一张 PNG。
Foundry 文档把同类编辑写成:物体替换、版式微调、文字更新、去运动模糊这类伪影,同时保住构图。它没有给你一个可复核的「中文小字准确率」。所以本文不编「谁的中文更准」。能写的只有:任务动词对得上,才算过关。
想看「改一处、其余冻结」在区域工具上怎么被做成可见按钮,对照 Grok Imagine Image 2.0 vs GPT Image 2——那边卖的是魔棒、分割、去背,不是场景推理。两条线都合法,服务的是不同手指动作。
下面这张工作流示意把「一次只改一个变量」画出来:先冻结其余,再动被点名的那一块。
配图:逐项修改、其余冻结。来源:ChatIMG 既有工作流示意图。
实用规则: 验收局部编辑,只看一件事——你没点的地方有没有漂。漂了,再高的 Arena 分也不算过关。
对话式改图:不学选区的那条路
区域工具要你指出「改哪」:魔棒、分割、画笔、矩形框。场景感知局部编辑把「懂场景」交给模型,但你仍然要说清楚改哪一块。对话式改图更轻:用连续几句人话迭代,模型自己推断位置。后者更接近 InstructPix2Pix 的原定义,适合不想学选区的人。
Adobe 走精确控制(Precision Flow / Markup),拆解见 Firefly Precision Flow vs 对话式改图。对话式路线不跟它比像素级笔刷;它比的是「一个能一句话说清的任务,几轮之内能不能到刚刚好」。
下面这张图把「从粗到精」的对话迭代画出来——第一句换背景,第二句修边缘,第三句才动字。
配图:一轮一句,不要一次塞三个变量。来源:ChatIMG。
ChatIMG 站在这一列:上传一张图,用一句话说「换背景 / 去水印 / 改局部」,而不是先学一套选区工具。它没有把 MAI-Image-2.5 放进模型选择器——事件页也写了这一点。你能选的是对话框里实际列出来的编辑模型。模型名不是功能本身;任务动词才是。
免费试用对话改图 适合验证「这句话能不能只改该改的地方」。它不是微软模型的替身,也不是 Grok 魔棒的壳。
实用规则: 不会点选区,就不要为了榜单去学一套圈选。先用一句话试一张你自己的图;漂了再换带选区的工具,而不是先换模型名。
按任务选:局部编辑、区域工具、对话迭代
骨架用的是 X vs Y vs Z。第三极不是又一个闭源大模型,而是你怎么指挥:场景感知局部编辑、可见选区工具、对话迭代。2026 的模型发布潮,单模型解读会被官方博客碾压;能留下的是「按任务怎么选」。更长的选型上下文见 2026 AI 图像生成器横评。
| 任务 | 先试 | 为什么 | 别做 |
|---|---|---|---|
| 已有图,换背景 / 换一行字 / 加一个物体,其余冻结 | 场景感知局部编辑(MAI-Image-2.5 这条产品叙事) | 官方卖点就是未触碰区域不动 | 再跑一轮文生图赌构图还在 |
| 要看见选区、边界必须干净 | 区域工具(魔棒 / 分割 / Markup) | 手指点到的地方才改 | 把「场景感知」当成圈选替代品硬凑 |
| 不会点选区,只会说话,准备连改 3–5 轮 | 对话式改图 | 指令式编辑的原义:改一处,其余不动 | 把模型名当功能本身 |
| 从零做一张文字密集海报 | 文生图对照物(横评里的海报默认候选) | 局部编辑救不了一张不存在的初稿 | 用换字工具硬凑一张没有的海报 |
决策树只留一个出口。选完工具就去试一张你自己的图,不要再开一篇「也可以看看某某」。
决策过滤器: 先问自己一个问题——你要改的是「被点名的那一块」、「你能圈出来的那一块」,还是「一个能一句话说清、准备连改几轮的任务」?场景选局部编辑,圈选选区域工具,说话选对话。
Arena 快照怎么用、怎么误用
微软在 6 月 2 日稿里写:MAI-Image-2.5 在 Arena 图像编辑榜排第二(稿面写超 Nano Banana 2),文生图第三(稿面写超 GPT-Image-1.5 与 Nano Banana Pro 2K)。同一天 Arena 官方账号 公布 Single-Image-Edit 分数 1401,并写比 Nano Banana 2、Grok Imagine Image Quality、ChatGPT-Image-Latest-High Fidelity 高出约 10 分。这些数字的日期锚点是 2026-06-02。
这组数字能用的方式只有两种:
- 时效锚点:6 月 2 日这一天,编辑能力已经进第一梯队,不是「也能改图」的附属功能。
- 对照,不是皇冠:第二名说明发布叙事故意站在编辑榜上;也说明榜是活的,过几周再截一张图,名次可能已经换人。
不能用的方式:把「第二」翻译成「现在仍然第二」,或翻译成「全面超过 GPT Image 2」。Arena 是偏好投票,不是印刷品验收。印刷品验收看的是:指定区域有没有漂、小字能不能印、加进去的物体阴影像不像本来就在那儿。
榜单入口:Arena Image Edit。引用时写下快照日期;不写日期的排名,本文当没说过。
配图:把「榜单名次」和「你要改的那一块」分开看。来源:ChatIMG 既有对比图。
可打脸预判
- 若 Arena 编辑榜在两周内把 MAI-Image-2.5 踢出前三:本文「编辑是一等能力」的判断要降级,局部编辑仍可能好用,但「第一梯队」这句话作废。
- 若微软公布可复核的多语言文字测试、且显著超过海报默认候选:换字任务的默认工具要改口,不能再把「改一行字」和「从零排版」混写成同一件事。
- 若消费端(PowerPoint / OneDrive / Playground)和 API 的能力集分叉:以你实际能点到的工具为准,不以新闻稿的能力清单为准。
- 场景感知不是圈选替代品。拿它去对 Markup / 魔棒类「像素级选区」会得出错误结论。
这些预判写在正文里,是为了 14 天后回查时有东西可证伪,而不是给自己留台阶。
常见问题
MAI-Image-2.5 是什么?
微软 AI 在 2026 年 6 月 2 日发布的图像生成与编辑模型。官方卖点是场景感知局部编辑:换背景、换字、加物体时,未点名的区域尽量不动。入口见 微软公告。
它现在还是 Arena 编辑榜第二吗?
不知道,也不该假设。6 月 2 日稿和 Arena 官方帖说的是当天快照。榜是活的,引用必须带日期。
ChatIMG 能不能直接选 MAI-Image-2.5?
不能。它不在模型选择器里。事件页 MAI-Image-2.5 是什么 把同一份工作接到对话框:上传照片,用一句话说改什么。
局部编辑和对话改图有什么差别?
局部编辑强调「懂场景 + 未触碰区域冻结」;对话改图强调「不会点选区,用几句话迭代」。前者可以是模型能力,后者是交互范式。选型看你的手指,不看新闻稿标题。
和 Grok Imagine 的魔棒比呢?
魔棒要你指出区域。MAI-Image-2.5 的公开叙事是场景推理。需要看见边界,用区域工具;需要说一句话就改,用对话。对照见 Image 2.0 区域编辑评测。
真正能稳定交付的人,不是追每一个新模型名的人,而是把每一次修改都变得可归因、可回滚的人。先写清任务动词,再打开工具。
如果你想马上试对话式这条最轻的路线,打开 chatimg.ai 上传一张图,用一句话开始改——从今天起,让「只改该改的地方」成为默认,而不是运气。
ChatIMG.ai 团队