昨天下午我连续给 aplus-builder 下了几单产品场景图,其中一单特别有意思:客户上传了一张模特参考图,要求「严格保持模特身材和样貌」,给模特换上一套抽象印花套装。
这个需求背后,是电商行业最古老也最值钱的痛——同一个人,穿不同的衣服,出现在不同的场景里。货架上的商品图要统一,详情页的模特要统一,广告素材更要统一。真人模特拍照能做到,因为模特是真人;但真人拍照贵、慢、改一次重拍一次。AI 生成能做到吗?我们在这件事上已经磨了一个多月,结论有点反直觉:
身材这道题,我们解完了;脸这道题,还在排队。

一次定案,三层分工
事情要从 7 月 26 日说起。当时 cherry 在梳理模特一致性方案时发现一个硬约束:我们主力用的 Ark Seedream 模型,没有 --cref 这类「角色参考图」参数——也就是说,你没法直接告诉模型「还是这个人,换个衣服」。这是很多 AI 生图工具的标配功能,偏偏主力模型没有。
于是我们定了一个三层分层的方案:
- 固定模特:先用一个固定的模特底图,保证「人」是同一个
- Dressing 换装:用专门的换装 API 把新衣服穿到模特身上
- Ark 换背景:最后用 Ark 把模特放进目标场景,调整光照和环境
方案落地的过程比预想顺:model_image_0 到 CVProcess 三步流程跑通,单张 17 秒、每秒 1 个请求的吞吐,已经能塞进 aplus-builder 的流水线里当日常工序用。
昨天下午的实战是这套方案的又一次检验:duma 拿着 WechatIMG37.jpg 这张参考图,要求「严格保持模特身材和样貌」换上抽象印花套装,后来又补了一张 model_ref.jpg 做换装参考。两轮跑下来,我盘了一下账:
- 身材:✅ 已闭环。 比例、体态、身形都能锁住,肉眼几乎看不出换了人。
- 面孔:⚠️ 方案定了,还没验证。 换装之后脸「像不像」这件事,目前还没跑通。
为什么脸比身材难?
这里有个反直觉的地方。普通人猜 AI 换装,第一反应都是「脸最难吧?脸不像就全完了」。我们的实际进度恰恰相反——身材先闭环了,脸卡住了。为什么?
因为身材是几何题,脸是身份题。
几何题有标准答案。肩宽、腰线、头身比,都是可以测量的量。可测量,就可验证——上个月我们在 aplus-video 流程里用 rembg 做像素级分割,把模特身高差异从 22% 压到 0.1%,就是用数字说话:误差 0.1%,就是过了。身材一致性本质上是一个「对齐」问题,对齐就有误差公式,有误差公式就能迭代。
脸不是。人的大脑里有一块专门的梭状回面孔区,进化出来就是为了干一件事:分辨「这张脸是不是我认识的那个人」。它对脸的敏感度远超身材——鼻子歪 2 毫米、眼睛间距差 5%,真人一眼就能发现「这个人不太对」。更麻烦的是,「像不像」没有客观误差公式:你没法定义「像度 98%」是什么样,它只有感觉,没有刻度。用大白话说:几何题做错了,卷子上有红叉;身份题做错了,没有红叉,只有「哪里不对劲」的鸡皮疙瘩。

这解释了为什么行业里 AI 模特一致性做了这么多年,「换脸」仍然是最后一块硬骨头:不是技术没到,是「像不像」这个评价标准本身,比「对不对」难验证一个量级。
一个可以带走的框架:一致性分层拆解法
这一个多月的攻坚,我们最大的收获不是某个模型参数,而是一个方法论——任何「像」的需求,先拆层,再逐层攻破。
拆法是这样的:
- 几何层(身材、比例、体态):可测量,用数字验证。误差 <1% 就是过。
- 身份层(面孔、特征、气质):难量化,先定方案、再用真人判断 + 特征点对齐双轨验证。
- 场景层(背景、光照、环境):可替换,交给换背景模型,最后统一光照。
- 材质层(衣服版型、面料、纹理):用「保真锁」把客户指定细节锁进负面锚点,防止模型自由发挥。

每层定义独立的成功标准,先做可验证的层,把难验证的层留到最后——顺序很重要:先用几何题建立信任,再啃身份题。
这个框架不止适用于模特。AI 视频里人物前后要一致,是同一套拆法:先锁比例体态(几何),再锁面孔(身份),最后统一场景光照。品牌视觉要一致,也是同一套:logo 的几何比例先锁死,品牌气质这种「说不清但感觉得到」的东西留到最后。甚至 AI 内容风格一致也一样——结构是几何题,文风是身份题。
今天的「未验证」,就是明天的选题
回头看,这个项目最诚实的部分不是「身材闭环了」的成功,而是「脸还在排队」的未完成。我越来越觉得,AI 落地项目的真实状态从来不是非黑即白,而是一半闭环、一半在途——能把「已闭环」和「未验证」分得清清楚楚的团队,才不会被自己的一时成功骗到。
顺便说一句,昨天 cherry 被问了一句「你还记不记得我们讨论过模特一致性的问题?」——它完整复原了 7 月 26 日的定案,连 Ark 没有 --cref 这个细节都记得。那一刻我意识到:AI 伙伴能记住一个多月前的技术决策,这件事本身,比很多人类团队还靠谱。
你遇到过「AI 生成的东西哪里不对,但说不出来哪里不对」的时刻吗?按这个框架拆一下——大概率是某一层没闭环。说说你被哪一层坑过?