
AI人物脸每次不一样,先别急着怪模型
很多人第一次用 AI 画人物,最常见的挫败感就是:同一个人,第一张像,第二张就换脸了。眼睛、鼻子、嘴型、发际线,甚至整张脸的气质都会飘。你明明写了“同一个角色”,模型却像没听见一样,越出图越不像。
这个问题不是单纯“提示词不够长”,也不是“模型不够聪明”。更准确地说,是你给模型的身份信息不够稳定,或者每次生成时引导方式在变。AI 生成图片本质上是在“重组视觉概率”,如果没有把关键身份特征钉住,它就会在合理范围内自由发挥。
想让人物脸稳定,思路要换一下:不是追求一次把所有细节写满,而是把最重要的身份锚点固定住,再控制每次生成的变量。像拍连续剧一样,角色设定先统一,镜头变化可以有,脸不能乱。
先弄清楚,为什么它会“换脸”
人物脸不稳定,常见原因其实很具体。第一类是参考图太弱。比如你只给了一张远景图,脸占画面太小,模型只能猜。第二类是提示词太散,既想要“清冷感”,又想要“甜妹感”,还加了太多风格词,模型会在不同特征之间摇摆。
第三类是你每次都改太多参数。换了风格、角度、光线、年龄描述,甚至种族或妆容,都可能让身份偏移。第四类是负面提示词没写对,口罩、遮挡、侧脸、夸张表情这些都会让五官识别更难。
还有一种情况最容易被忽略:你把“漂亮”“高级”“有氛围感”写得很满,却没写清楚“这个人到底长什么样”。模型当然会优先满足审美词,结果就是人好看了,但脸已经不是原来那张脸。
准备一张真正能用的参考图
稳定人物脸,第一步不是写提示词,而是选对参考图。最适合的不是网图大头照,也不是美颜到失真的自拍,而是五官清楚、光线均匀、遮挡少的半身或近景照片。脸部最好占画面 30% 以上,轮廓和五官都能看清。
如果你要做同一角色多张图,最好准备 3 类参考图:正面清晰照、略带侧角度的照、全身或半身造型照。这样模型能记住脸、发型、服装和体态,但前提是它们属于同一个人,拍摄条件也不要差异太大。
需要注意的是,参考图里这些元素会干扰识别:强滤镜、过度磨皮、侧脸遮住一半、头发挡住眼睛、手挡脸、墨镜、口罩、复杂光影。图片越“艺术化”,模型越容易记错脸。要想稳定,先用朴素照片打底。

提示词别写成形容词大杂烩
很多人写人物提示词时会堆一长串形容词,比如“精致、梦幻、冷感、电影感、时尚、高级、惊艳、通透、少女、灵动”。这类词不是没用,而是太容易把模型带偏。你需要的是“身份词”优先,“氛围词”其次。
一个好用的写法是分层:先写清楚人物身份,再写脸部特征,再写发型、服装、表情,最后才是光线和风格。比如:“一位 25 岁亚洲女性,圆脸,单眼皮,鼻梁自然,嘴唇偏薄,黑色长直发,耳边微卷,穿白衬衫,轻微微笑,正面人像,干净背景,柔和自然光”。这里最重要的是,脸部特征足够明确,且没有互相打架。
如果你想固定某个角色,最好给她一个稳定的“身份卡”。可以包括:年龄段、脸型、眼型、鼻型、嘴型、肤色、发型分缝、是否有痣或小雀斑、常穿颜色。这些是模型最容易记住、也最适合重复调用的部分。
别忽略表情。大笑、夸张张嘴、眯眼、仰拍,都可能改变脸部结构的可读性。想稳定人物,先用中性表情或轻微表情最稳。等角色已经定住,再慢慢改动作和情绪。
想让脸固定住,负面词要写到位
很多人只写正向提示词,不写负面提示词,结果模型总在一些细节上跑偏。负面词的作用不是“变好看”,而是把容易破坏身份一致性的因素排除掉。尤其是做连续角色时,负面词非常重要。
你可以重点排除这些方向:面部模糊、身份不一致、变成其他人、眼型改变、鼻子改变、嘴唇改变、脸部过度磨皮、塑料感皮肤、蜡质皮肤、重复人物、重复面孔、低分辨率、压缩伪影。如果画面里不需要遮挡,也可以把口罩、围巾遮嘴、下半张脸被挡住这类词加进去。
如果你想让角色更像真人,负面词里还可以去掉卡通、动漫、插画、娃娃感、CGI 这类风格偏移词。它们不是绝对不能出现,而是当你追求“同一个真人脸”的时候,先别让风格把身份冲散。
有些工具会默认强化“美颜脸”,所以你还得加上“不过度修饰”“不过度磨皮”“保留面部真实纹理”一类表达。这样能减少 AI 把脸统一修成一个模板脸。
同一个人反复出图,最关键的是固定变量
如果目标是同一角色多张图一致,最有效的方法不是每次重写一大段,而是建立一套固定模板。模板里保留不变的部分,比如身份、脸型、发型特征、核心服装元素;每次只换场景、动作和镜头。
可以这样拆:
- 固定项:年龄、性别、脸型、五官特征、发型、发色、小标记、服装基础款。
- 可变项:场景、姿势、光线、情绪、构图、摄影风格。
- 尽量少变项:镜头距离、角度、妆容强度、表情幅度。
比如同一个角色,第一张是室内半身照,第二张是街头全身照,第三张是近景肖像。只要身份卡不变,脸就更容易保持一致。每次都大改年龄、发型、妆面,那就相当于在让模型重新认识一个人。
如果你用的是支持参考图和多轮调优的工具,像机灵助手这类生成工具会更适合做“先定角色,再批量出图”的流程。先把角色像素级稳定下来,再去换场景,效率会高很多。
一个更稳的写法,可以直接照着套
很多人卡在“提示词到底怎么写”。其实不用追求文采,先追求可控。下面这个结构就很实用:人物身份 + 脸部特征 + 发型服装 + 表情动作 + 场景光线 + 风格要求 + 画面限制。
示例可以写成这样:“一位 20 多岁的亚洲女性,椭圆脸,单眼皮,大眼但不过分夸张,鼻梁自然,嘴唇偏薄,下颌线清晰,黑色中长发,侧分刘海,穿浅色针织衫,正面坐姿,轻微微笑,室内柔光,真实摄影感,背景简洁,面部特征一致,高清细节”。这类句子不花哨,但信息密度高,模型更容易抓住重点。
如果想要同一个角色做系列图,可以把身份卡缩成一段固定前缀,每次复制粘贴。比如每次都写“同一位亚洲女性,圆脸,单眼皮,黑长直,左眼下有一颗小痣”。这类稳定标记越具体,越不容易漂。
你也可以给角色设置一个“不可变特征”,比如“左眼下小痣”“齐刘海”“鼻尖一点浅雀斑”。人脸识别里,局部标记比空泛的“漂亮脸蛋”更好用,因为它们能帮模型把身份锚住。
参数和出图顺序,别一次全乱改
如果你同时改提示词、参考图、尺寸、风格和采样方式,根本不知道是哪一项导致换脸。更稳的做法是一次只动一个变量。先把参考图和基础提示词固定住,测试 3 到 5 张,看脸是否稳定,再改场景。
如果工具支持不同强度的参考权重,先从中等偏高开始。权重太低,模型不听参考图;太高,又可能把构图和动作也钉死,导致画面僵。稳定脸的目标不是复刻照片,而是在允许一定风格变化的前提下保留身份。
分辨率也很关键。低分辨率容易让脸部信息糊掉,模型只能补想象。人物脸要稳定,尽量从中高分辨率开始,不要拿缩得很小的图硬生成。
还有一个容易忽略的小点:批量出图时,种子值如果能固定,先固定。不同种子会带来不同细节漂移,但在相同提示词和参考图下,固定种子更容易找到一个稳定基准。先拿到一张“最像”的,再围绕它微调。
人物脸老跑偏时,按这个顺序排查
出图不稳的时候,不要到处乱改。按顺序排查,效率会高很多。先看参考图:脸是不是太小、太暗、被遮挡了?再看提示词:是不是把风格词写太多,把身份词挤没了?接着看负面词:有没有把关键排除项补上?
如果还是不稳,再看这几个点:
- 表情是否太夸张,导致五官结构变化大。
- 角度是否过多切换,从正面突然变极端侧脸。
- 妆容和发型是否改得太大,尤其是刘海、发色、眉形。
- 是否用了会强化“模板脸”的高美颜风格词。
- 是否把多个不同人的参考图混在一起。
当你发现人物开始“长得像但又不是”,通常不是模型完全失败,而是它在几个相近特征之间游走。这个时候最有效的办法往往不是继续加词,而是删词。把多余的形容词减掉,把不必要的风格收起来,角色反而会更稳。
用机灵助手时,怎么更省事地做角色一致性
如果你不想每次自己手写一大段,可以把固定身份整理成一份常用模板,交给机灵助手这类工具反复调用。你把角色的脸部锚点、发型、穿搭基调写清楚,再把每次变化的场景补进去,生成效率会高不少。
比较实用的做法是先做一版“角色基础图”,确认脸稳定之后,再继续扩展到日常场景、室内场景、活动照、半身特写等不同用途。这样做的好处是,前期花一点时间校准,后面就不会每张都从头猜。
如果你做的是头像、品牌人物、虚拟员工形象,或者同一角色的系列海报,机灵助手这一类工具的价值不只是“出图快”,更在于把固定模板变成可复用资产。你不需要每次从零开始拼提示词,省下来的时间都能用来打磨角色细节。
一套能直接开用的实操顺序
把步骤压缩成最实用的版本,大概就是这样:
- 先准备一张脸清楚、光线正常、无遮挡的参考图。
- 写清楚身份卡,优先固定脸型、眼型、鼻型、发型和标记特征。
- 提示词按“身份—五官—发型服装—动作表情—场景光线—风格”来排。
- 负面词补上身份漂移、遮挡、过度磨皮、脸部模糊等问题。
- 先固定种子和主要参数,连续出几张,观察稳定性。
- 如果脸不稳,先删词,再换参考图,不要一口气全改。
人物脸能不能稳定,核心就一句话:让模型先认出“这个是谁”,再决定“这个人现在在干什么”。顺序一旦反了,就容易变成“场景很像、脸不认识”。
真正好用的 AI 人像流程,不是一次生成完美答案,而是能把同一个角色不断复制出来。角色一旦立住,后面的换装、换景、换姿势都只是变量;脸一旦飘了,整组图都会失去统一感。把身份钉牢,出图才会越来越省心。










