
人物一致,才算把AI生图用顺手了
很多人第一次用AI生图时,最常见的困扰不是画不出来,而是“同一个人怎么每张都不一样”。上一张还是圆脸短发,下一张就变成了尖脸长发;上一张穿白衬衫,下一张衣服颜色和款式全变了。要让AI稳定画出同一个人物,关键不是只靠一条长提示词,而是把人物特征、参考图、场景约束、迭代方式一起设计好。
这件事并不复杂,但很容易忽略细节。真正能保持一致的方案,通常都不是“让模型自己理解”,而是把你想固定的内容说清楚,再把不想变化的部分锁住。无论是做头像系列、短剧角色图、品牌人物设定,还是给海报做同一位主角,方法都差不多。像机灵助手这类带模板和参考图输入的工具,就很适合先把一致性做稳,再谈风格变化。

先别急着加风格,先把人物“身份证”写出来
想保持一致,第一步不是写“电影感”“高级感”“赛博风”,而是写人物身份证:脸型、年龄感、发型、肤色、五官特征、身形比例、常穿服装、标志性配饰。AI最容易跑偏的地方,恰恰是这些看起来“默认可以省略”的信息。
写人物身份证时,建议把内容拆成三层:外观骨架、可识别特征、稳定穿搭。骨架决定人物基本轮廓,比如“25岁左右、亚洲女性、偏瘦、肩颈线条清晰”。可识别特征要更具体,比如“单眼皮、下颌线柔和、左侧眉尾有一颗小痣、齐肩黑发内扣”。稳定穿搭则是“米白色短风衣、深色直筒牛仔裤、银色细耳环”。
如果你只写“年轻女生,长得漂亮,穿搭简洁”,模型就会自己补全,结果每次都不一样。相反,越是具体、越是可重复,人物就越容易被固定住。机灵助手里常见的人物写真类模板,通常也是先写清楚人物特征,再叠加场景和光线,不会只堆风格词。
一条好提示词,得先锁住哪些不能变
保持一致的提示词,不是越长越好,而是要把“不能变”的内容放在前面。你可以先明确三类固定项:人物身份、外观细节、镜头设定。人物身份是“谁”,外观细节是“长什么样”,镜头设定是“怎么拍”。
比如拍同一位角色的系列图,可以这样组织:
- 人物身份:28岁左右的女性插画角色,气质冷静,职业感强
- 外观细节:短黑发、偏方脸、眉骨清晰、鼻梁挺、左耳三枚小耳钉
- 镜头设定:半身正面,眼神直视镜头,肩膀放松
- 固定穿搭:浅灰西装外套、白色内搭、黑色高腰裤
- 光线和色调:柔和自然光,低饱和,肤色真实
这类写法的好处,是模型更容易把资源分配给人物本身,而不是先去理解一堆抽象形容词。风格词可以有,但要放在后面,比如“日系写真感”“电影静帧感”“柔焦胶片感”。如果风格词太早出现,模型可能先去追求氛围,人物反而开始漂移。
还有一个很实用的习惯:同一角色尽量固定一份“主提示词”,后面只改场景,不改人物部分。这样你每次出图都像在同一个底稿上换环境,人物自然更稳。机灵助手这类工具如果支持模板复用,就把人物段落单独存起来,后续直接替换场景描述。
参考图不是越多越好,选对才有用
很多人误以为参考图越多越稳,其实不对。参考图太杂,模型会把不同图里的特征拼起来,最后变成“像谁都不完全像”。更有效的做法是:先选一张最能代表这个人物的正面清晰图,再补一两张用于补充发型、侧脸或穿搭。
参考图最好满足几个条件:脸部清楚、光线不过曝、没有强滤镜、角度不要太夸张、背景不要过于抢眼。尤其是头像或半身图,五官边界要清晰,不然模型会把磨皮、妆容、阴影都当成特征。若你要保留服装,也要确保衣服纹理、领口和配饰看得见。
有些场景适合多参考图,有些则不适合。比如做角色设定图时,1张正面参考图 + 1张侧脸参考图 + 1张全身穿搭参考图,通常比10张乱七八糟的图更好。做电商人物展示时,也可以把人物参考图和服装参考图分开输入,避免AI把背景、道具一并学进去。
如果工具支持“使用上传图片作为参考”,就要明确告诉模型:哪些是必须保留的,哪些只是风格参考。像“保留人物脸型、发型、年龄感、穿搭轮廓;允许背景、姿势、道具变化”这种写法,很实用。机灵助手在这类任务里,配合模板输入通常比临时手写更稳定。
最容易翻车的,其实是“细节没写全”
人物不一致,很多时候不是模型能力不够,而是细节没写全。模型会默认补全缺失信息,而默认补全往往不符合你的想法。最常见的漏项有三个:发型长度、服装版型、脸部标记。
发型要写到具体长度和方向,不要只写“短发”“长发”。可以写“齐肩黑发,发尾微内扣,右侧分缝,额前留少量碎刘海”。服装也要写版型,比如“宽松针织开衫”还是“合身西装外套”,两者会给人物完全不同的轮廓。脸部标记最容易帮助统一,比如痣、雀斑、单侧酒窝、眉形、眼尾走向。
如果想让一组图里的人物更像同一个人,还可以补充一些固定习惯,比如“总是右手拿杯子”“习惯性微微低头”“左耳带同款耳钉”。这类小动作会让角色更有“连续性”,尤其适合连载插图、故事分镜、IP人物图。
还有一点很重要:不要同时写太多互相冲突的细节。比如“短发”又写“长发披肩”,“冷感”又写“甜美幼态”,“西装职业装”又写“学院风制服”,模型会优先随机处理。细节必须统一服务于一个人物设定,而不是把你喜欢的所有元素都塞进去。
把“不能变”和“可以变”分开写,效果会好很多
要保持人物一致,提示词里最好明确区分两部分:固定项和可变项。固定项包括脸、发型、身材、服装核心轮廓、标志性配件;可变项包括场景、动作、天气、镜头距离、色调。
一个很好用的表达方式是直接写:“以下内容保持一致”,然后列出人物细节;接着写“以下内容可变化”,列出场景和构图。这样模型更容易知道哪些地方不能乱动。比如:
- 保持一致:25岁亚洲男性、短黑发、清晰下颌线、左眉尾小痣、深蓝牛仔外套、白T恤
- 可变化:咖啡馆、地铁站、夜景天台、街头霓虹、侧脸或正面、站姿或坐姿
这个写法在系列图里很实用。第一张可以先确认人物长相是否符合预期,后面每一张只换场景和动作。若发现某次出图开始跑偏,就回到固定项,把最重要的特征重新强调一遍。机灵助手支持模板复用的话,这一步会更省时间,因为你不用每次重写固定段落。
同一个人做不同场景,写法要像“换镜头”不是“重画人”
很多人做系列图时,习惯每张都重新写成一张新作品,结果人物特征不断变化。更稳的方法是把每张图理解成“同一个人被不同镜头拍到”。也就是说,人物设定完全不变,只改镜头语言。
比如同一角色在三张图里可以这样分:第一张正面头像,突出脸部识别度;第二张半身办公场景,突出职业感;第三张街头夜景,突出氛围变化。人物不变,镜头变。这样AI更容易理解你是在做连贯系列,而不是三次完全独立的创作。
写镜头时,尽量用具体摄影语言:正面胸像、三分之二侧脸、浅景深、85mm人像镜头感、柔和补光、低角度轻微仰拍。这些词不一定要堆很多,但要选对。越是与人物识别相关的内容,越要稳定;越是氛围相关的内容,越可以自由变化。
如果你希望人物在不同图里动作变化更大,也要先保持头部特征稳定,再让手势、站姿、道具变化。比如“右手插兜、左手拿文件夹、头部微微偏向镜头”这类动作,通常比大幅度奔跑、跳跃、侧躺更容易维持一致。
负面约束别省,很多跑偏都能提前挡住
不少人只写“要什么”,不写“不要什么”,结果模型就会自由发挥。负面约束的作用,就是把常见翻车点提前拦住。人物一致性任务里,最常见的负面项包括:脸型变化、年龄变化、发色变化、服装乱改、五官变形、手部异常、配饰丢失。
可以这样写:“不要改变脸型,不要改变发型长度,不要更换主服装颜色,不要添加夸张妆容,不要出现多余饰品,不要让人物显得过度幼态或过度成熟”。这类约束会让模型更收敛,尤其是在风格较强的图里更明显。
如果是生成多张系列图,建议把负面项也固定成模板。因为很多一致性问题并不是第一张出错,而是第二、第三张在压力下逐渐走样。负面约束不是为了“限制创作”,而是为了保住人物的识别核心。
另外,别忘了限制背景干扰。有些图不是人物变了,而是背景太复杂,模型把注意力分散了。比如你要的是人物写真,却写了过多环境细节,最后模型先去画街景和灯牌,人物反而失真。人物一致任务里,背景越干净,往往越稳。
一套实用的提示词顺序,直接照着套就行
如果你不知道怎么组织,可以按这个顺序来写:人物身份 → 外观特征 → 固定穿搭 → 动作表情 → 场景 → 光线 → 风格 → 质量要求 → 负面约束。这个顺序不是死规定,但很适合大多数人。
示例可以写成这样:
“25岁左右的亚洲女性,短黑发齐肩内扣,单眼皮,鼻梁清晰,左眉尾有一颗小痣,身形偏瘦,穿浅米色短风衣和白色高领内搭,站姿自然,轻微侧身看向镜头,背景为安静的城市咖啡店,下午柔光,低饱和电影感,画面干净清晰,高细节,保持脸型、发型、服装和配饰一致,不要改变五官比例,不要添加夸张妆容,不要更换服装款式。”
这类句子看上去长,但实际非常好用。因为它把“同一个人”的核心特征压缩在一个稳定的结构里。你后续只需要换掉咖啡店、街头、办公室、夜景这几个场景词,就能做出一组连贯的人物图。
如果你经常要批量做角色图,可以把这套顺序做成固定模板。像机灵助手里常见的模板功能,本质上就是帮你少写固定内容,把更多精力留给场景变化和结果筛选。
遇到跑偏时,别重来,先改这几个地方
人物已经不太像时,不要急着整条提示词推倒重写。先看三个最有效的修正点:参考图是否清晰、人物身份证是否足够具体、是否把风格词放得太前。大多数跑偏都能在这三处找到原因。
如果脸不对,优先检查参考图是不是角度太歪、遮挡太多、滤镜太重。发型不对,检查发长、刘海、分缝、卷直属性有没有写全。衣服不对,检查版型和颜色是否明确写出。动作不对,看看有没有写得太抽象,比如“自然一点”“有氛围一点”,这类词通常帮不上忙。
还有一个小技巧是“先锁人,再换景”。先用最稳定的一张图确认人物长相,后面再逐步扩展到不同场景。这样每一步只改一个变量,你更容易判断到底是人物漂了,还是场景干扰了。对多图系列、IP设定、角色海报来说,这种控制变量的方法特别重要。
如果你平时还会做头像、人物海报或角色设定图,建议把常用人物模板、参考图、负面约束分开保存。以后再生成时,直接复制固定段落,只改场景和动作,就能省掉很多反复试错。机灵助手这类工具配合好模板后,人物稳定性通常会比临时手写更高,适合做重复性很强的生图任务。










