AI生成同一个人物不同动作怎么做?保持一致性的几个技巧

淘宝闪购红包搜88744,有25元大红包

👇复制口令打开淘宝免单奶茶和25红包👇

¥XT7U4sdjF9I¥/ HU7405

AI生成同一个人物不同动作怎么做?保持一致性的几个技巧

AI生成同一个人物不同动作怎么做?先把“同一个人”钉住

很多人第一次做连续动作图,都会遇到同一个问题:第一张还像本人,第二张开始脸变了,第三张连年龄都不对了。动作明明换了,人物却像换了演员。想让 AI 生成“同一个人物不同动作”,关键不是先追动作,而是先把人物身份固定住。

最稳的思路,是把人物拆成几组不容易漂移的特征:脸型、五官比例、发型、发色、服装、身材轮廓、拍摄角度、光线风格。只要这些锚点稳定,动作变化才不会把整个人带跑。很多时候,动作本身不是难点,难点是模型在生成新姿势时顺手改了身份信息。

如果你希望一次出一组可用图,最好先想清楚这组图是给谁看的。是角色设定展示、社媒九宫格、动作分镜,还是电商模特多姿态展示?用途不同,约束重点也不同。像机灵助手这类带模板的工具,能把提示词结构先搭出来,省掉不少反复试错。

同一个人物在不同动作下保持脸型、发型和服装一致的示意图

最先稳住的,不是动作,是人物信息

如果只写“一个年轻女孩在跑步、跳跃、转身”,AI 往往会理解成“一个泛化女孩”,而不是你心里的那个人。要让模型记住身份,提示词里至少要有一段固定的角色描述,而且每一张都尽量复用同一段文字,不要一会儿说“短发”,一会儿说“齐肩发”,一会儿说“黑发微卷”。

可以把人物信息写成“不可变字段”,动作和场景写成“可变字段”。例如:

  • 不可变字段:25岁亚洲女性,鹅蛋脸,单眼皮,鼻梁自然,黑色齐肩直发,左边耳后一缕碎发,细金属圆框眼镜,米白色短外套,深蓝牛仔裤。
  • 可变字段:奔跑、转身、抬手打招呼、弯腰捡东西、坐在台阶上。
  • 风格字段:自然光、纪实感、浅景深、干净背景、真实摄影。

这类写法的好处是,生成第一张后,你很容易复制同一段角色描述,只改动作和构图。若使用支持参考图的工具,像机灵助手这类平台,建议把“人物描述”与“动作描述”分开写,后续改动会更少。

参考图不是越多越好,关键是挑对那一张

很多人会一口气上传十几张图,期待模型自动学习“这个人长什么样”。结果常常是脸部特征被平均化,最后谁都不像。真正好用的参考图,不一定是最精致的那张,而是最能稳定表达身份的那张。

优先选择这些图:

  • 正脸或接近正脸,五官无遮挡。
  • 光线均匀,没有强烈滤镜。
  • 发型、发色清晰可见。
  • 服装边界明确,别被宽松特效或复杂背景干扰。
  • 表情自然,别夸张到五官变形。

如果你是从零生成角色,先让 AI 出一张“角色基准图”,再拿这张去生动作图,比直接上复杂动作更稳。基准图最好是半身或全身站姿,人物比例正常,背景干净。等身份稳定后,再逐步加动作幅度。

一个实用办法是先做“1 张标准照 + 3 张动作图”。标准照负责锁身份,动作图负责测试姿态变化。这样即便后面有一两张偏了,也能回到标准照重新生成,而不是整组返工。

提示词里要写“保留什么”,别只写“做什么”

提示词最常见的错误,是把重点全放在动作上。比如“一个女生在街头跳跃,动态感强,画面明亮”,这对 AI 来说太宽了。更有效的写法,是明确告诉模型哪些东西必须保留,哪些东西可以变化。

可以直接写成这种结构:

保留项:保持同一个人物的脸型、五官比例、黑色短发、刘海形状、浅棕色风衣、白色运动鞋不变。

变化项:只改变动作、手势和身体重心。

动作项:向前快跑、回头看镜头、抬手挥手、单脚跳起。

画面项:城市街道、自然日光、真实摄影、轻微运动模糊。

这类写法比单纯描述动作稳定得多。因为模型会知道,动作可以重画,人物不能乱改。尤其在多张图连续生成时,“保持一致”四个字最好不是泛泛而谈,而是落到具体特征上。

如果你在机灵助手里套模板,也可以直接把“固定人物特征”保存成一段常用文本,每次只替换动作和场景。这样生成速度会快很多,出图稳定性也更高。

同一套镜头语言,比单独修人脸更重要

很多人以为人物跑偏,是脸部没写清楚;其实有时是镜头变了。AI 对“远景、近景、俯拍、仰拍、广角、长焦”的理解很强,一旦镜头语言变化过大,人物比例和面部结构也会跟着变。

想保持一致,最好让同一组图使用相近的拍摄条件:

  • 同样的景别:都用半身,或者都用全身。
  • 同样的角度:都正面,或者都 3/4 侧前方。
  • 同样的焦段感:都偏 50mm 纪实感,不要一张广角一张特写。
  • 同样的光线:都自然窗光,别一张冷光一张逆光。
  • 同样的背景复杂度:都干净背景,或都城市街景,不要混用。

举个例子,如果你要做“同一个模特的六个动作”,把镜头统一成“全身、正面、干净棚拍、白底或浅灰背景”,人物会比“今天室内、明天街头、后天海边”更稳定。动作可以变,但镜头一乱,识别度就会掉。

动作不要一口气跳太大,先做小幅度变化

如果从“站立”直接跳到“翻滚”“劈叉”“大幅后仰”,模型很容易在姿态结构上失控。尤其是人物身体被遮挡、四肢交叉、头发飞散时,身份特征最容易被冲掉。更稳的做法,是先做小幅度动作,再做大动作。

可以按这个顺序试:

  • 站立、双手自然下垂。
  • 抬手、挥手、整理头发。
  • 转身、回头、侧身行走。
  • 小跑、跨步、轻跳。
  • 下蹲、弯腰、坐下。

动作跨度越大,越要加强固定描述。比如“抬手挥手”这种轻动作,五官和服装还比较稳定;“跳跃”“奔跑”时,头发、衣摆、四肢比例就更容易乱。想让一组图看起来连贯,动作难度最好循序渐进,不要一上来就挑战模型的极限姿态。

一组图最好先设定“公共规则”

如果你的目标不是单张出图,而是连续动作组,那么最好在生成前先写一份公共规则。它像一份简短的角色说明书,所有图片都共享,只有动作单独变化。这样你不需要每次临时补漏。

公共规则可以包括:

  • 人物年龄、性别、发型、服装永远不变。
  • 画风固定为真实摄影、插画或半写实其中一种。
  • 色调一致,比如冷白、暖黄、低饱和、日系清透。
  • 背景统一,比如纯色背景、办公室、街景、舞台。
  • 构图统一,比如居中、三分法、上半身裁切、全身留白。

如果你在做角色海报、动作分镜或社媒展示图,这一步尤其重要。很多“看起来像同一个人”的作品,其实不是每张都生成得多准,而是每张都遵守了同一套规则。机灵助手里如果有模板保存功能,把这份公共规则存下来,会比每次重写省事得多。

提示词别写太散,结构清楚比辞藻多更有用

有些人喜欢把提示词写得很长,堆满“高清、超精细、电影级、极致细节、梦幻光影”等词。问题在于,这些词不会帮你锁住同一个人,反而可能让模型更关注氛围而不是身份。真正有用的是结构清楚,信息排序合理。

一个比较稳的顺序是:

  1. 人物身份:年龄、性别、脸型、发型、穿搭。
  2. 动作:跑、跳、坐、回头、挥手。
  3. 镜头:全身、半身、正面、侧面、俯拍。
  4. 场景:室内、街头、舞台、纯色背景。
  5. 风格:真实摄影、插画、胶片感、棚拍感。
  6. 限制:不要改变脸型,不要更换发型,不要增加配饰。

如果你想快速验证某种写法是否有效,可以先生成三张。第一张看脸,第二张看服装,第三张看动作。只要这三项都稳定,再扩大数量。比起一次做十几张,先小规模测试能省掉大量返工。

同一个人多动作,常见翻车点就这几个

做多动作图时,最容易翻车的地方其实很固定。知道这些坑,能少走很多弯路。

第一,发型变了。 头发是身份识别的重要标志,尤其是刘海、发缝、长短和卷直。提示词里最好把发型写得具体,别只写“长发”或“短发”。

第二,服装不一致。 如果你要的是同一个人物,不要一张图风衣、一张图卫衣、一张图连衣裙,除非你明确想做换装展示。

第三,脸部角度差太多。 侧脸、回头、仰拍会让五官结构变化更大,建议先从正面和轻微侧转开始。

第四,背景干扰太强。 复杂背景会分散模型注意力,人物容易被背景风格带偏。先把人物做稳,再逐渐加场景。

第五,动作遮挡太多。 手挡住脸、头发遮住眼睛、身体被道具遮住,都会增加身份漂移概率。

如果你要做系列图,最省力的策略不是“每张都重新想”,而是“把最容易变的东西先收紧”。人物一致性一旦建立,动作只是替换变量,不再是最难的部分。

给你一套能直接改的提示词骨架

下面这套骨架,适合大多数“同一个人物不同动作”的场景。你可以直接替换括号里的内容:

提示词骨架:同一个人物,保持脸型、五官比例、发型、发色、服装、身材比例完全一致;人物为(年龄)(性别)(发型)(服装描述);只改变动作和身体姿态;动作是(具体动作);镜头为(景别和角度);场景为(背景);风格为(真实摄影/插画/半写实);光线为(自然光/棚拍光/逆光);画面干净,没有多余人物,不改变身份特征。

如果你要做更稳定的系列图,可以再加一条:同一组图片使用相同角色设定,不更换发型、配饰和主色调。 这句话看起来简单,但对模型很有约束力。

下面是一个更具体的例子:

示例:同一个人物,25岁亚洲女性,鹅蛋脸,单眼皮,黑色齐肩直发,左耳后有一缕碎发,穿米白色短外套和深蓝牛仔裤,保持脸型、五官、发型、服装完全一致;只改变动作和身体姿态;动作分别为快走、回头、抬手挥手、轻跳、坐在台阶上;镜头为全身正面,50mm 真实摄影感;背景为干净城市街道,自然日光,轻微浅景深,画面中不要出现额外人物,不要改变年龄和气质。

这类骨架配上模板工具会更省时间。像机灵助手如果支持保存提示词模板,就很适合把“固定角色信息”存成底稿,再按动作批量替换。

要做得像一组作品,就别只盯着“单张像不像”

很多人评判结果时,只看每一张单图像不像本人,却忽略了整组图是否统一。实际上,连续动作图真正重要的,是“这组看起来是同一个角色在做不同事”,而不是每张都长得完全一样却毫无联系。

你可以从三个维度检查:

  • 身份统一:脸、发型、服装、年龄感有没有变。
  • 风格统一:色调、线条、质感、背景有没有跳来跳去。
  • 动作连贯:姿势变化是否合理,重心是否自然。

如果三项都过关,这组图就已经可用了。很多商业图、角色图和社媒图,不需要极端复杂的动作,只要稳定、连贯、辨识度高,就足够好看。把人物锚点固定住,再一点点放开动作范围,成功率通常会比“胡乱加词”高得多。

真正熟练之后,你会发现做这类图并不神秘。它更像整理一套角色规范:先定身份,再定镜头,再换动作。把这三个步骤做顺,AI 就更容易听懂你要的是“同一个人”,而不是“差不多的人”。

© 版权声明

相关文章