
先把“同一个人”说清楚,不然动作一换就跑脸
做人物连贯图,最容易翻车的不是动作,而是“身份没钉住”。很多人一上来就写“站着、跑步、回头、挥手”,结果每张图都像不同演员借了同一套衣服。原因很简单:模型先理解的是整体画面,不会自动替你记住一个稳定人物。
想让同一个人物做不同动作,提示词里最重要的不是动作词本身,而是人物身份锚点。也就是你要反复固定的那几项:年龄段、性别、脸型、发型、发色、肤色、穿着、气质、标志性配饰。锚点越稳定,动作变化时越不容易漂。
最实用的写法不是“一个年轻女性”,而是把她写成一组可识别特征。例如:“28岁亚洲女性,短黑发,齐刘海,圆脸,左眼下有一颗小痣,米白色针织衫,细银色耳钉,干净温和的气质”。这类信息不只是描述好看,而是在给模型建立人物身份证。
如果你用的是机灵助手这类提示词辅助工具,也可以先把人物卡写好,再去改动作。这样生成第一张图后,后面的图只换动作,不换人物设定,稳定性会高很多。

动作别只写一个词,要把姿态写完整
“跳起来”“坐下”“挥手”这种词太短,模型能懂个大概,但细节会自己补,补着补着就偏了。更稳的方式是把动作拆成“起点姿态 + 身体重心 + 手脚位置 + 面部状态”。
比如你想要“跑步”,不要只写“跑步中的女孩”,可以写成:“向前慢跑,身体微微前倾,右腿向前迈出,左臂摆在胸前,右臂向后摆动,表情专注但放松”。这样模型更容易理解动作结构,也更容易在不同镜头里保持一致。
如果你想要“回头”,也别只写“回头看”。可以写成:“身体朝前行走,头部向左后方转回,肩膀略微跟随转动,眼神看向镜头,步伐不停”。这类写法能把动作拆开,避免生成成“整个人扭成九十度”的生硬姿势。
动作描述还有一个常见误区:一次塞太多动作。比如“站着、举手、微笑、低头、转身、看镜头”全写进去,模型会不知道重点。一个画面尽量只保留一个主动作,再附带一个小动作即可。
镜头、场景、光线也要固定,不然同人不同图像不像同一组
很多人只关注人物和动作,却忽略了镜头语言。实际上,人物一致性不仅取决于脸,还取决于你给的拍摄条件。镜头一变,身份感就会变;光线一乱,脸部特征也会变。
写提示词时,最好把这几项顺手固定:
- 镜头距离:半身、全身、近景、特写
- 视角:平视、俯拍、仰拍、侧面
- 镜头焦段:35mm、50mm、85mm 之类的摄影表达
- 光线:自然光、窗边光、柔和棚拍光、逆光
- 背景:纯色、室内、街头、办公室、咖啡馆
例如你在做同一个人物的系列动作图,最好别一张是广角全身,一张是超近景脸部特写,再一张是俯拍俯到只剩头顶。不是不能换,而是换得太猛,模型会以为你换了项目。
更稳的做法是先定一套通用模板,比如:“室内自然光,浅景深,50mm 镜头,半身构图,背景简洁,柔和色调”。之后每张图只改动作和少量场景细节,整体就会更像同一组作品。
一个人物反复出图,最怕信息互相打架
提示词里最容易埋雷的地方,是前后信息冲突。比如你写“短发”,后面又写“长发飘动”;前面写“白衬衫”,后面又写“黑色连帽衫”;前面写“安静气质”,后面又写“夸张搞怪表情”。模型会在这些信息里摇摆,最后生成结果就不稳定。
尤其是同一人物不同动作的场景,建议把提示词分成三层:
- 人物层:脸、发型、服装、年龄、配饰
- 动作层:这张图具体在做什么
- 画面层:镜头、背景、光线、风格、质量要求
这三层一旦混写,就会出现“动作吃掉人物”的情况。比如你写“穿红裙的女孩在森林里奔跑,森林被晨雾包围,红色丝带飞舞,电影感,暖色调,裙摆飘动,动作轻盈,黑色短发,圆脸,耳环,目光坚定……”信息很多,但如果没有顺序,模型有时会优先抓森林和丝带,反而把脸部特征弄丢。
更好的方式是把人物身份放在前面,动作放中间,风格放后面。模型更容易先锁人,再理解动作。
别让“动作词”单打独斗,补上情绪和目的会稳很多
同一个动作,如果没有情绪和场景目的,画面容易像摆拍。比如“站着”“走路”“坐下”这些词太中性,模型会给你一个中规中矩的姿态,但人物神态容易空。
加上情绪之后,动作会更像真实人物在做事。比如:
- 不是“挥手”,而是“抬手向镜头挥手,带着轻松的笑意,像在和熟人告别”
- 不是“低头看手机”,而是“低头查看手机消息,眉头轻皱,像刚收到一条重要通知”
- 不是“坐在椅子上”,而是“坐在靠窗椅子上,身体微微前倾,神情专注地听人说话”
这种写法的好处,是模型知道这个动作为什么发生,表情和手势就更统一。哪怕换成不同动作,也会保持同一种人物性格。
如果你是在做一组角色动作图,尤其适合先定一个人设关键词,例如“安静克制”“轻快外向”“成熟利落”“学生感”“运动感”。人设词不要堆太多,一个主气质就够了。太多会让表情和姿势一起散。
想要同一角色连续出图,可以直接套这个骨架
比起临场乱拼,最稳的是用固定骨架。一个可复用的提示词结构,大致可以这样排:
人物身份 + 服装与配饰 + 动作 + 情绪 + 镜头与构图 + 光线与背景 + 风格与质量
例如:
“28岁亚洲女性,短黑发,齐刘海,圆脸,左眼下有小痣,米白色针织衫,细银色耳钉,站在窗边向左侧回头看镜头,肩膀略微转动,表情平静温柔,半身构图,50mm 镜头,自然窗光,室内简洁背景,柔和电影感,高细节,真实肤质。”
如果下一张要换动作,只改动作部分即可:
“28岁亚洲女性,短黑发,齐刘海,圆脸,左眼下有小痣,米白色针织衫,细银色耳钉,坐在椅子上低头看书,右手轻轻翻页,神情专注,半身构图,50mm 镜头,自然窗光,室内简洁背景,柔和电影感,高细节,真实肤质。”
你会发现,人物卡和画面条件都没变,变化只落在动作上,出图稳定度就高了很多。机灵助手里做提示词整理时,也很适合按这个结构保存成模板,后面批量改动作会快很多。
不同动作怎么写,才能让同一个人看起来像连续镜头
如果想做系列图,动作之间不能只换关键词,还要考虑“前一张和后一张是不是同一个时间轴”。比如站立、行走、转身、坐下、拿起杯子,这些动作之间是连得上的;但如果一张是奔跑,一张是仰躺,一张是跳舞空翻,除非你故意做风格化分镜,否则很难让人相信是同一组连续画面。
比较稳的动作链,通常有这几类:
- 日常连续动作:站立、走路、坐下、抬手、回头、整理衣角
- 工作动作:打字、翻文件、拿笔、看屏幕、讲解、记录
- 情绪动作:微笑、沉思、点头、轻叹、侧目、抱臂
- 展示动作:举起产品、展示手势、比心、挥手、拿包、转身露背面
如果要做“同一人物不同动作”的九宫格,最怕的是每一格都像单独拍的封面,没有前后关系。解决办法是让每个动作都保留同一套视觉条件,再让姿势变化有一点点递进感。这样系列图才像同一角色在不同瞬间被记录下来。
给你一个更稳的示例
“同一位 30 岁短发女性角色,黑色锁骨短发,浅棕色风衣,白色内搭,银色腕表,城市街头,统一的傍晚柔光,50mm 镜头,半身到全身构图。第一张站在路边看向远处,第二张向前迈步,第三张转头微笑,第四张抬手整理头发,第五张低头看手机,第六张停下脚步回望镜头。”
这个示例的关键不在“动作丰富”,而在统一的人物卡、统一的镜头、统一的时间和光线。如果这些基础没锁住,动作再多也只是换装人偶。
负面提示词别省,尤其是“变脸”和“多手多脚”
很多人只写正向提示词,不写负面提示词,结果人物稳定性差得很。对于同一人物不同动作,负面提示词并不是锦上添花,而是防止模型乱发挥的重要工具。
常见要加的负面方向有:
- 多余肢体、额外手指、扭曲手部
- 脸部变形、五官错位、左右脸不一致
- 发型变化、发色漂移、服装跑偏
- 多人入镜、背景杂乱抢主体
- 低清晰度、模糊、过曝、过度磨皮
如果你做的是动作变化明显的人像,手部尤其值得关注。因为动作一多,手就容易出问题。比如挥手、拿东西、整理头发、抱臂、撑桌子,这些动作都在考验模型的肢体控制。负面提示词加上“多余手指、畸形手部、手部融合”之类内容,通常会更稳。
不过负面词也别堆成一长串清单,堆太多有时会把画面压得过死。一般保留最常见的 5 到 10 项就够了,重点是精准,而不是越长越好。
换动作的时候,最值得固定的其实是“服装”和“发型”
如果你只想让观众一眼认出这是同一个人,服装和发型往往比脸部微调更可靠。因为同一张脸在不同角度、不同光线下本来就会有偏差,但发型轮廓和衣服色块更容易被记住。
所以做系列动作图时,建议尽量保持:
- 同一发型:长度、刘海、卷直、分缝不乱变
- 同一主色服装:不要一会儿白衬衫一会儿红礼服
- 同一配饰:耳钉、眼镜、项链、帽子尽量固定
- 同一年龄感:不要一张像学生,一张像职场人
如果你想表达角色成长或阶段变化,那是另一种任务,应该单独设定。不要把“同一人物不同动作”和“同一人物不同造型”混在一起做,不然你会很难判断到底是动作不稳,还是角色设定本身就变了。
在一些需要批量产出的场景里,机灵助手这类工具的价值就在于帮你先把设定整理成稳定模板,再批量替换动作词。这样可以少掉很多重复试错。
一套能直接拿去改的提示词模板
下面这套模板适合做同一人物的动作系列。你只要替换中括号里的内容就行:
“[年龄][性别][人种/地域特征],[发型],[发色],[脸型与标志性特征],[服装],[配饰],[主动作],[动作细节],[表情与情绪],[镜头距离],[拍摄角度],[光线],[背景],[整体风格],[高清、真实肤质、高细节]。”
示例一:
“26岁亚洲女性,及肩黑发,微卷发尾,瓜子脸,鼻梁高,穿浅灰色西装外套和白衬衫,戴细框眼镜,站在办公桌旁整理文件,左手扶住文件夹,神情专注,半身构图,平视角度,柔和室内光,背景是简洁办公室,干净写实风格,高清,真实肤质,高细节。”
示例二:
“26岁亚洲女性,及肩黑发,微卷发尾,瓜子脸,鼻梁高,穿浅灰色西装外套和白衬衫,戴细框眼镜,坐在办公桌前低头看电脑屏幕,右手轻点鼠标,神情认真,半身构图,平视角度,柔和室内光,背景是简洁办公室,干净写实风格,高清,真实肤质,高细节。”
这两句的核心差别只有动作,但因为人物和画面条件完全一致,所以更容易得到一组能连起来看的图。
几个最常见的坑,避开以后出图会顺很多
第一,动作写得太抽象。比如“很有表现力”“很自然”“很高级”,这些词对模型帮助有限,最好换成具体姿态。
第二,动作和场景不匹配。比如写“在狭小电梯里大幅奔跑”,模型会乱补空间;写“在椅子上跳跃”,也会造成肢体混乱。动作要和场景物理条件一致。
第三,人物特征太少。只写“漂亮女孩”,那基本等于没写身份。越是想保持同一人物,越要把脸、发型、服装写细。
第四,每次都改太多变量。想验证动作是否稳定,一次只改一个主动作,别同时改发型、服装、背景和镜头。
第五,过度追求长提示词。长不等于稳。重复和冲突越多,模型越容易失焦。写提示词时,删掉无用形容词,保留能锁定身份和姿势的信息,往往更有效。
如果你经常要做同一角色的多动作图,可以把人物卡、镜头卡、动作词库分开保存。真正用的时候,只替换动作和少量情绪词。这样不仅稳定,也更适合批量产出。机灵助手这类工具在这里的作用,就是帮你把这些重复劳动压缩掉,让你更快得到一组可复用的模板。
做“同一个人物不同动作”,本质上是在和模型一起维护连续性。人物要固定,动作要具体,镜头要统一,冲突要少,负面提示词要补上。把这几件事做实,出图就不会一会儿像这人,一会儿像那人。真正好用的提示词,不是写得最花,而是每次都能把同一个角色稳稳拉回来。










