Lem Gen
返回博客

角色一致性提示词:一套可复用的参考图工作流

用一张锚点参考图、受保护的身份区块和场景变化区块,把同一个 AI 角色稳定地带到不同镜头、不同场景和不同改图任务里。

2026年8月17日Lem Gen TeamLem Gen Team
角色一致性提示词:一套可复用的参考图工作流

角色一致性提示词 真正有效的前提,不是把所有要求塞进一大段“很会说话”的文字里,而是把身份和变化拆开。你需要的不是一条永远有效的魔法句子,而是一套能反复修改、能定位失败原因、能在不同场景里继续复用的提示词结构。

先从 Lem Gen 首页 进入,查看 人像摄影提示词专题 找构图模式;如果你已经有一张可授权使用的参考图,就直接打开 已选择 GPT Image 2 的图片编辑 Workspace。如果你还想比较另一种提示词风格,可以把 Nano Banana 提示词库 当成补充参考,但下面这套方法刻意保持“模型无关”,这样你换模型时也能继续用。

这篇文章会把角色一致性拆成四个核心动作:先定锚点参考图,再写身份锁定区,再把场景变化独立出去,最后用最短的复盘回路处理漂移。

角色一致性到底在控制什么

很多人说“保持角色一致”,其实混在一起讲了两件事:一是风格一致,二是识别度一致。风格一致只说明画面整体看起来像同一套作品;识别度一致才说明“这还是同一个人、同一个角色、同一个品牌主体”。

真正难的地方不在于把画面做得都很像,而在于你换了角度、换了背景、换了服装、换了表情之后,角色依然能被一眼认出来。广告系列、故事分镜、教程封面、账号头像延展、品牌人物主视觉,真正需要的都是这种“认得出”的连续性。

所以第一步不是问“哪条提示词最强”,而是先问一句更实际的话:哪一些细节一旦漂移,这个角色就不再是同一个角色?

先做一张锚点图,再谈后续场景

在你要求模型做第二张、第三张、第四张图之前,先做出一张锚点图。它是后续所有变化的基线。锚点图不一定非得是正脸,但必须足够清楚,能让人直接看出主体的身份特征,不要被背景、道具、复杂动作或多人物关系干扰。

作为锚点参考的干净源图,用来在后续场景变化前固定主体身份

先把锚点固定住,再去讨论动作、环境和氛围,后面的每一次修正 才有共同基线。

这个原则不只适用于真人角色,也适用于吉祥物、品牌代言形象、固定产品主体,甚至带有强识别度的插画人物。你先有一个共同起点,后面才有办法判断究竟是哪一层要求让结果开始漂移。

同时,它还能解决审批问题。团队讨论时,不再是每个人脑海里各自想一个“理想版本”,而是所有人都围绕同一张锚点图判断什么可以变、什么不能变。

如果你手里只有一张成图,但还没想清楚它的结构,可以先结合 image-to-prompt 工作流 把那张图拆成可编辑的提示词层级;但真正的角色一致性工作,要从“选定锚点图”才正式开始。

身份锁定区要先于场景描述

身份锁定区就是保护层。它只负责写“哪些信息绝对不能乱”。不要先写氛围,不要先写镜头,不要先写“高级感”或“电影感”,更不要先写场景故事。先把识别度最核心的东西写清楚。

对真人或拟人角色来说,身份锁定区通常包含:

  • 脸型和比例;
  • 发型、发际线、发量轮廓;
  • 肤色与明显肤质特征;
  • 眼距、眉形、鼻梁、嘴型;
  • 体型与姿态倾向;
  • 关键服装锚点,比如外套颜色、眼镜、耳环、帽子、徽章;
  • 标志性配饰或必须保留的元素。

对吉祥物、品牌角色或固定主体来说,则可能是:

  • 轮廓;
  • 材质表现;
  • 色彩锚点;
  • 结构比例;
  • Logo、贴片、纹样或包装几何。

可以直接用这种写法:

IDENTITY LOCK
Use the uploaded anchor image as the identity source.
Keep the same face shape, brow shape, eye spacing, nose bridge, mouth width,
hairstyle, skin tone, and overall body proportions.
Keep the black bomber jacket, silver hoop earring, and red stitched shoulder
patch exactly consistent.
Do not redesign the subject, age them up or down, or replace the clothing system.

这比一句“保持角色不变”有用得多。因为当结果出问题时,你能直接看出到底是哪条被破坏了,而不是模糊地觉得“怎么有点不像了”。

参考图要少而准,不要堆一大叠

很多人直觉上会觉得“多给几张参考图更稳”。现实里经常相反。不同裁切、不同光线、不同镜头、不同表情、不同服装,如果没有明确分工,只会让模型接收到互相矛盾的信号。

更稳妥的做法是:

  • 一张主锚点图,负责主体身份;
  • 只有在主锚点缺少必要信息时,再补一张特定角度;
  • 只有在某个配饰、服装或道具确实关键时,再补一张说明图;
  • 风格参考和身份参考尽量分开,不要混写成同一层要求。

如果你已经有可用主体图,优先进入 已选择 GPT Image 2 的图片编辑 Workspace。如果你只是想对比另一种提示词表达方式,再单独开一次 Nano Banana 图片编辑 Workspace 做对照,不要把两种风格的提示词逻辑混在同一个审批回路里。

把场景变化和身份分成两块

一旦身份锁定区稳定下来,后面的变化就应该写在独立的场景变化区。很多一致性失败,根本不是模型“听不懂”,而是用户把“这个人是谁”和“这次要去哪儿、做什么、看起来怎样”全写在一锅粥里。

一个可维护的场景变化区,至少要回答四件事:

  1. 这次发生了什么;
  2. 场景在哪里;
  3. 这次画面的氛围或制作语境是什么;
  4. 哪些东西可以变,哪些东西不能因为这次变化而被牵连。
SCENE VARIATION
Place the same subject on a rainy night street outside a neon ramen bar.
The character is turning halfway toward camera while holding a folded umbrella.
Keep the scene cinematic and grounded, with wet pavement reflections and visible
background depth.
The environment, lighting color, and weather may change. The subject identity may not.

这样分层的价值在于,你后面修图时知道应该改哪一块。场景太普通,就改场景变化区;脸不稳,就回到身份锁定区;而不是每次把全段重写。

镜头和裁切要单独控制

很多“角色不像了”的问题,其实不是脸完全变了,而是景别、角度和裁切把识别感带偏了。俯拍、仰拍、过近特写、过强透视、侧脸比例变化,都可能让用户主观感觉“已经不是同一个人”。

所以镜头和裁切最好再单独拆一层:

CAMERA AND CROP
Vertical 4:5 composition.
Chest-up portrait framing.
Eye-level camera with a slight three-quarter turn.
Leave clean negative space above the head for copy.
Do not crop hands into the face area or tilt the horizon.

这一层对活动图、封面图、缩略图尤其重要。很多项目真正需要保持的,不只是“同一个角色”,还是“同一个角色用差不多的视觉秩序出现”。如果构图完全乱掉,系列感一样会断。

你可以去 人像摄影提示词专题GPT Image 提示词专题 看镜头结构怎么写,但真正生成时一定要换成自己的主体、自己的品牌边界、自己的审批条件。

换服装和背景时,不要重写脸

角色一致性里最常见的业务需求不是“永远同一件衣服”,而是“还是同一个人,但换场景、换穿搭、换氛围”。解决办法不是把整段提示词推翻重来,而是明确哪些服装或道具是可替换的,哪些识别锚点必须保留。

比如:

  • 固定:发型、脸型、肤色、体型、眼镜、耳环、手表;
  • 可变:外套颜色、背景地点、天气、手里拿的物件。
WARDROBE AND PROP RULES
Keep the same face, body build, hairstyle, and silver hoop earring.
Replace the black bomber jacket with a cream trench coat.
Add a plain canvas tote bag.
No extra jewelry, no hat, no printed text, and no second person in frame.

这类写法的优势是“可控变化”。你不是每次发一条新提示词,而是在同一套身份基础上,移动允许变化的部分。这个逻辑和 Nano Banana 提示词工作流 里“先保护主体,再放开画面”的方法是一致的。

排除项要服务于真实失败,不要堆黑名单

排除项当然有用,但前提是它们对应真实会出错的地方。不要把网上见过的所有缺陷名词都复制进来。你要挡掉的是这次任务里成本最高、最不能接受的失败。

有效的排除项通常非常具体:

  • 不要出现第二个人;
  • 不要把耳环数量改掉;
  • 不要改变眼睛颜色;
  • 不要自动加胡子;
  • 不要在衣服上生成文字;
  • 不要给角色加帽子或面罩;
  • 不要出现年龄漂移或体型重设计。

无效的排除项往往太空:

  • 不要难看;
  • 不要奇怪;
  • 不要低质量;
  • 不要坏解剖。
EXCLUSIONS
No second subject.
No added facial hair.
No different eye color.
No text or logo on clothing.
No hats, helmets, masks, or sunglasses.
No camera angle above forehead level.
No age shift, ethnicity shift, or body-shape redesign.

排除项的意义不是“把模型骂一顿”,而是把审批标准写得能被追踪。这样你后面看到错误时,不是模糊觉得“味道不对”,而是知道哪条限制被打破了。

不要无脑加词,要先定位漂移

一旦结果开始漂移,最常见也是最没效率的做法,就是往提示词里继续堆形容词。长度不是控制力。先判断最大的失真点到底在哪一层:

  • 脸漂了;
  • 构图漂了;
  • 服装漂了;
  • 光线漂了;
  • 动作漂了;
  • 背景漂了;
  • 自动冒出多余文字或道具了。

然后只改对应那一层。

在场景变化后仍保持核心主体特征可识别的受控结果

真正高效的修正方式,是让锚点区保持稳定,只修改出问题的场景、 镜头或限制层。

一个最简单的诊断表可以长这样:

If the face drifts -> tighten IDENTITY LOCK
If the crop feels wrong -> tighten CAMERA AND CROP
If props keep appearing -> tighten EXCLUSIONS
If the atmosphere is flat -> improve SCENE VARIATION
If the outfit changes too much -> tighten WARDROBE AND PROP RULES

这样做的好处是,一致性不再是“玄学”。你每次都知道是哪个区块应该负责这次失败。

五个可直接改写的角色一致性模板

下面这些模板适合当起点,但不要把它们当万能咒语。

1. 同一角色,换背景

Use the uploaded anchor image as the identity source.
Keep the same facial structure, hairstyle, skin tone, body proportions, and
black leather jacket.
Place the character in a quiet bookstore aisle at dusk with warm practical
lighting and soft depth in the background.
Vertical 4:5 chest-up framing, eye-level camera, clean space above the subject.
No second person, no glasses, no age shift, no printed text, no new accessories.

2. 同一角色,动作更强

Use the uploaded anchor image as the identity source.
Preserve face shape, brow line, hairstyle, earrings, and athletic build.
Show the same character stepping quickly across a crosswalk while looking over
their shoulder toward camera.
Wide editorial street frame with wet pavement reflections and motion energy,
but keep the subject sharply recognizable.
No duplicate limbs, no crowd overlap across the face, no new hat or backpack.

3. 同一角色,换穿搭

Use the uploaded anchor image as the identity source.
Keep face, skin tone, haircut, body proportions, and silver hoop earrings.
Replace the jacket with a cream trench coat and dark knit top.
Portrait 4:5 crop, half-body framing, soft studio window light, neutral wall.
No extra jewelry, no text on clothing, no dramatic fisheye distortion.

4. 同一角色,做风格化重绘

Use the uploaded anchor image as the identity source.
Keep the same face structure, hairstyle silhouette, eye spacing, and body
proportions while translating the image into a polished illustrated poster.
Use simplified shapes, bold rim light, and a clean editorial color palette.
Keep the expression calm and recognizable.
No exaggerated cartoon anatomy, no oversized eyes, no added props, no text.

5. 同一角色,做封面缩略图

Use the uploaded anchor image as the identity source.
Keep the same face, hairstyle, glasses, and yellow jacket.
Create a chest-up YouTube-style thumbnail with strong subject separation,
clean top-right copy space, and bright contrast.
Direct eye contact, simple background, highly readable silhouette.
No extra hands near the face, no second subject, no tiny background clutter.

用一条很短的回路复盘结果

最短、最有用的工作流其实只有七步:

  1. 选一张锚点图;
  2. 写一层身份锁定区;
  3. 写一层场景变化区;
  4. 写一层镜头裁切区;
  5. 写明确排除项;
  6. 生成一个基线版本;
  7. 只修改失败那一层。

这条回路比任何“写得更华丽”的提示词都重要。因为它能被复现,也能被团队协作。别人问你为什么这张通过、那张不通过时,你可以直接指出是哪一层要求发生了变化。

权限、审核与模型选择

角色一致性工作经常碰到敏感素材:客户人像、主持人、创作者、运动员、品牌吉祥物。能在网上看到,并不等于你就能拿来上传、重绘、再发布。只用你有权使用的图片。

在 Lem Gen 里,决策可以很简单:

如果你的起点是一张成图,还需要先把结构拆出来,再进入一致性流程,可以结合 image-to-prompt 工作流。如果真正问题更偏向“商品主体跨场景保持一致”,那就切换到 AI 商品图提示词工作流

导出前的最后检查

在你点下确认之前,先问自己这几件事:

  • 不看提示词,主体还认得出来吗?
  • 哪些受保护的脸部、服装或配饰细节漂了?
  • 是不是裁切方式本身改变了识别感?
  • 有没有多出不该出现的文字、道具或人物?
  • 这次场景变化是否真的值得生成一张新图?
  • 你能不能指出该改哪一个区块,而不是重写整段提示词?

如果有三项以上是否定答案,不要继续堆描述词。先回到锚点,收紧出问题的区块,再跑一个更干净的基线版本。

这篇文章最短的结论就是:角色一致性不是靠一条很长的句子硬锁出来的,而是靠稳定锚点、精简身份区块、独立场景区块,以及可诊断的修改回路做出来的。你可以先从 Lem Gen 首页 进入,查看 人像摄影提示词专题,然后继续在 已选择 GPT Image 2 的图片编辑 Workspace 里实测。真正该保存的,是“还能认出来”的那个版本,而不是“词写得最热闹”的那个版本。