Lem Gen
返回博客

如何先做 GPT Image 2 角色设定板,再进 Seedance

先用 GPT Image 2 做角色设定板,再进入 Seedance 动画流程,可以更稳定地保住脸部、服装、道具和镜头收尾的一致性。

2026年8月25日Lem Gen TeamLem Gen Team
如何先做 GPT Image 2 角色设定板,再进 Seedance

如果你的 Seedance 片段老是在脸型、发际线、服装或者道具比例上漂,问题往往不是出在“动作之后”,而是出在动作之前。视频模型必须同时解决身份、镜头和运动,所以更稳的做法是先从 Lem Gen 首页GPT Image 提示词专题 入手,在已经选中 GPT Image 2 的 image-editor Workspace 里把角色设定板做扎实,再把它带进视频阶段。

设定板通过后,再去看 Seedance 提示词专题,并进入已选好 Seedance 2.5 的 image-to-video Workspace。重点不是写一条万能长提示词,而是先做一个可复用的身份包,让后续视频提示词专注于镜头、节奏和动作,不再反复“重新生成这个角色是谁”。

这篇文章讨论的就是这个更窄、更实用的任务:如何把 GPT Image 2 变成 Seedance 前的一步前期制作流程,设定板里到底该放什么,提示词该怎么拆,哪些失败最值得优先修,以及怎样把这套流程变成可重复的动画输入。

“先做角色设定板”到底在解决什么问题

所谓 GPT Image 2 角色设定板,不只是一个好看的角色概念页。放到视频工作流里,它其实是后续镜头的身份合同,用来记录那些应该跨镜头、跨动作、跨运镜仍然保留下来的元素:

  • 脸部结构和五官间距;
  • 发型、发际线和颜色锚点;
  • 服装轮廓与重复出现的配件;
  • 定义角色的核心道具;
  • 之后还要延续的视觉风格;
  • 一旦镜头动起来仍然能辨认的轮廓。

这和更泛化的 角色一致性提示词工作流 不是一回事。那篇文章讲的是如何在静态图片之间保护身份,这篇文章讨论的是更具体的视频前置问题:怎样先做出一个能顺利过渡到 Seedance 的设定板。

差别很重要,因为视频里的失败经常比静态图更早暴露:

  • 围裙突然变成另一套衣服;
  • 吉祥物道具一转镜头就换了形状;
  • 脸还算像,但整体轮廓已经接不上前一个镜头;
  • 第一帧还能用,最后一帧却完全接不上下一镜。

所以这里的设定板不是装饰,而是前期资产。

先按镜头需求做板,而不是先追求“好看”

最常见的错误,是一上来就让 GPT Image 2 “做一张很酷的角色设定板”,却没有说明后续镜头到底要用它做什么。这样得到的往往是审美上不错、但对动画输入帮助有限的拼板。

更稳的方式,是先问自己接下来要做什么镜头:

  • 你需要的是正面主视图、半身图还是全身轮廓?
  • 这个角色是否一定要拿着某个稳定道具?
  • 后续是否需要表情变化?
  • 镜头会绕主体运动,还是主要是慢慢推近?
  • 动作重点是手部、身体转向,还是一个带环境信息的揭示镜头?

这些答案会直接决定设定板该有哪些面板。比如一个短广告角色,最实用的板通常包括:

  • 一个干净的主视图;
  • 一个三分之四英雄视角;
  • 一个侧面或接近侧面的视角;
  • 一个中性站姿;
  • 一个带道具的动作姿态;
  • 几个后续镜头真的会用到的表情状态。

如果你要做的是短故事或角色预告,可以再加环境状态,但原则不变:设定板要服务后续镜头,而不是服务“看起来像概念页”。

先做一个锚点,再扩成设定板

更稳定的流程,是先做一个身份锚点图,或者先写一条非常清晰的锚点提示词,然后再让 GPT Image 2 把它扩成设定板。如果你的起点本来就是一张参考图,那么先走一次 Image to Prompt 工作流 仍然很值,因为它能把可见事实和猜测拆开,避免你还没进视频阶段就把身份源弄脏。

在扩展成动画前设定板之前,先建立一个干净的身份锚点参考

先有一个清晰的身份源,再去扩面板。多个互相冲突的参考裁切, 只会把后续运动阶段拖进猜谜模式。

锚点提示词应该尽量短、尽量事实化,不要一开始就写成一段带剧情的大片文案。第一步的目标只是把主体锁住。

先创建一个用于后续动画的角色身份锚点。
主体:年轻甜点主厨吉祥物,圆脸,短深色波波头,暖棕肤色,
白色围裙,红色颈巾,身体比例偏紧凑,始终带一把木勺。
风格:柔和的 3D 家庭动画质感。
背景:中性摄影棚底。
目标:固定脸部结构、围裙轮廓、颈巾颜色和木勺形状。

身份锚点通过后,再扩:

把已通过的身份锚点扩展成用于动画规划的角色设定板。
包含:正面、3/4 英雄视角、侧面、中性站姿、
一个举勺动作姿态,以及三种表情(专注、惊讶、微笑)。
每个面板都保持同一张脸、同一套围裙、同一条红色颈巾、
同一把木勺的几何形状。背景干净,面板之间留出清楚间距。

关键不在于一定要几个面板,而在于流程纪律:先有一个通过的身份源,再去扩,不要一开始就同时要求六种变化。

进入 Seedance 前,设定板至少要包含什么

一个能给 Seedance 使用的角色设定板,应该先把视频最容易丢的部分暴露出来。

对大多数短视频工作流来说,最低可用配置是:

  1. 一个清晰的主英雄帧;
  2. 一个侧面或三分之四视角;
  3. 一个可读的全身或半身姿态;
  4. 一个表情变化;
  5. 如果道具重要,再加一个稳定道具姿势。

如果后续视频更偏故事型,可以再补一个“动作前状态”和一个“动作后反应状态”。这些状态会让视频模型更容易读懂情绪走向,而不是自己乱补。

同时,你还应该明确写出不能变的是什么。我通常会直接写成排除块:

不要改变脸部比例。
不要把围裙替换成别的服装。
不要新增额外道具。
不要重画木勺的形状。
所有面板都保持同一种 3D 材质语言。

这类排除条件不华丽,但非常有用。它告诉 GPT Image 2:这张板是用来保护什么的。后面的 Seedance 提示词就可以继续复用这些不变量。

设定板提示词和动作提示词必须分开

设定板通过后,除非身份本身还错,否则不要继续在同一条提示词里一边改板、一边加镜头。很多流程从这里开始混乱。

设定板提示词负责回答:

  • 这个角色是谁?
  • 我后面会用到的视角、表情、姿态是什么?
  • 哪些服装、道具和轮廓必须保住?

动作提示词负责回答:

  • 这个镜头里发生了什么?
  • 镜头怎么动?
  • 镜头从哪里开始?
  • 结尾停在哪里?
  • 哪些东西可以变,哪些东西不能变?

最好让两层资产各自只做一件事。视频提示词引用通过的设定板,然后只写镜头行为。

使用已通过的角色设定板作为身份参考。
4 秒 image-to-video 镜头。
甜点主厨吉祥物站在木质操作台前,抬一次木勺,身体微微前倾,
露出微笑,最后停在英雄姿态。
镜头:慢速推近。
保持脸、围裙、颈巾和木勺形状一致。
不要新增手,不要新增道具,不要换衣服,不要突然拉长身体比例。
最后一帧停在干净、居中的英雄构图。

这已经比那种把身份、风格、剧情、动作、情绪和镜头全部塞进一段长文里要可靠得多。

先做一个小镜头,不要一上来就做完整段落

最容易浪费一张好设定板的方式,就是第一次测试就拿它去跑一个很复杂、很长、变量很多的动作段落。更有效的做法,是先跑一个短而可诊断的镜头。

第一次 Seedance 测试最好只测一种运动概念:

  • 一个慢推;
  • 一个轻微转向镜头;
  • 一个明确的手部动作;
  • 一个表情反应镜头;
  • 一个走一步再停住的小段落。

为什么要这么做?因为第一次测试的价值不在于“产出漂亮成片”,而在于定位失败源头。如果第一次就同时要求:

  • 快速运镜;
  • 服装变化;
  • 道具交互;
  • 环境揭示;
  • 表情大幅变化;
  • 最后一帧还要能接下一个镜头;

那你根本无法判断到底是哪一个变量导致了漂移。

这也是最近社区里不断重复出现的经验:当镜头要求更简单、相机指令更明确、参考源更稳定时,身份往往更容易保住;一旦同时改太多层,模型就会开始“自己补”。

用设定板去控制第一帧和最后一帧

一张好的设定板,另一个价值是能让第一帧和最后一帧更可控。对于要做广告、Reels、短故事切镜的人来说,这件事甚至比“整体一致”更关键。

第一帧应该继承设定板里已经通过的身份状态。最后一帧则应该是一个有意设计的落点,而不是动作结束时模型随手停下来的随机画面。

所以镜头计划里最好直接写出帧逻辑:

起始状态:采用通过版设定板里的中性站姿,木勺下垂。
中段动作:一次清晰的举勺动作并伴随轻微转头。
结束状态:木勺停在肩部高度,笑容可见,主体居中。

当设定板和镜头计划互相对得上时,结果更容易审;当它们互相打架时,模型只能猜。

这也是为什么旧的 Seedance 视频提示词模式总结 依然要一起看。Seedance 提示词最适合写成 shot description,而不是视觉形容词堆。设定板给镜头一个稳定演员,视频提示词再给这个演员一个清楚的动作节拍。

按失败类型来诊断,而不是笼统地说“它不稳”

跑完第一个动画测试后,不要只问“好不好”。更有用的问题是:最先坏掉的是哪一类东西? 这个答案会直接决定你改哪里。

最常见的失败类型有五类:

1. 脸漂

通常说明设定板里的脸部信息不够清楚,或者镜头一开始就要求太大的头部转动。

修法:

  • 强化主视图和三分之四视图;
  • 收缩表情变化幅度;
  • 先降低大动作,直到脸能保住。

2. 服装或道具漂

通常说明设定板没有把稳定服装或道具几何写清楚。

修法:

  • 在设定板里补一个更清楚的道具姿态;
  • 在视频提示词里重复写道具名称和材质;
  • 明确禁止替换道具。

3. 身体比例漂

通常说明镜头动作太多,而设定板里缺少可用的全身参考。

修法:

  • 补一个中性的全身板;
  • 缩短镜头;
  • 降低环境运动量。

4. 风格漂

通常说明设定板提示词和视频提示词对风格的表述不一致。

修法:

  • 两边都只保留同一条稳定风格短语;
  • 去掉额外的视觉比喻;
  • 让光线和材质词保持一致。

5. 结尾崩

通常说明你没有定义最后一帧应该停在哪里。

修法:

  • 把终点姿态写清楚;
  • 让结尾停在一个简单的英雄构图;
  • 缩小最后一秒的变化量。
当设定板提前定义了可保留元素时,后续变化更容易保持主体的可识别性

只要哪些元素必须保住在前面说清楚了,后续变化反而更容易被 控制,而不是每次都重新生成一个“像但又不完全像”的版本。

在 Lem Gen 里可复用的一套路由

如果你想把这件事在 Lem Gen 里变成可重复流程,最简单的组合是:

这套流程的核心,是让“设定板”和“镜头提示词”始终是两份资产:

  • 设定板负责身份;
  • 视频提示词负责镜头;
  • 审核记录负责解释为什么这个版本算通过。

很多人低估了审核记录的重要性。没有“为什么通过”的备注,下一次复用时你很难判断哪些元素是刻意保留的,哪些只是偶然碰巧对了。

什么时候该重做设定板,而不是继续逼视频提示词

有时真正该修的不是 Seedance,而是前面的板。以下情况通常说明你该回到 GPT Image 2 重新收板:

  • 已通过的静态图之间,脸已经互相打架;
  • 道具在不同面板里本身就换了形状;
  • 服装层次过于复杂,根本不适合进入运动;
  • 每个面板的风格语言并不一致;
  • 后续镜头需要的角度,设定板从来没给过。

这类问题如果不在前期修,视频提示词只会变成背锅工具。很多时间就是这样被浪费掉的:明明身份源是脏的,却一直在往动作层加字。

一个从静态到动作的最短可行循环

如果我要做一个短品牌角色片段,我会这样跑:

  1. 先在 GPT Image 2 做一个身份锚点。
  2. 把它扩成带主视图、三分之四视图、侧面和道具姿态的设定板。
  3. 先按脸、轮廓、服装和道具几何审核设定板。
  4. 写一个只有一个动作、一个镜头运动的 4 秒 Seedance 测试。
  5. 只看第一个明显失败点。
  6. 要么收紧设定板,要么简化镜头。
  7. 把通过版设定板、视频提示词和审核结论一起存档。

下面这个视频里,真正有用的不是“它动起来了”,而是主体在运动中依然可读,动作范围也被故意限制在一个容易审的区间里。

最实用的结论其实很短:先把身份做稳,再让它运动。

可直接改写的提示词模板

下面这几段最适合作为起步模板,然后再按你的角色和镜头任务改。

模板 1:身份锚点

先创建一个用于后续动画的清晰身份锚点。
主体:[角色是谁]
稳定脸部特征:[脸型、眼睛、头发、肤色、标记]
稳定服装锚点:[必须重复的衣物]
稳定道具:[必须始终可辨认的物件]
风格:[一条稳定的风格短语]
背景:中性摄影棚底
目标:为后续角色设定板扩展保留身份

模板 2:扩成设定板

把已通过的身份锚点扩展成用于动画规划的角色设定板。
包含:正面、3/4、侧面、中性站姿、道具姿态、
以及三种表情。
保持同一张脸、同一轮廓、同一服装锚点和同一道具几何。
不要背景杂物。面板干净分隔。整体风格一致。

模板 3:第一条 Seedance 镜头

使用已通过的角色设定板作为身份参考。
4 秒 image-to-video 镜头。
动作:[一个简单动作]
镜头:[一个简单运镜]
保持脸、服装锚点和道具形状一致。
不要新增角色。不要换装。不要新增道具。
最后一帧停在干净的英雄构图。

模板 4:漂移修复备注

本次片段主要漂移在 [脸 / 道具 / 服装 / 轮廓 / 结尾帧]。
只修这一类问题。
上一轮已通过的其他元素全部保持不变。

模板 5:通过版本存档

通过设定板版本:[名称]
通过镜头版本:[名称]
通过原因:[具体写明身份和动作为什么可用]
下一个镜头必须保留:[列表]
下一个镜头允许改变:[列表]

在进入动画前,最后再核一次

在你离开 GPT Image 2、切进 Seedance 之前,至少确认以下几点:

  • 已经有一个通过版身份锚点;
  • 设定板包含了后续镜头真正需要的视角;
  • 脸、服装和道具在各面板之间稳定;
  • 静态提示词和动作提示词使用的是同一条风格短语;
  • 第一次视频测试只测一个小动作;
  • 最后一帧有明确落点;
  • 审核备注解释了这个版本为什么算通过。

这份核对清单,往往比再加一段形容词更值钱。

这篇文章最短的总结就是:先做角色设定板,再做动作镜头,让每份资产只解决一件事。你可以先从 Lem Gen 首页 进入,对照 GPT Image 提示词专题Seedance 提示词专题,在已选 GPT Image 2 的 image-editor Workspace 里把身份包做稳,再切到已选 Seedance 2.5 的 image-to-video Workspace。如果你还需要更泛化的静态身份保护方法,可以同时看 角色一致性提示词工作流;如果你需要更强的镜头措辞,再搭配 Seedance 视频提示词模式总结