Lem Gen
返回博客

图片转提示词:一套可复用的反向提示工作流

用六层拆解法把参考图片转成可编辑的 AI 提示词,包含可复制模板、失败诊断、原创改写方法与完整实操步骤。

2026年8月12日Lem Gen 团队Lem Gen 团队
图片转提示词:一套可复用的反向提示工作流

图片转提示词真正有价值的地方,不是装作从像素里找到了某句“神秘原文”,而是把成品图转换成一份可以检查、修改和测试的视觉简报。图片能告诉我们主体、构图、光线、色板、纹理和空间关系,却无法可靠地暴露已经删掉的指令、随机种子、模型参数、参考图权重或后期修改。

所以目标应当很明确:把参考图拆成结构化提示词,并且知道每一段控制什么。你可以先从 Lem Gen 提示词库寻找视觉模式,查看 GPT Image 提示词专题,需要保留产品形状或身份时,再打开已经选中 GPT Image 2 的图片编辑工作台

下面这套流程包括六层拆解法、五个可直接改写的模板、单变量诊断方式,以及如何把“参考”转成原创方案而不是复制品。

图片转提示词能还原什么,又不能还原什么

反向提示工程首先要承认信息边界。像素是最终外观的证据,却不是完整制作记录。画面中的暖色高光可能来自大柔光箱、窗户、后期重打光,也可能只是模型模仿出来的明暗渐变。图片能支持“硬质侧光形成矩形窗影”这一描述,却通常不能证明具体灯具和镜头参数。

这种区分会直接影响提示词质量。较弱的工具往往输出一整段密集文字,并对风格标签表现得过度自信。更可靠的分析会把内容分成三类:

  • 可见事实: 瓶子居中、钴蓝色、表面有光泽,放在浅色石台上;
  • 有用推断: 阴影形状说明主光较硬,并从画面侧上方照入;
  • 未知条件: 具体镜头、随机种子、模型、参考权重和编辑历史。

把推断写成推断并不会削弱文章,反而让提示词更容易跨模型复用。“暖色硬光从左上方照入,并在背景投下清晰窗影”是可执行的;在没有证据时写“85 mm、f/1.8”只是虚假的精确。

六层反向提示词蓝图

可用的图片转提示词结果应该是模块化的。每一层只承担一个任务,修改其中一层时不需要推倒重来。

  1. 视觉任务: 产品主图、编辑人像、社交海报、分镜画面、概念设计或电商细节图。
  2. 主体: 身份、形状、姿态、表情、产品几何、服饰、道具和必须保持不变的部分。
  3. 构图: 裁切、视角、主体占比、留白、前后景关系和文字安全区。
  4. 机位与媒介: 摄影视角、透视和景深,或插画、3D 等表现方式;精确度只到证据允许的程度。
  5. 光线、色彩与材质: 方向、软硬、反差、色温、色板、表面反应、气氛和纹理。
  6. 限制条件: 排除项、身份规则、文字规则、比例、输出用途和允许变化的范围。
图片转提示词六层蓝图,分别拆解主体、构图、机位、光线、材质和排除项

六个字段把观察与推断分开,也让每次修改都能追溯到具体原因。

顺序很重要。“电影感、好看、高级”不能说明图片要解决什么问题,而清晰的视觉任务和稳定的主体可以。先让构图在脑中成立,再讨论风格和精修。

第一步:先定义视觉任务,再描述风格

先问一个直接的问题:这张图片必须完成什么? 如果答案只是“像参考图”,这份简报还没写完。参考图吸引你,往往是因为它解决了某个具体问题:让产品轮廓清晰、给文案留出空间、表达尺度,或建立合适的情绪距离。

把任务写成一句话:

视觉任务:制作一张 4:5 电商活动图,让小型陶瓷香水瓶显得有触感且高级,
同时在产品上方保留干净、可放文案的区域。

这句话是后续取舍标准。植物背景可能符合参考图的氛围,却会破坏标签可读性;夸张低机位可能看起来昂贵,却容易让瓶盖变形。视觉任务决定哪些细节应该保留。

如果你要做活动图,可以浏览产品广告提示词专题,比较不同提示词如何建立层级,不要逐字照搬某一个样例。

第二步:只盘点真正看得见的内容

解释之前先做字面盘点,从大结构写到小细节:

  • 一个钴蓝色陶瓷瓶,短瓶颈、圆角瓶盖;
  • 正面略带三分之四角度,产品约占画面一半高度;
  • 下方是浅色多孔石台;
  • 暖灰背景,没有明显地平线;
  • 瓶身右侧出现连续高光;
  • 柔边阴影落向后方和左侧;
  • 色板收敛在蓝、奶油白和石灰色;
  • 没有标签、商标、手、植物和可见文字。

这份清单刻意没有写“奢华、地中海、永恒、电影感”。这些词以后可以作为创意判断,但不是直接可见的事实。先写事实,能避免一个风格词悄悄改变主体或场景。

如果画面中有人,也应保持同样克制:描述姿态、视线、服饰、裁切和可观察的表情,不根据外貌推断族裔、健康、职业或性格。上传或生成可识别人物的变体前,要先确认肖像使用权限。

第三步:写空间关系,不要只列物体名称

很多反向提示词把所有东西都写到了,却仍然不像参考图,问题通常在构图。模型需要知道元素之间的关系:

  • 居中还是偏置;
  • 近景裁切还是环境远景;
  • 平视、俯视还是仰视;
  • 浅前景还是分层纵深;
  • 主体独立还是彼此遮挡;
  • 对称平衡还是有方向张力;
  • 留出文案区还是铺满细节。

构图段应当达到“别人读完能画草图”的程度:

构图:4:5 竖幅;瓶子居中并略低于画面中线;机位与产品等高;
石台占画面下四分之一;背景连续无分界;上三分之一保持安静留白;
任何物体都不能遮挡瓶子轮廓。

相对描述通常比伪造测量值更稳健。产品比例特别重要时可以写“占画面高度约 55%”,但跨比例复用时,“单一主角、上方留出充足空间”更容易迁移。

第四步:用光线造成的结果来描述光线

不要从灯具名称开始,先写光线在画面里做了什么:

  • 方向:正面、侧面、逆光、顶光或混合;
  • 软硬:边缘清晰、柔和包裹或均匀散射;
  • 反差:阴影深还是保留细节;
  • 色温:中性、暖、冷或混合;
  • 表面反应:陶瓷宽高光、玻璃锐利反射、哑光吸收;
  • 背景行为:明暗衰减、渐变、投影、薄雾或纯色。

需要时再补充一个合理的布光推断:

光线:暖色硬主光从画面左上方照入,形成可控的斜向阴影;
非常柔和的中性补光保留钴蓝釉面细节;不要发光轮廓,
不要死黑阴影,瓶盖上不要出现镜面爆点。

它比“专业影棚灯光”更有效,因为模型知道要渲染什么,也知道哪些失败不能出现。

第五步:把材质写成光学和触觉行为

材质名称必须配合行为才有用。只写“陶瓷”,模型可能生成粉笔、塑料或金属。要说明它怎样反光、边缘怎样、完美到什么程度。

瓶子可以这样拆:

  • 深钴蓝釉面,存在轻微色调变化;
  • 高光宽而柔,不是镀铬反射;
  • 有极轻微的手工表面不规则;
  • 轮廓清楚,瓶肩略圆;
  • 瓶盖和瓶身使用同一材质;
  • 不要透明玻璃、塑料接缝和印刷标签。

石台则是:浅色石灰岩或洞石、多孔边缘、小凹点、哑光表面、几何稳定,不要大理石纹和镜面抛光。

精确度要服务任务。如果下一版把瓶子换成运动鞋,就保留布光逻辑和构图,完全重写材质部分。这正是模块化提示词比一整段长文更容易改写的原因。

第六步:把排除项写成具体的失败控制

负面提示词不应该成为所有缺陷的垃圾桶。每一项都要对应视觉任务中的真实风险。干净产品主图可以这样写:

限制:只保留一个瓶子;不要标签、商标、手、花、重复物体、漂浮道具、
文字、水印、变形瓶盖、透明玻璃、被裁断的轮廓、过度景深虚化和背景地平线。

正向限制往往更强。“完整保持瓶子轮廓清晰”比列出几十种遮挡物更可执行。产品几何或身份变化代价很高时,可以同时使用正向不变量和负面排除项。

可直接复制的图片转提示词总模板

需要跨模型使用时,先用这份结构化简报,不急着添加某个模型专属语法:

视觉任务
[图片必须完成什么、目标格式、使用场景和受众]

主体
[可观察身份、几何、姿态、表情、道具和不变量]

构图
[比例、视角、裁切、主体占比、空间关系、留白]

机位或媒介
[摄影透视与景深,或插画/3D 媒介;不要超出证据进行伪精确]

光线与色彩
[方向、软硬、反差、色温、色板、背景行为]

材质
[纹理、反射、瑕疵、边缘质量、织物或产品表面行为]

限制
[必须保留什么、不得出现什么、文字规则、身份政策、允许变化范围]

第一次测试不要继续堆修饰词。基线的作用是判断模型是否理解结构。如果在测试前就加入年代、艺术指导、字体、情绪和镜头术语,结果漂移时你无法知道是谁造成的。

针对三种目标的反向提示词版本

同一张参考图,因为任务不同,提示词也应不同。

版本 A:忠实产品重建

只对你拥有或获得编辑授权的图片使用:

基于已授权的参考瓶制作干净产品研究图。保持钴蓝陶瓷材质、圆角瓶盖、
瓶肩比例和单一物体轮廓。匹配与产品等高的机位、浅色石台、暖灰背景
和有方向的窗影。标签区域保持空白,不改变任何产品几何。4:5 竖幅,
上三分之一可放文案。

版本 B:保留视觉语法,更换主体

制作一张原创哑光红色便携音箱的高级活动图。参考图只用于视觉语法:
单一居中主体、低矮石台、暖中性背景、矩形方向投影、克制色板和上方留白。
不要复现瓶子、瓶子轮廓或任何独特品牌元素。4:5 竖幅。

版本 C:受控创意扩展

为同一个无品牌钴蓝陶瓷瓶制作三个原创活动方向:深色建筑侧光、
暖色植物晨光、冷色海岸日落。保持瓶子身份和瓶盖几何,只改变场景、
光线和机位高度。每张只出现一个瓶子,不要文字和商标。

版本 C 的价值在于把反向提示变成小型实验。你不再模糊地要求“更有创意”,而是明确哪些轴允许变化。

用受控基线测试提示词

打开 Lem Gen 图片编辑工作台,上传你有权使用的图片,先生成一个基线。第一次比较时固定以下条件:

  • 相同生成模式和模型;
  • 一个画面比例;
  • 一张参考图;
  • 一个提示词版本;
  • 不添加额外风格参考;
  • 不同时重写主体和构图。

受控流程从参考图进入字段,再生成变化方向;它不会追逐无法知道的原始句子。

比较时先看结构,再看表面精修:主体大小对不对?机位是否接近?留白是否在正确位置?轮廓和裁切错误时,再漂亮的纹理也无法挽救结果。

一次只诊断一个最大偏差

基线失败时,先分类最大错误,不要把所有内容重写。

| 偏差 | 可能负责的字段 | 定向修复 | | ---------------- | --------------- | ------------------------------------ | | 主体太小 | 构图 | 写清画面占比和裁切 | | 产品形状改变 | 主体 / 限制 | 列出几何不变量,使用已授权图片编辑 | | 光线太平 | 光线 | 增加方向、软硬、投影位置和补光行为 | | 表面像塑料 | 材质 | 描述反射、纹理、瑕疵和禁止材质 | | 场景变得杂乱 | 视觉任务 / 限制 | 强化单主体层级和安静背景 | | 与参考图过于相似 | 创意边界 | 主动替换主体、场景、故事、色板或机位 |

使用单变量修改记录:

第 02 版,只改构图:
主体、材质、光线和背景保持不变。把瓶子扩大到约占画面一半高度,
恢复完整、连续的上三分之一文案留白。

保存基线、修改版和修改原因。这样的记录比一文件夹无命名图片更有价值,因为它告诉你哪条指令真正推动了结果。

把反向提示词变成原创提示词

反向提示工程应该以创意决定结束,而不是以复制品结束。保留底层视觉解法,同时至少改变两个有意义的轴:

  • 主体: 瓶子换成音箱、鞋、灯、原创角色;
  • 场景: 影棚换成厨房、站台、花园或抽象舞台;
  • 叙事: 静态主图换成组装、揭示、对比或使用时刻;
  • 机位: 平视换成微距、俯视、低机位或环境远景;
  • 色板: 保留反差逻辑,但更换具体颜色;
  • 材质: 釉陶换成拉丝金属、织物、半透明树脂或纸;
  • 光线: 保留层级,改变时间、方向或阴影语言。

不照搬地改写 GPT Image 提示词一文继续解释了从参考结构走向原创方案的方法。如果最终素材需要运动,Seedance 视频提示词模式会告诉你怎样加入镜头运动、主体连续性和明确结尾,而不是把图片提示词直接当成视频脚本。

权利、隐私与诚实边界

公开可见不等于允许复用。上传参考图前,要确认你拥有图片、持有许可,或已经得到创作者与可识别人物的授权。不要提取并重建商标、受保护角色、私人文件、签名、水印,也不要把在世艺术家的独特作品当作商业模仿目标。

客户项目应记录素材来源和允许用途。如果参考图只用于方向,要明确哪些属性可以迁移,例如光影节奏和留白策略;哪些不能迁移,例如产品身份、品牌和独特创意。这个备注可以防止团队把“灵感”误解成全面授权。

也要诚实面对模型差异。反向提示词可以提高控制,但无法保证不同模型之间逐像素还原,重复运行也可能不同。产品几何必须准确时,使用有授权的参考图编辑流程并人工检查;文字必须准确时,把文字当作独立设计层,不依赖偶然生成。

实用质量检查表

保存提示词之前逐项检查:

  • 第一行是否说明视觉任务?
  • 可见事实是否与推断分开?
  • 别人能否根据文字画出构图草图?
  • 光线是否说明方向、软硬、投影和表面反应?
  • 材质词是否解释行为,而不是增加形容词?
  • 身份和几何不变量是否明确?
  • 排除项是否对应真实失败?
  • 提示词是否足够紧凑,便于诊断?
  • 商业复用前是否改变了有意义的创意轴?
  • 参考图权利和肖像授权是否清楚?

如果有三项以上回答“否”,不要继续加长提示词,回去重建缺失字段。

常见问题

图片转提示词工具能还原最初的原始提示词吗?

通常不能。像素不会保存全部指令、随机种子、模型设置、参考图和编辑记录。可用结果应该是一份可测试的视觉简报,不是法证式逐字稿。

一份可用的反向提示词应该包含什么?

至少应包含视觉任务、主体、构图、机位或媒介、光线与色彩、材质和限制条件。这些字段能让每次修改都可追踪。

应该用文生图还是图片编辑?

需要新诠释时使用文生图;需要更强的产品形状、布局或身份连续性时,在拥有使用权的前提下使用图片编辑和参考图。

为什么提示词很详细,生成结果仍不同?

文字无法恢复模型行为、随机种子、参考权重、裁切历史和后期处理等隐藏条件,空间描述也可能被不同解释。

怎样避免过度复制参考图?

保留有价值的视觉语法,同时替换主体、场景、叙事、机位、色板或材质。删除未经授权的商标、身份、受保护角色和独特元素。

提示词应该写多长?

写到能定义任务和限制即可。先生成基线,找出一个最大偏差,再修改对应字段。精确度比形容词数量重要。

建立可复用提示词,然后开始测试

最强的反向提示词不是最长的,而是你能修改它,并且不会失去因果关系。先确定视觉任务,分开观察与推断,写成六个模块,运行受控基线,再为一个明确原因只改变一项。

Lem Gen 首页和提示词库寻找可复用模式,继续查看人像摄影提示词Nano Banana 提示词示例,最后进入已经选好模型的 GPT Image 2 图片编辑工作台。保存真正解决任务的版本,而不是听起来最华丽的版本。