提示词工程

从图片到提示词:如何提高 AI 复刻的准确度

underwood
underwood

Promptsref 网站创始人

Promptsref 创始人、AI UGC 创作者,长期研究生成式 AI 工作流、提示词工程与创作者教育,社交媒体粉丝超过 4 万。

8 分钟阅读

从主体、构图、镜头、光线和视觉层级拆解图片,比较 JSON 与自然语言提示词,并分析 Midjourney、GPT Image 2 和 Nano Banana 的复刻能力。

本文目录

图片反推并不是为画面寻找一组漂亮的形容词。它要解决的问题,是如何把构图、光线、镜头和视觉重点重新写成模型能够执行的指令。

将一张图片上传给 AI,几秒钟后得到一段提示词,已经不是什么困难的事。困难在于,为什么这段提示词看上去写得很详细,重新生成的图片却仍然不像原图。

原因通常不在于遗漏了某个物体,而在于 AI 只识别了“画面里有什么”,没有解释“这张画面是如何成立的”。

一张街拍照片里可能有一个人、一辆汽车和一条街道。这些内容识别完全正确,但不足以完成复刻。真正决定结果的,可能是人物偏离中心的位置、低机位带来的透视、阴天环境中唯一鲜艳的外套,以及人物回头时尚未完成的动作。

图片转提示词,需要还原的是这些关系。

“好看”不是一个可以直接写进提示词的属性

有关图像美学的研究通常会把技术质量和审美质量分开讨论。前者包括模糊、噪点和压缩失真;后者则与内容、构图、色彩、风格以及观看者的主观判断有关。Google Research 的 NIMA 研究没有给图片简单地判定“好”或“不好”,而是尝试预测一组人类评分的分布。Google Research:NIMA 图像质量与美学评估

从复刻角度看,一张图片可以分成四层信息。

第一层是画面内容,包括主体、动作、表情、服装、物体以及它们之间的关系。识别主体只是起点,更重要的是找到视觉记忆点。例如,一件红色外套的作用可能不只是服装,而是让人物从低饱和背景中被第一时间看见。

第二层是空间安排。主体位于哪里,占据多大面积;前景是否遮挡画面;背景提供了哪些环境信息;镜头是俯拍、平视还是仰拍;广角透视有没有夸大人物与环境的距离。这些信息共同决定了观众站在哪里看这张图。

第三层是光学特征,包括光源方向、软硬程度、阴影、曝光、景深、色温和材质反光。相比“柔和的氛围光”,“左侧窗户进入的自然光,在面部右侧留下浅阴影”更接近可以执行的生成指令。

最后一层是图片的风格和情绪。摄影、插画、3D 或油画属于表现媒介;商业棚拍、纪实照片、时尚杂志和手机抓拍,则对应不同的成像习惯。轻微倾斜、皮肤纹理、运动模糊和偶然遮挡看似是瑕疵,却经常构成一张照片最难替代的真实感。

2022 年发表在《IEEE Transactions on Image Processing》的一项研究,也把语义内容、艺术风格和构图作为图像美学评估的重要组成部分。Composition and Style Attributes Guided Image Aesthetic Assessment

图片的美感通常不来自细节数量,而来自信息层级:观众先看到什么,随后看到什么,哪些元素负责吸引注意力,哪些元素退到背景中提供气氛。

反推提示词,实际是在重建画面的生成条件

一张图片可能由很多不同的提示词生成。即使知道原始提示词,只要随机种子、模型版本或参数发生变化,输出也可能不同。

CVPR 2024 的一项 Prompt Inversion 研究指出,从图片寻找可解释提示词,需要在规模极大的离散提示词空间中进行搜索。Prompting Hard or Hardly Prompting 因此,图片反推工具恢复的并不是原作者输入过的那句话,而是一组可能重新生成相似视觉结果的指令。

较为可靠的分析,应当沿用前面的四层结构。

先记录客观可见的内容:人物在哪里,正在做什么,穿着什么,周围有哪些物体。暂时不要急着加入“高级”“浪漫”等评价,也不要在没有证据时猜测人物身份、相机型号或拍摄地点。

随后处理空间关系。主体位于画面的哪一区域,身体朝向哪里,镜头距离多远,前中后景如何分布,画面是否留白,是否存在遮挡和透视变形。

再向下分析光线、色彩与材质。主光从哪里来,背景比主体更亮还是更暗,阴影是否清晰,皮肤和衣服如何反光,主色与强调色分别承担什么作用。

最后才是风格与情绪。这里仍然需要视觉证据。如果画面显得孤独,应说明这种感受来自空旷空间、背对镜头的人物,还是冷色环境和低照度光线。

完成识别后,还应把信息分成不同优先级。决定画面身份的内容被标记为“必须保留”;不影响整体效果的小道具可以变化;容易造成跑偏的内容则写入限制条件。

例如,一张街拍图的提示词可以这样写:

阴天街头的低机位中景照片。一名穿红色长外套的女性位于画面右侧,身体朝向街道,回头看向镜头,左侧保留大面积环境空间。灰蓝色低饱和背景,红色外套是画面唯一的高饱和色。湿润路面反射右后方店铺的暖光。保留非居中的构图、轻微广角透视和雨后空气感,避免晴天硬光、正面摆拍和拥挤人群。

这段提示词没有试图写出所有细节。它先锁定人物、构图和色彩关系,再补充镜头、光线和限制条件。对于复刻任务,这种优先级通常比形容词数量更重要。

JSON 与自然语言之争被夸大了

在图片提示词领域,JSON 经常被包装成一种更先进的写法,也有人认为 JSON 充满括号、引号和字段名,只会浪费 token。

两种看法都把格式的重要性放大了。

JSON 的价值主要在分析和管理。它可以把主体、动作、构图、镜头、光线、色彩和限制条件分别存放,让使用者发现遗漏,也方便程序读取、局部修改和版本比较。代价是格式字符确实会增加输入长度,结构过深时还会影响阅读。

自然语言省去了这些格式成本,也更接近多数图片模型官方示例所采用的写法。但自然语言如果没有经过结构化分析,很容易只描述主体和风格,漏掉构图、光源和空间关系。

真正影响结果的不是花括号,而是两种格式是否携带了同样的信息。

如果 JSON 详细记录了八个视觉维度,而自然语言只写了主体、风格和几个形容词,两者的差异当然明显。问题并非 JSON 天生更有效,而是它保留了更多生成条件。反过来,把同一组信息完整、清楚地整理成自然语言,通常也能达到相近的控制效果。

需要压缩的应当是重复、冲突和无法确认的信息,而不是为了缩短提示词,删除构图、光线或材质等关键维度。

一种更实用的工作流程是,先用 JSON 保存分析结果,再根据目标模型整理成自然语言。Promptsref 的 Image to Prompt 工具采用了这种方式:同一次图片分析可以输出结构化 JSON,也可以生成较短的自然语言版本。两种结果来自相同的视觉维度,只服务于不同的使用场景。

模型选择决定复刻的最后一步

截至 2026 年 8 月,Midjourney、GPT Image 2 和 Nano Banana 系列在参考图任务上的定位已经相当清楚。

模型主要优势用于图片复刻时的表现
Midjourney审美生成、风格变化和创意探索容易对参考图重新创作,相似的是气质,未必是细节
GPT Image 2高保真图片输入、复杂指令和精确编辑适合保留主体、构图、产品特征和页面结构
Nano Banana多张参考图、连续对话和一致性控制适合通过多轮修改逐步接近参考图

Midjourney 更像一名具有强烈审美倾向的创作者。它可以读取参考图片的内容、构图和颜色,但官方把 Image Prompt 定义为创作灵感,而不是精确复制工具。Midjourney Image Prompts

Midjourney 的 Describe 功能也有类似限制。官方说明中明确提到,该功能用于从图片中寻找提示词和创作方向,输出结果不会精确复制原图。同一张图片被多次分析,还可能得到不同的建议。Midjourney Describe

如果目标是发现相似风格或者从一张图片发展出新的视觉方向,Midjourney 仍然很有优势;如果要求稳定保留画面细节,它通常不是第一选择。

GPT Image 2 更适合高相似度重建。它可以同时接收图片和文字,并用于生成或编辑图片。OpenAI 的技术文档显示,该模型会自动以高保真方式处理输入图片,尤其适合参考图和编辑工作流。OpenAI:GPT Image 2 图片输入保真度

在实际使用中,原图负责提供难以用文字表达的几何和纹理信息,反推提示词则负责告诉模型哪些特征需要保留、哪些地方允许变化。两者同时使用,比把原图完全压缩成一段文字更可靠。

Nano Banana 系列的优势体现在多图输入和对话式修改。Google 将其定义为 Gemini 的原生图片生成能力,可以结合文字和图片完成生成、编辑与连续迭代。当前的 Nano Banana 2 侧重多参考图处理和一致性,Nano Banana Pro 更强调复杂指令、品牌一致性与精确控制。Google:Nano Banana 图片生成文档

当任务涉及保持同一个人物、组合多个产品素材,或者需要连续修改背景、服装和构图时,Nano Banana 往往更方便。

从这个角度看,Midjourney 适合探索“还可以变成什么”,GPT Image 2 和 Nano Banana 则更适合回答“怎样才能更接近原图”。

复刻准确度最终取决于反馈,而不是第一版提示词

即使图片已经被完整拆解,第一次生成仍然可能出现偏差。问题可能来自模型对指令权重的理解,也可能来自原图中存在无法被文字充分表达的空间信息。

更稳定的办法,是把生成结果与原图放在一起比较:先检查主体和构图,再检查镜头与光线,最后处理材质和局部细节。每一轮只修正最明显的差异,提示词也随之更新。

文字提示词可以重建原图的视觉逻辑,却很难单独保存每一个像素。真正追求高相似度时,合理的技术路线不是寻找一句所谓的“完美提示词”,而是把参考图片、结构化分析和多轮生成放进同一个工作流。

关于作者

underwood

underwood

Promptsref 网站创始人

Promptsref 创始人、AI UGC 创作者,长期研究生成式 AI 工作流、提示词工程与创作者教育,社交媒体粉丝超过 4 万。