博客

为什么给一张效果参考图,比写一段提示词更准

你想要的那张图是视觉的。把它写成一段话,再让模型把这段话还原成画面,中间经过两次转换——你的转述丢一次,模型的理解再丢一次。效果参考图跳过这两次。

提示词丢掉的是哪一类信息

试着用文字描述一张你已经看过的商品图:光从哪个方向来、有多硬、背景是哪一种灰、模特站姿的重心偏向哪一侧、镜头离多远、画面留白多少。写到第三条你就会发现,每一条都得在"太笼统"和"太啰嗦"之间挑一个,而挑哪个都不对。

"柔和的自然光"这五个字,落到不同的模型、不同的时候,会变成十几种不同的光。你没有说错,但你也没有说准——因为这句话本来就没有那么多信息量。

而一张效果参考图,把上面那一整串问题一次答完,而且答得没有歧义。

两个槽位,两件不同的事

真镜的技能表单里有两个图片槽位。它们看起来都是"传图",承载的东西完全不同:

  • 产品原图承载「这件衣服本身长什么样」:版型、面料、工艺。它是被替换进画面的内容
  • 效果参考图承载「画面该长什么样」:构图、光、背景、姿态。它是被保留下来的容器

于是选一张效果参考图,等于说完了"我要这一类图"。要幽灵模特图就给一张幽灵模特图,要街拍场景就给一张街拍场景——不需要形容它,指给系统看就行。

这也解释了为什么这两个槽位不能合并成一个"上传图片"。它们在最终画面里的命运是相反的:一个被换掉,一个被留下。合并之后,系统就得去猜你传的这张是想要它变还是想要它不变——而这正是提示词工程要解决的那类问题,我们不想让你回到那里。

手上没有效果参考图怎么办

新用户注册时,官方素材库的成品图已经在你的图库里了。那就是你的第一批参考。

用一段时间之后,你自己出的好图会变成下一批。这件事有个副作用值得说清楚:你的审美会沉淀下来。 一张你满意的图进了效果参考图的槽位,后面几百个款就都长成那个样子——而这在纯提示词的工作流里做不到,因为提示词换个款就失效,跑两次结果还不一样,交不到运营同事手上。

为什么这件事对上新快的店特别要紧

同一段提示词,今天你写得出来,下个月接手的同事写不出来。它不是流程,是手艺。

而"挑一张效果参考图"是流程:谁都能执行,结果可复现,第一件商品怎么做,第三百件也怎么做。规模化最需要的恰恰是这个。

一句话:我们不是让你不写提示词,是让你根本不需要有"提示词"这个概念。