真正能驾驭模型的提示词解剖
扩散模型不会像人读句子那样读提示词,它响应的是 token 和学到的关联——这就是为什么结构化的提示词胜过文采斐然的提示词。持续有效的结构按重要性排列信息:先主体,然后是媒介、风格、光照、构图,最后才是技术细节。
主体是名词短语加上动作和场景——"一位年迈的钟表匠在杂乱的工作台前修理怀表"给模型的是关系,而不只是物件。具体性在这里比任何地方都重要:"美丽的女人"产出的是训练集的平均脸,"四十多岁、红发被风吹乱、有雀斑的女人"产出的才是一个人。
媒介决定整条渲染管线:照片、油画、水彩、3D 渲染、炭笔素描。它应该靠前,因为它约束后面的一切——水彩画里谈"胶片颗粒"毫无意义。
风格在媒介内部继续收窄:黑色电影、吉卜力、1970 年代国家地理、新艺术运动。然后是光照与构图(见下文),最后是宽高比之类的参数。
顺序重要有一个机械原因:多数模型给靠前的 token 更高权重,长提示词的尾部会被截断或稀释。把你绝不妥协的内容放进前十个词,把第四十个词之后的一切当作模型可以无视的建议。
Midjourney、Stable Diffusion、DALL-E:同样的词,不同的机器
提示词是不可移植的。三大生态对权重、负面词和参数的解析方式各不相同;把一个引擎的语法粘到另一个引擎里,要么悄无声息地失效,更糟的是,变成画面里的文字。
Midjourney 用双冒号加权(ocean::2 sky::0.5)、命令行式参数(--ar 16:9 控制宽高比、--chaos 控制多样性、--sref 引用风格图),以及排除用的 --no 参数(--no text, watermark)。它默认就风格化、有主见,平淡的提示词也能出"好看"的图。
Stable Diffusion 生态(AUTOMATIC1111、ComfyUI)用括号加权——(golden hour:1.3) 增强一个概念,小于 1 的值削弱它——还有真正独立的负面提示词栏,这才是主要的质量杠杆:deformed hands、extra fingers、watermark、low quality 都住在那里,而不是主提示词里。原生 SD 比 Midjourney 字面得多,而且结果随你加载的 checkpoint 模型剧烈波动。
DALL-E 及类似的自然语言系统把整套思路反过来:没有权重,没有负面栏。它们被训练成理解散文,所以你要写一段清晰的描述性文字,把排除项写成句子("图中任何位置都不要出现文字")。关键词大杂烩式提示词在这里反而表现更差。
这个工具输出的是逗号分隔的关键词提示词——Midjourney 和 SD 共用的方言。要用于 DALL-E 式系统,先让大语言模型把关键词列表改写成流畅的散文。
Same intent, three dialects:
Midjourney:
lighthouse on a cliff, storm waves::2, oil painting,
dramatic lighting --ar 16:9 --no boats, text
Stable Diffusion:
oil painting of a lighthouse on a cliff,
(storm waves:1.3), dramatic lighting
Negative prompt: boats, text, watermark, blurry
DALL-E style:
An oil painting of a lighthouse on a cliff battered
by storm waves. Dramatic lighting, wide 16:9
composition. No boats and no text in the image.真正改变画面的词汇:光、构图、镜头
流传的提示词里,大多数"质量词"都是噪音。masterpiece、best quality、highly detailed、8k 是货物崇拜式的 token——在某些模型上无害,在另一些模型上无意义。真正能稳定改变画面的词汇来自摄影和电影摄影,因为训练用的图片说明就来自那里。
光照是杠杆最大的类别。golden hour 带来温暖的低角度光和长影;blue hour 是冷调的暮色光晕。Rembrandt lighting 在人像上留下标志性的脸颊光三角;rim lighting 把主体从暗背景中剥离;北向窗户的柔和漫射光是经典人像配方;正午烈日制造纪实式的平直感。每个短语都携带着一整个学到的场景。
构图词设定那台你从未握过的相机:extreme close-up、low-angle shot(压迫感)、bird's-eye view、rule of thirds、negative space(极简的孤立感)、dutch angle(不安)。镜头和胶片 token 负责收尾:85mm f/1.4 意味着奶油般的背景虚化;24mm wide angle 意味着环境交代和轻微畸变;macro 意味着微小尺度的极致细节;shot on Portra 400 调出特定的暖调胶片色盘;long exposure 抹平水面、拉出光轨。
每个类别只挑一个词。把 golden hour、neon lighting、overcast 叠在一起,不会融合三种氛围——只会让模型把它们平均成一滩泥。
Flat prompt:
portrait of an old fisherman, masterpiece, 8k,
highly detailed, best quality, amazing
Photographic prompt:
portrait of an old fisherman mending a net,
weathered hands in focus, Rembrandt lighting,
overcast harbor at dawn, 85mm f/1.4, shallow
depth of field, Kodak Portra 400, rule of thirds像摄影师一样迭代,而不是拉老虎机
提示词迭代的默认失败模式是老虎机循环:生成、不满意、把整条提示词重写、再来。因为每次运行都会重掷随机种子,你什么也学不到——你分不清画面的变化是因为你的修改,还是因为骰子。
摄影师的循环是:固定种子,一次只改一个变量。在 Stable Diffusion 里显式设置 seed;在 Midjourney 里用 --seed。种子钉住后,每做一次单独修改就重新生成:把 golden hour 换成 overcast,加一个权重,删一个形容词。这样输出的差异就能归因于你的改动;一场下来,你会攒出一本"每个 token 在我的引擎里到底干什么"的私人词典。
一次实用的工作流:先跑一批松散探索(4-8 张,不定种子)找到值得深挖的构图;钉住那个种子;然后按属性分轮修改——先光照,再风格,最后用负面提示词或 --no 清场。每张留用图都保存完整提示词和种子;丢了配方的神图只是一次性运气,不是能力。
还要知道何时离开提示词输入框:修一只画错的手、删一个多余的物体,是局部重绘(或 Vary Region)的活,不是把你已经喜欢的构图重掷一遍的理由。
失败模式与诚实的局限
有些失败是提示词的问题,有些是模型的问题;分得清两者能省下几个小时。
自相矛盾的 token 只会产出泥浆:minimalist 加 intricate details,或两种互相竞争的画风,平均出来两边都不是。概念渗漏更隐蔽——属性会在主体之间游走,"红发女人和穿蓝外套的男人"经常把头发和外套互换。加权有帮助;把主体分到不同区域(或分开生成再合成)帮助更大。
另一些局限是结构性的,任何措辞都无法稳定修复:图像里可读的文字(在进步,但仍不可靠——文字排版请留到编辑软件里加)、手和交叠的手指、超过三四个之后的准确数量,以及自行车、钟表这类机械结构的物理合理性。给这些留出修图预算,别烧五十次重生成。
两条值得认真对待的核查提醒。从构建器借来的风格 token 可能夹带你意想不到的行李——一个你没研究过的标签可能引入你并不想要的美学,所以陌生 token 先在固定种子上测试再依赖。商用之前,查清你所用生成器的授权条款;若提示词里出现在世艺术家的名字,发布前请同时掂量伦理问题和日益活跃的法律动向。