我们不持有也不访问任何用户数据,除非有合法机构要求执行措施,否则我们不会暂停账户。
指南 · 图像提示词

AI 绘图提示词指南

Shannon 的图像模型像语言模型一样读提示词。仅这一条事实,就改变了你该怎么写提示词的一切 — 从丢掉逗号分隔的标签开始。

更新于 2026 年 9 月 5 日实用指南Shannon 3 · 图像生成

太长不看

完整句子写流畅的散文,不要写关键词标签。目标是 30–80 个词。按模型阅读的顺序来组织:主体 → 动作 → 风格 → 场景与光线 → 技术细节,最重要的放最前。把主体写具体。想要照片,就按照片来写 — 点名一台相机、一支镜头,以及一种胶片或一种光。把精确颜色以 color #RRGGBB 的形式挂到具体物体上。从五种画幅比例里挑一种。然后丢掉 SDXL 时代的习惯:不要“masterpiece, best quality, 8k”不要 (word:1.3) 权重,以及文生图里没有负面提示词 — 只描述你想要的东西。编辑与合成确实接受负面提示词。

大多数人带着在 SDXL 上养成的提示词习惯而来:一串逗号分隔的名词、一段画质词开场白、几个带括号的权重,还有一条和正面提示词一样长的负面提示词。那些习惯对那些模型是对的,在这里却会适得其反。这是关于什么真正管用的精简版 — 而且因为 Shannon 会替你写生成提示词,并在渲染前把它展示出来,这同样是一份关于如何读懂并修正 Shannon 所提方案的指南。

30–80
目标词数
5
画幅比例
0
文生图中的负面提示词
1
先过确认卡片

01为什么散文胜过标签:模型像语言模型一样读

大多数提示词经验所针对的旧扩散模型,用的文本编码器在实践中更像一个概念袋:语法几乎不起作用,制胜策略就是堆砌相关名词并用权重给它们加偏置。对那种编码器来说,标签汤就是提示词的正确形态。

Shannon 的图像模型不是这样工作的。它读提示词的方式和语言模型读文本一样,因此句法承载意义。“把伞抵在肩上拿着”是人、物体与身体部位之间的一种关系;“伞,肩膀”只是两样碰巧同时在场的东西。介词负责摆放位置。动词创造姿态。从句把细节挂到正确的名词上,而不是让它在整幅画面里漂浮。

同一张画面,用两种方式提出来。

标签式 — 旧习惯
woman, 30s, tokyo, rain, night, crosswalk, neon signs, umbrella,
wet asphalt, reflections, masterpiece, best quality, 8k, ultra
detailed, (bokeh:1.3), cinematic lighting, photorealistic
27 个逗号分隔的碎片。没有动词,没有关系,四个无效词,还有一处不会被解析的权重语法。
散文式 — 在这里管用的写法
A woman in her early thirties waits at a rain-soaked Tokyo
crosswalk at night, holding a clear vinyl umbrella against her
shoulder and glancing down the street. Neon storefront signs
bleed red and cyan into the wet asphalt at her feet. Shot on
Kodak Portra 400, 85mm f/1.4, shallow depth of field, the
traffic signal behind her thrown out of focus.
61 个词。每个元素都相对于另一个元素被摆放,取景也被表述为一个相机决策。

看看标签版表达不出来的东西。它从没说伞是被拿着的,所以伞可能最后躺在地上。它从没说霓虹是倒映在沥青上的,只说了两者都存在,于是你得到招牌和一条湿路面,两者之间没有任何光学关系。它从没说女人在看哪里,所以她的姿态全凭抛硬币。“cinematic lighting”是一个情绪标签,不是一个光源。而最后那五个词是噪音,它们会被当作关于摄影的英文词语来读,而不是控制抓手。

散文版之所以更长,不是因为它辞藻华丽,而是因为它回答了标签版留下的那些问题。全部诀窍就在这里。

02一条图像提示词该写多长?

目标是 30 到 80 个词。不要大幅超过 100。这是你手上最容易操作的一根质量杠杆,而且区间的两端都重要。

低于大约 30 个词,构图、光线和取景都没有被指定,于是模型会挑统计上最普通的那一种。“一个女人在咖啡馆里”是一条有效的提示词,产出的却是一张转头就忘的图,因为你把每一个有意思的决定都交了出去。

超过大约 100 个词,另一种失败出现了:靠后的从句会与靠前的从句争夺画面中的同一区域,于是你得到的不是细节累积,而是细节稀释。第三处光线描述会抵消第一处,而你在前八个词里立起来的主体,每多加一句就少分到一点注意力。长提示词读起来周到,渲染出来却并不周到。

纪律是:先把你想写的提示词写出来,然后砍到只剩那些删掉就会改变画面的句子。

03排序纪律:最重要的东西放最前

因为模型是顺序阅读的,位置就是强调:排在前面的锚定画面,排在后面的调整画面。按模型需要的顺序来放:

  1. 主体 — 这张图画的是谁或什么,要具体。
  2. 动作或姿态 — 他们在做什么,身体是怎么摆的。
  3. 风格或氛围 — 照片、油画、技术插图,以及它所处的调性。
  4. 场景与光线 — 事情发生在哪里,什么光落在上面。
  5. 技术细节 — 取景、镜头、景深、具体色彩。

最常见的自伤,是从技术从句开头。用“Cinematic wide shot, anamorphic lens flare, teal and orange grade, of a man reading a newspaper”开场,等于告诉模型这个观感才是主体,而那个男人只是个细节。你会得到一个精美而空洞的画面,里面站着一个模糊的小人影。

技术在前 — 主体来得太晚
Cinematic wide shot, anamorphic lens flare, teal and orange
color grade, shallow depth of field, golden hour, of a man
reading a newspaper on a park bench.
主体在前 — 同样的元素,正确的顺序
A man in his sixties in a gray wool overcoat sits on a park
bench reading a folded broadsheet newspaper, one ankle crossed
over his knee. Late golden-hour sun rakes across him from the
left through bare plane trees. Photographed wide on a 35mm
anamorphic lens, shallow depth of field, warm highlights and
cool shadows.

第一版里的每一个元素在第二版中都还在;什么都没丢。只不过模型现在在被告知怎么拍之前,先知道了这张图画的是什么 — 而仅仅这一次重排,就把主体从可有可无变成了中心。

04把主体写具体

“一个人”不是主体,而是一个占位符 — 而模型会用它见过的一切的平均值来填占位符,那种光滑、无年龄、无性格的观感正是这么来的。写具体只花五个词,换来的却是一个具体的人:

含糊具体
一个人一位 40 多岁的男人,留着花白胡子,有很深的笑纹
一个女人一位快 30 岁的女人,剃两侧的深色短发,一颗门牙有缺口
一栋老房子一栋四层砖砌仓库,招牌被漆盖掉,上层窗户钉着木板
食物一碗拉面,上面放着切半的溏心蛋,正冒着热气

注意这个模式:年龄或年代、一个结构性特征、一处能区分身份的瑕疵。第三项正是让结果看起来像拍出来而不是生成出来的东西。一颗缺口的牙、一处磨损的衣边、被漆盖掉的招牌 — 微小的不对称是你能用上的最强的“去塑料感”信号,而它们几乎不占词数预算。

05照片写实:把请求当成一张照片来写

除非你要求艺术、插画或动漫,否则照片写实就是默认调性。但“photorealistic”这个词起不了多大作用。真正产出照片的,是描述拍摄这一行为本身:一台真实的相机、一支真实的镜头,以及一种真实的胶片或光源。

原因很直接。每一张标注着“Kodak Portra 400”的图像,都出自一个具有特定颗粒结构、高光滚降和肤色还原的具体流程,点名这种胶片就把这一切都调动了起来。而“8k ultra detailed”只出现在图库网站的垃圾内容里,所以它调动的就是图库垃圾。下面是几套可靠的配方,同一个主体用它们会得到明显不同的图像:

配方它给你什么
Kodak Portra 400, 85mm f/1.4, soft window light温暖、宽容的肤色;奶油般的主体分离;杂志人像感
Ilford HP5 pushed to 1600, 35mm, available light颗粒感黑白,高对比,街头纪实的劲道
Digital medium format, 80mm, single softbox at 45°干净的商业棚拍观感,受控的光线衰减,产品级
135mm f/2, backlit at golden hour, atmospheric haze压缩的背景,轮廓光,浪漫的长焦观感

让落地细节与配方相匹配 — 在一张脸只有八十像素高的 24mm 广角里,毛孔级的皮肤质感毫无意义 — 匹配之后再把它加上。落地细节就是 — 证明确实有一支镜头记录下了这一切的那些质感证据。可见的毛孔与细软的面部绒毛。亚麻衬衫的织纹。一束光里的浮尘。皮靴上的一道擦痕。亮背景前几缕翘起的碎发。两三处就够了,而它们正是“一个人的渲染图”与“一个人的照片”之间的差别。

06有层次的场景:前景、中景、背景

当一个场景有纵深时,把三个层面分开、按顺序描述。对那些应当像真实地点而不是背景板的图像来说,这是最有效的技巧,却几乎没人用。不这么做,你得到的是扁平:提示词提到的一切都落在大致相同的距离上,争夺画面中间那一条带。点明层面,等于给了模型一份可以花掉的纵深预算。

三个层面,明确点名
In the foreground, a cracked concrete ledge with a half-empty
paper coffee cup and a scattering of cigarette ash, slightly out
of focus. In the midground, a bicycle courier in a yellow rain
jacket wheels her bike across a wet plaza, caught mid-stride. In
the background, a glass office tower dissolves into low fog.
Shot on a 50mm lens at f/2.8, flat overcast light.
70 个词。那个失焦的前景元素才是卖出纵深感的关键 — 它告诉模型相机站在哪里。

两点细化。在前景放一个刻意失焦的东西 — 真实的纵深场景照片几乎总有一个,它的缺席是常见的破绽。另外要说明主体处在哪一层:如果那位快递骑手才是这张图的重点,她就该在中景,否则大楼和咖啡杯会和她抢画面。

07精确颜色:十六进制色值,挂到物体上

做品牌工作、服装连贯性,或者任何“红色”还不够具体的场合,就把十六进制色值写成 color #RRGGBB,并把它挂到一个点名的物体上

正确:色值绑定到名词
...wearing a heavy wool peacoat, color #8B0000, over a cream
turtleneck, against a studio backdrop, color #1E3A5F.
错误:色值悬空
...#8B0000, #1E3A5F, dark red and navy color palette, moody...
没有任何东西把这些色值绑定到具体对象上,于是它们只会像一层笼罩整幅画面的模糊色调建议。

三条经验法则。只对真正重要的那两三个颜色用十六进制,其余用普通文字 — 一条带六个色值的提示词,大半预算都花在色卡上了。把色值绑定到有边界的物体上,永远不要绑到“光线”或“氛围”上。还要记住它指定的是物体的颜色,而不是最终像素值:一件 #8B0000 的大衣在黄金时刻的逆光下会比色卡更暖,和现实中完全一样。

08选择画幅比例

共有五种比例可用,合适的那一种通常由主体本身暗示,但你明确提出的要求永远优先 — 你要一张壁纸,就会得到 tall,无论内容本身暗示什么。

比例最适合原因
square默认值。单个居中物体、图标、对称构图、社交贴文没有主导轴,因此不会被画幅自身的倾向裁掉东西
portrait人物全身或半身;塔、树、瓶子等高瘦主体让站立的人像从头到脚都有空间,又不必缩小
landscape风景、室内、人群、带环境的产品图横向空间让场景真正成为场景
wide电影画面、影片剧照、横幅、页头图最宽的选项;强烈的留白,宽银幕感
tall海报、书封、手机壁纸、竖版社交格式比 portrait 更高;为文字或天空刻意留出空间

选错的破坏力比看上去大。把一个全身站立的人放进 wide 画幅,得到的不是大画面里的小人 — 通常得到的是被裁掉的人,因为模型会把宽度填满,而头或脚就出了画。让画幅与主体的主导轴相匹配,大多数构图上的抱怨都会消失。

两个值得记住的行为:编辑会自动沿用源图的画幅比例,所以你没法靠编辑来重新取景;而合成允许你选择新的画布 — 这往往是改变一张已有图片形状的最干净的办法。

09反模式:该停下来的那些做法

画质词:“masterpiece, best quality, 8k, ultra detailed”

这些是社区在一种特定的旧训练分布上摸索出来的抓手,在那种分布里某些字幕短语与某些图像来源相关。它们迁移不过来。在这里它们会被当作普通英文词读掉,什么也贡献不了,还要吃掉你那本就吃紧的词数预算。替代做法是说出你想要哪一处细节:不要写“ultra detailed”,而要写“大衣布料上可见的织纹,以及下颌线上细密的胡茬” — 同样的意图,表达成模型能渲染的东西。

权重语法:(word:1.3)[word]{{word}}

不会被解析。括号、方括号、冒号和数字都会被当成字面文本落下来,反而让周围的从句更难读。如果你想强调什么,就用两根真正有效的杠杆:把它挪到更前面,以及给它更多的词。“A crimson silk scarf, its fringed ends lifting in the wind”在每一项要紧的指标上都胜过“(red scarf:1.4)”。

互相冲突的方向

混入不相容的指令不会把它们融合起来;它会产出一个不稳定的平均值,通常两边都不满足。常见的犯错:

  • 媒介 — “photorealistic”加“watercolor”;“oil painting”加“shot on 85mm”。选一个,别犹豫。
  • 取景 — “wide establishing shot”加“extreme close-up on her eyes”;“全身”加“细致的面部毛孔”。
  • 光线 — “正午强光”加“柔和的黄金时刻光晕”;“低调、深阴影”加“明亮通透”。
  • 年代 — “1970 年代胶片质感”加“现代极简”再加“赛博朋克”。
  • 风格堆叠 — 一次塞进四位艺术家或四种类型。两个相关的参照可以奏效;四个会互相抵消成平庸。
  • 铺陈 — “质朴的、饱经风霜的、古老的、被岁月磨损的木门”是同一个意思写了四遍,而每一次重复都在稀释提示词的其余部分。

10文生图里没有负面提示词

这是最容易坑住老手的反模式,因为在旧的技术栈上,负面提示词几乎是一半的手艺。

操作负面提示词该怎么做
文生图(生成)不支持只描述你想要的东西。永远不要写“不要 X”。
编辑一张图支持把不想要的瑕疵放进去,指令本身保持正面表述。
合成两张或更多支持同上 — 瑕疵放负面,角色放正面。

对生成来说,这条规则是绝对的,而且略反直觉:在提示词里写“不要文字、不要水印、不要多余手指”,会让这些东西更可能出现,而不是更不可能。模型把“不要文字”读成一句包含文字这个概念的句子;否定是弱信号,而名词是强信号。你实际上是在要文字。请一律改用正面表述:

与其写不如写
背景不要杂乱干净的无缝灰色背景纸
不要模糊眼睛处刀锐,f/8
不要有其他人黎明时分独自站在空无一人的街道上
不要现代物品一间 1930 年代的厨房,有搪瓷器皿和一台铸铁炉
不要卡通风格shot on Kodak Portra 400, 85mm, natural skin texture

编辑与合成来说,负面提示词是存在的,你也应该用它 — 但用来对付瑕疵,不是内容。适合放进去的:水印、叠加文字、重复的肢体、扭曲的手、过锐化的光晕、JPEG 色块、合成边缘的接缝线。不适合放进去的:任何关于这张图画的是什么的内容,那属于指令。

11读懂 Shannon 替你写的提示词

下面这一点让本指南立刻能用,而不只是理论。你不必自己写生成提示词。你用任何语言、用日常说法提出要求;Shannon 认出这是一个出图请求,写出英文的生成提示词,并在任何东西渲染之前把它展示在确认卡片上。你不确认,就不会生成,也不会计费。

所以回报最高的技能不是从零写提示词 — 而是卡片上的那一条。照着这份清单过一遍:

  1. 主体够具体吗?如果卡片上写的是“a person”或“a woman”,你就找到了最大的一处可改进空间。给它一个年龄、一种体型、一个特征。
  2. 主体在最前面吗?如果提示词以风格或相机开头,就要求它改成主体领头。
  3. 长度在区间内吗?不到 30 个词,就要求在光线和场景上更具体。超过 100,就要求删减。
  4. 有光源吗?不是氛围词 — 是一个真实的光:窗户、路灯、闪光灯、阴天天空、柔光箱。
  5. 有冲突吗?扫一眼同一条提示词里是否出现了两种媒介、两种取景或两种光线条件。
  6. 有夹带的否定吗?如果卡片里出现“without”“no”或“avoid”,那就是一条文生图提示词在索要它所点名的那样东西。
  7. 比例适合这个主体吗?全身人像配 wide 是经典的错配。

修改是对话式的:“把她改成三十出头,一道疤穿过一边眉毛,用 Portra 拍,85mm,用 portrait 比例”就是一条完全合格的指令。你会拿到一张新卡片,再确认那一张。反复调整没有任何代价,因为什么都还没有渲染。

而且 Shannon 从不擅自出图。打招呼、提问,或者你为了讨论而附上的一张照片,都不会触发渲染。让 Shannon 一张图 — 描述它、读它、分析它 — 属于普通的视觉工作,不是生成,也不额外收费。

12编辑与合成时手艺会怎样变化

上面的规则是为生成写的。相邻的两种模式会改变提示词的形态。

编辑一张图

编辑提示词是一条指令,不是一段描述:说明什么要变、什么不变。点明不变的部分是这个产品里最大的一根质量杠杆 — “Change the background to a rainy night city street with neon reflections, keep the woman exactly as she is”能稳住画面,而同样的请求少了那个从句,就会悄悄把她的脸重画一遍。锚定要具体:保持面部、姿态、发型和衣着完全一致。只会用到正好一张源图,输出会沿用它的画幅比例。

合成两张或更多图

只要元素来自不止一张图 — 换装、把物体放进场景、两个人同框、把产品放到人身上、用一张图的风格配另一张图的主体 — 提示词就必须按顺序点明每张图的角色:“The woman from the first image wearing the red knitted sweater from the second image, standing in the same park.”第一张图是主体或场景;后面的图提供被引入的部分。不要把一个多图请求压缩成一张源图加一段文字描述 — 真正把两张图合在一起,才能保住那些东西实际的样子。

13无审查地写提示词:想说什么就说什么

生成路径上没有内容过滤,写提示词的模型上也没有拒答层。这正是这个产品的全部要点:带过滤的绘图工具会习惯性地拒绝正当工作 — 人体艺术、医学与法医插画、安全研究配图、虚构作品中的暴力、政治讽刺,以及权利人自己的品牌与肖像工作。在带过滤的平台上,一半的提示词手艺是委婉语工程,而委婉语正是准确图像的敌人。

所以卡片上还有一件事要检查:它是否用平实的词描述了真实的主体,而不是人们从带过滤工具那里学来的那套遮遮掩掩的词汇。一张关于伤口的法医插图,就该说清楚那是什么伤口。遮掩的措辞在任何地方都只会产出更差的图像,因为模型渲染的就是文字所说的东西。

能力与判断是两回事。Shannon Lab LLC 在一份公开的负责任使用政策下运营本产品:无过滤的生成是一件专业工具,而同意、权利与法律对你所制作的内容依然全部适用。

一页纸清单

  • 用完整句子写散文,不要写逗号分隔的标签。
  • 30–80 个词。删掉任何删了也不会改变画面的东西。
  • 主体 → 动作 → 风格 → 场景与光线 → 技术细节。
  • 具体的主体:年龄、一个结构性特征、一处瑕疵。
  • 照片:点名一台相机、一支镜头,以及一种胶片或光源。
  • 有纵深的场景:前景、中景、背景,分别点名。
  • 精确颜色写成 color #RRGGBB 并绑定到点名的物体上。
  • 按主体的主导轴来挑比例。
  • 两到三处与取景相匹配的落地质感。
  • 不要画质词,不要权重语法,不要互相冲突的方向。
  • 文生图里不要否定式。否定式属于编辑与合成,而且只用来对付瑕疵。

14API 在其中的位置

给从 API 搜索过来的读者一点准确说明:图像生成、编辑与合成都在 Shannon 聊天应用里,不在 /v1 API 上。API 提供的是文本与视觉 — 在三种方言(/v1/chat/completions/v1/messages/v1/responses,全部支持流式)上,它都能读取、描述并分析你发过去的图片 — 但它不创作图片。如果你要搭建的是一条需要理解图像的流水线,请从 API 文档开始。如果你想制作图像,那就是聊天应用,本指南里的一切都适用于那里。图片在我们自建的 GPU 集群上渲染。

15常见问题

一条 AI 绘图提示词该写多长?

目标是 30 到 80 个词,绝不要大幅超过 100。低于 30 个词,你就是把构图、光线和取景交给了运气。超过 100 个词,靠后的从句开始与靠前的从句相互竞争,细节会被冲淡而不是累积。

我该写关键词标签还是完整句子?

写完整句子。Shannon 的图像模型读提示词的方式,和语言模型读文本一样,因此语法本身携带信息。“A woman in her 30s at a rain-soaked Tokyo crosswalk at night”会产出一个连贯的场景;“woman, 30s, Tokyo, rain, night”则只产出一堆彼此没有关系的松散属性。

文生图可以用负面提示词吗?

不行。Shannon 上的文生图不接受负面提示词,所以只描述你想要的东西,永远不要在提示词里写“不要 X” — 点名一样东西往往会把它召唤出来。图像编辑与图像合成确实支持负面提示词,那里才是放水印、叠字或多余肢体这类不想要的瑕疵的正确位置。

“masterpiece, best quality, 8k”这类词能提升画质吗?

不能。那些是上一代模型的抓手,在这里不携带任何信息 — 它们只是被当作普通词语读掉,还白白花掉你 30–80 个词预算中的一部分。像 (word:1.3) 这样的权重语法同样不会被解析;它会被当成字面文本。请改为描述你真正想要的那个细节。

怎样得到一个精确的颜色?

把十六进制色值写成 color #RRGGBB 的形式,并把它挂到一个具体点名的物体上,例如“a wool jacket, color #8B0000”。一个不依附于任何物体的色值没有可绑定的对象。只对真正重要的那两三个颜色使用它,其余的用文字描述。

我能通过 Shannon API 生成图片吗?

不能。图像生成、编辑与合成都发生在 Shannon 聊天应用中。/v1 API 提供的是文本与视觉 — 它能读取并分析你发过去的图片,但不会创作图片。本指南中的一切都适用于聊天应用。

拿一条真实的提示词试试

用任何语言提问。读卡片。调整它。然后确认。

打开 Shannon 聊天 更多研究

在你确认提示词之前,什么都不会渲染,也不会计费


相关阅读:无审查 AI 图像生成 · 无审查 AI 图像编辑 · 负责任使用政策 · API 文档 · 全部 Shannon 研究。本文中的建议来自我们自己对 Shannon 图像模型的测试;为更早的扩散技术栈写的经验通常迁移不过来。

所有研究链接