我们不持有也不访问任何用户数据,除非有合法机构要求执行措施,否则我们不会暂停账户。
图像指南 · 多图合成

无审查的 AI 换装合成

在 Shannon 上把两张以上的图片合成为一张 —— 衣服迁移、物体入场景、人物并肩而立、产品上模特 —— 以及那一条让这一切都成立的规则。

更新于 2026 年 9 月 5 日图像指南Shannon 3 · 聊天应用

太长不看

把图片都附上,然后描述你要的结果,同时按顺序点明每张图各自提供什么第一张图是主体或场景;后面的图提供被带进来的那些部分。「第一张图里的那位女性,穿着第二张图里那件红色针织毛衣,站在同一个公园里。」不要把一件需要两张图的活儿压缩成一张图加一段对另一张的文字描述 —— 被描述出来的衣服会变成一件通用的衣服;真实那件才始终是真实那件。合成支持负面提示词,也允许你挑一块新的画布比例。这里没有内容过滤也没有拒答层 —— 而且没有视频生成

人们真正需要的图像工作,多数不是「给我画一张某某东西的图」。而是「把这件夹克穿到这个人身上」「把这把椅子放进这个房间」「把这款产品拍进那只手里」。这些都需要来自不止一张照片的素材,而且它们失败的方式都一样:一张图被附上,另一张被用文字描述,回来的东西看着挺像回事,却不是你手上那件。解法比你想的要小,而且到处都管用。

2+
每次合成的图片数
5
种画布比例
Yes
负面提示词
0
个拒答层

01「合成图片」是什么,以及它发生在哪里

Shannon 3 对图片能做三件截然不同的事:从一段描述生成一张新图,编辑一张已有的图片,以及把两张或更多图片合成为一张新图。它们规则不同,而选错通路正是质量最先出问题的地方。

只要成品需要来自不止一张照片的素材,就用合成:换装与衣物迁移、把一个物体放进场景、人物 A 站在人物 B 旁边、真实模特拿着真实产品、把一张图的风格用到另一张图的主体上。如果你发现自己希望能同时指着两张图,那就是这个操作。

这一切都发生在 Shannon 聊天应用里,就在普通对话中。它不在 /v1 API 上 —— API 提供的是文本与视觉能力,也就是说它读取你发过去的图片,而不是生成新图片。如果你是从 API 搜索过来的,这就是实话;各个接口到底提供什么,见 API 文档。图片在我们自己的 GPU 集群上渲染。

你用大白话提问,用你自己说的任何语言都行。Shannon 判断出这是一次图像请求,自己用英文写出生成指令,并在任何东西渲染之前把它显示在一张确认卡片上。在你确认之前,不会生成任何东西,也不会计任何费 —— 而对多图工作来说,那张卡片正是你核对角色与顺序是否如你所愿的地方。Shannon 绝不会不请自来地生成:一句问候、一个问题,或者一张随手附上的照片,都不会触发渲染。

02规则:按顺序点明每张图的角色

指令必须说清楚每张图各自提供什么,而且必须按照图片给出的顺序来说。整个技巧就这些;下面的一切都只是这条规则在具体活儿上的应用。

第一张图是基底 —— 主体,或者场景,取决于成品主要是由哪一个构成的。它决定身份、姿势、取景、光线,以及所有你没要求改动的东西。后面的图是素材来源:被带进来的那些部分。把句子写成这样:一个陌生人按顺序拿着这些图片,就能手工把这件活儿做出来。

有效
第一张图里的那位女性,穿着第二张图里那件红色针织毛衣,
站在同一个公园里,姿势相同,午后的光线也相同,
她的脸和头发保持不变。
失败
把这两张图合起来。   合并这些照片。   放到一起。

这些失败的写法之所以失败,不是因为太短,而是因为它们从没说清哪张图是人、哪张图是毛衣。有三个习惯能让这条规则变得可靠:

  • 明确使用序数说法。「第一张图里的」「第二张图里的」。几个字而已,歧义就没了。
  • 说清楚哪些保持不变。「保持她的脸、头发和姿势完全一致。」点名那些不该动的部分,是 Shannon 所有图像操作里最大的一根质量杠杆,而在这里最要紧,因为一次合成有两个甚至更多可能跑偏的对象。
  • 写散文,不要写标签。图像模型读指令的方式,和语言模型读句子一样,所以完整的句子胜过逗号隔开的关键词。目标写到 30 到 80 个词,并跳过 SDXL 时代的废料(「masterpiece, best quality, 8k」)和 (word:1.3) 这类权重语法。

当一张图里不止一样东西时,点名你要从中取哪一部分。如果第二张图是一位模特穿着这件毛衣的商品图,「第二张图里那位女性所穿的红色针织毛衣」就说明了你要的是这件衣服,而不是这位模特。只写「第二张图」,你可能连她的脸也一并拿到。

按活儿类型划分的角色模板

活儿第一张图第二张图指令形状
换装迁移那个人那件衣服「第一张图里的[人],穿着第二张图里的[衣服],[哪些保持不变]」
物体入场景那个场景那个物体「第一张图里的[房间],把第二张图里的[物体]放在[位置],并匹配[光线]」
人物 + 人物人物 A 与环境人物 B「第一张图里的[男士]站在第二张图里的[女士]旁边,[站位、视线]」
产品上模特模特或场景那件产品「第一张图里的[模特]拿着第二张图里的[产品],[握持方式、标签朝向]」
风格迁移那个主体风格参考图「第一张图里的[主体],以第二张图的[风格维度]来呈现,[主体保持不变]」

03毁掉大多数尝试的那个错误:只描述而不附图

这个错误值得大声强调,因为它远比其他错误常见,而且它看起来像是成功了。用户手上有两张照片 —— 他们的客户和客户的产品,或者他们自己和自己的一件夹克。他们附上了一张,另一张靠打字。

这个错误
[附上一张女性的照片]
「给她穿一件红色针织毛衣,麻花编织,稍微粗一点,
带一个卷边领。」

回来的是一位穿着红色针织毛衣的女性。那是一件不错的毛衣。但它不是那件毛衣。麻花纹路是编出来的,染色是另一种红,罗纹的深浅不对,领子卷的方向不对,而那些让一件真实衣物可被认出的细微不对称 —— 一处修补、一根抽丝、手肘处的松弛 —— 全都没了,因为句子里根本没有装下它们。

文字是一条有损通道,照片不是。一句精心写下的话大概能承载一个物体的十几个属性;照片承载的是成千上万个,其中包括所有你根本想不到要写下来的,以及那些你说不出名字的。用描述代替附图,等于扔掉所有你没想到的东西,而那恰恰是绝大部分。附图能保住真实的外观,因为真实的外观就在那儿。

判断标准很简单。如果这张图的意义就在于它是那一个 —— 那件具体的衣服、那个人、那款确切的产品、那个房间 —— 就把它附上。如果你能从一排相似物里把它挑出来,而且结果必须跟你会挑的那一个对得上,那么描述是做不到的。

一句话版本

被描述出来的衣服会变成一件通用的衣服。真实那件才始终是真实那件。第二张脸、那件产品、那把椅子和那个房间都是同理:附图保住身份,描述则把它换成了一个平均值。

有一种正当的描述场景:当那样东西还不存在时,或者当你要的就是一个通用版本时。设计一件还没人织出来的毛衣、粗略勾一个概念 —— 那属于文生图的活儿,用描述是对的,因为根本没有一个真实物体的身份需要你保住。而一旦一个真实物体进入需求,它的照片也就该一起进来。

还有一个相关的半错误:两张图都附上了,然后仍然把第二张详细描述一遍。那些形容词会和照片打架 —— 真实衣物是细针距的,你却写了「粗一点」,这就引入了一处矛盾。对第二张图的描述,只需刚好够指明你要它的哪一部分。

04换装与衣物迁移

典型的双图活儿。人先附衣服后附。衣服那张图可以是平铺图、挂拍图、商品图,或者别人穿着它的照片 —— 都行,只要你说清楚你要的是它的哪一部分。

换装迁移
第一张图里的那位女性,穿着第二张图里那件红色针织毛衣。
保持她的脸、头发、姿势和公园背景完全照旧,
光线仍是同样柔和的阴天光。毛衣应当自然地垂落在她的身形上,
并保留原衣物的麻花纹路与领口。

负面提示词:warped cable pattern, extra sleeves, distorted
hands, plastic-looking fabric, mismatched lighting

起作用的有三点:角色按顺序被点名,保持不变的部分被明明白白地列了出来(这正是让脸不跑偏的东西),而最后一句告诉模型,衣物本身的细节才是重点 —— 少了这句,合成往往会保住颜色和轮廓,却悄悄把质感磨平。

  • 合身是一个物理主张,那就把它说出来。「自然垂落在她的身形上」「腰部收紧」「袖口到手腕」—— 否则衣服可能以它源图里的比例出现,而不是穿着者的比例。
  • 遮挡是难点。如果双臂交叉,或者有一条包带斜跨胸前,就要说清楚它会怎么处理。这里的含糊会产生经典的「袖子融化」瑕疵。
  • 衣服更多,就意味着图片更多。人先,然后上衣,然后裤子,然后鞋 —— 并且始终一致地把它们称作第二、第三和第四张图。别中途改口叫「鞋那张图」。

05把一个物体放进场景

这里角色反了过来:场景放第一,因为成品主要由场景构成,而物体是被带进来的那一部分。室内效果图、用还没买的家具布置房间、把一辆车放到路上、把一件雕塑摆进画廊 —— 每次都是同一个形状。

物体入场景
第一张图里的那间客厅,把第二张图里那把墨绿色天鹅绒扶手椅
放在左侧窗边,略微朝向镜头,在画面中大约到腰高。
匹配房间里温暖的午后偏晚光线,并在椅子右侧的地毯上
落下一道柔和的影子。房间其余部分与机位保持不变。

负面提示词:floating object, cut-out edges, duplicate
shadows, mismatched color temperature

这里的失败模式不是身份,而是物理。一个仍带着自己那套光线的物体看上去就是贴上去的,观者会立刻察觉,哪怕说不清是为什么。把你的字数花在一张孤立物体的照片不可能知道的那三件事上:位置(在画面的哪里,相对于什么)、以场景为参照而不是以厘米为单位的尺度(「大约到腰高」「和门把手一样高」),以及光与影 —— 方向、质感,以及影子落在哪里。最后这一项,正是把一张拼贴变成一张照片的东西。

06人物 A 站在人物 B 旁边

两个从未同处一室的人:跨代际的家庭合影、联合创始人出差时的创始人肖像、两位表演者的海报。这行得通,但它需要两样单主体活儿不需要的东西。

两个人
第一张图里的那位男士,站在第二张图里那位女士旁边,
两人都在第一张图里的那座石砌露台上。他站左边,
她站在他右侧,肩膀几乎相触,两人都面向镜头且视线等高。
保持两张脸、发型和衣着与各自照片里完全一致,
并用同一道来自左侧的柔和傍晚光照亮两人。

画布:landscape
负面提示词:mismatched skin tone, duplicated limbs, seam
line between subjects, uneven lighting

多出来的那两样:相对几何关系 —— 谁在哪一边、相距多远、谁的视线看向哪里,以及相对身高,因为两张裁切方式不同的肖像根本无法让模型知道其中一人高出一个头 —— 以及一道共用的光,必须明确说出来,因为你正在合并两套光照环境,总得有一套胜出。

这里也正是「选一块新画布比例」发挥价值的地方:两张竖幅源图会拼出一张糟糕的竖幅合影,所以要求 landscapewide。还有一句显而易见的话说一次就够 —— 把一个真人放进他从未出现过的画面里,这件事很有力量,也并非天然无害。要么你有权利,要么你有同意;我们的负责任使用政策是它的简版。

07产品上模特,以及无审查的产品摄影

从商业角度看,这是那种能自己赚回成本的合成。你有一张白底产品图,你也有一位模特、一只手、一间厨房、一张工作台。把它们合起来,你不用花一天棚拍就能得到一张生活场景照片 —— 而且里面是你真实的产品,而不是一个生成出来的近似品,这正是「可用的营销素材」和「你还得替它道歉的样机图」之间的全部差别。

产品上模特
第一张图里的那位女性,右手拿着第二张图里那只琥珀色玻璃
精华液瓶,抬到胸口高度,标签正对镜头且完全清晰可读,
她的手指自然地环握瓶身且不遮挡标签。
保持她的脸、头发和厨房背景不变。以 Kodak Portra 400 拍摄,
85mm f/1.4,来自左侧的柔和窗光。

画布:portrait
负面提示词:warped label text, extra fingers, floating
bottle, duplicated reflections, plastic skin

产品类工作有两点特有的补充。握持方式:手拿着物体是合成最容易出问题的地方,所以要说清楚是哪只手、抬到什么高度,以及手指自然环握且不遮挡标签。摄影处理:点名一台相机、一支镜头,以及一种胶片或光源。输出应当读起来像一张被拍下来的照片,而不是两张被合起来的照片,而把它当成一张照片来写,正是达成这一点的办法。

「无审查」在这里的意义比听上去要平淡得多。带过滤的生成器会拒绝整类寻常且合法的商业内容:内衣与泳装目录、烟草与电子烟硬件、酒类、枪械配件、成人健康产品、在合法地区的大麻制品、医疗器械、战术与狩猎装备。它们同样会拒绝由权利人本人所做的品牌与肖像工作。这些都不是边缘情形;这就是一家代理公司的普通周二。Shannon 的生成通路上没有内容过滤器,负责写提示词的模型上也没有拒答层,所以活儿能做下去,而权利的问题留在你这边 —— 它本来就该在那里。

08风格取自一张图,主体取自另一张

主体在前,风格参考在后。这件活儿的不同之处在于,你借的是一种特质而不是一个物体,所以你必须点名是哪些特质 —— 并且声明参考图自己的主体和构图不跟着一起过来。

风格参考
第一张图里那位男士的肖像,以第二张图的视觉风格来呈现:
同样的低饱和青绿与赭黄色调、可见的干笔触质感,
以及平坦均匀的光线。保持他的脸、表情和姿势可辨认且不变。
不要把第二张图的主体、背景或构图带过来。

负面提示词:second face, borrowed background, photographic
texture

要明确点名风格维度,因为只写「以第二张图的风格」是欠指定的:色调(或者精确颜色,写成挂在某个具名物体上的 color #8B0000)、笔触或颗粒光线质感线条粗细抽象程度边缘处理。挑出定义这个观感的那两三项;六项全点等于把它们平均掉。另外别混入互相冲突的方向 —— 「照片级真实」加「水彩」得到的是一团糊,不是一次融合。如果你想要的是一张仅仅借了个色调的照片,那就照实说。

09负面提示词与挑选新的画布比例

两项只对合成与编辑存在、对文生图不存在的能力,而且两项都被用得太少。

负面提示词

合成图片支持负面提示词。不想要的瑕疵应该放在那里 —— 而且放在那里而不是写进指令,这一点很要紧,因为在主指令里写「不要多余的手指」,等于在说出你想要的一切的同一口气里,把你想避开的东西也点名了。把排除项放进它们自己的通道。那些始终值得写上的条目:

  • 解剖结构 —— extra fingers, duplicated limbs, malformed hands, second face。
  • 拼贴痕迹 —— cut-out edges, visible seam line, floating object, duplicate shadows, halo around subject。
  • 光线不匹配 —— mismatched color temperature, inconsistent shadow direction, uneven exposure between subjects。
  • 质感失败 —— plastic skin, smoothed fabric, warped label text, illegible logo。

只写对你这张图确实可能出现的那几条。列了三十项的负面提示词是一条散掉的指令,而不是一条有力的指令。

画布比例

编辑单张图片会自动继承源图的画幅比例 —— 只有一张源图,它的形状就是答案。合成没有这样的默认值,所以你可以挑一块新的画布比例,而且你往往应该挑,因为适合某一张源图的形状,很少适合这次合成。

比例最适合典型的合成用途
square默认值,社交信息流单主体加一个迁移过来的元素
portrait人物、高瘦的主体换装迁移、单个模特手持产品
landscape风景、多人两人并肩、把物体放进房间
wide电影感取景合影、环境产品场景、横幅
tall海报、手机壁纸全身穿搭照、海报排版

明确提出的要求永远优先。什么都不说,你拿到的就是方形 —— 对大多数双人和全身穿搭的活儿来说都是错的形状,所以值得多写一个词。

10Shannon 会用哪些图片:会话里的,还是这条消息里的

图片进入一次合成有两条路,而知道自己依赖的是哪一条,可以避免大部分顺序错乱。

附在当前这条消息上。直接路线:把所有东西都附在带指令的那条消息上,顺序就按你打算指代的顺序来,于是「第一张图」和「第二张图」的意思就跟看起来一模一样。默认就用这个。

已经在会话里。会话中早前发过的图片仍然可用,可以用日常语言指代 —— 「我前面发的那张照片」「之前那张毛衣的图」「你做的第二个版本」。Shannon 会在会话中解析这些指代,这在长时间的工作中确实很方便:你可以在一个结果上反复迭代,然后再引入一个新元素,而不必把所有东西重新上传一遍。

两条路的保险机制是同一个。确认卡片会在任何东西渲染之前把指令显示出来,包括它选定的顺序。读它。如果角色搞反了 —— 毛衣成了基底,人成了素材来源 —— 说一声就能改,而这发生在任何一个像素被生成或计费之前。不过话说回来,当一个会话很长、图片很多时,还是把你需要的那几张重新附上;隔了六张图之后,「第二张图」对任何读者来说都是含糊的。

让 Shannon 看一看一张图 —— 描述它、读出标签、告诉你面料是什么 —— 属于普通的视觉工作,不是生成。它不额外收费,而且在合成之前拿它做个检查很有用:如果 Shannon 的描述里没提到你在意的那个细节,那你的指令就需要把它点名。

11无审查,以及它究竟意味着什么

生成通路上没有内容过滤器负责写提示词的模型上也没有拒答层。合成正是带过滤的工具失败得最明显的地方,因为一套拒答系统无法分辨「合成你自己拥有的图片」和「合成你本不该拥有的图片」—— 于是它把两者一起挡掉。

这些工具经常拒绝的工作一点也不猎奇:人体艺术与人体写生、医学与法医插画、安全研究配图、用于书籍封面和游戏美术的虚构暴力、政治讽刺,以及上文列出的那些合法产品品类。每一项都是正当的专业工作,而关键词过滤器无法把它们和滥用区分开。

无审查不等于无责任。你提供的是真实物体、而且往往是真实人物的照片;权利与同意由你持有,对结果的责任同样由你承担。Shannon Lab LLC 是一家新墨西哥州公司,运营遵循公开发布的负责任使用政策 —— 在开始涉及他人肖像的工作之前,值得花五分钟读一读。

12动手之前值得知道的限制

这里没有视频生成。Shannon 不会让图片动起来,也不会由上述任何一种操作产出视频,任何形式都没有 —— 不管是从单张图片,还是从一次合成,也没有什么实验性选项。如果你的需求最终落在动态上,那么最后这一步不该用这个工具。这是产品现在的样子,不是路线图的暗示。

其他几条诚实的边界,都附带变通办法:

  • 细小文字是最弱的一环。小号字、密集的包装文案和长串序列号可能出得不完美。构图时让重要文字大一些,把 warped label text 放进负面提示词,并在全尺寸下检查。
  • 尺度差距过大很难办。一张 4000 像素的产品图配上一张房间的小缩略图,模型能用的东西太少了。用你手上每张源图的最佳版本。
  • 严重遮挡会限制能迁移的内容。一件折叠着拍、背面从未露出的衣服,它的背面无法被忠实地凭空造出来。如果合成里会露出背面,就把背面也提供出来。
  • 图片越多,混淆的余地越大。四张源图在严格的序数命名下是可行的,但那不是可以随意的时候 —— 用这件活儿需要的数量,不多用。
  • 同时做两个大改动会互相争夺。先迁移衣服,确认,再换背景。分步编辑几乎每次都胜过一条塞满了要求的指令,而且每一步的检查成本都很低。

13常见问题

我怎样用 AI 把两张图合成为一张?

在 Shannon 聊天里把两张图都附上,然后描述你要的结果,同时按顺序点明每张图各自提供什么。第一张图是主体或场景;后面的图提供被带进来的那些部分。例如:第一张图里的那位女性,穿着第二张图里那件红色针织毛衣,站在同一个公园里。Shannon 会自己用英文写出最终指令,把它显示在一张确认卡片上,在你确认之前不会渲染任何东西。

为什么我用文字描述衣服而不是把它附上,效果就不对?

因为一句话是对一张照片的有损描述。写下一件红色针织毛衣,你会得到一件说得过去的红色针织毛衣,但不是你那件 —— 麻花纹路、罗纹、染色、垂坠感、缝线位置和穿旧的痕迹全都是编出来的。把第二张图附上,才能保住那件真实衣物真实的样子。如果这张图的意义就在于它是那一件具体的物品、那一个人、那一款产品,就把它附上,而不是去描述它。

多图合成支持负面提示词和新的画幅比例吗?

两者都支持。合成图片支持负面提示词,所以像多余的手指、重复的肢体、扭曲的 logo 文字或可见的接缝这类不想要的瑕疵,应该放在那里,而不是写进指令里。你还可以选择一块新的画布比例 —— 方形、竖幅、横幅、宽银幕或长幅。这一点与编辑单张图片不同,后者会自动继承源图的画幅比例。

Shannon 能用对话里已有的图片吗,还是只能用我现在附上的?

都可以。你可以把图片附在当前这条消息上,也可以用日常语言指代会话里已有的图片 —— 我前面发的那张照片、之前那张毛衣的图。Shannon 会解析这些指代,而确认卡片会显示它选定的顺序,所以你可以在任何东西被渲染之前纠正顺序。把所有图片按你将要指代的顺序放在同一条消息里附上,是最可靠的工作方式。

Shannon 能把合成好的图片变成视频吗?

不能。Shannon 不生成视频,也不会让图片动起来。它能生成新图片、编辑一张已有的图片,以及把两张或更多图片合成为一张。图像相关的工作发生在 Shannon 聊天应用里;/v1 API 提供的是文本与视觉能力,也就是说它读取图片,而不是生成图片。

无审查的图像合成真的没有过滤吗?

生成通路上没有内容过滤器,负责写提示词的模型上也没有拒答层。带过滤的生成器经常拒绝正当的合成工作 —— 内衣与泳装目录、人体艺术、医学与法医插画、受监管的消费品、安全研究配图、政治讽刺,以及权利人自己所做的品牌与肖像工作。Shannon 不会拒。源图的权利与责任都在你手上;请参见我们的负责任使用政策

直说

这份指南里没有出现任何跑分数字,因为对于「那件毛衣有没有还是原来那件毛衣」这件事,并不存在一个诚实的公开基准。上面的一切都是来自真实使用的操作性建议。凡是某项能力不存在的地方 —— 视频、API 上的图像生成 —— 我们都直说,而不是含糊带过。

把你的图片合起来

附上它们,按顺序点明每个角色,确认指令,渲染。没有拒答层。

打开 Shannon 聊天 阅读 API 文档

Shannon Lab LLC · 美国新墨西哥州 · 图片在我们自己的 GPU 集群上渲染


图像生成、编辑与多图合成都是 Shannon 聊天应用的功能;/v1/chat/completions/v1/messages/v1/responses 这些接口提供的是文本与视觉能力,也就是说它们读取图片而不是生成图片。这里没有视频生成。画幅比例选项、负面提示词支持与确认行为的信息截至 2026 年 9 月 5 日有效。相关阅读:无审查 AI 图像生成 · 无审查 AI 图像编辑 · 负责任使用 · API 文档 · 研究索引

所有研究链接