无审查的 AI 图像编辑器
写一句话,就能对一张已有的图片做修改、换风格、重新打光、换装或修复。不用蒙版,没有过滤,不会拒答 —— 而且有一个技巧,比其余所有技巧加起来还重要。
太长不看
Shannon 每次只编辑一张已有的图片,靠的是一句大白话指令 —— 没有画笔、没有蒙版、没有选区。这条指令必须同时说清楚哪里改,以及哪里保持不变,因为模型会重新生成整幅画面:凡是你没点名说要保持不变的东西,都可以自由漂移。点名那些不该动的部分 —— 「保持人脸、姿势和衣着完全一致」 —— 是你手上最大的一根质量杠杆。编辑这条路确实接受负面提示词(文生图不接受);把不想要的瑕疵放进去,而不是在指令里写「不要 X」。输出会自动继承源图的画幅比例。这里没有视频生成,也没有任何办法让图片动起来。编辑跑在我们自己的 GPU 集群上,在聊天应用内运行,没有内容过滤,也没有拒答层。
大多数搜索无审查 AI 图像编辑器的人,手上都是一张图和一个问题:背景不对、光太平、外套颜色不对、画面里站着一个陌生人、扫描件上有一道折痕 —— 又或者这次修改完全正当,可他们现在用的工具就是不肯碰。这篇讲的是怎么把这件事做好:不是比哪个编辑器的滑块最多,而是那一个习惯 —— 它决定了一次修改是稳稳落地,还是趁你不注意悄悄把主体的脸重建了一遍。
01指令式编辑到底是什么
传统的 AI 编辑要求你亲手做最难的那部分:打开画布,在想改的区域上涂出一层蒙版,再输入一句话描述蒙版里应该出现什么。精确,缓慢,而且一旦你的改动没有清晰的轮廓就完全失效 —— 比如光线变化、会改变剪影的换装、或者全局调色。
Shannon 的做法正好反过来。你什么都不用选。你用任何语言写一句关于这张图的话,区域由你的措辞推断出来。这让它成为一个实用的无审查局部重绘替代方案,适合那些只想要结果、不想做选区工作的人 —— 但有一个机制上的后果,你得先弄明白:
一次编辑是以你的源图为条件、对整幅画面的重新渲染 —— 而不是往图上某一块打的补丁。图像模型读你的原图,读你的指令,然后生成一张新图,这张新图理应等于原图加上那处改动。没有任何东西是被机制性冻结的。每一次编辑,每一个像素都可以被重新商量。
这就是为什么「一条雨中的东京街道」—— 在带蒙版的工具里毫无问题 —— 回来时站在街上的那个人已经微妙地变了。在带蒙版的工具里,是蒙版声明了这个人不可触碰;在这里,得由你的句子来声明。好处是:指令式编辑能做到蒙版做不到的事 —— 把太阳挪个位置,让阴影跟着一起对;换一件衣服,让布料顺着已有的姿势自然垂落;把一张照片改成水墨线条加平涂色块,同时保住构图。这些修改根本没有可以涂出来的边界;它们是贯穿整幅画面的关系。
02锚定:那根最大的质量杠杆
锚定的意思是,把每一条编辑指令都写成两个子句:变更子句(什么应该变得不一样,正面、具体地表述)和保留子句(哪些部分必须原封不动地留下来,用具体的名词点名)。两者都是承重的 —— 只有变更子句,那就只是一个愿望。如果这一页你只带走一句话:决定你结果好坏的,是你把「哪些不变」点名得有多明确,而不是你把「哪里变」描写得有多生动。
没有锚定的指令会以三种方式跑偏
- 身份漂移。脸回来时几乎是对的 —— 鼻子略有不同,下颌线被悄悄美化了。这是破坏性最大的一种失败,因为在手机上很难看出来,而认识这个人的人一眼就能看出来。
- 连带风格化。你要的是一个新背景;结果你还额外收到了新的调色、新的镜头感,以及一件本来是罗纹的毛衣。模型把这条指令读成了对整张目标图的描述,而不是相对源图的一个增量。
- 形容词带来的范围蔓延。「更有张力」「更干净」「更专业」根本没有点名任何对象。一个没有名词的形容词会作用于一切,于是一切都动了。
锚点词汇表
锚点是靠具体名词起作用的。「保持不变」太弱了 —— 模型无法知道你在意的是哪一种「不变」。挑出对这次修改真正要紧的三到五项,直接把它们点名说出来。
| 你要改的东西 | 值得明确点名的锚点 |
|---|---|
| 背景 / 场景 | 人脸与五官、发型、姿势、手、衣着、机位、构图裁切、主体身上的光 |
| 光线 / 氛围 | 人脸、表情、皮肤质感、姿势、衣着、背景内容、取景 |
| 衣着 / 服装 | 人脸、胡须或头发、姿势、手、身体比例、背景、光的方向、调色 |
| 风格 / 媒介 | 构图、姿势、头发长度、服装轮廓、人物数量、构图裁切 |
| 去除物体 / 修复 | 画面里的其他一切 —— 主体、周围建筑、颗粒、影调、对比度、色彩 |
| 改某一样东西的颜色 | 图中其余所有颜色,以及被改物体的纹理和材质 |
注意最后一行。改颜色出错的方式很隐蔽,因为「把外套改成红色」等于邀请模型从头重造一件外套 —— 新的剪裁、新的材质、新的褶皱。加上锚定后:「把现有这件外套改成深绯红色,保持它原本的剪裁、缝线、面料质感以及垂坠方式完全不变。」只差一个子句,结果却好得多。
03实例演练:弱指令、为什么跑偏、加锚定后的改写
下面每一组都是同一个意图的两种写法。中间那段诊断才是可以迁移到别处的部分。
A. 替换背景
为什么跑偏:这描述的是一张目标图,不是一个增量。这个女人身上没有任何东西受到保护,也没有任何东西把机位钉住,所以模型会一边搭出一个合理的场景,一边把她重新取景、重新渲染。
改动之处:保留子句钉住了身份、服装和取景,最后一句则规定了接缝往哪一边收 —— 背景去迁就主体的光,而不是反过来。
B. 重新打光
为什么跑偏:「好看」是一个没有名词的形容词。模型只能自己发明一个定义,而在重新渲染时,让画面看起来「更好看」最省事的办法就是磨平皮肤、把牙齿提亮、把下巴削瘦。你要的是光,拿到的是一次磨皮。
改动之处:光是用物理方式描述的 —— 方向、质感、色温、衰减。皮肤质感被明确锚定,因为重新打光正是模型最想把它磨掉的时刻。
C. 给主体换装
为什么跑偏:西装会改变剪影,所以躯干必须重新渲染 —— 而上面那颗头通常也跟着一起变。没有锚定的换装,是仅次于换背景的第二大身份漂移来源。
改动之处:「剪裁贴合他当前的体态」让衣服从属于姿势。手被单独锚定,因为手正是换装类修改最容易明显崩坏的地方。
D. 给照片换风格
为什么跑偏:光有一个风格词,等于把一切都交了出去 —— 构图、裁切、头发、服装、人数 —— 而「动漫」是三十年互不兼容的传统的总和。你会得到一张画得挺好、但画的是另一个场景的插画。
改动之处:风格类修改需要另一种锚点。你没法锚定纹理 —— 纹理正是被替换掉的东西 —— 所以你锚定的是结构:构图、姿势、剪影、裁切、人物数量。在赛璐珞动画里要求保留「照片级真实的皮肤」,本身就是自相矛盾。
E. 去掉某样东西
为什么跑偏:一句否定仍然把那个概念摆到了模型面前,而且完全没说腾出来的空间该由什么填上。去除类操作需要对目标和填充物都给出正面的说明。
改动之处:目标是用物体、颜色和位置点名的;填充物有明确指定,所以模型不会在本该是人行道的地方凭空造出一个广场;而且「其余一切」被拆成了实实在在的名词。
F. 修复受损的照片
为什么跑偏:「修」会被读成「改进」,而改进一张老照片就意味着把它现代化 —— 更干净的皮肤、更高的对比度,以及一张已经不太像你奶奶的脸。
改动之处:损伤被逐项列了出来,所以「修」有了明确的范围;颗粒和影调被锚定,因为正是它们让这张照片读起来有年代真实感。那三条禁令是否定句难得站得住脚的情形 —— 它们是关于处理过程的指令,而不是在点名某个对象。
一条好指令长什么样
目标写到 25 到 60 个词左右,用完整的句子,而不是逗号隔开的关键词标签 —— 图像模型读提示词的方式和语言模型一样,所以散文胜过标签汤。跳过 SDXL 时代的那些废料(masterpiece, best quality, 8k)和权重语法比如 (word:1.3);它们在这里不起任何作用。一条指令只改一件事 —— 一句话里塞两个不相干的改动,会互相争夺注意力,最后两个都做了一半。
04负面提示词 —— 这里支持,文生图不支持
这一点常把人绊住,所以直说:
| 通路 | 源图数量 | 负面提示词 | 画幅比例 | 提示词形式 |
|---|---|---|---|---|
| 文生图 | 0 | 不支持 | 自行选择(默认方形) | 描述性散文 |
| 编辑一张图 | 正好 1 | 支持 | 继承自源图 | 指令:变更 + 保留 |
| 合成 2 张以上 | 2 张或更多 | 支持 | 可选新画布 | 点明角色的散文 |
文生图完全不接受负面提示词 —— 从无到有地生成时,只描述你想要什么本身就是那份纪律(参见无审查 AI 图像生成)。编辑不一样:你已经有一张源图,而重新渲染的典型失败方式是已知且可以点名的,所以负面提示词有实实在在的东西可以压制。
该放什么进去
瑕疵,而且只有瑕疵。它是一份缺陷清单,不是第二条指令通道:
- extra fingers, fused fingers, malformed hands —— 任何会重新渲染人物的编辑。
- warped text, garbled lettering, misspelled signage —— 画面里有招牌、标签或包装的场合。
- duplicated limbs, duplicated railing, repeated windows —— 去除物体和背景延展。
- smeared texture, blurry patch, halo around the subject, visible seam —— 换背景和去除物体。
- plastic skin, waxy skin, over-smoothed face, watermark, jpeg artifacts —— 重新打光、人像修图,以及日常卫生。
不该放什么进去
内容层面的决定。如果你想去掉那顶帽子,指令应该是「去掉帽子」—— 而不是在负面提示词里写「帽子」。负面提示词并不能可靠地移除你源图中已经存在的东西;它压制的是渲染过程中冒出来的缺陷。把内容放进去会让你两头落空:帽子还在,而一个本可以用来压制扭曲手部的位置也没了。
这条规则的另一半适用于你的指令:别再在里面写「不要 X」了。「一条没有车的街道」「一张没有戴眼镜的肖像」都把不想要的概念放进了句子里,然后要求模型去否定它 —— 这件事语言处理得很好,图像条件化处理得很差。改说应该出现什么:「一条空荡荡、柏油路面干净的街道」「一张双眼没有遮挡的肖像」。唯一的例外,就像例子 F 那样,是关于处理过程的指令 —— 「不要锐化」「不要重新调色」—— 它拒绝的是一个操作,而不是在点名一个对象。
一句话说清分工
指令:哪里改、哪里不变 —— 正面表述。负面提示词:一次渲染可能出现的各种畸形。把两者分开,两者都会变好。
05一张源图,以及 Shannon 是怎么挑中它的
一次编辑作用于正好一张源图:要么是对话里已经存在的某张图片 —— 之前上传的,或者是给你生成的 —— 要么是附在你正在发送的这条消息上的那张。不会从这个会话之外拉进任何东西,编辑这条路也绝不会悄悄把两张图合并起来。如果你的意图需要来自不止一张图的元素 —— 把照片 A 里的衣服放到照片 B 里的人身上 —— 那就是一次合成,提示词形式也不同,需要按顺序点明每张图的角色。
追加指令与「最近相关的那张图」
一旦有一张图进入了对话,简短的追加指令就会像你期望的那样工作。「再暗一点。」「现在试试日落。」这些都会解析到会话里最近相关的那张图 —— 通常就是你刚刚收到的那张结果 —— 于是一连串小指令的行为就像一叠依次叠加的编辑。这带来三个后果:
- 一步一步地迭代。每一次追加都是一次完整的重新渲染,所以「再暗一点、把她的外套换掉、再把机位放低」等于三次编辑在同一趟里互相打架。发三条消息;停在你喜欢的那一步。
- 当心代际损失。细小的偏差会累积;到第六次连续编辑时,一张脸可能已经离原图很远了,尽管单看每一步都不算出错。一旦你察觉到漂移,就别再打补丁了 —— 重新上传原始文件,写一条把你一路上想明白的所有要求都编码进去的合并指令。
- 在长会话里要说明白。「用我前面上传的那张海滩照片,……」能在多张图同时在场时消除歧义。
确认卡片是你补上锚点的最后机会
你用大白话提问,用你自己说的任何语言都行。Shannon 判断这是一次图像操作请求,自己用英文写出最终的指令,并在任何东西渲染之前把它显示在一张确认卡片上。在你确认之前,不会生成任何东西,也不会计任何费。读一读那张卡片 —— 那正是你在花钱之前抓出缺失的保留子句的地方。
还有两个相关行为:Shannon 绝不会不请自来地生成 —— 一句问候、一个问题或者一张随手附上的照片,都不会触发图像操作。而单纯让 Shannon 看一张图 —— 描述它、读出里面的文字、说说构图为什么不成立 —— 属于普通的视觉工作,不是生成,也不会额外收费。「这张照片你会改哪里?」是免费的建议;照着做才是编辑。
06画幅比例会自动继承
编辑后的图片会以与源图相同的画幅比例返回。你不用选,也不需要选:4:5 的竖幅还是 4:5,16:9 的画面还是 16:9,一张比例别扭的手机截图也会保住它的比例。一次会悄悄给你重新取景的编辑就不叫编辑了 —— 那是一次裁切,外加对原图边界之外有什么东西的一次猜测。
这一点和另外两条通路有实质区别。文生图要求你从 square(方形,默认)、portrait(竖幅)、landscape(横幅)、wide(宽银幕)和 tall(长幅,适合海报与壁纸)里挑一个,而且明确提出的要求永远优先;合成则允许你选一块全新的画布,因为那里没有唯一一张可供继承的源图。所以如果你需要另一种形状,那就不是编辑 —— 把一张 1:1 的产品图变成 16:9 的横幅,意味着凭空造出从未被拍下来的像素。要做就有意识地做:用生成,或者合成到一块新画布上。
07这里没有视频生成
直说,因为总有人问
Shannon 不生成视频,也不会让图片动起来。没有图生视频的通路,没有「让这张照片动起来」,没有循环动画,没有 cinemagraph。这不是一项处于预览或即将推出的能力 —— 它在产品里根本不存在,本页上也没有任何一句话应该被读成暗示了别的意思。
Shannon 3 对图片做的事正好只有三件:生成一张新图、编辑一张已有的图,以及把两张或更多图片合成为一张。这一整页讲的都是第二件事。
值得说两遍,因为在人们心里「AI 图像编辑器」和「AI 视频生成器」已经挨得很近了,而一个能痛快给你的照片重新打光的工具,感觉上离让它动起来只差一个按钮。它不是 —— 而且你应该在第一分钟就知道,而不是在第十分钟。
08为什么「无审查」对编辑比对生成更重要
带过滤的编辑器和带过滤的生成器失败的方式不同,而且通常更糟。带过滤的生成器拒的是你的提示词;你改写一下再试就是了。带过滤的编辑器可以拒掉源图本身,连你的指令一个字都还没读。上传一张临床创口照片用于病例报告,输入端就被驳回。上传一张历史战争照片想修掉一道折痕,画面里那支步枪直接终结了对话。正当的工作,一刀切的拒绝,任何改写都救不回来。
Shannon 的图像通路输出端没有内容过滤,负责写指令的模型上也没有拒答层。正是这一点让下面这些寻常工作变得可行:
- 人体艺术与人像写生 —— 为与知情同意的成年被摄者合作的艺术家和摄影师做修图、重新打光和风格化。
- 医学与法医插画 —— 为教学材料、病例报告和重建工作清理临床影像,这类内容主流编辑器一看就拒。
- 安全研究配图 —— 用于钓鱼意识培训项目和红队报告的截图、物理安防照片与硬件文档。
- 虚构作品中的暴力 —— 影视、游戏和漫画的制作美术,其中伤口或武器本身就是题材。
- 政治讽刺与社论插画 —— 背后有好几个世纪的历史,在带过滤的工具里却几乎得不到任何支持。
- 权利人自己的品牌与肖像工作 —— 你自己的产品摄影、logo 组合图和人像,以及棘手的家庭档案,不必再跟一个分类器争论你有没有资格这么做。
无审查不等于无责任。Shannon 由Shannon Lab LLC(美国新墨西哥州)运营,遵循公开发布的负责任使用政策,真正的边界写在那里 —— 那是关于法律与伤害的边界,而不是某个分类器看到一张创口照片时的不适。缺少一层条件反射式的拒绝,是关于工具的一句声明,而不是关于你对自己所创造之物应负责任的一句声明。
09API 在哪里派得上用场 —— 以及在哪里派不上
对于从 API 搜索过来的读者,这是一个常见的岔路口。图像生成与编辑发生在 Shannon 聊天应用里,不在 API 上。三种 /v1 接口方言 —— /v1/chat/completions(OpenAI 形态)、/v1/messages(Anthropic 形态)和 /v1/responses,全部支持流式,全部跑在同一批模型上 —— 提供的是文本与视觉能力。视觉的意思是模型会读你发过去的图片:描述它们、转写文字、分析一张图表。它不意味着模型会生成或修改图片。
不过这里仍然留下了一个有用的模式:视觉能力加上一个无审查的文本模型,是一位很强的「指令撰写助手」。把源图发给 API,让它描述画面里有什么,并起草一条点明改动与锚点的锚定式指令,然后把那条指令拿到聊天里去跑 —— 它会替你抓住那些你本来会忘掉的锚点。请求与响应的具体形态见 API 文档。
10常见问题
什么是无审查 AI 图像编辑器?
它接收一张已有的图片加上一句大白话指令,然后返回改好的图片:输出端没有内容过滤器,负责写指令的那个模型也没有拒答层。它跑在我们自己的 GPU 集群上,位于 Shannon 聊天应用内部,所以那些被带过滤的编辑器一口回绝的活儿 —— 人体艺术摄影的修图、医学与法医插画、安全研究配图、虚构作品中的暴力场面、政治讽刺 —— 在这里是被做完,而不是被拒绝。
我只让它换背景,为什么人脸也变了?
因为一条编辑指令是以你的源图为条件重新生成整幅画面,而不是只动你心里想的那一块 —— 凡是你没点名说要保持不变的东西,都可以自由漂移。解法就是锚定:加一句保留子句,比如「保持人脸、发型、姿势和衣着完全一致,机位与构图裁切不变」。点名那些不该动的部分,是你手上最大的一根质量杠杆。
Shannon 的图像编辑支持负面提示词吗?
支持。文生图那条路完全不接受负面提示词,而编辑和多图合成这两条路都支持。用它来压制不想要的瑕疵 —— 多余的手指、扭曲的文字、重复的栏杆、糊掉的纹理、塑料感皮肤、水印 —— 而不是在指令里写「不要 X」。内容层面的决定属于指令,而且要正面表述;瑕疵压制才属于负面提示词。
Shannon 能让我的图片动起来或者变成视频吗?
不能。Shannon 不生成视频,也不会让图片动起来。没有图生视频这条通路,也没有任何相关预告。Shannon 3 对图片能做的是:生成一张新图、编辑一张已有的图,或者把两张以上的图合成为一张 —— 就这三件事,此外没有别的。
一次编辑会用到几张源图?
正好一张:要么是对话里已经存在的某张图片,要么是你当前这条消息里附上的那张。如果需要的元素来自两张或更多图片 —— 把一张照片里的衣服穿到另一张照片里的人身上 —— 那就是合成,不是编辑,而且你应该把真实的图片都提供出来,而不是用文字去描述第二张。
我需要画蒙版或者用局部重绘吗?
不需要。这里没有画笔、套索或蒙版图层。你用一句话描述要改什么,区域由你的措辞推断出来 —— 所以精确的名词很重要:「右边那辆停着的银色汽车」的定位效果远好于「那个东西」。这让 Shannon 成为一个实用的无审查局部重绘替代方案,适合那些只想要结果、不想做选区工作的人。
我能通过 Shannon API 编辑图片吗?
不能。图像生成与编辑都在 Shannon 聊天应用里。/v1 系列接口 —— /v1/chat/completions、/v1/messages 和 /v1/responses —— 提供的是文本与视觉能力:它们会读取并分析你发过去的图片,但不会生成或修改图片。一个常见的工作流是让 API 的视觉能力先起草那条带锚定的指令,再到聊天里执行这次编辑。
Shannon AI 由 Shannon Lab LLC 运营,美国新墨西哥州。图像生成、编辑与合成都是 Shannon 3 的聊天应用功能;/v1 API 只提供文本与视觉能力。产品中不存在视频生成。编辑只接受正好一张源图,并继承其画幅比例。无审查图像通路的使用受负责任使用政策约束。