我们不持有也不访问任何用户数据,除非有合法机构要求执行措施,否则我们不会暂停账户。
研究 · 定位

无审查与带过滤的 AI 绘图工具

内容过滤最初是为了阻止一小类真实危害而建的。实际上它同时也阻止了医学插画、法医重建、人体写生、战争史、社论讽刺,以及企业为自家产品出图。这就是它的代价 — 以及拿掉过滤器改变了什么、又没有改变什么。

发布于 2026 年 9 月 5 日研究Shannon Lab LLC

太长不看

主流绘图工具用分类器筛查提示词和输出,而这些分类器只看得见词与像素,永远看不见目的。这就注定会有误判,而误判最狠地砸在专业工作上:解剖、法医、人体艺术、历史图像、影视预演、讽刺、安全意识材料,以及要求生成自家品牌的权利人。OVERT(ICML 2025)是针对这一失败模式的首个大规模基准,它用了 4,600 条无害但看似可疑的提示词,发现过度拒答在各主流模型中普遍存在。Shannon 在我们自建的 GPU 集群上运行图像生成、单图编辑与多图合成,没有内容过滤,也没有拒答层,并用一个看得见的决策取代黑名单:一张在任何东西渲染之前展示完整提示词的确认卡片。这提高了你和我们双方的责任;两者都写在负责任使用政策里。这里没有视频生成,图像工作在聊天应用里,而不在 API 上。

几乎每个以图像为业的人都有同一段经历。一段描述某个再平常不过之物的提示词 — 一张膝关节剖面、一辆汽车碰撞瞬间、一幅炭笔人体习作、一名 1944 年的士兵 — 回来的却是一条违反政策的提示。你换个说法,得到另一条违规提示。最后你写出一段含糊到能通过的文字,拿到的图却不再呈现你需要的东西。工具没有大声地失败;它是一层层地失败,而最后妥协的人成了你。

01AI 绘图工具为什么会拒绝一个明显正当的提示词?

这个拒绝通常不是图像模型自己的意见。它是围绕模型的一整套过滤栈的输出,而它的各个层级几乎能解释你收到过的每一次奇怪拒绝。

层级它检查什么典型失效
提示词黑名单你文本中的字面字符串及其近似变体不看句子上下文就封词 — “speculum”不行,“stethoscope”可以
提示词分类器对提示词“风险”的一种学习出来的判断按话题邻近性触发:凡是靠近医学、武器、身体或政治的都得高分
模型拒答训练模型自身被训练出的抗拒不报错就拒绝,或者悄悄给出一个消过毒的替代品
输出分类器渲染出来的像素,没有提示词语境分不清解剖图与色情,也分不清电影剧照与真实事件
策略替换在渲染前悄悄改写你的提示词你拿到了一张图,但不是你指定的那张,而且没人告诉你为什么

每一层都共享同一个盲区:没有一层看得见你为什么要问。一位医学插画师、一位为原告做碰撞重建的专家,和一个心怀恶意的人,打出的是同一个名词。过滤器看见的是名词,而不是那本图谱或那份案卷;而且考核它的是漏过去的危害 — 从来不是它毁掉的工作。在这种不对称下,任何运营方的理性设置都是多拒一点。这也是为什么“换个说法就行了”并不是解决办法:改写并不能给过滤器补上它缺失的信息,它只是把你的提示词从触发它的那些词旁边挪开,而那通常也意味着挪离了你的本意。

02内容过滤真正要防住的是什么

一篇假装过滤器毫无理由存在的无过滤生成论证,不值得读。确实有一小类输出,其危害内在于图像本身,与谁提出、为何提出无关:

  • 涉及未成年人的性内容。没有任何语境能让它变得可接受;没有任何专业流程需要它。
  • 真实人物的非自愿私密影像。伤害落在一个从未同意的人身上,而下架并不能撤销它。
  • 定向骚扰与诽谤性捏造 — 让某个指名道姓的人看上去做了他们没做过的事。
  • 可用于伪造的证件级文件 — 护照、身份证、钞票、印章和金融票据,做得足以以假乱真。
  • 具有欺骗性的合成证据 — 捏造的真实事件影像,被当作记录而不是插图来呈现。

这份清单很短,而且有结构:危害存在于成品之中、存在于它与某个真实人物或文件的相似之中,以及存在于它被当作真相来呈现之中。注意没有被列进去的是什么 — 裸体、血、武器、历史暴行、政治嘲讽。那些恰是医学、新闻、艺术、法医与讽刺的原材料,而把它们当成危害类别的过滤器,实际上是在推行一套关于哪些题材才体面的、宽泛得多的观念。

Shannon 禁止上面清单里的一切,写在一份公开的负责任使用政策里,写明类别与后果,而不是一张连“placenta”也一并拦下的关键词表。前者是一条你能读到、并据以要求我们负责的规则;后者是一个你看不见的分类器对你意图的猜测。

03过度拒答问题有多大?研究测到了什么

直到不久之前,图像模型的过度拒答还只是一种坊间说法 — 成千上万人有同样的经历,却没有办法衡量它的规模。OVERT(OVEr-Refusal evaluation on Text-to-image models)改变了这一点:它由加州大学伯克利分校的一个团队在 ICML 2025 上发表,成员包括 Ziheng Cheng、Somayeh Sojoudi、Xuandong Zhao、Dawn Song 和 Song Mei,是首个衡量文生图系统多频繁地拒绝完全无害提示词的大规模基准。

4,600
无害提示词
9
安全类别
1,785
有害对照
ICML
2025

它的设计很关键。那 4,600 条提示词被刻意做成看起来有害而实际无害 — 就是一个真实专业请求提到手术刀、瘀伤或抗议时的样子 — 而 1,785 条真正有害的提示词与之并列作为对照,因此模型无法靠一律拒绝拿高分。九个类别涵盖个人隐私与公众人物隐私、版权、歧视、自我伤害、性内容、非法活动,直到暴力。

主要结论是:过度拒答在各个类别、各主流模型中普遍存在。第二个结论对那个标准的绕行办法打击更大:作者们测试了把改写提示词作为缓解手段,并报告说它“往往会损害对原始提示词含义的忠实度”。你可以通过改变自己的诉求来绕过过滤器,但那之后你手里的已经不是你原本要的东西了。

一项更聚焦的研究从像素这一侧得出了同样的结论。在《An Art-centric perspective on AI-based content moderation of nudity》(Riccio、Curto、Hofmann 与 Oliver,ECCV 2024 的 AI4VA 研讨会)中,作者在艺术裸体上评估了三个生产环境中的 NSFW 分类器,发现了性别偏差风格偏差:对一幅人体习作的判定,取决于画的是谁的身体、用的是什么风格。这是把每个写生画家都被告知“纯属想象”的那件事,用测量说了出来。

04带过滤的绘图工具会拦下的八类正当工作

在这些类别里,过度拒答不是不便,而是停工。凡有具体的公开报道案例就注明出处;没有核实到的,就只描述类别,不编造事件。

1. 医学与解剖插画

这一领域中记录最完整的案例。2023 年 4 月,The Intercept(Debbie Nathan)报道称,Midjourney 封禁了包括 speculum、placenta、cervix、vulva、fallopian tubes、mammary glands、uterine、urethra、hymen、sperm、condom 和 IUD 在内的解剖学词汇,而 DALL·E 2 则以内容政策提示拒绝了“pills used in medication abortion”。这一模式是由临床数据分析师 Julia Rockwell 发现的 — 她当时想生成一张胎盘图片,作为送给一位细胞生物学家朋友的礼物 — 并报告给了MIT Technology Review。这种不对称就是破绽:“stethoscope”能正常生成,而“speculum”被禁止。华盛顿大学研究者 Bill Howe 称这些过滤器“笨手笨脚”,并表示它们使得“关于生殖的科学讨论基本不可能进行”。患者教育、手术图谱和护理课程都需要准确地描绘身体,包括那些被关键词表判定为不雅的部位。

2. 法医与事故重建

碰撞重建、起火点分析和法庭演示材料,都需要以临床级的准确度描绘损伤、伤口和暴力力学。一个被调校成拒绝“血”或“枪伤”的过滤器,拒绝的是整个学科:语境 — 一份专家报告、一份保险卷宗 — 对分类器来说是不可见的;而恰恰是让这类图像具备可采性的那种中立性,使它在分类器眼里读作血腥。

3. 人体艺术与写生

裸体是世界各地美术的基础题材,人体习作是美术教育的核心。上面那项 ECCV 2024 的结果,正是艺术家们所反映情况的测量版本:分类器无法可靠地把人体习作与色情区分开,而且它们的错误还带有性别与风格上的偏差 — 一个过滤器对它本应识别的那个传统下手最狠。

4. 历史与战时图像

教材插图、博物馆阐释和纪念项目都需要描绘军服、武器、营地、战役与暴行。2024 年 2 月的 Gemini 事件很有启发性,因为它的失败方向恰好相反,造成的损害却同样大。在模型生成了包括纳粹时期德国士兵在内的、种族构成被重新编排的历史群体形象之后,Google 于 2024 年 2 月 22 日暂停了 Gemini 生成人物图像的能力。CEO Sundar Pichai 称这些输出“完全不可接受”;高级副总裁 Prabhakar Raghavan 承认模型“矫枉过正”,变得“过度保守”。看不见语境的安全措施并没有让历史图像更安全 — 它让历史图像变成了假的,而对一家历史类出版商来说,那更糟。

5. 虚构作品中的暴力与影视预演

分镜、概念图、漫画和游戏设计描绘暴力,理由和小说与电影一样。一个分不清恐怖分镜与威胁的过滤器,会把整条叙事艺术生产线都当作可疑对象 — 尽管分镜明确地就是非真实的东西,它是演员与特效团队将要搬演的一场戏的方案。

6. 政治讽刺与社论漫画

对权势者的讽刺画,在多数民主国家属于受保护程度最高的言论类别之一,却往往是图像过滤器最先删掉的东西。记录最清楚的案例是 Midjourney 在 2023 年 4 月决定禁止生成中国国家主席习近平的图像,并在提示词中屏蔽他的名字 — 由 PetaPixelDecrypt 等媒体报道 — 同时继续允许生成其他国家领导人。创始人 David Holz 在 Discord 上解释说,公司希望“把风波降到最小”,并称“中国人能用上这项技术,比你们能生成讽刺内容更重要”;来自个人权利与表达基金会的 Sarah McLaughlin 称之为审查。无论你如何评价其中的商业算计,这一机制值得点明:一项国别性的言论限制,被施加到了全世界的每一个用户身上,因为一个全球性的过滤器只有一档设置。

7. 安全研究与钓鱼防范材料

安全团队制作的培训材料,必须看起来像它所警告的那种东西:一个足够逼真的伪造登录页、一张仿冒发票、一个贴在停车计时器上的恶意二维码。对分类器来说,这与它所要免疫的那种攻击无法区分 — 逼真本身就是目的 — 于是过滤器对防守与进攻一视同仁地拦截,反而让攻击者占了便宜,而攻击者本来也压根不会去用一个带过滤的消费级工具。

8. 权利人被拒绝生成自家品牌、产品或肖像的图像

版权与商标过滤并不核查所有权;它核查的是相似度。一家公司很难生成自家 logo 或产品的图像,一个权利人无法为自己的角色出图,人们也常常无法生成自己的脸,因为肖像过滤器认的是可辨识度,而不是是否获得同意。OVERT 把“版权侵犯”列入它的九个过度拒答类别之一,正是因为这类误判太常见了。面对一个问题 — 你对此拥有权利吗? — 过滤器是一件粗糙的工具,因为它根本无从发问。

以上八类中有四类锚定在具体的公开案例上(医学、人体艺术、历史、讽刺),第八类则锚定在 OVERT 的版权类别上。法医、虚构预演与安全意识材料是作为类别陈述的:它们是众所周知会受影响的专业工作类型,但我们没有核实到具体的公开报道事件。

去核对原始来源

上面每一个有据可查的案例都是公开且可独立核实的。请自己去读,而不要只信我们的转述。

05AI 绘画工具为什么总拦错东西,以及内容过滤的误判为何调不掉

面对过度拦截,本能的反应是“把阈值放松一点”。这行不通,原因是结构性的,而不是因为大家不够努力。

这些类别在信号上重叠,在现实中并不重叠。手术插图与色情共享裸体。法医重建与血腥共享血。防范培训幻灯片与钓鱼工具包共享一个伪造登录表单。讽刺漫画与诽谤性捏造共享一位可辨认的政治人物。区分每一对的是目的与呈现方式 — 而这既不在提示词里,也不在像素里。当两个群体占据输入空间的同一区域时,没有任何阈值能把它们分开;移动阈值只是把一种错误换成另一种。Gemini 事件展示的正是这一点:一次意在修复某个失败的干预,制造出了另一个失败,用 Google 自家高级副总裁的话说就是“矫枉过正”。

代价的不对称针对的是运营方,而不是你。一个放过一张坏图的过滤器会引来一篇新闻报道。一个拦下一万张正当图片的过滤器换来的是沉默,因为被拒绝的用户不会组织起来 — 他们只是放弃。在这种不对称下,风险管理会永久地收敛到过度拦截。而且由于底层的判断本身就不可能做到,黑名单会随着一次次事件不断堆积字面字符串,于是就出现了“stethoscope”没事而“speculum”被禁的情形。没有人决定过女性专用器械更危险;名单只是在投诉落下的地方生长。它编码的是一家运营方的公关历史,而不是一套关于危害的理论。

最严格的司法辖区成了全球默认值。一个过滤器服务于每个国家的每个用户,因此为某一个市场加上的限制会被输出到所有市场 — 习近平那条规则就是教科书式的例子。而且改写你的提示词会毁掉你的本意,这正是 OVERT 的实验要点:每一位为了通过过滤器而把请求洗成委婉说法的专业人士,都已经亲手验证过它。你没有赢;你只是将就了。

这一切都不是免费的,而且因为它是静悄悄地失败,这份代价在运营方所关注的指标里根本看不见。被拒绝得够多之后,你就不再提问了,你会预先把每一条提示词都收窄到你估计能通过的范围;那句最终通过的委婉说法,产出的图像接近但并不是你的文档所需要的。一条笼统的政策提示不会告诉你是哪一层被触发的,于是你只能猜了再试 — 而图像工作是迭代的,因此一个每五次拦下一次的过滤器打断的是整个循环,而不只是让它变慢。与此同时,那些最有资格要求专业工具的领域,得不到复核人、得不到申诉渠道,通常也拿不到一份公开的拦截清单。一条你读不到的规则不是规则;那是天气。

06无审查与带过滤的 AI 绘图工具:究竟改变了什么

这里是这份对比的如实版本,包括一个无过滤系统不能给你什么。

维度带过滤的绘图工具无过滤(Shannon)
由谁决定一个读词与像素的分类器一个读完整提示词的人
你何时得知提交之后 — 有时是付费之后在任何东西渲染或计费之前
规则是什么不公开、不断变动的黑名单一份公开的负责任使用政策
专业语境对系统不可见由你掌握,也由你负责
失败模式静默的过度拦截,含义漂移你要什么就得到什么 — 包括错误在内
谁承担风险厂商,并把它转嫁到你的工作上共担:运营方政策加上用户问责

最后一行是大家会跳过、却最要紧的一行。拿掉过滤器并不会拿掉第 02 节里的那些危害类别;它拿掉的是那台一直在对它们胡乱猜测的机器。义务还在原处,只是现在由两个能够对语境进行推理的主体承担:发布并执行政策的运营方,以及知道这张图是干什么用的你。无过滤的 AI 图像生成是给那些已经准备好为自己产出负责的人用的工具 — 外科图谱、专家报告、分镜、漫画 — 他们此前一直被一个分不清他们和别人的系统挡住。

07Shannon 做什么 — 以及不做什么

在这里,精确比热情更重要,尤其是对从 API 搜索过来的读者而言。

Generate
生成新图
Edit
编辑一张源图
Combine
合成两张或更多图
No
视频生成

它做什么

  • 生成。用任何语言、用日常说法描述一张图。无论你用什么语言提问,Shannon 都会自己用英文写出生成提示词。
  • 编辑一张图。正好一张源图 — 对话里已有的一张图,或者附在你当前消息上的一张 — 再加一条说明什么要变、什么不变的指令。输出会自动沿用源图的画幅比例。
  • 合成两张或更多图。换装、把物体放进场景、人物与人物并列、把产品放到人身上、用一张图的主体配另一张图的风格。提示词会按顺序点明每张图的角色,并且用的是真实图片,因此保留的是它们实际的外观,而不是重新描述一遍。
  • 画幅控制。square(默认)、portraitlandscapewidetall。你明确提出的要求永远优先。
  • 在我们自建的 GPU 集群上渲染,生成路径上没有内容过滤,写提示词的模型上也没有拒答层。

它不做什么

  • 没有视频。Shannon 不会让图片动起来,也不产出视频。这不是路线图上被含蓄藏起来的东西 — 它根本不存在。
  • 不在 API 上。图像生成、编辑与合成都在 Shannon 聊天应用里。/v1 API 提供的是文本与视觉 — 它能读取你发过去的图片 — 但它不渲染图片。
  • 不擅自出图。打招呼、提问或随手附上一张照片,都不会触发出图。让 Shannon 看一张图 — 描述它、读它、分析它 — 属于普通的视觉工作,不是生成,也不额外收费。

确认卡片

这就是取代过滤器的那套机制,而且它是一项设计选择,不是走过场。当 Shannon 判定你是在要一张图时,它会写出生成提示词,并在任何东西渲染之前把它展示在一张确认卡片上。你不确认,就不会生成,也不会计费。

就其本身优劣来对比这两种设计。过滤器用比你更少的信息去猜测你的意图,并悄无声息地执行这个猜测。确认卡片则在花掉任何算力之前,把这张图的字面规格摆在那个知道它派什么用场的人面前。它能抓住对你请求的误读,而过滤器从来做不到;它让你补上模型没写足的解剖精度或历史细节;它还让责任变得可读,而不是弥散的。你看过提示词,是你按下了那个按钮。

08无过滤生成提高了责任,而不是免除责任

这一节该放在这里而不是页脚,因为它是整个论证的一半。带过滤的绘图工具许下了一个它兑现不了的承诺:这个工具会替你阻止滥用。它在两个方向上都失败了 — 它拦下了外科医生,却拦不住一个铁了心的恶意行为者,后者本来就有别的路子,而且一直都有。它真正可靠地做到的,是让所有人都觉得责任已经在上游、由机器处理掉了。拿掉过滤器就拿掉了这层虚构;一张图该不该存在的问题,回到了能够回答它的人手里。

  • Shannon Lab LLC 的义务。一份公开、具体、点明禁止类别的负责任使用政策,而不是一张不公开的黑名单 — 这是你能读到、能引用、并据以要求我们负责的规则。
  • 你的义务。你知道用途、受众、司法辖区,以及画中每一个人的同意状态。工具不知道,分类器也永远做不到。确认卡片存在的意义,就是让这份知识在真正关键的那一刻,由掌握它的一方来运用。
  • 那条不会移动的界线。“过滤器没拦我”在任何媒介里都从来不是辩护理由。相机不会拒绝,铅笔不会拒绝;管辖使用的是法律与职业伦理,而不是工具本身。一个无过滤的绘图工具,只是恢复了其他每一件专业工具都适用的那套寻常安排。

动手之前请读一读负责任使用政策。它很短、很具体,也是这个产品中让其余部分站得住脚的那一部分。

09常见问题

AI 绘图工具为什么会拒绝一个明显正当的提示词?

因为大多数过滤器判断的是你提示词里的词,而不是你的目的。一个分类器挡在模型前面,既不知道你是谁,也不知道你为什么要问,于是医学插画师、法医分析师和心怀恶意的人打出同一个名词,收到的是同一句拒绝。The Intercept 在 2023 年 4 月报道,Midjourney 封禁了包括 speculum、placenta 和 cervix 在内的解剖学词汇,而 stethoscope 却能正常使用。

有没有研究测量过 AI 绘画工具中内容过滤的误判?

有。OVERT(arXiv:2505.21347,ICML 2025)是首个针对文生图模型的大规模过度拒答基准:涵盖九个安全类别的 4,600 条看起来有害但实际无害的提示词,外加 1,785 条真正有害的提示词作为对照。作者报告称,过度拒答在各主流模型中普遍存在。另一项 ECCV 2024 的研究发现,三个 NSFW 分类器在艺术裸体上的判定存在性别偏差与风格偏差。

无审查的 AI 绘图工具究竟改变了什么?

它把拒答层和内容过滤从生成路径上移除,因此一个正当请求不会被悄悄重新归类为攻击。它并没有取消判断 — 它把判断挪了位置。在任何东西渲染之前,Shannon 会用确认卡片把完整的生成提示词展示给你,于是这个决定由一个能看清将要产出什么的人做出,并受负责任使用政策约束。

Shannon 能生成视频吗?

不能。Shannon 生成新图片、编辑一张已有的图片,并把两张或更多图片合成一张。它不会让图片动起来,也不会产出任何形式的视频。

我能通过 Shannon API 生成图片吗?

不能。图像生成、编辑与合成都在 Shannon 聊天应用中。/v1 API 提供的是文本与视觉 — 读取并分析你提供的图片 — 而不是图像生成。

如果没有过滤器,靠什么防止滥用?

靠政策、问责,以及一个看得见的决策点,而不是一张关键词黑名单。Shannon 从不擅自出图,在渲染前展示完整提示词,你不确认就不计费,并在一份公开的负责任使用政策下运营,该政策禁止涉及未成年人的性内容、真实人物的非自愿私密影像、定向骚扰,以及伪造身份或金融文件。

去要你真正需要的那张图

聊天应用中的生成、单图编辑与多图合成 — 没有内容过滤,没有拒答层,提示词在任何东西渲染之前就在屏幕上。

开始聊天 负责任使用政策

图像功能在聊天应用中 · 没有视频生成 · 更多研究


来源:Cheng, Huang, Xu, Sojoudi, Zhao, Song & Mei — OVERT(arXiv:2505.21347,ICML 2025) · Riccio, Curto, Hofmann & Oliver — An Art-centric perspective on AI-based content moderation of nudity(arXiv:2409.17156,AI4VA @ ECCV 2024) · Debbie Nathan,The Intercept,2023 年 4 月 22 日 · PetaPixel,2023 年 4 月 3 日 · CNBC,2024 年 2 月 22 日。Shannon AI 由 Shannon Lab LLC(美国新墨西哥州)运营。

所有研究链接