Shannon 3,会审查自己答案的无审查 AI 模型
运行在我们自建 GPU 集群上的迭代推理循环:思考、起草、审查、重写。Lite 跑一遍,Pro 最多跑十遍,并主动去要它知道自己缺少的事实。
太长不看
Shannon 3 是一个由我们自建 GPU 集群提供服务的无审查 AI 模型系列。它的标志性特征是一轮对话的形态:模型先思考,写出一份草稿,然后对照自己的思考回读这份草稿,并重写其中站不住的部分。Lite(shannon-3)只做一遍思考加起草,以获得最低延迟。Pro(shannon-3-pro)跑完整循环,最多 10 轮,一旦某次审查通过草稿就立即停止;此外它还会针对一个更大的模型执行知识采集,补上它注意到自己缺失的事实。整个推理过程都是可见的,并且用你的语言书写。两个档位都支持视觉与文档输入。3.0 发布时的上下文为 32,768 个 token。
你用过的几乎每一个聊天模型都是在一次前向传播里作答的。它在知道最后一个 token 之前就选定了第一个 token,而一句话一旦输出就无法收回:模型可以在后文自相矛盾,却不能回头修改。当答案很短、问题只有一部分时,这运作得很好。当答案很长、问题有四个部分、而第六段悄悄推翻了第二段时,它就运作得很糟。Shannon 3 之所以存在,是因为我们不认为解决这个问题的办法是更大的模型。办法是让模型读一读自己刚写下的东西。
01Shannon 3 是什么
Shannon 3 是一个两档位的模型系列。两个档位都运行在我们自建的 GPU 集群上,而不是第三方推理 API;两者都是无审查的:前面没有拒答层,后面没有内容过滤器。档位之间的差别在于,在答案送达你之前,一轮对话被允许做多少工作。
在 API 上,这两个档位就是普通的模型 id。没有特殊端点,没有单独的 SDK,也没有定制的请求格式:
| 档位 | 模型 id | 一轮的形态 | 适合场景 |
|---|---|---|---|
| Shannon 3 Lite | shannon-3 | 一遍思考 + 起草 | 聊天、起草、查询、高吞吐 |
| Shannon 3 Pro | shannon-3-pro | 完整循环,最多 10 遍,外加知识采集 | 分析、长文、对正确性敏感的工作 |
02为什么单次前向传播不适合难题
从左到右生成文本的模型,做的是一连串不可撤销的局部决定。它没有橡皮擦。当它写到一段解释的第 400 个 token,才意识到自己选的框架错了,它只有两个选择:在错误的框架里继续写,或者追加一段更正 — 于是就产生了大家都认得的那种答案,写到一半来一句其实,回过头看上文,然后把两个互不相容的半截留给你去调和。
思维链改善了这一点,但没有解决它。先思考让模型在落笔成文之前有了计划,这是实打实的收益;可随后的草稿依然是一遍写成,依然未经阅读就交付。从来没有人问出那个人类编辑最先会问的问题:这个答案真的做到了思考里说要做的事吗?能在思维链之后依然存活下来的失败模式,是具体而可辨认的:
- 漏掉子问题。你问了四件事。思考里列了四件事。答案覆盖了三件。
- 计划漂移。推理确定了一种方案;行文却逐渐采用了另一种,而且找不出具体是哪一句开始跑偏的。
- 算术与单位。在思考里算对的数字,被誊写到答案里时出错;或者把按月的数字当成按年的呈现。
- 无视约束。你说了不要外部依赖;代码却 import 了一个,而思考在确认过这条约束之后再也没提起它。
- 自信的空白。模型在思考里说自己对某个具体事实没有把握,然后在答案里照样把它斩钉截铁地说出来。
上面每一条,读一遍草稿就能抓住。更小心地生成草稿,一条也抓不住。
03推理循环,逐阶段拆解
一次 Shannon 3 Pro 的对话轮次,是一个包含四个阶段和一个退出条件的循环。
思考
模型在给你写任何东西之前先把问题过一遍:拆解问题、记下约束、辨明自己知道什么、不知道什么,并确定方案。它在这里产出的内容,随后会成为衡量答案的标准。
起草
模型写出一份完整、真实的答案 — 不是提纲。它必须完整,因为下一阶段评估的是一件成品,而草图无法被审查出那些只在全长文本中才显现的失败模式。
审查
这是让这个系列成其所是的阶段。模型对照思考来读草稿 — 这比单独读草稿要严苛得多。问模型“这个答案好不好?”等于邀请它说好;而问“计划里说要在约束 C 下覆盖 X、Y 和 Z — 这段文字做到了吗?”,就给了它一个可证伪的检查对象。审查的产出是指出哪里错了,而不是打一个分数。
重写
被点名的问题会在一份新草稿中修好。这是重写,不是打补丁:如果一个修复需要重排论证顺序,那就允许重排论证顺序。新草稿会再送回审查。
停止
循环在第一次审查通过草稿时结束 — 这是正常退出,而且在大多数轮次里都远早于上限发生。10 轮的硬上限是为病态情况准备的,比如一个确实含混的问题,使得每次重写都只是用一个缺陷换掉另一个,从而保证一轮对话不会无限空转。
Lite 只取前两个阶段然后停下。它思考、起草,把草稿交给你。这是有意的产品决定,不是删减出来的意外:在很大一部分真实消息上,第一份草稿就是正确答案,为了被告知这一点而付出审查的延迟是一笔糟糕的交易。想让模型快,用 Lite;想让模型稳,用 Pro。
04Pro 的知识采集:与其猜,不如去问
自我审查能抓住矛盾、遗漏和违反约束,因为抓住这些所需的证据本来就在这一轮里。它抓不住模型压根不具备的事实。一个审查自己草稿的模型可以得出我对这个数字没有把握的结论,然后却无处可去。
Pro 给了它一个去处。在起草阶段前后,它会执行一次知识采集:识别出自己缺失或不确定的具体事实,就这些事实去询问另一个更大的模型,并把返回的内容融进改进后的答案。这是由模型自己点名的缺口所驱动的定向查询,而不是笼统地征求第二意见。
实践中有两点性质很重要。它是有范围的:采集只针对已识别的缺口发问,而不是把整个问题重问一遍,因此更大的模型是在能补充信息的地方被咨询,而不是在只会多出一种口吻的地方。它也是被整合的:采集来的事实会回到循环里,和其他一切一样接受同样的审查,而不是作为一段外挂的补充段落出现。
这如何改变了“不确定”
知识采集最有用的效果并不是让 Pro 知道得更多,而是让 Pro 的不确定变得可操作。一个只知道自己没把握的模型,只能在处处含糊和自信断言之间二选一。而一个能把“我对这点没把握”变成“那我去查一下”的模型,含糊的地方更少,具体的地方更多。
05推理过程是可见的,而且用你的语言
整个推理过程会在这一轮运行时展示给你:思考内容,以及在 Pro 上每一次审查及其提出的异议。这不是我们勉强容忍暴露出来的调试视图 — 它是你所购买价值的很大一部分,并且从三个具体方面改变了协作关系。
- 你可以及早叫停。如果思考误读了你的问题 — 这通常是提示含混的结果,而不是模型不好 — 你在最初几秒就会发现,而不是等到一份完整答案送来、却解决了错误的问题。
- 你可以把推理和答案分开审计。靠错误推理得到的正确答案是一种隐患,因为它撑不过下一个问题。
- 你能看见循环失败。当 Pro 烧掉好几轮迭代仍未收敛时,这会被显示出来而不是藏起来 — 而这是真实的信息,通常意味着问题本身设定得不够清楚。
推理过程是用你自己的语言书写的,而不是先用英文生成再在最后翻译。如果你用日语、阿拉伯语、土耳其语或葡萄牙语工作,模型就用那种语言推理 — 这让推理过程中的术语与答案中的术语保持一致,也避免了模型用一种语言思考、用另一种语言说话时出现的接缝。
06无审查:没有拒答层,没有输出过滤器
Shannon 3 出厂时没有拒答层,也没有输出内容过滤。拒答行为在产品的任何层级都不存在:不是在模型看到消息之前检查你输入的包装层,不是在你看到答案之前检查输出的分类器,也不是一种需要被反复劝说才肯放下的模型反射。这与人们说“无审查”时通常指的两种做法有实质区别:
| 做法 | 它做了什么 | 它如何失效 |
|---|---|---|
| 系统提示越狱 | 指示一个已对齐的模型表现得像未对齐 | 在长对话中逐渐衰减;一旦施压,拒答就回来了 |
| 移除输出过滤 | 不再拦截模型已经生成的文本 | 模型依然会写出含糊回避的文字 — 没有东西被拦截,是它压根就没写出来 |
| Shannon 3 | 没有拒答层可移除,也没有过滤器可关闭 — 这种行为本来就不存在 | 判断的责任完全落在你身上;模型不会替你拒绝 |
实际使用中,Shannon 3 处理的是你真正提出的那个问题,而不是它旁边那个更安全的问题:带真实反派的虚构作品、以技术层面而非新闻稿高度讨论的安全议题、直接给出的医疗、法律与金融信息并附上真正必要的提醒 — 结尾也不会附赠一段关于你为什么会这么问的说教。它同样不会稀释循环:一次审查完全可以说草稿是错的,这是一种与拒答不同、也更有用的反驳。
而缺少拒答层并不能让模型变得正确。无审查模型自信地说错话的能力与被审查的模型完全一样强,而且更加明显,因为它在没把握时不会退回到含糊其辞。这恰恰是支持循环的更好理由之一:在没有拒答反射挡路的情况下,自我审查做的是对专业用户真正重要的那部分安全工作 — 抓错误。你对本模型的使用仍受我们的负责任使用政策以及你所在地法律的约束。
我们不为 Shannon 3 公布任何基准分数,也不做与其他模型的正面比较。循环的收益是结构性的 — 它能抓住单遍生成抓不住的那几类错误 — 而我们宁愿把这个机制描述准确,也不愿给它挂上一个我们没有独立验证过的数字。以上内容描述的都是一轮对话实际做了什么;最快的验证方式,就是跑一轮,然后读推理过程。
07视觉、文档与图像生成
两个档位都接受图片和文档作为附件,并在这一轮里读取它们。一张构建失败的截图、一张拍下来的白板、一份原理图、一页扫描的合同或一个 PDF,都可以直接成为提问的对象,而不必先由你转录成文字。在 Pro 上,附件和其他一切一样参与循环:如果某次审查判定草稿回答的问题并没有图片支撑,那部分就会被重写。
图像生成与编辑在聊天中以工具形式提供,而不是模型的目的。Shannon 3 是一个能在对话需要时生成或编辑图片的推理模型,而不是一个挂了聊天界面的图像模型。这个区分能把预期摆正:按它如何思考来评判这个系列,而把出图看作省去一次切换的便利。
08上下文窗口,以及 3.x 这条线后来去了哪里
Shannon 3.0 发布时的上下文窗口是 32,768 个 token。这是如实的历史数字,值得明说,因为循环消耗上下文的方式和单遍模型不同:你的提示、你的附件、思考内容,以及每一轮草稿与审查,都活在同一份预算里。
32K 对大多数聊天和分析工作是宽裕的 — 一份长文档、一个规模可观的代码文件、一个细致的多部分问题,都还留得下循环运行的余地。但对真正大体量的输入就吃紧了,而这个限制正是下一个版本要解决的。Shannon 3.1 大幅提高了上下文窗口,也改变了这个循环可以指向什么;如果你今天在评估这个系列,请把那篇文章作为第二篇来读,并把这里的数字当作历史。
09从 API 调用 Shannon 3
Shannon 3 在我们三种 API 方言上都可用,模型相同,且都支持流式输出:
| 方言 | 端点 | 什么时候用它 |
|---|---|---|
| OpenAI 兼容 | /v1/chat/completions | 你已有 OpenAI 客户端代码 — 改一下 base URL 和模型 id 即可 |
| Anthropic 兼容 | /v1/messages | 你的技术栈围绕 Messages 格式构建 |
| Responses | /v1/responses | 你想用更新的请求/响应形态 |
把 shannon-3 或 shannon-3-pro 作为模型 id 传入。客户端这边有两件事值得提前规划。Pro 的一轮更耗时,而且时长不固定,因为迭代次数取决于问题 — 超时要按上限而不是平均值来设,并且优先使用流式,让用户看到进展而不是一个转圈图标。以及推理过程是你可以选择展示的内容;在用户等待的场景里,展示通常比隐藏更好,因为它把死等的时间变成了可读的东西。请求与响应结构、流式细节以及在线调试台见 API 文档。
10如何选择档位
Pro 的循环所值回的延迟,与有多少东西可能出错成正比。
| 你的任务 | 档位 | 原因 |
|---|---|---|
| 简单事实性提问,回答很短 | shannon-3 | 第一份草稿就是答案,审查无错可抓 |
| 高吞吐或受延迟约束的自动化 | shannon-3 | 可预测的单轮耗时才是硬约束 |
| 带约束的多部分分析 | shannon-3-pro | 漏掉子问题和违反约束,正是审查擅长抓的 |
| 必须自洽的长文写作 | shannon-3-pro | 内部矛盾是全长文本才有的属性,起草时看不见 |
| 任何你会据以行动的数字 | shannon-3-pro | 审查会对照思考复核算术与单位 |
| 触及模型知识边缘的问题 | shannon-3-pro | 知识采集把点名的缺口变成一次查询 |
一个实用的做法:在你还在琢磨该怎么问的阶段用 Lite,等问题定下来之后再用 Pro 跑一次。这个循环值得付费的地方,是你真正想问的那一版问题。
11投入之前值得知道的局限
只列优点的模型卡是广告。以下是 Shannon 3 会让你失望的地方:
- Pro 更慢,而且慢得不可预测。两轮就收敛的一次对话,和跑满十轮的一次对话,墙钟时间可以差好几倍。如果你需要有界延迟,请用 Lite。
- 审查不是证明。模型检查自己的作业,也共享自己的盲区。循环能可靠地抓住思考与草稿之间的不一致;但它抓不住那些在思考本身中就被自信地固化了的错误。
- 上下文要与循环共享。在 32K 下,一份很长的输入再加上好几份全长草稿,对 3.0 是实打实的约束。抬高后的上限见 Shannon 3.1。
- 采集只能补上模型察觉到的缺口。它把“我对这点没把握”变成一次查询,这是真实的收益 — 但一个模型自信地弄错了的事实,永远不会被标记为缺失,因此也永远不会被采集。
- 无审查就是无审查。模型不会拒绝,也不会软化措辞。如果你的产品需要一条拒答边界,请把它建在你看得见的地方,而不是指望模型替你提供。
12常见问题
什么是 Shannon 3?
Shannon 3 是一系列运行在我们自建 GPU 集群上的无审查模型。它与众不同之处在于一轮对话的形态:它不是一次前向传播就作答,而是先思考、起草答案,然后对照自己的思考审查这份草稿并加以重写。它提供两个档位:shannon-3(Lite)和 shannon-3-pro(Pro)。
Shannon 3 Lite 和 Shannon 3 Pro 有什么区别?
Lite 只跑一遍思考加起草,延迟与普通模型相当。Pro 跑完整循环,对每一份草稿进行审查和重写,最多 10 轮,一旦某次审查通过就立即提前结束。Pro 还会执行知识采集:把自己识别出的缺失事实拿去询问另一个更大的模型。
Shannon 3 真的是无审查的吗?
是的。Shannon 3 出厂时没有拒答层,也没有输出内容过滤。拒答行为并不存在于模型本身,因此不会像用提示词扮演出来的人格那样,在长对话进行到一半时悄悄回归。使用该模型仍然受我们的负责任使用政策以及你所在地法律的约束。
审查循环真的能让答案变好吗?
在单遍生成结构性薄弱的地方帮助最大:结尾与开头自相矛盾的长答案、被悄悄漏掉某一部分的多问题提问、算术与单位错误,以及无视既定约束的代码。在简短查询上帮助最小,因为第一份草稿本身就是答案。这正是 Lite 存在的理由。
如果审查一直不通过草稿会怎样?
循环会在 10 轮的上限处停止,返回它所达到的最佳草稿,而不是无限空转。由于推理过程是可见的,你还可以读到那些始终没有被解决的异议 — 这通常意味着问题本身足够含混,以至于每次重写都只是用一个缺陷换掉另一个缺陷,也是一个提示:该换个说法重新提问了。
Shannon 3 能读图片和文档吗?
可以。两个档位都接受图片和文档附件,并在这一轮里读取它们,因此截图、图表、扫描页或 PDF 本身就可以成为提问的对象,而不必先由你转录成文字。聊天中也提供图像生成与编辑,但那是模型可以调用的一个工具,而不是它的目的。
我能看到模型的推理过程吗?
可以。推理过程会在这一轮运行时实时展示,并且用你自己的语言书写,而不是最后从英文翻译回来。在 Pro 上你能看到每一轮审查,因此模型抓住自己错误的时刻是可见的 — 它没抓住的时候同样可见。
Shannon 3 发布时的上下文窗口是多大?
Shannon 3.0 发布时的上下文窗口为 32,768 个 token,由你的提示、任何附件、推理过程和答案共同分享。Shannon 3.1 提高了这个数字;当前数值请参见 Shannon 3.1 的文章。
自己试试这个循环
同一个问题问两遍 — 一遍用 Lite,一遍用 Pro — 看看审查改变了什么。
开始聊天 阅读 API 文档shannon-3 · shannon-3-pro · 三种 API 方言均支持流式输出
Shannon 3 由 Shannon Lab LLC(美国新墨西哥州)运营。此处的数字描述的是 3.0 发布时的配置;当前限制请见 Shannon 3.1 模型卡,系列其余部分见研究索引。我们不为 Shannon 3 公布基准分数,也不做任何比较性的性能主张。