Shannon 3.1
Vẫn vòng lặp lý luận đó, chuyển sang cụm GPU của riêng chúng tôi: thông minh hơn 32%, nhanh gấp 10-15 lần, và cửa sổ ngữ cảnh 196,608 token.
Tóm tắt nhanh
Shannon 3.1 giữ lại mọi thứ khiến Shannon 3 đáng dùng — vòng lặp lý luận lặp, không lớp từ chối, không lọc đầu ra — và thay đổi nơi cũng như cách nó chạy. Mô hình giờ được phục vụ từ cụm GPU của riêng chúng tôi thay vì một nhà cung cấp suy luận bên thứ ba. Đánh giá của Shannon Lab đo được mức cải thiện 32% về trí tuệ và phản hồi nhanh gấp 10-15 lần so với Shannon 3.0. Cửa sổ ngữ cảnh tăng từ 32,768 lên 196,608 token. Lớp điều tiết vốn cố ý làm chậm đầu ra của 3.0 đã biến mất: 3.1 stream ở tốc độ tối đa của engine. Model id là shannon-3.1 và shannon-3.1-pro, có trong chat và trên cả ba phương ngữ API.
Phần lớn bản phát hành mô hình đòi bạn tin vào một tuyên bố năng lực rồi chờ một bảng benchmark phân định đúng sai. Bản này dễ kiểm chứng hơn: mở hai tab, đưa cùng một prompt vào shannon-3 và shannon-3.1, rồi quan sát. Khác biệt về tốc độ câu trả lời xuất hiện không hề tinh vi, và cũng không phải mẹo hiển thị. Shannon 3.0 bị bóp tốc độ có chủ đích. Shannon 3.1 thì không.
01Điều thực sự thay đổi trong Shannon 3.1
Shannon 3.0 giới thiệu thứ định nghĩa cả dòng mô hình này: một vòng lặp lý luận lặp. Mô hình không trả lời bằng ý nghĩ đầu tiên. Nó suy nghĩ, phác thảo, rà soát bản nháp của chính mình đối chiếu với câu hỏi, rồi cải thiện nó. Lite chạy một lượt của vòng lặp đó; Pro chạy toàn bộ vòng lặp, bao gồm một bước thu hoạch kiến thức trước khi phác thảo. Thiết kế đó được mô tả chi tiết trong bài nghiên cứu Shannon 3, và không có phần nào trong đó thay đổi ở 3.1.
Thứ thay đổi là bộ máy bên dưới. Shannon 3.0 được phục vụ qua một nhà cung cấp suy luận bên thứ ba — một cách hợp lý để ra mắt một mô hình, và một cách đầy ràng buộc để vận hành nó. Bạn thừa hưởng cấu hình phục vụ của người khác, hàng đợi của người khác, trần ngữ cảnh của người khác, và quan niệm của người khác về việc bạn được phép có bao nhiêu token mỗi giây. Shannon 3.1 chạy trên cụm GPU của riêng chúng tôi, trên một ngăn xếp phục vụ do chúng tôi cấu hình, và mọi con số nổi bật trong bài viết này đều là hệ quả của quyết định duy nhất đó.
| Shannon 3.0 | Shannon 3.1 | |
|---|---|---|
| Nơi chạy | Nhà cung cấp bên thứ ba | Cụm GPU của riêng chúng tôi |
| Cửa sổ ngữ cảnh | 32,768 | 196,608 |
| Streaming đầu ra | Điều tiết / giới hạn tốc độ | Tốc độ tối đa của engine |
| Trọng số | Mặc định của nhà cung cấp | NVFP4 4-bit |
| Giải mã | Tiêu chuẩn | Suy đoán |
| Vòng lặp lý luận | Suy nghĩ → phác thảo → rà soát → cải thiện | Không đổi |
| Lớp từ chối | Không có | Không có |
| Model id | shannon-3, shannon-3-pro | shannon-3.1, shannon-3.1-pro |
02Vì sao Shannon 3.1 cho cảm giác nhanh gấp 10-15 lần
Con số tốc độ là thứ người ta hỏi đầu tiên, nên đáng để nói chính xác nó đến từ đâu. Có hai đóng góp độc lập, và đóng góp lớn hơn lại là đóng góp kém hào nhoáng hơn.
Chúng tôi đã gỡ bỏ cổng tốc độ
Đầu ra của Shannon 3.0 đi qua một lớp điều tiết. Token rời khỏi engine, bị giữ lại, rồi được nhả về kết nối của bạn theo một lịch trình. Đây không phải tai nạn hay lỗi. Khi một hạ tầng suy luận dùng chung là điểm nghẽn, việc điều tiết đầu ra làm phẳng tải, ngăn một lần sinh dài độc chiếm một slot, và khiến luồng đến theo nhịp đều đặn, dễ đọc thay vì bùng nổ từng đợt. Đó là một lựa chọn kỹ thuật có thể biện minh, và nó lấy đi thời gian thực của mọi người dùng trong từng câu trả lời.
Shannon 3.1 không có cổng tốc độ và không có điều tiết hiển thị. Token được ghi vào luồng của bạn ngay khi engine tạo ra chúng. Nếu engine đang sinh nhanh, bạn thấy nó sinh nhanh. Không có bộ đệm làm mượt nào nằm giữa mô hình và terminal, cửa sổ chat, hay bộ đọc SSE của bạn. Với một câu trả lời dài — một phân tích 2,000 token, một file mã được sinh ra — riêng điều này đã chiếm phần lớn mức cải thiện mà bạn sẽ nhận thấy.
Một hệ quả cần nói thật: luồng bây giờ bùng theo đợt. Giải mã suy đoán (bên dưới) phát ra các token được chấp nhận thành từng chuỗi ngắn, nên văn bản có thể đến theo khối nhìn thấy được thay vì theo nhịp đều đặn từng chữ một. Nếu bạn đã xây giao diện quanh nhịp mượt của 3.0, nó vẫn hoạt động — thứ tự và nội dung token không đổi — nhưng bạn có thể muốn thêm lại hiệu ứng làm mượt phía client nếu thích kiểu máy đánh chữ. Chúng tôi nghĩ hầu hết mọi người thà lấy lại số giây đó.
Bản thân engine cũng nhanh hơn
Gỡ cổng chỉ có ích nếu thứ đứng sau cổng đủ nhanh. Đóng góp thứ hai là ngăn xếp phục vụ được mô tả ở mục 03: trọng số NVFP4 4-bit và giải mã suy đoán trên các bộ tăng tốc thế hệ hiện tại, hỗ trợ FP4 nguyên bản, trong cụm của riêng chúng tôi. Cùng nhau, chúng nâng cái trần mà việc gỡ cổng vừa để lộ ra.
Độ trễ phản hồi tương đối từ đầu đến cuối, đánh giá nội bộ của Shannon Lab, tháng 9 năm 2026. Khoảng dao động phản ánh độ dài prompt và bậc mô hình: prompt ngắn trên Lite nằm gần đầu thấp, các lần sinh dài trên Pro nằm gần đầu cao.
03Giải mã suy đoán thực sự làm gì
"Giải mã suy đoán" hay bị dùng như một từ khóa tiếp thị, nên đây là cơ chế, nói thẳng.
Một mô hình ngôn ngữ thông thường tạo ra một token mỗi lượt truyền xuôi. Lượt đó bị chi phối không phải bởi phép tính mà bởi băng thông bộ nhớ — trọng số phải được đọc thì mới tính được gì, và việc đọc chúng mất thời gian lâu hơn nhiều so với phép toán. GPU dành phần lớn thời gian chờ bộ nhớ trong khi các đơn vị tính toán nằm không. Sinh ra 500 token nghĩa là trả cái độ trễ đó 500 lần, một cách tuần tự.
Giải mã suy đoán tấn công vào phần tuần tự. Một mô hình nháp nhỏ và rẻ đề xuất một chuỗi ngắn các token tiếp theo có khả năng cao — chẳng hạn bốn hoặc tám token. Mô hình chính sau đó đánh giá toàn bộ chuỗi đó trong một lượt truyền xuôi theo lô, tốn kém chẳng hơn bao nhiêu so với đánh giá một token, vì phần đắt đỏ (đọc trọng số) chỉ xảy ra một lần trong cả hai trường hợp. Mọi token được đề xuất mà mô hình chính đồng ý đều được chấp nhận và phát ra ngay lập tức. Tại điểm bất đồng đầu tiên, chuỗi bị cắt và giải mã thông thường tiếp tục từ đó.
Đặc tính quan trọng
Giải mã suy đoán bảo toàn đầu ra. Bước xác minh được xây dựng sao cho chuỗi được chấp nhận có phân phối đúng như việc lấy mẫu của chính mô hình chính. Bạn không nhận được câu trả lời của mô hình nháp, và cũng không nhận được một xấp xỉ của câu trả lời từ mô hình lớn. Bạn nhận được đầu ra của mô hình chính, chỉ là đạt tới nó qua ít bước tuần tự hơn. Mô hình nháp chỉ có thể ảnh hưởng đến tốc độ, không bao giờ đến nội dung.
Tỷ lệ chấp nhận là thứ gánh vác công việc. Với văn bản dễ đoán — mã khuôn mẫu, cấu trúc code, phần liên kết của một lập luận — mô hình nháp đoán trúng và cả chuỗi dài được chấp nhận cùng lúc. Với những token thực sự khó, tỷ lệ chấp nhận giảm và hệ thống suy giảm êm ái về giải mã từng token như thường lệ. Đó chính là sự bất đối xứng bạn muốn: nó tăng tốc những phần dễ và không đụng tới những phần khó.
Vì sao trọng số 4-bit thuộc về cùng một đoạn văn
Vì điểm nghẽn là băng thông bộ nhớ, thu nhỏ trọng số là một đòn bẩy tốc độ trực tiếp, chứ không chỉ là chuyện dung lượng bộ nhớ. NVFP4 là một định dạng dấu phẩy động 4-bit với hệ số tỉ lệ theo từng khối mịn, và đó là thứ cho phép nó giữ được độ chính xác ở chỗ mà các sơ đồ lượng tử hóa số nguyên 4-bit cũ hơn đã đánh mất. Chỉ còn khoảng một phần tư số byte phải đọc mỗi lượt truyền xuôi nghĩa là thời gian chờ bộ nhớ giảm tương ứng, đồng thời để lại nhiều dư địa hơn hẳn cho KV cache ngữ cảnh dài mà một cửa sổ 196K đòi hỏi.
Hai yếu tố này nhân lên chứ không chỉ cộng vào nhau: ít byte hơn mỗi lượt, và ít lượt hơn cho mỗi token phát ra. Đó là điều khiến việc streaming không bị chặn, ở tốc độ tối đa, trở nên đủ rẻ để phục vụ thay vì là một khoản chi phí mà chúng tôi phải bù lại bằng điều tiết — vốn chính xác là việc mà lớp điều tiết đã làm trên 3.0.
04196,608 token: một cửa sổ lớn gấp 6 lần mở ra điều gì
Shannon 3.0 có cửa sổ 32,768 token: một phiên làm việc, chứ không phải một tài liệu. Khoảng 70-80 trang văn xuôi, trừ đi phần vòng lặp lý luận tiêu tốn cho việc suy nghĩ của chính nó, trừ đi system prompt của bạn, trừ đi cuộc hội thoại tính đến lúc đó. Công việc thật liên tục đâm vào bức tường ấy, và các cách lách — chia nhỏ, tóm tắt, truy xuất trên chính tài liệu của bạn — đều làm suy giảm đúng thứ bạn đang cố gìn giữ. 196,608 token là một hạng bài toán khác.
Cụ thể, đó là cỡ 400-500 trang văn bản tiếng Anh, hoặc một codebase cỡ trung cùng với test và README của nó, hoặc một năm ghi chú cuộc họp của một dự án, hoặc trọn bộ hợp đồng cùng mọi phụ lục — được giữ trong một cuộc hội thoại, có thể hỏi trong một câu hỏi, không có lớp chia nhỏ nào chen giữa bạn và tài liệu.
- Câu hỏi ở phạm vi toàn repository. Nạp mã nguồn vào và hỏi vì sao một lỗi lọt tới production, thay vì dán ba file mà bạn vốn đã nghi ngờ. Mô hình có thể tìm ra file mà bạn không nghĩ tới việc đưa vào.
- Phân tích tài liệu dài mà không cần truy xuất. Truy xuất là một bộ lọc trước có mất mát, quyết định mô hình được phép thấy gì. Ở mức 196K bạn thường có thể bỏ qua nó và để mô hình đọc mọi thứ, loại bỏ trọn một lớp lỗi trong đó đoạn văn đúng chưa bao giờ được truy xuất ra.
- Hội thoại giữ được tính mạch lạc. Một phiên làm việc dài không còn âm thầm đánh rơi chính phần mở đầu của nó. Các ràng buộc bạn đặt ở tin nhắn thứ ba vẫn còn hiệu lực ở tin nhắn thứ tám mươi.
- Chỗ cho vòng lặp lý luận. Việc suy nghĩ, phác thảo và rà soát của chính vòng lặp cũng tiêu tốn ngữ cảnh. Trên 3.0, các bước đó tranh giành ngân sách khan hiếm với tài liệu của bạn. Trên 3.1 chúng nằm gọn thoải mái, và đó là một phần lý do mức tăng chất lượng và mức tăng cửa sổ đến cùng lúc.
- Đầu vào hỗn hợp cỡ lớn. Hình ảnh, văn bản trích xuất từ tài liệu và mã nguồn trong cùng một lượt, không cần phân loại xem bạn đủ sức đưa vào cái nào.
Một lưu ý thành thật áp dụng cho mọi mô hình ngữ cảnh dài, kể cả của chúng tôi: một cửa sổ lớn là một sức chứa, không phải bảo đảm về sự chú ý đồng đều trên toàn bộ nó. Cấu trúc vẫn có ích. Đặt câu hỏi gần cuối, gắn nhãn cho tài liệu, và nói cho mô hình biết cần tìm gì đều cải thiện kết quả một cách đo được ở mức 150K token theo cách mà chúng đơn giản là không làm được ở mức 5K.
05Lite và Pro: shannon-3.1 và shannon-3.1-pro
Hai bậc khác nhau ở chỗ chúng chạy bao nhiêu phần của vòng lặp lý luận, và đó là khác biệt duy nhất có ý nghĩa khi bạn chọn giữa chúng.
| shannon-3.1 (Lite) | shannon-3.1-pro (Pro) | |
|---|---|---|
| Lý luận | Một lượt duy nhất | Toàn vòng lặp + thu hoạch kiến thức |
| Tự rà soát | Không | Có |
| Cửa sổ ngữ cảnh | 196,608 | 196,608 |
| Streaming | Tốc độ tối đa, không bị chặn | Tốc độ tối đa, không bị chặn |
| Thị giác & tài liệu | Có | Có |
| Công cụ tạo ảnh | Có | Có |
| Phù hợp nhất cho | Hầu hết công việc, khối lượng lớn | Câu hỏi khó, bản nháp đầu chưa đủ |
Hãy dùng Lite làm mặc định. Một lượt của một mô hình lý luận tốt xử lý được đại đa số yêu cầu thực tế, và trên 3.1 nó đủ nhanh để vòng lặp không còn là thứ bạn phải ngồi chờ. Hãy chuyển sang Pro khi câu hỏi thuộc loại mà câu trả lời đầu tiên thường sai theo một cách đáng học hỏi: đánh đổi kiến trúc, phân tích đối kháng, bất cứ thứ gì bạn muốn một đồng nghiệp giỏi ngủ một đêm rồi hãy trả lời. Bước tự rà soát của Pro không phải để trang trí — đó là mô hình tự tìm ra lỗi của mình trước khi bạn phải làm việc đó.
06Mức tăng 32% về trí tuệ, và cách đọc con số đó
Đánh giá nội bộ của Shannon Lab đặt Shannon 3.1 ở mức cải thiện 32% về trí tuệ so với Shannon 3.0. Chúng tôi muốn nói rõ đó là gì và không phải là gì.
Đó là con số của chúng tôi, từ bộ đánh giá nội bộ của chúng tôi, đo trên các tác vụ mà chúng tôi cho là đại diện cho những gì người dùng thực sự mang đến cho các mô hình này. Đó không phải là một benchmark của bên thứ ba, và chúng tôi không dựng một bảng xếp hạng quanh một chỉ số tổng hợp nội bộ hay công bố phân tách theo từng benchmark — một bảng phân tách hàm ý một mức độ so sánh được với bên ngoài mà một bộ đánh giá nội bộ không có.
Điều chúng tôi sẽ nói là mức tăng đó đến từ đâu, vì phần đó không hề bí ẩn. Cửa sổ ngữ cảnh lớn hơn nghĩa là ít tài liệu bị vứt bỏ hơn trước khi mô hình lý luận trên đó, và phần lớn cái vẻ kém thông minh trong các phiên dài thực ra chỉ là chứng hay quên. Một ngăn xếp phục vụ do chúng tôi kiểm soát nghĩa là mô hình chạy với cấu hình chúng tôi dự định thay vì mặc định của nhà cung cấp. Và vòng lặp lý luận — không đổi về thiết kế — giờ có chỗ để thực sự chạy bên trong cửa sổ thay vì bị ép vào cái trần 32K mà nó phải chia sẻ với đầu vào của bạn.
Benchmark hữu ích nhất với bạn là benchmark của chính bạn. Lấy một prompt từ khối lượng công việc thật của bạn — không phải câu đố, mà là việc thật — rồi chạy nó trên shannon-3 và sau đó trên shannon-3.1. So sánh câu trả lời, và bấm giờ chúng. Con số của chúng tôi mô tả trung bình trên một bộ tác vụ; prompt của bạn mới là thứ phải tốt lên.
07Thị giác, tài liệu và tạo ảnh
Shannon 3.1 đọc được hình ảnh và tài liệu. Ảnh chụp màn hình, sơ đồ, ảnh chụp, trang quét, PDF và tài liệu văn bản đều có thể đưa vào cuộc hội thoại và được lý luận cùng với mọi thứ khác. Kết hợp với cửa sổ 196K, đây là điều khiến các quy trình làm việc trên trọn tài liệu trở nên khả thi: một báo cáo dài cùng các biểu đồ của nó trong một lượt, không cần quyết định trước mô hình được phép xem những trang nào.
Tạo ảnh và chỉnh sửa ảnh có sẵn trong chat dưới dạng một công cụ. Bạn yêu cầu một tấm ảnh và mô hình gọi công cụ ngay trong dòng hội thoại, trong cùng cuộc trò chuyện, với ngữ cảnh của mọi thứ đã bàn đến lúc đó. Chỉnh sửa cũng hoạt động theo cách như vậy — đưa cho nó một tấm ảnh, mô tả thay đổi bạn muốn. Không có chế độ riêng nào phải chuyển sang và không có giao diện riêng nào phải học.
08Gọi Shannon 3.1 từ API
Shannon 3.1 có sẵn trên cả ba phương ngữ API, với streaming trên từng phương ngữ. Cùng những mô hình đó, ba dạng request — chọn cái nào khớp với SDK bạn đang có.
| Endpoint | Dạng | Streaming |
|---|---|---|
| /v1/chat/completions | Tương thích OpenAI | Có |
| /v1/messages | Tương thích Anthropic | Có |
| /v1/responses | Responses | Có |
{
"model": "shannon-3.1",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarize this contract set and flag anything unusual." }
]
}
Đổi "shannon-3.1" thành "shannon-3.1-pro" để chạy toàn bộ vòng lặp lý luận. Nếu bạn đã đang gọi shannon-3, việc chuyển đổi chỉ là model id và không gì khác: dạng request và response không đổi, và các client streaming hiện có vẫn hoạt động. Khác biệt hành vi duy nhất cần lường trước là luồng bùng theo đợt đã mô tả ở mục 02 — cùng token, cùng thứ tự, đến sớm hơn và theo các khối kém đều đặn hơn.
Tham chiếu đầy đủ về tham số, xác thực, ngữ nghĩa lỗi và một playground tương tác nằm trong tài liệu API. Các thẻ mô tả mô hình khác và bài viết kỹ thuật nằm trong nghiên cứu Shannon.
09Vẫn không kiểm duyệt, và không đổi ở điểm đó
Shannon 3.1 không có lớp từ chối và không lọc nội dung đầu ra. Đây vẫn là lập trường như phần còn lại của dòng Shannon và nó không thay đổi khi chuyển sang cụm của riêng chúng tôi — nếu có gì khác, việc kiểm soát ngăn xếp phục vụ còn giúp bảo đảm điều đó dễ hơn, bởi không có nhà cung cấp trung gian nào với chính sách riêng của họ nằm giữa mô hình và bạn.
Đáng nói thẳng vì đó là điều hiển nhiên người ta sẽ thắc mắc về một bản phát hành đã thay đổi toàn bộ đường đi của đầu ra: gỡ bỏ lớp điều tiết không có nghĩa là chèn một lớp kiểm duyệt vào chỗ của nó. Không có gì kiểm tra, viết lại hay chặn luồng. Thứ mô hình tạo ra chính là thứ đến nơi. Theo hiểu biết của chúng tôi, Shannon 3.1 là mô hình AI không kiểm duyệt nhanh nhất hiện có với cửa sổ ngữ cảnh cỡ này — và hai đặc tính đó có liên quan với nhau, vì cả hai đều đến từ việc vận hành hạ tầng của chính mình thay vì thuê năng lực đã được đẽo gọt theo khuôn tuân thủ của người khác.
Không kiểm duyệt không đồng nghĩa với không chịu trách nhiệm. Việc sử dụng được điều chỉnh bởi Chính sách Sử dụng Có Trách nhiệm của chúng tôi, và nghĩa vụ đi kèm với một mô hình sẵn sàng làm việc với tài liệu khó là bạn phải làm việc với nó một cách có trách nhiệm.
10Tự chạy phép so sánh
Mọi tuyên bố ở đây đều có thể kiểm chứng trong khoảng hai phút, và chúng tôi thà bạn kiểm chứng còn hơn tin lời chúng tôi.
- Chọn một prompt từ công việc bạn thực sự làm. Càng dài càng tốt — nó thử thách cả cửa sổ ngữ cảnh lẫn streaming.
- Chạy nó trên
shannon-3. Ghi lại bao lâu thì có token đầu tiên, và bao lâu thì câu trả lời hoàn tất. - Chạy đúng prompt đó trên
shannon-3.1. Ghi lại đúng hai con số ấy. - Rồi đọc cả hai câu trả lời, bỏ qua đồng hồ, và quyết định bạn muốn câu nào.
Khác biệt về tốc độ sẽ hiện ra ngay lập tức và rõ ràng. Khác biệt về chất lượng mới là thứ đáng ngồi lại ngẫm — nó bộc lộ rõ nhất trên các đầu vào dài, nơi 3.0 lặng lẽ làm việc với ít tài liệu của bạn hơn bạn tưởng.
11Câu hỏi thường gặp
Shannon 3.1 là gì?
Shannon 3.1 là bản phát hành hiện tại của dòng Shannon 3. Nó giữ nguyên vòng lặp lý luận lặp — suy nghĩ, phác thảo, tự rà soát, cải thiện — nhưng chạy nguyên bản trên cụm GPU của riêng chúng tôi thay vì một nhà cung cấp suy luận bên thứ ba. Đánh giá nội bộ của Shannon Lab đo được mức cải thiện 32% về trí tuệ và phản hồi nhanh gấp 10-15 lần so với Shannon 3.0, với cửa sổ ngữ cảnh nâng từ 32,768 lên 196,608 token.
Shannon 3.1 nhanh hơn Shannon 3.0 bao nhiêu?
Nhanh hơn từ 10 đến 15 lần trên toàn bộ quá trình phản hồi, theo đánh giá nội bộ của Shannon Lab. Có hai nguyên nhân. Đầu ra của Shannon 3.0 đi qua một lớp điều tiết cố ý giới hạn tốc độ luồng; Shannon 3.1 không có cổng tốc độ và không có điều tiết hiển thị, nên token đến với bạn nhanh ngang tốc độ engine tạo ra chúng. Bản thân engine cũng nhanh hơn: trọng số NVFP4 4-bit cộng với giải mã suy đoán trên cụm GPU của riêng chúng tôi.
Cửa sổ ngữ cảnh của Shannon 3.1 lớn bao nhiêu?
196,608 token, tăng gấp 6 lần so với 32,768 token có sẵn trên Shannon 3.0. Con số đó tương đương khoảng 400-500 trang văn bản, hoặc một codebase cỡ trung, được giữ trong một cuộc hội thoại duy nhất mà không cần chia nhỏ hay truy xuất.
Giải mã suy đoán là gì và tại sao nó quan trọng ở đây?
Một mô hình nháp nhỏ và nhanh đề xuất một chuỗi token tiếp theo có khả năng cao, rồi mô hình chính xác minh cả chuỗi trong một lượt xử lý theo lô duy nhất. Các token được chấp nhận sẽ được phát ra ngay lập tức; các token bị từ chối quay về giải mã thông thường. Đầu ra chính là thứ mà mô hình chính sẽ tự tạo ra, nhưng nhiều token có thể xuất hiện sau mỗi bước xác minh thay vì chỉ một. Đó là điều khiến việc streaming ở tốc độ tối đa trở nên khả thi về chi phí thay vì là một vấn đề.
Shannon 3.1 có bị kiểm duyệt không?
Không. Shannon 3.1 không có lớp từ chối và không có lọc nội dung áp lên đầu ra, giống như phần còn lại của dòng Shannon. Việc gỡ bỏ lớp điều tiết không hề thêm một lớp kiểm duyệt vào chỗ đó — luồng bạn nhận được chính là đầu ra của mô hình.
Các model id là gì và tôi có thể dùng Shannon 3.1 ở đâu?
shannon-3.1 là bậc Lite và shannon-3.1-pro là bậc Pro. Cả hai đều có trong chat và trên cả ba phương ngữ API: /v1/chat/completions (dạng OpenAI), /v1/messages (dạng Anthropic), và /v1/responses. Streaming hoạt động trên cả ba.
Khác biệt giữa shannon-3.1 và shannon-3.1-pro là gì?
Lite chạy một lượt duy nhất của vòng lặp lý luận: nó suy nghĩ, rồi trả lời. Pro chạy toàn bộ vòng lặp — suy nghĩ, phác thảo, tự rà soát, cải thiện — với một bước thu hoạch kiến thức trước khi phác thảo. Lite là lựa chọn mặc định hợp lý cho hầu hết công việc; Pro dành cho những câu hỏi mà câu trả lời đầu tiên thường không phải là câu tốt nhất.
Dùng thử Shannon 3.1
Vẫn vòng lặp lý luận đó. Cửa sổ gấp sáu lần. Không cổng tốc độ.
Bắt đầu trò chuyện Đọc tài liệu APIshannon-3.1 · shannon-3.1-pro · streaming trên cả ba phương ngữ
Các con số về hiệu năng và trí tuệ trong bài viết này là phép đo của chính Shannon Lab từ đánh giá nội bộ, tháng 9 năm 2026, và được nêu như thông số sản phẩm chứ không phải kết quả benchmark của bên thứ ba. Cửa sổ ngữ cảnh, model id và khả năng sử dụng qua API là thông số kỹ thuật của sản phẩm. Shannon AI được vận hành bởi Shannon Lab LLC, New Mexico, Hoa Kỳ. Đọc thêm: Shannon 3 · Chỉ mục nghiên cứu Shannon · Tài liệu API.