Мы не храним и не получаем доступ к данным пользователей и не приостанавливаем аккаунты, если только законный орган не требует принудительных мер.
Релиз · Shannon 3.1

Shannon 3.1

Тот же цикл рассуждения, перенесённый на наш собственный GPU-кластер: на 32% умнее, в 10-15 раз быстрее и контекстное окно на 196,608 токенов.

Опубликовано 5 сентября 2026 годаЗаметки о релизеshannon-3.1 · shannon-3.1-pro

Коротко

Shannon 3.1 сохраняет всё, ради чего стоило пользоваться Shannon 3 — итеративный цикл рассуждения, отсутствие слоя отказов, отсутствие фильтрации вывода — и меняет то, где и как модель работает. Теперь она обслуживается с нашего собственного GPU-кластера, а не со стороннего хостинга инференса. Оценка Shannon Lab фиксирует прирост интеллекта на 32% и ответы в 10-15 раз быстрее по сравнению с Shannon 3.0. Контекстное окно выросло с 32,768 до 196,608 токенов. Слоя пейсинга, который намеренно замедлял вывод версии 3.0, больше нет: 3.1 передаёт поток на полной скорости движка. Идентификаторы моделей — shannon-3.1 и shannon-3.1-pro, в чате и во всех трёх диалектах API.

Большинство релизов моделей просят поверить заявлению о возможностях на слово и подождать, пока спор разрешит таблица бенчмарков. Этот проверить проще: откройте две вкладки, отправьте один и тот же запрос в shannon-3 и shannon-3.1 и посмотрите. Разница в скорости появления ответа не тонкая, и это не трюк рендеринга. Shannon 3.0 замедляли намеренно. Shannon 3.1 — нет.

+32%
Интеллект против 3.0
10-15x
Быстрее ответы
196,608
Токенов контекста
0
Слоёв отказа

01Что на самом деле изменилось в Shannon 3.1

Shannon 3.0 принёс то, что определяет всё это семейство: итеративный цикл рассуждения. Модель не отвечает первой же мыслью. Она думает, набрасывает, сверяет собственный черновик с вопросом и улучшает его. Lite выполняет один проход этого цикла; Pro выполняет полный цикл, включая сбор знаний перед составлением черновика. Эта конструкция подробно описана в исследовательской статье о Shannon 3, и ничего из неё в 3.1 не изменилось.

Изменилась механика под капотом. Shannon 3.0 обслуживался через сторонний хостинг инференса — разумный способ запустить модель и стеснительный способ её эксплуатировать. Вы наследуете чужую конфигурацию обслуживания, чужую очередь, чужой потолок контекста и чужое представление о том, сколько токенов в секунду вам позволено получать. Shannon 3.1 работает на нашем собственном GPU-кластере, на стеке обслуживания, который настраиваем мы, и каждая ключевая цифра в этой статье — следствие этого единственного решения.

 Shannon 3.0Shannon 3.1
Где работаетСторонний хостингНаш собственный GPU-кластер
Контекстное окно32,768196,608
Потоковый выводС пейсингом / ограничением скоростиПолная скорость движка
ВесаПо умолчанию у хостинга4-битные NVFP4
ДекодированиеСтандартноеСпекулятивное
Цикл рассужденияПодумать → набросать → проверить → улучшитьБез изменений
Слой отказовНетНет
Идентификаторы моделейshannon-3, shannon-3-proshannon-3.1, shannon-3.1-pro

02Почему Shannon 3.1 ощущается в 10-15 раз быстрее

О цифре скорости спрашивают в первую очередь, поэтому стоит точно объяснить, откуда она берётся. Вкладов два, они независимы, и больший из них — менее эффектный.

Мы сняли ограничитель скорости

Вывод Shannon 3.0 проходил через слой пейсинга. Токены выходили из движка, удерживались и отдавались в ваше соединение по расписанию. Это не случайность и не баг. Когда узкое место — общий хостинг инференса, пейсинг вывода сглаживает нагрузку, не даёт длинной генерации монополизировать слот и заставляет поток приходить в предсказуемом, читаемом ритме, а не всплесками. Это защитимое инженерное решение, и оно стоило каждому пользователю реального времени на каждом ответе.

У Shannon 3.1 нет ни ограничителя скорости, ни пейсинга выдачи. Токены пишутся в ваш поток по мере того, как их производит движок. Если движок генерирует быстро, вы это видите. Между моделью и вашим терминалом, окном чата или SSE-читателем нет сглаживающего буфера. Для длинного ответа — анализа на 2000 токенов, файла сгенерированного кода — именно это даёт большую часть заметного вам улучшения.

Честное следствие: поток теперь идёт всплесками. Спекулятивное декодирование (см. ниже) выдаёт принятые токены короткими сериями, поэтому текст может приходить видимыми кусками, а не в метрономном ритме по одному слову. Если вы строили интерфейс вокруг ровной каденции 3.0, он продолжит работать — порядок и содержание токенов не затронуты, — но, возможно, вы захотите вернуть собственное клиентское сглаживание, если вам нравился эффект печатной машинки. Мы считаем, что большинство предпочтёт получить секунды назад.

Сам движок стал быстрее

Снятие ограничителя помогает только тогда, когда то, что за ним, работает быстро. Второй вклад — стек обслуживания, описанный в разделе 03: 4-битные веса NVFP4 и спекулятивное декодирование на ускорителях текущего поколения с нативной поддержкой FP4 в нашем собственном кластере. Вместе они поднимают потолок, который открывается после снятия ограничителя.

Shannon 3.110-15x
Shannon 3.01x

Относительная сквозная задержка ответа, внутренняя оценка Shannon Lab, сентябрь 2026 года. Разброс отражает длину запроса и уровень модели: короткие запросы на Lite ближе к нижней границе, длинные генерации на Pro — к верхней.

03Что на самом деле делает спекулятивное декодирование

«Спекулятивное декодирование» используют как маркетинговое слово, поэтому вот механизм, простыми словами.

Языковая модель обычно производит один токен за прямой проход. В этом проходе доминирует не арифметика, а пропускная способность памяти: чтобы что-то вычислить, нужно прочитать веса, и чтение занимает намного больше времени, чем сама математика. GPU большую часть времени ждёт память с простаивающими вычислительными блоками. Сгенерировать 500 токенов — значит заплатить эту задержку 500 раз, последовательно.

Спекулятивное декодирование бьёт по последовательной части. Небольшая дешёвая черновая модель предлагает короткую серию вероятных следующих токенов — скажем, четыре или восемь. Основная модель затем оценивает всю серию за один пакетный прямой проход, который стоит едва ли дороже оценки одного токена, потому что дорогая часть (чтение весов) в любом случае происходит один раз. Каждый предложенный токен, с которым основная модель согласна, принимается и выдаётся немедленно. На первом расхождении серия обрывается, и с этого места возобновляется обычное декодирование.

Свойство, которое здесь важно

Спекулятивное декодирование сохраняет вывод. Шаг проверки устроен так, что принятая последовательность распределена в точности так же, как при собственном сэмплировании основной модели. Вы получаете не ответ черновой модели и не приближение ответа большой модели. Вы получаете вывод основной модели, полученный за меньшее число последовательных шагов. Черновая модель может влиять только на скорость, но никогда на содержание.

Всю работу делает доля принятия. На предсказуемом тексте — шаблонном коде, структуре программы, соединительной ткани рассуждения — черновая модель угадывает хорошо, и длинные серии проходят целиком. На по-настоящему трудных токенах доля принятия падает, и система плавно деградирует к обычному декодированию по одному токену. Именно такая асимметрия и нужна: она ускоряет лёгкие места и не трогает трудные.

Почему 4-битные веса относятся к тому же абзацу

Поскольку узкое место — пропускная способность памяти, уменьшение весов является прямым рычагом скорости, а не только объёма памяти. NVFP4 — это 4-битный формат с плавающей точкой с тонким поблочным масштабированием, и именно оно позволяет ему сохранять точность там, где старые схемы 4-битного целочисленного квантования её теряли. Примерно вчетверо меньше байтов для чтения на каждый прямой проход означает пропорционально меньше времени ожидания памяти, и это оставляет намного больше запаса для KV-кэша длинного контекста, которого требует окно на 196K.

Эти два фактора не просто складываются, а перемножаются: меньше байтов на проход и меньше проходов на выданный токен. Именно это делает неограниченную потоковую передачу на полной скорости приемлемой по стоимости обслуживания, а не расходом, который пришлось бы отыгрывать пейсингом — ровно тем, чем и занимался слой пейсинга в 3.0.

04196,608 токенов: что даёт окно в 6 раз больше

У Shannon 3.0 было окно на 32,768 токенов: рабочая сессия, а не документ. Примерно 70-80 страниц прозы минус то, что цикл рассуждения тратит на собственное мышление, минус ваш системный промпт, минус уже накопившийся диалог. Реальная работа упиралась в эту стену постоянно, а обходные пути — нарезка на фрагменты, суммаризация, поиск по собственным материалам — все ухудшают то, что вы пытались сохранить. 196,608 токенов — это задача другого класса.

Shannon 3.1196K
Shannon 3.032K

Конкретно это порядка 400-500 страниц английского текста, или кодовая база среднего размера вместе с тестами и README, или год заметок со встреч по одному проекту, или полный комплект договоров со всеми приложениями — удерживаемые в одном диалоге, адресуемые одним вопросом, без слоя нарезки между вами и материалом.

  • Вопросы по целому репозиторию. Загрузите код и спросите, почему баг доходит до продакшена, вместо того чтобы вставлять три файла, на которые вы и так подумали. Модель может найти файл, который вы не догадались приложить.
  • Анализ длинных документов без поиска. Поиск по документам — это лишающий информации префильтр, который решает, что модели вообще позволено увидеть. При 196K его часто можно пропустить и дать модели прочитать всё, что убирает целый класс отказов, когда нужный фрагмент так и не был найден.
  • Диалоги, сохраняющие связность. Долгая рабочая сессия больше не теряет молча собственное начало. Ограничения, заданные в третьем сообщении, продолжают действовать в восьмидесятом.
  • Место для цикла рассуждения. Собственное мышление цикла, черновики и проверка тоже расходуют контекст. В 3.0 эти шаги конкурировали с вашим материалом за скудный бюджет. В 3.1 они помещаются свободно, и отчасти поэтому прирост качества и увеличение окна пришли вместе.
  • Крупные смешанные входы. Изображения, извлечённый текст документов и код в одном ходе, без сортировки того, что вы можете себе позволить включить.

Одна честная оговорка, применимая к любой модели с длинным контекстом, включая нашу: большое окно — это ёмкость, а не гарантия равномерного внимания по всей его длине. Структура по-прежнему помогает. Вопрос ближе к концу, размеченные документы и указание модели, что именно искать, измеримо улучшают результат на 150K токенов так, как этого просто не происходит на 5K.

05Lite и Pro: shannon-3.1 и shannon-3.1-pro

Два уровня отличаются тем, какую часть цикла рассуждения они выполняют, и это единственное различие, важное при выборе между ними.

 shannon-3.1 (Lite)shannon-3.1-pro (Pro)
РассуждениеОдин проходПолный цикл + сбор знаний
СамопроверкаНетДа
Контекстное окно196,608196,608
Потоковая передачаПолная скорость, без ограничителяПолная скорость, без ограничителя
Зрение и документыДаДа
Инструмент генерации изображенийДаДа
Лучше всего дляБольшинства задач, больших объёмовТрудных вопросов, где первого черновика мало

По умолчанию используйте Lite. Один проход хорошей рассуждающей модели закрывает подавляющее большинство реальных запросов, а на 3.1 он достаточно быстр, чтобы ожидание цикла перестало ощущаться. Берите Pro, когда вопрос из тех, где первый ответ обычно неверен поучительным образом: архитектурные компромиссы, состязательный анализ, всё, где вы хотели бы, чтобы компетентный коллега переспал с этой мыслью. Шаг самопроверки в Pro — не украшение: это модель находит собственные ошибки раньше вас.

06Прирост интеллекта на 32% и как его читать

Собственная оценка Shannon Lab даёт Shannon 3.1 прирост интеллекта на 32% относительно Shannon 3.0. Мы хотим ясно сказать, что это такое и чем оно не является.

Это наша цифра, из нашего внутреннего набора оценок, измеренная на задачах, которые мы считаем показательными для того, с чем люди реально приходят к таким моделям. Это не сторонний бенчмарк, и мы не строим таблицу лидеров вокруг единственного внутреннего агрегата и не публикуем разбивку по отдельным бенчмаркам — разбивка подразумевала бы уровень внешней сопоставимости, которого у внутреннего набора нет.

Что мы скажем — так это откуда берётся прирост, потому что здесь нет никакой загадки. Большее контекстное окно означает, что меньше материала приходится отбрасывать до того, как модель начнёт над ним рассуждать, а изрядная доля кажущейся неразумности в долгих сессиях — на самом деле просто амнезия. Стек обслуживания, который контролируем мы, означает, что модель работает с той конфигурацией, которую мы задумали, а не с настройками хостинга по умолчанию. А цикл рассуждения — неизменный по устройству — теперь имеет место, чтобы действительно развернуться внутри окна, а не тесниться у потолка в 32K, который он делил с вашим вводом.

Проверьте сами

Самый полезный бенчмарк для вас — ваш собственный. Возьмите запрос из вашей настоящей работы — не головоломку, а реальный — и выполните его на shannon-3, а затем на shannon-3.1. Сравните ответы и засеките время. Наши цифры описывают среднее по набору; лучше должен стать именно ваш запрос.

07Зрение, документы и генерация изображений

Shannon 3.1 читает изображения и документы. Скриншоты, схемы, фотографии, отсканированные страницы, PDF и текстовые документы можно поместить в диалог и рассуждать о них наравне со всем остальным. Вместе с окном на 196K это и делает работу с целыми документами практичной: длинный отчёт вместе с его графиками за один ход, без необходимости заранее решать, какие страницы модели позволено увидеть.

Генерация и редактирование изображений доступны в чате как инструмент. Попросите изображение, и модель вызовет инструмент прямо по ходу, в том же диалоге, с контекстом всего обсуждённого ранее. Редактирование работает так же: передайте изображение и опишите изменение. Нет отдельного режима, в который нужно переключаться, и нет отдельного интерфейса, который нужно осваивать.

08Вызов Shannon 3.1 из API

Shannon 3.1 доступен во всех трёх диалектах API, с потоковой передачей в каждом. Те же модели, три формы запроса — выберите ту, что совпадает с уже имеющимся у вас SDK.

ЭндпоинтФормаПотоковая передача
/v1/chat/completionsСовместимо с OpenAIДа
/v1/messagesСовместимо с AnthropicДа
/v1/responsesResponsesДа
{
  "model": "shannon-3.1",
  "stream": true,
  "messages": [
    { "role": "user", "content": "Summarize this contract set and flag anything unusual." }
  ]
}

Замените "shannon-3.1" на "shannon-3.1-pro", чтобы запустить полный цикл рассуждения. Если вы уже вызываете shannon-3, миграция сводится к идентификатору модели и больше ни к чему: формы запроса и ответа не изменились, а существующие потоковые клиенты продолжают работать. Единственное поведенческое отличие, которого стоит ждать, — более всплесковый поток, описанный в разделе 02: те же токены, тот же порядок, приходят раньше и менее равномерными кусками.

Полный справочник параметров, аутентификация, семантика ошибок и интерактивная песочница — в документации API. Другие карточки моделей и технические разборы — в разделе исследований Shannon.

09По-прежнему без цензуры и без изменений в этой части

У Shannon 3.1 нет слоя отказов и нет фильтрации контента на выходе. Это та же позиция, что и у остальной линейки Shannon, и она не изменилась с переездом на наш собственный кластер — скорее наоборот, контроль над стеком обслуживания делает её проще гарантировать, потому что между моделью и вами не сидит промежуточный хостинг со своей политикой.

Стоит сказать прямо, потому что это первое, о чём задумываешься при релизе, изменившем весь путь вывода: снятие слоя пейсинга не означало установку на его место слоя модерации. Ничто не инспектирует, не переписывает и не придерживает поток. Что модель произвела, то и приходит. Насколько нам известно, Shannon 3.1 — самая быстрая доступная модель ИИ без цензуры с контекстным окном такого размера, и эти два свойства связаны, поскольку оба происходят от работы на собственной инфраструктуре, а не от аренды мощностей, скроенных под чужой комплаенс.

Без цензуры не означает без ответственности. Использование регулируется нашей Политикой ответственного использования, и обязательство, которое приходит вместе с моделью, готовой работать с трудным материалом, состоит в том, чтобы работать с ним ответственно.

10Проведите сравнение сами

Каждое утверждение здесь проверяется примерно за две минуты, и нам предпочтительнее, чтобы вы проверили, а не поверили нам.

  1. Возьмите запрос из работы, которой вы действительно занимаетесь. Длинный лучше — он нагружает и окно, и потоковую передачу.
  2. Выполните его на shannon-3. Отметьте, сколько прошло до первого токена и сколько до завершения ответа.
  3. Выполните тот же самый запрос на shannon-3.1. Отметьте те же две величины.
  4. Затем прочитайте оба ответа, забыв о часах, и решите, какой из них вы предпочли бы получить.

Разница в скорости будет мгновенной и очевидной. Разница в качестве — та, над которой стоит посидеть: она заметнее всего на длинных входах, где 3.0 тихо работал с меньшей частью вашего материала, чем вам казалось.

11Часто задаваемые вопросы

Что такое Shannon 3.1?

Shannon 3.1 — это текущий релиз семейства Shannon 3. Он сохраняет тот же итеративный цикл рассуждения — подумать, набросать, проверить себя, улучшить — но выполняет его нативно на нашем собственном GPU-кластере, а не на стороннем хостинге инференса. Собственная оценка Shannon Lab фиксирует прирост интеллекта на 32% и ответы в 10-15 раз быстрее по сравнению с Shannon 3.0, а контекстное окно выросло с 32,768 до 196,608 токенов.

Насколько Shannon 3.1 быстрее Shannon 3.0?

От 10 до 15 раз быстрее на сквозных ответах, по собственной оценке Shannon Lab. Причин две. Вывод Shannon 3.0 проходил через слой пейсинга, который намеренно ограничивал скорость потока; у Shannon 3.1 нет ни ограничителя скорости, ни пейсинга выдачи, поэтому токены доходят до вас так быстро, как их производит движок. Сам движок тоже стал быстрее: 4-битные веса NVFP4 плюс спекулятивное декодирование на нашем собственном GPU-кластере.

Насколько велико контекстное окно Shannon 3.1?

196,608 токенов — в 6 раз больше, чем 32,768 токенов, доступные в Shannon 3.0. Это примерно 400-500 страниц текста или кодовая база среднего размера, удерживаемые в одном диалоге без разбиения на фрагменты и без поиска по документам.

Что такое спекулятивное декодирование и почему оно здесь важно?

Небольшая быстрая черновая модель предлагает серию вероятных следующих токенов, а основная модель проверяет их за один пакетный проход. Принятые токены выдаются немедленно; отклонённые возвращаются к обычному декодированию. Результат — то, что основная модель произвела бы сама, но за один шаг проверки может появиться сразу несколько токенов вместо одного. Именно это делает потоковую передачу на полной скорости доступной по стоимости, а не проблемой расходов.

Shannon 3.1 работает без цензуры?

Да. У Shannon 3.1 нет слоя отказов и нет фильтрации контента на выходе — как и у остальной линейки Shannon. Снятие слоя пейсинга не привело к появлению на его месте слоя модерации: поток, который вы получаете, и есть вывод модели.

Какие у модели идентификаторы и где можно использовать Shannon 3.1?

shannon-3.1 — это уровень Lite, а shannon-3.1-pro — уровень Pro. Обе доступны в чате и во всех трёх диалектах API: /v1/chat/completions (в форме OpenAI), /v1/messages (в форме Anthropic) и /v1/responses. Потоковая передача работает во всех трёх.

В чём разница между shannon-3.1 и shannon-3.1-pro?

Lite выполняет один проход цикла рассуждения: думает, затем отвечает. Pro выполняет полный цикл — подумать, набросать, проверить себя, улучшить — со сбором знаний перед составлением черновика. Lite — правильный вариант по умолчанию для большинства задач; Pro нужен там, где первый ответ обычно не лучший.

Попробуйте Shannon 3.1

Тот же цикл рассуждения. Окно в шесть раз больше. Без ограничителя скорости.

Начать чат Читать документацию API

shannon-3.1 · shannon-3.1-pro · потоковая передача во всех трёх диалектах


Показатели производительности и интеллекта в этой статье — собственные измерения Shannon Lab из внутренней оценки, сентябрь 2026 года; они приводятся как продуктовые цифры, а не как результаты стороннего бенчмарка. Контекстное окно, идентификаторы моделей и доступность в API — продуктовые характеристики. Shannon AI управляется Shannon Lab LLC, Нью-Мексико, США. По теме: Shannon 3 · указатель исследований Shannon · документация API.

Все ссылки на исследования