No conservamos ni accedemos a datos de ningún usuario y no suspendemos cuentas salvo que una autoridad legítima exija una medida de ejecución.
Lanzamiento · Shannon 3.1

Shannon 3.1

El mismo bucle de razonamiento, trasladado a nuestro propio clúster de GPU: un 32% más inteligente, 10-15 veces más rápido y una ventana de contexto de 196.608 tokens.

Publicado el 5 de septiembre de 2026Notas de la versiónshannon-3.1 · shannon-3.1-pro

En resumen

Shannon 3.1 conserva todo lo que hacía que Shannon 3 mereciera la pena — el bucle de razonamiento iterativo, sin capa de rechazo, sin filtrado de salida — y cambia dónde y cómo se ejecuta. El modelo ahora se sirve desde nuestro propio clúster de GPU en lugar de desde un proveedor de inferencia externo. La evaluación de Shannon Lab mide una mejora del 32% en inteligencia y respuestas 10-15 veces más rápidas frente a Shannon 3.0. La ventana de contexto pasa de 32.768 a 196.608 tokens. La capa de cadencia que ralentizaba deliberadamente la salida de la 3.0 ha desaparecido: la 3.1 emite en streaming a la velocidad plena del motor. Los identificadores de modelo son shannon-3.1 y shannon-3.1-pro, en el chat y en los tres dialectos de la API.

La mayoría de los lanzamientos de modelos te piden que aceptes una afirmación de capacidad por fe y esperes a que una tabla de benchmarks zanje la discusión. Este es más fácil de comprobar: abre dos pestañas, pon el mismo prompt en shannon-3 y en shannon-3.1, y mira. La diferencia en la rapidez con la que llega la respuesta no es sutil, y no es un truco de renderizado. Shannon 3.0 estaba limitado a propósito. Shannon 3.1 no lo está.

+32%
Inteligencia frente a la 3.0
10-15x
Respuestas más rápidas
196.608
Tokens de contexto
0
Capas de rechazo

01Qué ha cambiado realmente en Shannon 3.1

Shannon 3.0 introdujo lo que define a esta familia: un bucle de razonamiento iterativo. El modelo no responde con su primera idea. Piensa, redacta, revisa su propio borrador frente a la pregunta y lo mejora. Lite ejecuta una pasada de ese bucle; Pro ejecuta el bucle completo, incluido un paso de recolección de conocimiento antes de redactar. Ese diseño se describe en detalle en el artículo de investigación de Shannon 3, y nada de eso ha cambiado en la 3.1.

Lo que ha cambiado es la maquinaria de debajo. Shannon 3.0 se servía a través de un proveedor de inferencia externo: una forma sensata de lanzar un modelo y una forma limitante de operarlo. Heredas la configuración de servicio de otro, la cola de otro, el techo de contexto de otro y la idea de otro sobre cuántos tokens por segundo se te permite tener. Shannon 3.1 se ejecuta en nuestro propio clúster de GPU, sobre una pila de servicio que configuramos nosotros, y todas las cifras destacadas de este artículo se derivan de esa única decisión.

 Shannon 3.0Shannon 3.1
Dónde se ejecutaProveedor externoNuestro propio clúster de GPU
Ventana de contexto32.768196.608
Streaming de salidaCon cadencia / limitadoVelocidad plena del motor
PesosPor defecto del proveedorNVFP4 de 4 bits
DecodificaciónEstándarEspeculativa
Bucle de razonamientoPensar → redactar → revisar → mejorarSin cambios
Capa de rechazoNingunaNinguna
Identificadores de modeloshannon-3, shannon-3-proshannon-3.1, shannon-3.1-pro

02Por qué Shannon 3.1 se siente 10-15 veces más rápido

La cifra de velocidad es la primera que la gente consulta, así que conviene ser preciso sobre de dónde sale. Hay dos contribuciones independientes, y la mayor es la menos vistosa de las dos.

Hemos quitado el limitador de velocidad

La salida de Shannon 3.0 pasaba por una capa de cadencia. Los tokens salían del motor, se retenían y se liberaban hacia tu conexión según un calendario. Esto no era un accidente ni un error. Cuando el cuello de botella es un proveedor de inferencia compartido, marcar el ritmo de la salida suaviza la carga, evita que una generación larga monopolice una plaza y hace que el flujo llegue con un ritmo predecible y legible en vez de a ráfagas. Es una decisión de ingeniería defendible, y le costaba a cada usuario tiempo real de reloj en cada respuesta.

Shannon 3.1 no tiene limitador de velocidad ni cadencia de revelado. Los tokens se escriben en tu flujo a medida que el motor los produce. Si el motor está generando rápido, lo ves generar rápido. No hay búfer de suavizado entre el modelo y tu terminal, tu ventana de chat o tu lector de SSE. Para una respuesta larga — un análisis de 2.000 tokens, un archivo de código generado — solo esto explica la mayor parte de la mejora que notarás.

Una consecuencia honesta: el flujo ahora llega a ráfagas. La decodificación especulativa (más abajo) emite los tokens aceptados en series cortas, así que el texto puede llegar en bloques visibles en lugar de con una cadencia metronómica de palabra a palabra. Si construiste tu interfaz alrededor de la cadencia suave de la 3.0, seguirá funcionando — el orden y el contenido de los tokens no cambian — pero quizá quieras reintroducir tu propio suavizado en el cliente si preferías el efecto de máquina de escribir. Creemos que la mayoría prefiere recuperar los segundos.

El propio motor se ha vuelto más rápido

Quitar el limitador solo ayuda si lo que hay detrás es rápido. La segunda contribución es la pila de servicio descrita en la sección 03: pesos NVFP4 de 4 bits y decodificación especulativa sobre aceleradores de generación actual con soporte nativo de FP4 en nuestro propio clúster. Juntos elevan el techo que deja al descubierto la retirada del limitador.

Shannon 3.110-15x
Shannon 3.01x

Latencia relativa de respuesta de extremo a extremo, evaluación interna de Shannon Lab, septiembre de 2026. El rango refleja la longitud del prompt y el nivel: los prompts cortos en Lite se sitúan cerca del extremo bajo, y las generaciones largas en Pro cerca del alto.

03Qué hace realmente la decodificación especulativa

«Inferencia con decodificación especulativa» se usa como palabra de marketing, así que aquí está el mecanismo, dicho con claridad.

Un modelo de lenguaje produce normalmente un token por pasada hacia adelante. Esa pasada no está dominada por la aritmética, sino por el ancho de banda de memoria: hay que leer los pesos para calcular cualquier cosa, y leerlos lleva mucho más tiempo que las operaciones matemáticas. La GPU pasa la mayor parte del tiempo esperando a la memoria con sus unidades de cómputo ociosas. Generar 500 tokens significa pagar esa latencia 500 veces, de forma secuencial.

La decodificación especulativa ataca la parte secuencial. Un modelo borrador pequeño y barato propone una serie corta de tokens probables — digamos cuatro u ocho. El modelo principal evalúa entonces esa serie entera en una única pasada hacia adelante por lotes, que cuesta apenas más que evaluar un solo token, porque la parte cara (leer los pesos) ocurre una vez en cualquier caso. Cada token propuesto con el que el modelo principal está de acuerdo se acepta y se emite de inmediato. En el primer desacuerdo, la serie se trunca y la decodificación normal se reanuda a partir de ahí.

La propiedad que importa

La decodificación especulativa preserva la salida. El paso de verificación está construido de modo que la secuencia aceptada se distribuye exactamente igual que lo habría hecho el muestreo del propio modelo principal. No estás recibiendo la respuesta del modelo borrador, ni una aproximación de la respuesta del modelo grande. Estás recibiendo la salida del modelo principal, alcanzada en menos pasos secuenciales. El modelo borrador solo puede afectar a la velocidad, nunca al contenido.

La tasa de aceptación hace el trabajo. En texto predecible — código repetitivo, estructura de programas, el tejido conectivo de un argumento — el modelo borrador acierta bien y llegan series largas de una vez. En los tokens genuinamente difíciles la aceptación cae y el sistema degrada con elegancia hasta la decodificación ordinaria de un token cada vez. Esa asimetría es justo la que quieres: acelera las partes fáciles y no toca las difíciles.

Por qué los pesos de 4 bits pertenecen al mismo párrafo

Como el cuello de botella es el ancho de banda de memoria, reducir los pesos es una palanca directa de velocidad, no solo de huella de memoria. NVFP4 es un formato de coma flotante de 4 bits con escalado por bloques de grano fino, que es lo que le permite mantener la precisión donde los esquemas antiguos de cuantización entera de 4 bits la perdían. Aproximadamente una cuarta parte de los bytes que leer por pasada significa proporcionalmente menos tiempo esperando a la memoria, y deja mucho más margen para la caché KV de contexto largo que exige una ventana de 196K.

Los dos efectos se componen en lugar de simplemente sumarse: menos bytes por pasada y menos pasadas por token emitido. Eso es lo que hace que el streaming sin limitador y a velocidad plena sea asequible de servir, en vez de un coste que tendríamos que recuperar mediante la cadencia — que es exactamente lo que hacía la capa de cadencia en la 3.0.

04196.608 tokens: qué desbloquea una ventana 6 veces mayor

Shannon 3.0 tenía una ventana de 32.768 tokens: una sesión de trabajo, no un documento. Unas 70-80 páginas de prosa, menos lo que consume el bucle de razonamiento para su propio pensamiento, menos tu prompt de sistema, menos la conversación hasta ese momento. El trabajo real chocaba con ese muro constantemente, y los apaños — fragmentar, resumir, recuperar sobre tu propio material — degradan todos justo aquello que intentabas preservar. 196.608 tokens es una categoría de problema distinta.

Shannon 3.1196K
Shannon 3.032K

En concreto, eso es del orden de 400-500 páginas de texto, o un repositorio de código de tamaño medio con sus pruebas y su README, o un año de notas de reunión de un proyecto, o un conjunto contractual completo con todos sus anexos — sostenido en una sola conversación, interrogable con una sola pregunta y sin ninguna capa de fragmentación entre tú y el material.

  • Preguntas sobre el repositorio entero. Carga el código y pregunta por qué un fallo llega a producción, en lugar de pegar los tres archivos que ya sospechabas. El modelo puede encontrar el archivo que no se te ocurrió incluir.
  • Análisis de documentos largos sin recuperación. La recuperación es un prefiltro con pérdidas que decide qué se le permite ver al modelo. Con 196K a menudo puedes saltártela y dejar que el modelo lo lea todo, lo que elimina toda una clase de fallos en la que el pasaje correcto nunca se recuperó.
  • Conversaciones que se mantienen coherentes. Una sesión de trabajo larga ya no descarta en silencio su propio comienzo. Las restricciones que fijaste en el mensaje tres siguen aplicándose en el mensaje ochenta.
  • Espacio para el bucle de razonamiento. El pensamiento, la redacción y la revisión del propio bucle consumen contexto. En la 3.0 esos pasos competían con tu material por un presupuesto escaso. En la 3.1 caben con holgura, y eso es parte de por qué la mejora de calidad y el aumento de ventana llegaron juntos.
  • Entradas mixtas grandes. Imágenes, texto extraído de documentos y código en un solo turno, sin tener que decidir cuáles de ellos puedes permitirte incluir.

Una salvedad honesta que se aplica a todos los modelos de contexto largo, el nuestro incluido: una ventana grande es una capacidad, no una garantía de atención uniforme a lo largo de ella. La estructura sigue ayudando. Poner la pregunta cerca del final, etiquetar tus documentos y decirle al modelo qué debe buscar mejoran de forma medible los resultados con 150K tokens de una manera que sencillamente no ocurre con 5K.

05Lite y Pro: shannon-3.1 y shannon-3.1-pro

Los dos niveles se diferencian en cuánto del bucle de razonamiento ejecutan, y esa es la única diferencia que importa para elegir entre ellos.

 shannon-3.1 (Lite)shannon-3.1-pro (Pro)
RazonamientoUna sola pasadaBucle completo + recolección de conocimiento
AutorrevisiónNo
Ventana de contexto196.608196.608
StreamingVelocidad plena, sin limitadorVelocidad plena, sin limitador
Visión y documentos
Herramienta de generación de imágenes
Mejor paraLa mayoría del trabajo, gran volumenPreguntas difíciles, primer borrador insuficiente

Usa Lite por defecto. Una pasada de un buen modelo de razonamiento resuelve la gran mayoría de las peticiones reales, y en la 3.1 es lo bastante rápida como para que el bucle ya no sea algo que notes esperando. Recurre a Pro cuando la pregunta sea de esas en las que una primera respuesta suele equivocarse de forma instructiva: compromisos de arquitectura, análisis adversarial, cualquier cosa en la que querrías que un colega competente lo consultara con la almohada. El paso de autorrevisión de Pro no es decorativo: es el modelo encontrando sus propios errores antes de que tengas que hacerlo tú.

06La mejora del 32% en inteligencia, y cómo interpretarla

La evaluación interna de Shannon Lab sitúa a Shannon 3.1 en una mejora del 32% en inteligencia sobre Shannon 3.0. Queremos ser claros sobre qué es y qué no es.

Es una cifra nuestra, de nuestro conjunto de evaluación interno, medida sobre tareas que consideramos representativas de lo que la gente trae realmente a estos modelos. No es un benchmark de terceros, y no estamos construyendo una tabla de clasificación en torno a un único agregado interno ni publicando un desglose por benchmark: un desglose insinuaría un nivel de comparabilidad externa que un conjunto interno no tiene.

Lo que sí diremos es de dónde viene la mejora, porque esa parte no tiene misterio. Una ventana de contexto mayor significa que hay que descartar menos material antes de que el modelo razone sobre él, y buena parte de la aparente falta de inteligencia en sesiones largas es en realidad amnesia. Una pila de servicio que controlamos significa que el modelo se ejecuta con la configuración que pretendíamos y no con la de un proveedor por defecto. Y el bucle de razonamiento — sin cambios de diseño — ahora tiene espacio para ejecutarse de verdad dentro de la ventana, en lugar de quedar apretado contra un techo de 32K que compartía con tu entrada.

Compruébalo tú mismo

El benchmark más útil para ti es el tuyo. Coge un prompt de tu carga de trabajo real — no un acertijo, uno de verdad — y ejecútalo en shannon-3 y luego en shannon-3.1. Compara las respuestas y cronométralas. Nuestros números describen una media sobre un conjunto; tu prompt es el que tiene que mejorar.

07Visión, documentos y generación de imágenes

Shannon 3.1 lee imágenes y documentos. Capturas de pantalla, diagramas, fotografías, páginas escaneadas, PDF y documentos de texto pueden entrar en la conversación y razonarse junto con todo lo demás. Combinado con la ventana de 196K, esto es lo que hace prácticos los flujos de trabajo sobre documentos completos: un informe largo y sus gráficos en un solo turno, sin decidir de antemano qué páginas se le permite ver al modelo.

La generación y la edición de imágenes están disponibles en el chat como herramienta. Pide una imagen y el modelo llama a la herramienta en línea, en la misma conversación, con el contexto de todo lo hablado hasta ese momento. La edición funciona igual: dale una imagen y describe el cambio. No hay un modo aparte al que cambiar ni una interfaz distinta que aprender.

08Llamar a Shannon 3.1 desde la API

Shannon 3.1 está disponible en los tres dialectos de la API, con streaming en cada uno. Los mismos modelos, tres formas de petición: elige la que encaje con el SDK que ya tienes.

EndpointFormatoStreaming
/v1/chat/completionsCompatible con OpenAI
/v1/messagesCompatible con Anthropic
/v1/responsesResponses
{
  "model": "shannon-3.1",
  "stream": true,
  "messages": [
    { "role": "user", "content": "Summarize this contract set and flag anything unusual." }
  ]
}

Cambia "shannon-3.1" por "shannon-3.1-pro" para ejecutar el bucle de razonamiento completo. Si ya estás llamando a shannon-3, la migración es el identificador de modelo y nada más: las formas de petición y respuesta no cambian, y los clientes de streaming existentes siguen funcionando. La única diferencia de comportamiento que debes esperar es el flujo más a ráfagas descrito en la sección 02: los mismos tokens, en el mismo orden, llegando antes y en bloques menos uniformes.

La referencia completa de parámetros, la autenticación, la semántica de errores y un playground interactivo están en la documentación de la API. Otras fichas de modelo y artículos técnicos están en Shannon research.

09Sigue sin censura, y sin cambios en ese aspecto

Shannon 3.1 no tiene capa de rechazo ni filtrado de contenido en la salida. Es la misma postura que el resto de la línea Shannon y no cambió con el traslado a nuestro propio clúster; en todo caso, controlar la pila de servicio hace más fácil garantizarlo, porque no hay un proveedor intermedio con su propia política situado entre el modelo y tú.

Vale la pena decirlo con claridad, porque es lo obvio que uno se pregunta ante una versión que cambió toda la ruta de salida: eliminar la capa de cadencia no significó insertar una capa de moderación en su lugar. Nada inspecciona, reescribe ni filtra el flujo. Lo que el modelo produce es lo que llega. Shannon 3.1 es, hasta donde sabemos, el modelo de IA sin censura más rápido disponible con una ventana de contexto de este tamaño, y las dos propiedades están relacionadas, ya que ambas vienen de operar nuestra propia infraestructura en lugar de alquilarle a otro una capacidad moldeada por el cumplimiento normativo.

Sin censura no es lo mismo que sin responsabilidad. El uso se rige por nuestra Política de uso responsable, y la obligación que acompaña a un modelo dispuesto a tratar material difícil es que tú lo trates de forma responsable.

10Haz tú mismo la comparación

Todas las afirmaciones de este artículo se pueden comprobar en unos dos minutos, y preferimos que lo compruebes a que nos creas.

  1. Elige un prompt de trabajo que hagas de verdad. Cuanto más largo, mejor: pone a prueba tanto la ventana como el streaming.
  2. Ejecútalo en shannon-3. Anota cuánto tarda el primer token y cuánto tarda en completarse la respuesta.
  3. Ejecuta el prompt idéntico en shannon-3.1. Anota los mismos dos números.
  4. Luego lee ambas respuestas, ignorando el reloj, y decide cuál habrías querido.

La diferencia de velocidad será inmediata y evidente. La diferencia de calidad es la que merece detenerse a considerar: se nota con más claridad en entradas largas, donde la 3.0 trabajaba discretamente con menos material tuyo del que creías.

11Preguntas frecuentes

¿Qué es Shannon 3.1?

Shannon 3.1 es la versión actual de la familia Shannon 3. Conserva el mismo bucle de razonamiento iterativo — pensar, redactar, autorrevisar, mejorar — pero lo ejecuta de forma nativa en nuestro propio clúster de GPU en lugar de en un proveedor de inferencia externo. La evaluación interna de Shannon Lab mide una mejora del 32% en inteligencia y respuestas entre 10 y 15 veces más rápidas frente a Shannon 3.0, con la ventana de contexto ampliada de 32.768 a 196.608 tokens.

¿Cuánto más rápido es Shannon 3.1 que Shannon 3.0?

Entre 10 y 15 veces más rápido en respuestas de extremo a extremo, según la evaluación interna de Shannon Lab. Hay dos motivos. La salida de Shannon 3.0 pasaba por una capa de cadencia que limitaba deliberadamente el flujo; Shannon 3.1 no tiene limitador de velocidad ni cadencia de revelado, así que los tokens te llegan tan rápido como el motor los produce. El propio motor también es más rápido: pesos NVFP4 de 4 bits más decodificación especulativa en nuestro propio clúster de GPU.

¿Cómo de grande es la ventana de contexto de Shannon 3.1?

196.608 tokens, seis veces más que los 32.768 tokens disponibles en Shannon 3.0. Eso equivale a unas 400-500 páginas de texto, o a un repositorio de código de tamaño medio, dentro de una sola conversación y sin fragmentación ni recuperación.

¿Qué es la decodificación especulativa y por qué importa aquí?

Un modelo borrador pequeño y rápido propone una serie de tokens probables y el modelo principal los verifica en una única pasada por lotes. Los tokens aceptados se emiten de inmediato; los rechazados vuelven a la decodificación normal. La salida es la que el modelo principal habría producido por su cuenta, pero pueden llegar varios tokens por paso de verificación en vez de uno. Es lo que hace asequible el streaming a velocidad plena en lugar de convertirlo en un problema de coste.

¿Shannon 3.1 está sin censura?

Sí. Shannon 3.1 no tiene capa de rechazo ni filtrado de contenido aplicado a su salida, igual que el resto de la línea Shannon. Eliminar la capa de cadencia no supuso añadir una capa de moderación en su lugar: el flujo que recibes es la salida del modelo.

¿Cuáles son los identificadores de modelo y dónde puedo usar Shannon 3.1?

shannon-3.1 es el nivel Lite y shannon-3.1-pro es el nivel Pro. Ambos están disponibles en el chat y en los tres dialectos de la API: /v1/chat/completions (formato OpenAI), /v1/messages (formato Anthropic) y /v1/responses. El streaming funciona en los tres.

¿Cuál es la diferencia entre shannon-3.1 y shannon-3.1-pro?

Lite ejecuta una sola pasada del bucle de razonamiento: piensa y luego responde. Pro ejecuta el bucle completo — pensar, redactar, autorrevisar, mejorar — con un paso de recolección de conocimiento antes de redactar. Lite es la opción por defecto adecuada para la mayoría del trabajo; Pro es para preguntas en las que la primera respuesta no suele ser la mejor.

Prueba Shannon 3.1

El mismo bucle de razonamiento. Seis veces la ventana. Sin limitador de velocidad.

Empezar a chatear Leer la documentación de la API

shannon-3.1 · shannon-3.1-pro · streaming en los tres dialectos


Las cifras de rendimiento e inteligencia de este artículo son mediciones propias de Shannon Lab a partir de su evaluación interna, septiembre de 2026, y se presentan como cifras de producto y no como resultados de benchmarks de terceros. La ventana de contexto, los identificadores de modelo y la disponibilidad en la API son especificaciones de producto. Shannon AI está operado por Shannon Lab LLC, Nuevo México, EE. UU. Lecturas relacionadas: Shannon 3 · Índice de Shannon research · Documentación de la API.

Todos los enlaces de investigación