Shannon 3.1
Loop penalaran yang sama, dipindahkan ke klaster GPU kami sendiri: 32% lebih cerdas, 10-15x lebih cepat, dan jendela konteks 196,608 token.
Ringkasnya
Shannon 3.1 mempertahankan semua yang membuat Shannon 3 layak dipakai — loop penalaran iteratif, tanpa lapisan penolakan, tanpa penyaringan keluaran — dan mengubah di mana serta bagaimana ia berjalan. Model kini dilayani dari klaster GPU kami sendiri, bukan dari penyedia inferensi pihak ketiga. Evaluasi Shannon Lab mengukur peningkatan kecerdasan 32% dan balasan 10-15x lebih cepat dibandingkan Shannon 3.0. Jendela konteks naik dari 32,768 menjadi 196,608 token. Lapisan pacing yang sengaja memperlambat keluaran 3.0 kini hilang: 3.1 melakukan streaming pada kecepatan penuh mesin. Id modelnya adalah shannon-3.1 dan shannon-3.1-pro, di chat dan pada ketiga dialek API.
Sebagian besar rilis model meminta Anda mempercayai klaim kemampuan begitu saja dan menunggu tabel benchmark menyelesaikan perdebatan. Yang satu ini lebih mudah diperiksa: buka dua tab, masukkan prompt yang sama ke shannon-3 dan shannon-3.1, lalu perhatikan. Perbedaan kecepatan datangnya jawaban sama sekali tidak halus, dan itu bukan trik render. Shannon 3.0 memang sengaja dicekik. Shannon 3.1 tidak.
01Apa yang sebenarnya berubah di Shannon 3.1
Shannon 3.0 memperkenalkan hal yang mendefinisikan keluarga ini: sebuah loop penalaran iteratif. Model tidak menjawab pada pikiran pertamanya. Ia berpikir, menyusun draf, meninjau drafnya sendiri terhadap pertanyaan, lalu memperbaikinya. Lite menjalankan satu lintasan loop itu; Pro menjalankan loop penuh, termasuk langkah panen pengetahuan sebelum menyusun draf. Desain itu dijelaskan rinci di artikel riset Shannon 3, dan tidak satu pun darinya berubah di 3.1.
Yang berubah adalah mesin di bawahnya. Shannon 3.0 dilayani lewat penyedia inferensi pihak ketiga — cara yang masuk akal untuk meluncurkan sebuah model, dan cara yang membatasi untuk menjalankannya. Anda mewarisi konfigurasi penyajian orang lain, antrean orang lain, batas konteks orang lain, dan gagasan orang lain tentang berapa token per detik yang boleh Anda dapatkan. Shannon 3.1 berjalan di klaster GPU kami sendiri, pada tumpukan penyajian yang kami konfigurasi sendiri, dan setiap angka utama dalam artikel ini adalah turunan dari satu keputusan tersebut.
| Shannon 3.0 | Shannon 3.1 | |
|---|---|---|
| Tempat berjalan | Penyedia pihak ketiga | Klaster GPU kami sendiri |
| Jendela konteks | 32,768 | 196,608 |
| Streaming keluaran | Dipacu / dibatasi laju | Kecepatan penuh mesin |
| Bobot | Default penyedia | NVFP4 4-bit |
| Decoding | Standar | Spekulatif |
| Loop penalaran | Berpikir → draf → tinjau → perbaiki | Tidak berubah |
| Lapisan penolakan | Tidak ada | Tidak ada |
| Id model | shannon-3, shannon-3-pro | shannon-3.1, shannon-3.1-pro |
02Mengapa Shannon 3.1 terasa 10-15x lebih cepat
Angka kecepatan adalah yang paling sering ditanyakan orang, jadi ada baiknya kita tepat soal dari mana asalnya. Ada dua kontribusi yang saling bebas, dan yang lebih besar justru yang kurang memesona.
Kami menghapus pembatas kecepatan
Keluaran Shannon 3.0 melewati sebuah lapisan pacing. Token keluar dari mesin, ditahan, lalu dilepas ke koneksi Anda sesuai jadwal. Ini bukan kecelakaan atau bug. Ketika penyedia inferensi bersama menjadi leher botol, memacu keluaran akan meratakan beban, mencegah satu generasi panjang memonopoli slot, dan membuat aliran datang dengan ritme yang dapat diprediksi dan enak dibaca alih-alih meledak-ledak. Itu pilihan rekayasa yang bisa dipertahankan, dan itu merenggut waktu nyata setiap pengguna pada setiap balasan.
Shannon 3.1 tidak punya pembatas kecepatan dan tidak punya pacing penampilan. Token dituliskan ke aliran Anda seiring mesin memproduksinya. Jika mesin menghasilkan dengan cepat, Anda melihatnya menghasilkan dengan cepat. Tidak ada buffer perata antara model dan terminal Anda, jendela chat Anda, atau pembaca SSE Anda. Untuk jawaban panjang — analisis 2,000 token, sebuah berkas kode yang dihasilkan — hal ini saja sudah menyumbang mayoritas peningkatan yang akan Anda rasakan.
Satu konsekuensi jujur: aliran kini meledak-ledak. Speculative decoding (di bawah) mengeluarkan token yang diterima dalam deretan pendek, sehingga teks bisa datang dalam potongan yang terlihat alih-alih dengan irama satu kata per waktu ala metronom. Jika Anda membangun antarmuka di sekitar irama halus 3.0, itu tetap berfungsi — urutan dan isi token tidak terpengaruh — tetapi Anda mungkin ingin menambahkan pelembutan sendiri di sisi klien jika lebih suka tampilan mesin ketik. Kami rasa kebanyakan orang lebih memilih mendapatkan detiknya kembali.
Mesinnya sendiri menjadi lebih cepat
Menghapus pembatas hanya berguna jika yang ada di balik pembatas itu memang cepat. Kontribusi kedua adalah tumpukan penyajian yang dijelaskan di bagian 03: bobot NVFP4 4-bit dan speculative decoding pada akselerator generasi terkini yang native FP4 di klaster kami sendiri. Bersama-sama keduanya menaikkan langit-langit yang tersingkap saat pembatas dihapus.
Latensi balasan ujung ke ujung relatif, evaluasi internal Shannon Lab, September 2026. Rentangnya mencerminkan panjang prompt dan tier: prompt pendek di Lite berada di ujung bawah, generasi panjang di Pro mendekati ujung atas.
03Apa yang sebenarnya dilakukan speculative decoding
Istilah "speculative decoding inference" sering dipakai sebagai jargon pemasaran, jadi berikut mekanismenya, secara lugas.
Sebuah model bahasa normalnya menghasilkan satu token per lintasan maju. Lintasan itu didominasi bukan oleh aritmetika, melainkan oleh bandwidth memori — bobot harus dibaca untuk menghitung apa pun, dan membacanya jauh lebih lama daripada perhitungannya sendiri. GPU menghabiskan sebagian besar waktunya menunggu memori sementara unit komputasinya menganggur. Menghasilkan 500 token berarti membayar latensi itu 500 kali, secara berurutan.
Speculative decoding menyerang bagian yang berurutan itu. Sebuah model draf yang kecil dan murah mengusulkan deretan pendek token berikutnya yang mungkin — katakanlah empat atau delapan. Model utama lalu mengevaluasi seluruh deretan itu dalam satu lintasan maju terkelompok, yang biayanya nyaris tidak lebih dari mengevaluasi satu token, karena bagian mahalnya (membaca bobot) tetap terjadi sekali saja. Setiap token usulan yang disetujui model utama diterima dan langsung dikeluarkan. Pada ketidaksepakatan pertama, deretan dipotong dan decoding normal dilanjutkan dari titik itu.
Sifat yang penting
Speculative decoding bersifat menjaga keluaran. Langkah verifikasinya disusun sedemikian rupa sehingga urutan yang diterima terdistribusi persis seperti hasil sampling model utama sendiri. Anda tidak sedang mendapatkan jawaban model draf, dan tidak pula mendapatkan aproksimasi jawaban model besar. Anda mendapatkan keluaran model utama, yang dicapai dalam lebih sedikit langkah berurutan. Model draf hanya dapat memengaruhi kecepatan, tidak pernah isi.
Tingkat penerimaanlah yang bekerja di sini. Pada teks yang dapat ditebak — boilerplate, struktur kode, jaringan penghubung sebuah argumen — model draf menebak dengan baik dan deretan panjang mendarat sekaligus. Pada token yang benar-benar sulit, penerimaan turun dan sistem menurun dengan mulus kembali ke decoding satu token per waktu yang biasa. Asimetri itu justru yang Anda inginkan: ia mempercepat bagian yang mudah dan tidak menyentuh yang sulit.
Mengapa bobot 4-bit masuk dalam paragraf yang sama
Karena leher botolnya adalah bandwidth memori, mengecilkan bobot adalah tuas kecepatan langsung, bukan sekadar soal jejak memori. NVFP4 adalah format titik-mengambang 4-bit dengan penskalaan per blok yang halus, dan itulah yang membuatnya mampu mempertahankan akurasi di tempat skema kuantisasi bilangan bulat 4-bit lama kehilangannya. Kira-kira seperempat jumlah byte yang harus dibaca per lintasan maju berarti waktu tunggu memori yang berkurang secara proporsional, dan menyisakan jauh lebih banyak ruang untuk cache KV konteks panjang yang dituntut jendela 196K.
Keduanya bersifat majemuk, bukan sekadar dijumlahkan: lebih sedikit byte per lintasan, dan lebih sedikit lintasan per token yang dikeluarkan. Itulah yang membuat streaming tanpa pembatas pada kecepatan penuh terjangkau untuk dilayani, alih-alih menjadi biaya yang harus kami tarik kembali lewat pacing — yang persis itulah yang dilakukan lapisan pacing pada 3.0.
04196,608 token: apa yang dibuka jendela 6x
Shannon 3.0 punya jendela 32,768 token: sebuah sesi kerja, bukan sebuah dokumen. Kira-kira 70-80 halaman prosa, dikurangi apa pun yang dikonsumsi loop penalaran untuk berpikirnya sendiri, dikurangi prompt sistem Anda, dikurangi percakapan sejauh ini. Pekerjaan nyata terus-menerus membentur dinding itu, dan akal-akalannya — pemotongan, peringkasan, retrieval atas materi Anda sendiri — semuanya menurunkan mutu hal yang justru ingin Anda pertahankan. 196,608 token adalah kategori masalah yang berbeda.
Konkretnya, itu setara sekitar 400-500 halaman teks Inggris, atau sebuah basis kode berukuran menengah lengkap dengan tes dan README-nya, atau catatan rapat satu proyek selama setahun, atau satu set kontrak penuh dengan seluruh lampirannya — ditampung dalam satu percakapan, dapat ditanyakan dalam satu pertanyaan, tanpa lapisan pemotongan antara Anda dan materinya.
- Pertanyaan tingkat seluruh repositori. Muat kodenya dan tanyakan mengapa sebuah bug lolos ke produksi, alih-alih menempelkan tiga berkas yang sudah Anda curigai. Model bisa menemukan berkas yang tidak terpikir Anda sertakan.
- Analisis dokumen panjang tanpa retrieval. Retrieval adalah pra-penyaring yang lossy dan menentukan apa yang boleh dilihat model. Pada 196K Anda sering bisa melewatinya dan membiarkan model membaca semuanya, yang menghapus satu kelas kegagalan penuh di mana bagian yang tepat tidak pernah terambil.
- Percakapan yang tetap koheren. Sesi kerja panjang tidak lagi diam-diam membuang awalnya sendiri. Batasan yang Anda tetapkan di pesan ketiga masih berlaku di pesan kedelapan puluh.
- Ruang untuk loop penalaran. Berpikir, menyusun draf, dan meninjau di dalam loop itu sendiri mengonsumsi konteks. Di 3.0 langkah-langkah itu bersaing dengan materi Anda memperebutkan anggaran yang langka. Di 3.1 semuanya muat dengan lega, dan itu sebagian alasan mengapa peningkatan kualitas dan pembesaran jendela datang bersamaan.
- Masukan campuran berukuran besar. Gambar, teks dokumen yang diekstraksi, dan kode dalam satu giliran, tanpa harus memilah mana yang mampu Anda sertakan.
Satu catatan jujur yang berlaku untuk setiap model konteks panjang, termasuk model kami: jendela besar adalah kapasitas, bukan jaminan perhatian yang merata di sepanjang isinya. Struktur tetap membantu. Menaruh pertanyaan di dekat akhir, memberi label pada dokumen Anda, dan memberi tahu model apa yang harus dicari semuanya meningkatkan hasil secara terukur pada 150K token dengan cara yang tidak terjadi pada 5K.
05Lite dan Pro: shannon-3.1 dan shannon-3.1-pro
Kedua tier berbeda dalam seberapa banyak loop penalaran yang mereka jalankan, dan hanya perbedaan itulah yang penting saat memilih di antara keduanya.
| shannon-3.1 (Lite) | shannon-3.1-pro (Pro) | |
|---|---|---|
| Penalaran | Satu lintasan | Loop penuh + panen pengetahuan |
| Tinjauan diri | Tidak | Ya |
| Jendela konteks | 196,608 | 196,608 |
| Streaming | Kecepatan penuh, tanpa pembatas | Kecepatan penuh, tanpa pembatas |
| Visi & dokumen | Ya | Ya |
| Alat pembuat gambar | Ya | Ya |
| Paling cocok untuk | Sebagian besar pekerjaan, volume tinggi | Pertanyaan sulit, draf pertama tidak cukup |
Gunakan Lite secara default. Satu lintasan dari model penalaran yang baik menangani sebagian besar permintaan nyata, dan di 3.1 ia cukup cepat sehingga loop-nya tidak lagi terasa sebagai penantian. Beralihlah ke Pro ketika pertanyaannya adalah jenis yang jawaban pertamanya biasanya salah dengan cara yang instruktif: trade-off arsitektur, analisis adversarial, apa pun yang Anda ingin rekan kerja kompeten memikirkannya semalaman dulu. Langkah tinjauan diri di Pro bukan hiasan — itu model yang menemukan kesalahannya sendiri sebelum Anda harus melakukannya.
06Peningkatan kecerdasan 32%, dan cara membacanya
Evaluasi internal Shannon Lab menempatkan Shannon 3.1 pada peningkatan kecerdasan 32% dibandingkan Shannon 3.0. Kami ingin jelas tentang apa arti angka itu dan apa yang bukan.
Itu adalah angka kami, dari rangkaian evaluasi internal kami, diukur pada tugas-tugas yang kami anggap mewakili apa yang benar-benar orang bawa ke model semacam ini. Itu bukan benchmark pihak ketiga, dan kami tidak sedang menyusun tabel papan peringkat di sekitar satu agregat internal atau menerbitkan rincian per benchmark — rincian semacam itu menyiratkan tingkat keterbandingan eksternal yang tidak dimiliki rangkaian internal.
Yang akan kami katakan adalah dari mana peningkatan itu berasal, karena bagian itu tidak misterius. Jendela konteks yang lebih besar berarti lebih sedikit materi yang harus dibuang sebelum model menalarnya, dan banyak sekali yang tampak sebagai ketidakcerdasan dalam sesi panjang sebenarnya hanyalah amnesia. Tumpukan penyajian yang kami kendalikan berarti model berjalan dengan konfigurasi yang kami maksudkan, bukan default penyedia. Dan loop penalaran — yang desainnya tidak berubah — kini punya ruang untuk benar-benar berjalan di dalam jendela alih-alih terjepit pada langit-langit 32K yang harus dibagi dengan masukan Anda.
Benchmark yang paling berguna bagi Anda adalah benchmark Anda sendiri. Ambil satu prompt dari beban kerja nyata Anda — bukan teka-teki, yang sungguhan — lalu jalankan di shannon-3 dan kemudian di shannon-3.1. Bandingkan jawabannya, dan hitung waktunya. Angka kami menggambarkan rata-rata sebuah rangkaian; prompt Andalah yang harus menjadi lebih baik.
07Visi, dokumen, dan pembuatan gambar
Shannon 3.1 membaca gambar dan dokumen. Tangkapan layar, diagram, foto, halaman pindaian, PDF, dan dokumen teks bisa masuk ke percakapan dan dinalar bersama semua yang lain. Dipadukan dengan jendela 196K, inilah yang membuat alur kerja dokumen utuh menjadi praktis: sebuah laporan panjang beserta grafiknya dalam satu giliran, tanpa harus memutuskan lebih dulu halaman mana yang boleh dilihat model.
Pembuatan dan pengeditan gambar tersedia di chat sebagai sebuah alat. Mintalah sebuah gambar dan model akan memanggil alat itu secara inline, dalam percakapan yang sama, dengan konteks semua yang telah dibahas sejauh ini. Pengeditan bekerja dengan cara yang sama — berikan sebuah gambar, jelaskan perubahannya. Tidak ada mode terpisah yang harus dipindah dan tidak ada antarmuka terpisah yang harus dipelajari.
08Memanggil Shannon 3.1 dari API
Shannon 3.1 tersedia pada ketiga dialek API, dengan streaming di masing-masing. Model yang sama, tiga bentuk permintaan — pilih mana pun yang cocok dengan SDK yang sudah Anda punya.
| Endpoint | Bentuk | Streaming |
|---|---|---|
| /v1/chat/completions | Kompatibel OpenAI | Ya |
| /v1/messages | Kompatibel Anthropic | Ya |
| /v1/responses | Responses | Ya |
{
"model": "shannon-3.1",
"stream": true,
"messages": [
{ "role": "user", "content": "Summarize this contract set and flag anything unusual." }
]
}
Ganti "shannon-3.1" dengan "shannon-3.1-pro" untuk menjalankan loop penalaran penuh. Jika Anda sudah memanggil shannon-3, migrasinya hanya soal id model dan tidak ada yang lain: bentuk permintaan dan responsnya tidak berubah, dan klien streaming yang ada tetap bekerja. Satu-satunya perbedaan perilaku yang perlu diantisipasi adalah aliran yang lebih meledak-ledak seperti dijelaskan di bagian 02 — token yang sama, urutan yang sama, datang lebih cepat dan dalam potongan yang kurang merata.
Referensi parameter lengkap, autentikasi, semantik galat, dan playground interaktif ada di dokumentasi API. Kartu model lain dan tulisan teknis lainnya ada di riset Shannon.
09Tetap tanpa sensor, dan tidak berubah dalam hal itu
Shannon 3.1 tidak memiliki lapisan penolakan dan tidak ada penyaringan konten pada keluaran. Ini sikap yang sama dengan model Shannon lainnya dan tidak berubah dengan perpindahan ke klaster kami sendiri — kalau ada, mengendalikan tumpukan penyajian justru membuatnya lebih mudah dijamin, karena tidak ada penyedia perantara dengan kebijakannya sendiri yang duduk di antara model dan Anda.
Perlu dinyatakan dengan lugas karena inilah hal yang jelas akan dipertanyakan tentang rilis yang mengubah seluruh jalur keluaran: menghapus lapisan pacing tidak berarti menyisipkan lapisan moderasi di tempatnya. Tidak ada yang memeriksa, menulis ulang, atau menyaring aliran. Apa yang model hasilkan itulah yang sampai. Sejauh yang kami ketahui, Shannon 3.1 adalah model AI tanpa sensor tercepat yang tersedia dengan jendela konteks sebesar ini — dan kedua sifat itu berkaitan, karena keduanya berasal dari menjalankan infrastruktur kami sendiri alih-alih menyewa kapasitas yang sudah dibentuk oleh kepatuhan pihak lain.
Tanpa sensor bukan berarti tanpa tanggung jawab. Penggunaan diatur oleh Kebijakan Penggunaan yang Bertanggung Jawab kami, dan kewajiban yang datang bersama model yang mau menghadapi materi sulit adalah bahwa Anda menghadapinya dengan bertanggung jawab.
10Jalankan perbandingannya sendiri
Setiap klaim di sini bisa diperiksa dalam sekitar dua menit, dan kami lebih ingin Anda memeriksanya daripada memercayai kami.
- Pilih sebuah prompt dari pekerjaan yang benar-benar Anda lakukan. Yang panjang lebih baik — itu menguji jendela sekaligus streaming-nya.
- Jalankan di
shannon-3. Catat berapa lama sampai token pertama, dan berapa lama sampai jawabannya selesai. - Jalankan prompt yang identik di
shannon-3.1. Catat dua angka yang sama. - Lalu baca kedua jawabannya, abaikan jam, dan putuskan mana yang sebenarnya Anda inginkan.
Perbedaan kecepatannya akan langsung terasa dan jelas. Perbedaan kualitasnyalah yang layak direnungkan — itu paling terlihat pada masukan panjang, di mana 3.0 diam-diam bekerja dengan materi Anda yang lebih sedikit daripada yang Anda kira.
11Pertanyaan yang sering diajukan
Apa itu Shannon 3.1?
Shannon 3.1 adalah rilis terkini dari keluarga Shannon 3. Model ini mempertahankan loop penalaran iteratif yang sama — berpikir, menyusun draf, meninjau diri sendiri, memperbaiki — tetapi menjalankannya secara native di klaster GPU kami sendiri, bukan di penyedia inferensi pihak ketiga. Evaluasi internal Shannon Lab mengukur peningkatan kecerdasan 32% dan balasan 10-15x lebih cepat dibandingkan Shannon 3.0, dengan jendela konteks naik dari 32,768 menjadi 196,608 token.
Seberapa jauh Shannon 3.1 lebih cepat dari Shannon 3.0?
Antara 10x dan 15x lebih cepat pada balasan ujung ke ujung, menurut evaluasi internal Shannon Lab. Ada dua penyebabnya. Keluaran Shannon 3.0 melewati lapisan pacing yang sengaja membatasi laju aliran; Shannon 3.1 tidak punya pembatas kecepatan maupun pacing penampilan, sehingga token sampai kepada Anda secepat mesin memproduksinya. Mesinnya sendiri juga lebih cepat: bobot NVFP4 4-bit ditambah speculative decoding di klaster GPU kami sendiri.
Seberapa besar jendela konteks Shannon 3.1?
196,608 token, naik 6x dari 32,768 token yang tersedia di Shannon 3.0. Itu kira-kira setara 400-500 halaman teks, atau sebuah basis kode berukuran menengah, yang ditampung dalam satu percakapan tanpa pemotongan atau retrieval.
Apa itu speculative decoding dan mengapa penting di sini?
Sebuah model draf yang kecil dan cepat mengusulkan sederet token berikutnya yang mungkin, lalu model utama memverifikasinya dalam satu lintasan terkelompok. Token yang diterima langsung dikeluarkan; yang ditolak kembali ke decoding biasa. Keluarannya tetap sama dengan yang akan dihasilkan model utama sendiri, tetapi beberapa token bisa mendarat per langkah verifikasi, bukan hanya satu. Inilah yang membuat streaming pada kecepatan penuh terjangkau, bukan menjadi masalah biaya.
Apakah Shannon 3.1 tanpa sensor?
Ya. Shannon 3.1 tidak memiliki lapisan penolakan dan tidak ada penyaringan konten yang diterapkan pada keluarannya, sama seperti model Shannon lainnya. Menghapus lapisan pacing tidak berarti menambahkan lapisan moderasi sebagai gantinya — aliran yang Anda terima adalah keluaran model itu sendiri.
Apa id modelnya dan di mana saya bisa memakai Shannon 3.1?
shannon-3.1 adalah tier Lite dan shannon-3.1-pro adalah tier Pro. Keduanya tersedia di chat dan pada ketiga dialek API: /v1/chat/completions (bentuk OpenAI), /v1/messages (bentuk Anthropic), dan /v1/responses. Streaming berfungsi di ketiganya.
Apa bedanya shannon-3.1 dan shannon-3.1-pro?
Lite menjalankan satu lintasan loop penalaran: berpikir, lalu menjawab. Pro menjalankan loop penuh — berpikir, menyusun draf, meninjau diri sendiri, memperbaiki — dengan langkah panen pengetahuan sebelum menyusun draf. Lite adalah pilihan default yang tepat untuk sebagian besar pekerjaan; Pro untuk pertanyaan yang jawaban pertamanya biasanya bukan yang terbaik.
Coba Shannon 3.1
Loop penalaran yang sama. Jendela enam kali lipat. Tanpa pembatas kecepatan.
Mulai Mengobrol Baca Dokumentasi APIshannon-3.1 · shannon-3.1-pro · streaming di ketiga dialek
Angka kinerja dan kecerdasan dalam artikel ini adalah pengukuran Shannon Lab sendiri dari evaluasi internal, September 2026, dan dinyatakan sebagai angka produk, bukan hasil benchmark pihak ketiga. Jendela konteks, id model, dan ketersediaan API adalah spesifikasi produk. Shannon AI dioperasikan oleh Shannon Lab LLC, New Mexico, USA. Bacaan terkait: Shannon 3 · Indeks riset Shannon · Dokumentasi API.