Kami tidak menyimpan atau mengakses data pengguna mana pun, dan kami tidak menangguhkan akun kecuali otoritas yang sah meminta tindakan penegakan.
Panduan · Prompt Gambar

Panduan Prompt Gambar AI

Image Model Shannon membaca prompt seperti model bahasa. Satu fakta itu mengubah segalanya tentang cara Anda seharusnya menulisnya — dimulai dengan meninggalkan tag berpemisah koma.

Diperbarui 5 September 2026Panduan PraktisShannon 3 · Pembuatan Gambar

Ringkasnya

Tulis prosa mengalir dalam kalimat utuh, bukan tag kata kunci. Bidik 30–80 kata. Susun sesuai cara model membacanya: subjek → aksi → gaya → latar dan pencahayaan → teknis, yang terpenting lebih dulu. Buat subjeknya konkret. Jika Anda mau sebuah foto, tulislah sebagai sebuah foto — sebut kamera, lensa, dan jenis film atau sumber cahaya. Tempelkan warna persis pada objek bernama sebagai color #RRGGBB. Pilih satu dari lima rasio aspek. Dan tinggalkan kebiasaan era SDXL: tanpa "masterpiece, best quality, 8k", tanpa bobot (word:1.3), dan tanpa negative prompt di text-to-image — jelaskan hanya apa yang Anda inginkan. Pengeditan dan penggabungan memang menerima negative prompt.

Kebanyakan orang datang dengan kebiasaan prompt yang dipelajari di SDXL: deretan kata benda berpemisah koma, pembuka berisi token kualitas, beberapa bobot dalam tanda kurung, dan negative prompt sepanjang prompt positifnya. Kebiasaan itu benar untuk model-model tersebut dan justru kontraproduktif di sini. Ini versi ringkas dari apa yang benar-benar berhasil — dan karena Shannon menuliskan prompt pembuatan untuk Anda lalu menampilkannya sebelum apa pun dirender, ini sekaligus panduan untuk membaca dan mengoreksi apa yang Shannon usulkan.

30–80
Target kata
5
Rasio aspek
0
Negative prompt di T2I
1
Kartu konfirmasi dulu

01Mengapa prosa mengalahkan tag: modelnya membaca seperti model bahasa

Model difusi lama yang menjadi sasaran hampir semua saran prompt memakai text encoder yang dalam praktiknya berlaku seperti kantong konsep: tata bahasa nyaris tidak penting, dan strategi pemenangnya adalah menumpuk kata benda yang relevan lalu membiaskannya dengan bobot. Sup tag memang bentuk prompt yang benar untuk encoder itu.

Image Model Shannon tidak bekerja seperti itu. Ia membaca prompt seperti model bahasa membaca teks, jadi sintaks membawa makna. "Holding an umbrella against her shoulder" adalah hubungan antara seseorang, sebuah objek, dan sebuah bagian tubuh; "umbrella, shoulder" hanyalah dua hal yang kebetulan hadir. Kata depan menempatkan benda. Kata kerja menciptakan pose. Klausa melekatkan detail pada kata benda yang tepat alih-alih membiarkannya melayang ke seluruh gambar.

Berikut gambar yang sama diminta dengan dua cara.

Gaya tag — kebiasaan lama
woman, 30s, tokyo, rain, night, crosswalk, neon signs, umbrella,
wet asphalt, reflections, masterpiece, best quality, 8k, ultra
detailed, (bokeh:1.3), cinematic lighting, photorealistic
27 potongan berpemisah koma. Tanpa kata kerja, tanpa hubungan, empat token mati, satu sintaks bobot yang tidak diurai.
Gaya prosa — yang berhasil di sini
A woman in her early thirties waits at a rain-soaked Tokyo
crosswalk at night, holding a clear vinyl umbrella against her
shoulder and glancing down the street. Neon storefront signs
bleed red and cyan into the wet asphalt at her feet. Shot on
Kodak Portra 400, 85mm f/1.4, shallow depth of field, the
traffic signal behind her thrown out of focus.
61 kata. Setiap elemen ditempatkan relatif terhadap elemen lain, dan pembingkaiannya dinyatakan sebagai keputusan kamera.

Perhatikan apa yang tidak bisa diungkapkan versi tag. Ia tidak pernah bilang payungnya dipegang, jadi payung itu bisa saja tergeletak di tanah. Ia tidak pernah bilang neonnya terpantul di aspal, hanya bahwa keduanya ada, jadi Anda mendapat papan reklame dan jalan basah tanpa hubungan optis di antaranya. Ia tidak pernah bilang ke mana perempuannya memandang, jadi posenya undian. "Cinematic lighting" adalah label suasana, bukan sumber cahaya. Dan lima token terakhirnya derau, dibaca sebagai kata Inggris tentang fotografi, bukan sebagai kendali.

Versi prosa lebih panjang bukan karena berbunga-bunga. Ia lebih panjang karena menjawab pertanyaan yang dibiarkan terbuka oleh versi tag. Itu saja triknya.

02Seberapa panjang sebuah prompt gambar sebaiknya?

Bidik 30 sampai 80 kata. Jangan jauh melewati 100. Ini tuas kualitas paling mudah yang tersedia bagi Anda, dan kedua ujung rentangnya sama pentingnya.

Di bawah sekitar 30 kata, komposisi, cahaya, dan pembingkaiannya tidak dispesifikasikan, jadi model memilih apa pun yang paling lazim secara statistik. "A woman in a coffee shop" adalah prompt yang sah yang menghasilkan gambar mudah dilupakan, karena Anda mendelegasikan setiap keputusan yang menarik.

Di atas kira-kira 100 kata muncul kegagalan berbeda: klausa akhir bersaing dengan klausa awal memperebutkan wilayah gambar yang sama, dan alih-alih menumpuk detail Anda mendapat pengenceran. Deskripsi pencahayaan ketiga membatalkan yang pertama, dan subjek yang Anda tetapkan pada delapan kata pertama mendapat perhatian relatif yang makin kecil setiap kali Anda menambah kalimat. Prompt panjang terbaca menyeluruh. Ia tidak terender menyeluruh.

Disiplinnya: tulis prompt yang Anda mau, lalu pangkas kembali sampai tersisa kalimat yang akan mengubah gambarnya jika dihapus.

03Disiplin urutan: hal terpenting lebih dulu

Karena model membaca secara berurutan, posisi adalah penekanan: yang datang pertama menjangkarkan gambarnya, yang datang terakhir menyetelnya. Susun sesuai urutan yang dibutuhkan model:

  1. Subjek — siapa atau apa yang menjadi isi gambar ini, secara konkret.
  2. Aksi atau pose — apa yang mereka lakukan, bagaimana posisinya.
  3. Gaya atau suasana — foto, lukisan cat minyak, ilustrasi teknis, dan nadanya.
  4. Latar dan pencahayaan — di mana ini terjadi dan cahaya apa yang menimpanya.
  5. Teknis — pembingkaian, lensa, kedalaman bidang, kekhususan warna.

Luka yang paling sering ditimbulkan sendiri adalah memulai dengan klausa teknis. Membuka dengan "Cinematic wide shot, anamorphic lens flare, teal and orange grade, of a man reading a newspaper" memberi tahu model bahwa tampilannya adalah subjeknya dan lelaki itu hanya detail. Anda mendapat bingkai indah nan kosong dengan sosok kecil yang tidak jelas di dalamnya.

Teknis lebih dulu — subjeknya datang terlalu telat
Cinematic wide shot, anamorphic lens flare, teal and orange
color grade, shallow depth of field, golden hour, of a man
reading a newspaper on a park bench.
Subjek lebih dulu — elemen yang sama, urutan yang benar
A man in his sixties in a gray wool overcoat sits on a park
bench reading a folded broadsheet newspaper, one ankle crossed
over his knee. Late golden-hour sun rakes across him from the
left through bare plane trees. Photographed wide on a 35mm
anamorphic lens, shallow depth of field, warm highlights and
cool shadows.

Setiap elemen dari versi pertama bertahan di versi kedua; tidak ada yang dibuang. Modelnya kini sekadar tahu gambar itu tentang apa sebelum diberi tahu cara memotretnya — dan penyusunan ulang itu saja memindahkan subjeknya dari sampingan menjadi pusat.

04Buat subjeknya konkret

"A person" bukan subjek, ia tempat kosong — dan model mengisi tempat kosong dengan rata-rata dari segala yang pernah ia lihat, dan justru dari sanalah tampilan mengilap, tanpa usia, tanpa karakter itu berasal. Kekonkretan memakan lima kata dan membelikan Anda seorang manusia yang spesifik:

KaburKonkret
seseorangseorang lelaki berusia empat puluhan dengan janggut beruban dan garis senyum yang dalam
seorang perempuanseorang perempuan akhir dua puluhan dengan potongan undercut gelap dan gigi depan yang gompal
sebuah bangunan tuasebuah gudang bata empat lantai dengan papan nama yang tertutup cat dan jendela atas yang dipapan
makanansemangkuk ramen dengan telur setengah matang terbelah di atasnya, uap mengepul

Perhatikan polanya: usia atau era, satu ciri struktural, satu ketidaksempurnaan pembeda. Butir ketiga itulah yang membuat hasilnya terasa difoto alih-alih dihasilkan mesin. Gigi gompal, keliman yang usang, papan nama yang tertutup cat — asimetri kecil adalah sinyal anti-plastik terkuat yang tersedia, dan hampir tidak memakan anggaran kata Anda.

05Fotorealisme: tulis permintaannya sebagai sebuah foto

Fotorealisme adalah nada default kecuali Anda meminta seni, ilustrasi, atau anime. Tetapi kata "photorealistic" hampir tidak melakukan apa-apa. Yang menghasilkan sebuah foto adalah menggambarkan tindakan memotret: kamera nyata, lensa nyata, dan jenis film atau sumber cahaya nyata.

Alasannya lugas. Setiap gambar berkapsi "Kodak Portra 400" dibuat lewat proses tertentu dengan struktur butir, peluruhan sorot, dan rendisi kulit tertentu, dan menyebut jenis filmnya memanggil semua itu. "8k ultra detailed" hanya pernah muncul di spam situs stok, jadi ia memanggil spam situs stok. Beberapa resep andal, masing-masing menghasilkan gambar yang jelas berbeda atas subjek yang sama:

ResepApa yang Anda dapat
Kodak Portra 400, 85mm f/1.4, soft window lightWarna kulit hangat dan pemaaf; pemisahan lembut; potret editorial
Ilford HP5 pushed to 1600, 35mm, available lightHitam putih berbutir, kontras tinggi, energi dokumenter jalanan
Digital medium format, 80mm, single softbox at 45°Tampilan studio komersial yang bersih, peluruhan terkendali, kelas produk
135mm f/2, backlit at golden hour, atmospheric hazeLatar terkompresi, cahaya tepi, tampilan telefoto yang romantis

Sesuaikan pembumian dengan resepnya — tekstur kulit setingkat pori tidak berarti apa-apa pada lensa lebar 24mm di mana wajahnya cuma setinggi delapan puluh piksel — lalu tambahkan. Detail pembumian adalah — bukti tekstur bahwa sebuah lensa benar-benar merekam ini. Pori kulit dan bulu wajah halus yang terlihat. Anyaman kemeja linen. Butir debu dalam berkas cahaya. Goresan pada sepatu bot kulit. Helai rambut liar terhadap latar terang. Dua atau tiga saja cukup, dan itulah pembeda antara render seseorang dan foto seseorang.

06Adegan berlapis: latar depan, latar tengah, latar belakang

Ketika sebuah adegan punya kedalaman, jelaskan ketiga bidangnya secara terpisah dan berurutan. Ini teknik paling efektif untuk gambar yang seharusnya terasa seperti tempat, bukan seperti kain latar, dan hampir tidak ada yang melakukannya. Tanpa itu Anda mendapat kedataran: semua yang disebut prompt mendarat kira-kira pada jarak yang sama, bersaing memperebutkan pita tengah bingkai yang sama. Menyebut bidang memberi model anggaran kedalaman untuk dibelanjakan.

Tiga bidang, disebut secara eksplisit
In the foreground, a cracked concrete ledge with a half-empty
paper coffee cup and a scattering of cigarette ash, slightly out
of focus. In the midground, a bicycle courier in a yellow rain
jacket wheels her bike across a wet plaza, caught mid-stride. In
the background, a glass office tower dissolves into low fog.
Shot on a 50mm lens at f/2.8, flat overcast light.
70 kata. Elemen latar depan yang tidak fokus itulah yang menjual kedalamannya — ia memberi tahu model di mana kameranya berdiri.

Dua penyempurnaan. Taruh sesuatu di latar depan yang sengaja tidak fokus — foto sungguhan atas adegan berkedalaman hampir selalu punya satu, dan ketiadaannya adalah petunjuk yang umum. Dan sebutkan bidang mana yang ditempati subjeknya: jika kurir sepeda itu inti gambarnya, ia milik latar tengah, kalau tidak menaranya dan cangkir kopinya akan berebut bingkai dengannya.

07Warna persis: kode heksadesimal, ditempelkan pada objek

Untuk pekerjaan merek, kesinambungan kostum, atau di mana pun "merah" tidak cukup spesifik, tulis kode heksadesimalnya sebagai color #RRGGBB dan tempelkan pada objek bernama:

Benar: heksadesimal terikat pada kata benda
...wearing a heavy wool peacoat, color #8B0000, over a cream
turtleneck, against a studio backdrop, color #1E3A5F.
Salah: heksadesimal melayang bebas
...#8B0000, #1E3A5F, dark red and navy color palette, moody...
Tidak ada yang mengikat kode ini pada apa pun, jadi mereka bertindak sebagai saran rona samar atas seluruh bingkai.

Tiga pedoman praktis. Pakai heksadesimal untuk dua atau tiga warna yang benar-benar penting dan kata biasa untuk sisanya — prompt dengan enam kode heksadesimal menghabiskan sebagian besar anggarannya untuk contoh warna. Ikat kodenya pada objek bertepi, jangan pernah pada "pencahayaan" atau "suasana". Dan ingat bahwa ia menentukan warna objeknya, bukan nilai piksel akhirnya: mantel #8B0000 dalam cahaya belakang golden hour akan terender lebih hangat daripada contoh warnanya, persis seperti di dunia nyata.

08Memilih rasio aspek

Tersedia lima rasio dan yang tepat biasanya sudah tersirat dari subjeknya, tetapi permintaan eksplisit dari Anda selalu menang — minta sebuah wallpaper dan Anda mendapat tall tanpa peduli apa yang disiratkan isinya.

RasioPaling cocok untukAlasan
squareDefault. Objek tunggal di tengah, ikon, komposisi simetris, unggahan media sosialTidak ada sumbu dominan, jadi tidak ada yang terpotong oleh bias bingkainya sendiri
portraitOrang, seluruh atau setengah badan; subjek menjulang seperti menara, pohon, botolMemberi figur berdiri ruang dari kepala sampai kaki tanpa mengecilkannya
landscapePemandangan, interior, sekelompok orang, foto produk dalam konteksRuang horizontal agar latarnya benar-benar menjadi sebuah latar
wideBingkai sinematik, cuplikan film, spanduk, gambar headerPilihan terlebar; ruang negatif yang kuat, rasa anamorfik
tallPoster, sampul buku, wallpaper ponsel, format sosial vertikalLebih tinggi dari portrait; menyisakan ruang yang disengaja untuk teks atau langit

Salah memilih ini lebih merusak daripada kelihatannya. Figur berdiri seluruh badan dalam bingkai wide tidak memberi Anda figur kecil dalam bingkai besar — ia biasanya memberi figur yang terpotong, karena model mengisi lebarnya dan kepala atau kakinya keluar bingkai. Sesuaikan bingkai dengan sumbu dominan subjeknya dan sebagian besar keluhan komposisi akan lenyap.

Dua perilaku yang layak diingat: pengeditan otomatis mempertahankan rasio aspek gambar sumbernya, jadi Anda tidak bisa membingkai ulang lewat pengeditan, sementara penggabungan membiarkan Anda memilih kanvas baru — sering kali cara paling bersih untuk mengubah bentuk sesuatu yang sudah Anda punya.

09Kebiasaan buruk: apa yang harus dihentikan

Token kualitas: "masterpiece, best quality, 8k, ultra detailed"

Ini pegangan hasil temuan komunitas untuk distribusi pelatihan lama tertentu, di mana frasa kapsi tertentu berkorelasi dengan sumber gambar tertentu. Semua itu tidak berpindah ke sini. Di sini mereka dibaca sebagai kata Inggris biasa, tidak menyumbang apa-apa, dan memakan sebagian anggaran kata yang sudah dikatakan sempit. Penggantinya adalah menyebut detail yang mana yang Anda inginkan: bukan "ultra detailed" melainkan "visible weave in the coat fabric and fine stubble along the jaw" — niat yang sama, diungkapkan sebagai sesuatu yang bisa dirender model.

Sintaks bobot: (word:1.3), [word], {{word}}

Tidak diurai. Tanda kurung, kurung siku, titik dua, dan angkanya mendarat sebagai teks harfiah dan, kalau ada efeknya, justru membuat klausa di sekitarnya lebih sulit dibaca. Jika Anda mau lebih menekankan sesuatu, gunakan dua tuas yang memang bekerja: pindahkan lebih awal di dalam prompt, dan beri lebih banyak kata. "A crimson silk scarf, its fringed ends lifting in the wind" mengalahkan "(red scarf:1.4)" pada setiap ukuran yang penting.

Arahan yang bertentangan

Mencampur instruksi yang tak sejalan tidak membaurkannya; ia menghasilkan rata-rata yang labil yang biasanya tidak memuaskan keduanya. Pelanggar yang sering muncul:

  • Medium — "photorealistic" plus "watercolor"; "oil painting" plus "shot on 85mm". Pilih satu dan tetaplah di situ.
  • Pembingkaian — "wide establishing shot" plus "extreme close-up on her eyes"; "full body" plus "detailed facial pores".
  • Pencahayaan — "harsh midday sun" plus "soft golden hour glow"; "low key, deep shadows" plus "bright and airy".
  • Era — "1970s film aesthetic" plus "modern minimalist" plus "cyberpunk".
  • Penumpukan gaya — empat seniman atau empat genre sekaligus. Dua rujukan yang berkerabat bisa berhasil; empat saling meniadakan menjadi generik.
  • Bertele-tele — "rustic, weathered, ancient, timeworn wooden door" adalah satu gagasan yang ditulis empat kali, dan setiap pengulangannya mengencerkan sisa prompt-nya.

10Tidak ada negative prompt di text-to-image

Inilah kebiasaan buruk yang paling keras menjegal pengguna berpengalaman, karena pada tumpukan lama negative prompt adalah separuh dari keahliannya.

OperasiNegative promptApa yang harus dilakukan
Text-to-image (membuat)Tidak didukungJelaskan hanya apa yang Anda inginkan. Jangan pernah menulis "tanpa X".
Mengedit satu gambarDidukungTaruh artefak yang tak diinginkan di sana, jaga instruksinya tetap positif.
Menggabungkan dua atau lebihDidukungSama — artefak di bagian negatif, peran di bagian positif.

Untuk pembuatan gambar aturannya mutlak dan sedikit berlawanan dengan intuisi: menulis "tanpa teks, tanpa tanda air, tanpa jari berlebih" ke dalam prompt justru membuat hal-hal itu lebih mungkin muncul, bukan kurang. Model membaca "tanpa teks" sebagai kalimat yang mengandung konsep teks; penyangkalan adalah sinyal lemah dan kata bendanya sinyal kuat. Anda praktis telah meminta teks. Nyatakan selalu bentuk positifnya:

Alih-alihTulis
tanpa latar yang berantakanlatar abu-abu mulus tanpa sambungan
jangan buramtajam sekali pada mata, f/8
tanpa orang lainsendirian di jalan kosong saat fajar
tanpa benda moderndapur tahun 1930-an dengan peralatan enamel dan tungku besi tuang
tanpa gaya kartundipotret dengan Kodak Portra 400, 85mm, tekstur kulit alami

Untuk pengeditan dan penggabungan, negative prompt memang ada dan sebaiknya Anda gunakan — tetapi untuk artefak, bukan untuk isi. Bahan yang bagus: tanda air, teks tumpang tindih, anggota tubuh ganda, tangan yang melengkung aneh, lingkar halo akibat penajaman berlebih, blok JPEG, garis sambungan di tepi komposit. Bahan yang buruk: apa pun tentang gambar itu tentang apa, yang tempatnya di instruksi.

11Membaca prompt yang ditulis Shannon untuk Anda

Inilah yang membuat panduan ini langsung bisa dipakai alih-alih teoretis. Anda tidak harus menulis prompt pembuatannya sendiri. Anda meminta dengan bahasa sehari-hari, dalam bahasa apa pun; Shannon mengenali bahwa sebuah gambar sedang diminta, menyusun prompt pembuatan dalam bahasa Inggris, dan menampilkannya kepada Anda di sebuah kartu konfirmasi sebelum apa pun dirender. Tidak ada yang dibuat dan tidak ada yang ditagih sampai Anda mengonfirmasi.

Jadi keterampilan yang paling menguntungkan bukanlah menulis prompt dari nol — melainkan membaca prompt yang ada di kartu. Telusuri daftar ini:

  1. Apakah subjeknya konkret? Jika kartunya berbunyi "a person" atau "a woman", Anda baru saja menemukan perbaikan terbesar yang tersedia. Berilah usia, perawakan, sebuah ciri.
  2. Apakah subjeknya lebih dulu? Jika prompt-nya dibuka dengan gaya atau kamera, mintalah agar dibuka dengan subjeknya.
  3. Apakah panjangnya masuk rentang? Di bawah 30 kata, mintalah kekhususan lebih pada cahaya dan latar. Di atas 100, mintalah dipangkas.
  4. Adakah sumber cahaya? Bukan kata suasana — melainkan cahaya sungguhan: jendela, lampu jalan, lampu kilat, langit mendung, softbox.
  5. Ada pertentangan? Pindai apakah ada dua medium, dua pembingkaian, atau dua kondisi pencahayaan dalam prompt yang sama.
  6. Ada penyangkalan yang menyelinap? Jika kartunya memuat "without", "no", atau "avoid", itu prompt text-to-image yang justru meminta hal yang ia sebut.
  7. Apakah rasionya cocok untuk subjeknya? Figur seluruh badan dalam wide adalah ketidakcocokan klasiknya.

Koreksinya bersifat percakapan: "buat dia awal tiga puluhan dengan bekas luka di salah satu alis, potret dengan Portra pada 85mm, dan pakai portrait" sudah menjadi instruksi yang sangat baik. Anda mendapat kartu baru dan mengonfirmasi yang itu. Tidak ada denda untuk mengulang, karena belum ada yang dirender.

Dan Shannon tidak membuat gambar tanpa diminta. Sapaan, pertanyaan, atau foto yang Anda lampirkan untuk didiskusikan tidak memicu render. Meminta Shannon melihat sebuah gambar — mendeskripsikannya, membacanya, menganalisisnya — adalah pekerjaan visi biasa, bukan pembuatan gambar, dan tidak memakan biaya tambahan.

12Bagaimana keahliannya bergeser untuk pengeditan dan penggabungan

Aturan di atas ditulis untuk pembuatan gambar. Dua mode bertetangga mengubah bentuk prompt-nya.

Mengedit satu gambar

Prompt pengeditan adalah sebuah instruksi, bukan deskripsi: nyatakan apa yang berubah dan apa yang tetap. Menyebutkan bagian yang tidak berubah adalah tuas kualitas terbesar dalam produk ini — "Ubah latarnya menjadi jalan kota di malam hujan dengan pantulan neon, pertahankan perempuannya persis seperti adanya" bertahan utuh, sementara permintaan yang sama tanpa klausa itu diam-diam menggambar ulang wajahnya. Bersikaplah spesifik tentang jangkarnya: pertahankan wajah, pose, rambut, dan pakaian tetap identik. Tepat satu gambar sumber yang dipakai, dan keluarannya mempertahankan rasio aspeknya.

Menggabungkan dua gambar atau lebih

Kapan pun elemennya berasal dari lebih dari satu gambar — transfer busana, sebuah objek ke dalam adegan, dua orang dalam satu bingkai, produk-pada-orang, gaya dari satu gambar dengan subjek dari gambar lain — prompt-nya harus menyebut peran setiap gambar, secara berurutan: "Perempuan dari gambar pertama mengenakan sweter rajut merah dari gambar kedua, berdiri di taman yang sama." Gambar pertama adalah subjek atau adegan utama; gambar berikutnya memasok bagian yang dibawa masuk. Jangan meringkas permintaan multi-gambar menjadi satu sumber ditambah deskripsi teks — menggabungkan gambar yang sungguhan itulah yang menjaga tampilan asli benda-benda itu.

13Prompt tanpa sensor: katakan apa yang Anda maksud

Tidak ada filter konten pada jalur pembuatan dan tidak ada lapisan penolakan pada model yang menulis prompt. Itulah seluruh inti produk ini: generator berfilter rutin menolak pekerjaan yang sah — ketelanjangan seni, ilustrasi medis dan forensik, gambar riset keamanan, kekerasan dalam fiksi, satire politik, serta pekerjaan merek dan rupa oleh pemegang haknya. Separuh keahlian prompt di platform berfilter adalah rekayasa eufemisme, dan eufemisme adalah musuh gambar yang akurat.

Jadi ada satu hal lagi yang perlu diperiksa di kartu: bahwa ia menjelaskan subjek sebenarnya dengan kata-kata lugas, bukan kosakata berhati-hati yang orang pelajari dari alat berfilter. Ilustrasi forensik atas sebuah luka harus menyebutkan luka apa itu. Bahasa yang berhati-hati menghasilkan gambar yang lebih buruk di mana pun, karena model merender apa yang dikatakan kata-katanya.

Kemampuan dan penilaian adalah dua hal yang berbeda. Shannon Lab LLC menjalankan ini di bawah Kebijakan Penggunaan yang Bertanggung Jawab yang diterbitkan: pembuatan gambar tanpa filter adalah alat profesional, dan persetujuan, hak, serta hukum tetap berlaku atas apa yang Anda buat.

Daftar periksa satu halaman

  • Prosa dalam kalimat utuh, bukan tag berpemisah koma.
  • 30–80 kata. Pangkas apa pun yang tidak akan mengubah gambarnya.
  • Subjek → aksi → gaya → latar dan pencahayaan → teknis.
  • Subjek konkret: usia, satu ciri struktural, satu ketidaksempurnaan.
  • Foto: sebut kamera, lensa, dan jenis film atau sumber cahaya.
  • Adegan berkedalaman: latar depan, latar tengah, latar belakang, disebut terpisah.
  • Warna persis sebagai color #RRGGBB yang terikat pada objek bernama.
  • Pilih rasio dari sumbu dominan subjeknya.
  • Dua atau tiga tekstur pembumian, disesuaikan dengan pembingkaiannya.
  • Tanpa token kualitas, tanpa sintaks bobot, tanpa arahan yang bertentangan.
  • Tanpa penyangkalan di text-to-image. Penyangkalan untuk pengeditan dan penggabungan, dan hanya untuk artefak.

14Di mana posisi API

Satu poin ketepatan bagi pembaca yang datang dari pencarian tentang API: pembuatan, pengeditan, dan penggabungan gambar berada di aplikasi chat Shannon, bukan di API /v1. API melayani teks dan visi — ia bisa membaca, mendeskripsikan, dan menganalisis gambar yang Anda kirimkan lewat ketiga dialek (/v1/chat/completions, /v1/messages, /v1/responses, semuanya streaming) — tetapi ia tidak membuatnya. Jika Anda sedang membangun alur yang perlu memahami gambar, dokumentasi API adalah tempat memulainya. Jika Anda ingin membuat gambar, itu di aplikasi chat, dan semua isi panduan ini berlaku di sana. Gambar dirender di klaster GPU kami sendiri.

15Pertanyaan yang sering diajukan

Seberapa panjang seharusnya sebuah prompt gambar AI?

Bidik 30 sampai 80 kata dan jangan jauh melewati 100. Di bawah 30 kata Anda menyerahkan komposisi, pencahayaan, dan pembingkaian kepada kebetulan. Lewat 100 kata, klausa yang belakangan mulai bersaing dengan yang di depan dan detailnya justru memudar alih-alih menumpuk.

Sebaiknya saya menulis tag kata kunci atau kalimat utuh?

Kalimat utuh. Image Model Shannon membaca prompt seperti model bahasa membaca teks, jadi tata bahasa membawa informasi. "A woman in her 30s at a rain-soaked Tokyo crosswalk at night" menghasilkan adegan yang koheren; "woman, 30s, Tokyo, rain, night" menghasilkan tumpukan atribut lepas tanpa hubungan satu sama lain.

Bisakah saya memakai negative prompt untuk text-to-image?

Tidak. Text-to-image di Shannon tidak menerima negative prompt, jadi jelaskan hanya apa yang Anda inginkan dan jangan pernah menulis "tanpa X" di dalam prompt-nya sendiri — menyebut sesuatu justru cenderung memanggilnya. Pengeditan gambar dan penggabungan gambar memang mendukung negative prompt, dan di sanalah tempat yang tepat untuk artefak yang tak diinginkan seperti tanda air, teks tumpang tindih, atau anggota tubuh ganda.

Apakah token seperti "masterpiece, best quality, 8k" memperbaiki gambarnya?

Tidak. Itu pegangan bagi model generasi lama dan tidak membawa informasi apa pun di sini — semuanya sekadar dibaca sebagai kata biasa, dan menghabiskan sebagian anggaran 30–80 kata Anda tanpa mengatakan apa-apa. Sintaks bobot seperti (word:1.3) juga tidak diurai; ia mendarat sebagai teks harfiah. Sebagai gantinya, jelaskan detail nyata yang Anda inginkan.

Bagaimana cara mendapatkan warna yang persis?

Tulis kode heksadesimalnya sebagai color #RRGGBB dan tempelkan pada objek bernama yang spesifik, misalnya "a wool jacket, color #8B0000". Kode heksadesimal yang melayang tanpa objek tidak punya apa pun untuk ditambatkan. Pakailah untuk dua atau tiga warna yang benar-benar penting dan jelaskan sisanya dengan kata-kata.

Bisakah saya membuat gambar melalui API Shannon?

Tidak. Pembuatan, pengeditan, dan penggabungan gambar terjadi di aplikasi chat Shannon. API /v1 melayani teks dan visi — ia bisa membaca dan menganalisis gambar yang Anda kirimkan, tetapi tidak membuatnya. Semua isi panduan ini berlaku untuk aplikasi chat.

Cobalah pada prompt sungguhan

Mintalah dalam bahasa apa pun. Baca kartunya. Sesuaikan. Lalu konfirmasi.

Buka Shannon Chat Riset Lainnya

Tidak ada yang dirender, dan tidak ada yang ditagih, sampai Anda mengonfirmasi prompt-nya


Bacaan terkait: Pembuatan gambar AI tanpa sensor · Pengeditan gambar AI tanpa sensor · Kebijakan Penggunaan yang Bertanggung Jawab · Dokumentasi API · Semua riset Shannon. Panduan di sini diambil dari pengujian kami sendiri atas Image Model Shannon; saran yang ditulis untuk tumpukan difusi lama umumnya tidak berpindah ke sini.

Semua tautan riset