Der KI-Bild-Prompt-Leitfaden
Shannons Bildmodell liest einen Prompt wie ein Sprachmodell. Diese eine Tatsache ändert alles daran, wie Sie einen schreiben sollten — angefangen damit, die kommagetrennten Tags wegzulassen.
Kurzfassung
Schreiben Sie fließende Prosa in ganzen Sätzen, keine Stichwort-Tags. Zielen Sie auf 30–80 Wörter. Ordnen Sie es so, wie das Modell liest: Motiv → Handlung → Stil → Schauplatz und Licht → Technik, das Wichtigste zuerst. Werden Sie beim Motiv konkret. Wenn Sie ein Foto wollen, schreiben Sie es als Foto — nennen Sie eine Kamera, ein Objektiv und einen Filmtyp oder ein Licht. Hängen Sie exakte Farben als color #RRGGBB an benannte Objekte. Wählen Sie eines von fünf Seitenverhältnissen. Und lassen Sie die Gewohnheiten aus der SDXL-Ära: kein „masterpiece, best quality, 8k“, keine (word:1.3)-Gewichte und keinen negativen Prompt bei Text-zu-Bild — beschreiben Sie nur, was Sie wollen. Bearbeitung und Zusammenführung nehmen sehr wohl einen negativen Prompt entgegen.
Die meisten kommen mit Prompt-Gewohnheiten an, die sie an SDXL gelernt haben: eine kommagetrennte Kette von Substantiven, eine Präambel aus Qualitätstoken, ein paar Gewichte in Klammern und ein negativer Prompt, so lang wie der positive. Diese Gewohnheiten waren für jene Modelle richtig und sind hier kontraproduktiv. Das hier ist die Kurzfassung dessen, was tatsächlich funktioniert — und weil Shannon den Generierungs-Prompt für Sie schreibt und ihn zeigt, bevor etwas gerendert wird, ist es genauso ein Leitfaden zum Lesen und Korrigieren dessen, was Shannon vorschlägt.
01Warum Prosa Tags schlägt: Das Modell liest wie ein Sprachmodell
Die älteren Diffusionsmodelle, für die die meisten Prompt-Ratschläge geschrieben wurden, nutzten einen Text-Encoder, der sich praktisch wie ein Sack voller Begriffe verhielt: Grammatik spielte kaum eine Rolle, und die Gewinnstrategie war, relevante Substantive aufzutürmen und mit Gewichten zu verschieben. Tag-Suppe war für diesen Encoder die richtige Prompt-Form.
Shannons Bildmodell funktioniert nicht so. Es liest einen Prompt so, wie ein Sprachmodell Text liest, also trägt die Syntax Bedeutung. „Holding an umbrella against her shoulder“ ist eine Beziehung zwischen einer Person, einem Objekt und einem Körperteil; „umbrella, shoulder“ sind zwei Dinge, die zufällig vorhanden sind. Präpositionen platzieren Dinge. Verben erzeugen Posen. Nebensätze heften Details an das richtige Substantiv, statt sie über das ganze Bild schweben zu lassen.
Hier ist dasselbe Bild auf beide Arten angefragt.
woman, 30s, tokyo, rain, night, crosswalk, neon signs, umbrella,
wet asphalt, reflections, masterpiece, best quality, 8k, ultra
detailed, (bokeh:1.3), cinematic lighting, photorealistic
A woman in her early thirties waits at a rain-soaked Tokyo
crosswalk at night, holding a clear vinyl umbrella against her
shoulder and glancing down the street. Neon storefront signs
bleed red and cyan into the wet asphalt at her feet. Shot on
Kodak Portra 400, 85mm f/1.4, shallow depth of field, the
traffic signal behind her thrown out of focus.
Schauen Sie, was die Tag-Fassung nicht ausdrücken kann. Sie sagt nie, dass der Schirm gehalten wird, er kann also am Boden liegen. Sie sagt nie, dass das Neonlicht sich im Asphalt spiegelt, nur dass beides existiert — Sie bekommen also Schilder und eine nasse Straße ohne optische Beziehung dazwischen. Sie sagt nie, wohin die Frau schaut, ihre Pose ist also Münzwurf. „Cinematic lighting“ ist ein Stimmungsetikett, keine Lichtquelle. Und die letzten fünf Token sind Rauschen, gelesen als englische Wörter über Fotografie statt als Steuergriffe.
Die Prosa-Fassung ist nicht länger, weil sie blumig ist. Sie ist länger, weil sie Fragen beantwortet, die die Tag-Fassung offengelassen hat. Das ist der ganze Trick.
02Wie lang sollte ein Bild-Prompt sein?
Zielen Sie auf 30 bis 80 Wörter. Gehen Sie nicht viel über 100 hinaus. Das ist der einfachste Qualitätshebel, den Sie haben, und beide Enden der Spanne zählen.
Unter etwa 30 Wörtern sind Komposition, Licht und Bildausschnitt unbestimmt, das Modell wählt also, was statistisch am gewöhnlichsten ist. „Eine Frau in einem Café“ ist ein gültiger Prompt, der ein vergessliches Bild erzeugt, weil Sie jede interessante Entscheidung delegiert haben.
Über rund 100 Wörtern tritt ein anderes Versagen auf: Späte Satzteile konkurrieren mit frühen um dieselben Bildregionen, und statt sich anzureichern, verdünnt sich das Detail. Die dritte Lichtbeschreibung hebt die erste auf, und das Motiv, das Sie in den ersten acht Wörtern etabliert haben, bekommt mit jedem weiteren Satz relativ weniger Aufmerksamkeit. Lange Prompts lesen sich gründlich. Sie rendern sich nicht gründlich.
Die Disziplin: Schreiben Sie den Prompt, den Sie wollen, und kürzen Sie ihn dann auf die Sätze zusammen, deren Wegfall das Bild verändern würde.
03Die Reihenfolge-Disziplin: das Wichtigste zuerst
Weil das Modell sequentiell liest, ist Position gleich Betonung: Was zuerst kommt, verankert das Bild, was zuletzt kommt, justiert es. Bringen Sie die Dinge in die Reihenfolge, in der das Modell sie braucht:
- Motiv — wen oder was dieses Bild zeigt, konkret.
- Handlung oder Pose — was die Person tut, wie sie gehalten ist.
- Stil oder Stimmung — Foto, Ölgemälde, technische Illustration, und in welcher Tonlage.
- Schauplatz und Licht — wo das passiert und welches Licht darauf fällt.
- Technik — Bildausschnitt, Objektiv, Schärfentiefe, Farbangaben.
Die häufigste selbstverschuldete Wunde ist, mit dem technischen Teil zu beginnen. Mit „Cinematic wide shot, anamorphic lens flare, teal and orange grade, of a man reading a newspaper“ zu eröffnen sagt dem Modell, dass der Look das Motiv ist und der Mann ein Detail. Sie bekommen einen prächtigen, leeren Bildrahmen mit einer kleinen, undeutlichen Figur darin.
Cinematic wide shot, anamorphic lens flare, teal and orange
color grade, shallow depth of field, golden hour, of a man
reading a newspaper on a park bench.
A man in his sixties in a gray wool overcoat sits on a park
bench reading a folded broadsheet newspaper, one ankle crossed
over his knee. Late golden-hour sun rakes across him from the
left through bare plane trees. Photographed wide on a 35mm
anamorphic lens, shallow depth of field, warm highlights and
cool shadows.
Jedes Element der ersten Fassung überlebt in der zweiten; nichts wurde weggelassen. Das Modell weiß jetzt einfach, wovon das Bild handelt, bevor man ihm sagt, wie es aufzunehmen ist — und allein diese Umstellung macht das Motiv vom Beiwerk zur Hauptsache.
04Werden Sie beim Motiv konkret
„Eine Person“ ist kein Motiv, sondern ein Platzhalter — und das Modell füllt Platzhalter mit dem Durchschnitt von allem, was es gesehen hat, und genau daher kommt dieser glatte, alterslose, charakterlose Look. Konkretheit kostet fünf Wörter und kauft einen bestimmten Menschen:
| Vage | Konkret |
|---|---|
| eine Person | ein Mann Mitte vierzig mit graumeliertem Bart und tiefen Lachfalten |
| eine Frau | eine Frau Ende zwanzig mit dunklem Undercut und einem abgesplitterten Schneidezahn |
| ein altes Gebäude | ein vierstöckiges Backsteinlagerhaus mit übermalter Beschriftung und vernagelten Fenstern im Obergeschoss |
| Essen | eine Schale Ramen mit einem halbierten weichgekochten Ei obenauf, aufsteigender Dampf |
Beachten Sie das Muster: Alter oder Epoche, ein strukturelles Merkmal, eine unterscheidende Unregelmäßigkeit. Der dritte Punkt lässt ein Ergebnis fotografiert statt generiert wirken. Ein abgesplitterter Zahn, ein abgewetzter Saum, übermalte Beschriftung — kleine Asymmetrien sind das stärkste verfügbare Signal gegen den Plastik-Look, und sie kosten fast nichts im Wortbudget.
05Fotorealismus: Formulieren Sie die Anfrage als Foto
Fotorealismus ist die Voreinstellung, solange Sie nicht nach Kunst, Illustration oder Anime fragen. Aber das Wort „photorealistic“ leistet wenig. Was ein Foto erzeugt, ist die Beschreibung des fotografischen Akts: eine echte Kamera, ein echtes Objektiv und ein echter Filmtyp oder eine echte Lichtquelle.
Der Grund ist einfach. Jedes Bild mit der Bildunterschrift „Kodak Portra 400“ entstand in einem bestimmten Prozess mit bestimmter Kornstruktur, bestimmtem Lichterverlauf und bestimmter Hautwiedergabe, und den Filmtyp zu nennen ruft das alles ab. „8k ultra detailed“ tauchte immer nur in Spam von Bilddatenbanken auf, also ruft es Bilddatenbank-Spam ab. Ein paar verlässliche Rezepte, die jeweils ein deutlich anderes Bild desselben Motivs erzeugen:
| Rezept | Was es Ihnen gibt |
|---|---|
| Kodak Portra 400, 85mm f/1.4, soft window light | Warme, nachsichtige Hauttöne; weiche Freistellung; Editorial-Porträt |
| Ilford HP5 pushed to 1600, 35mm, available light | Körniges Schwarzweiß, kontrastreich, Street-Doku-Energie |
| Digital medium format, 80mm, single softbox at 45° | Sauberer kommerzieller Studio-Look, kontrollierter Lichtabfall, produktreif |
| 135mm f/2, backlit at golden hour, atmospheric haze | Komprimierter Hintergrund, Streiflicht, romantischer Tele-Look |
Passen Sie die Erdung zum Rezept — Hautporen auf Porenebene bedeuten nichts in einer 24-mm-Weitwinkelaufnahme, in der das Gesicht achtzig Pixel hoch ist — und fügen Sie sie dann hinzu. Erdende Details sind die Texturbelege dafür, dass hier tatsächlich ein Objektiv aufgenommen hat. Sichtbare Hautporen und feine Gesichtsbehaarung. Die Webstruktur eines Leinenhemdes. Staubkörner in einem Lichtstrahl. Ein Kratzer an einem Lederstiefel. Abstehende Haare vor hellem Hintergrund. Zwei oder drei reichen, und sie machen den Unterschied zwischen der Darstellung einer Person und einem Foto von ihr.
06Geschichtete Szenen: Vordergrund, Mittelgrund, Hintergrund
Wenn eine Szene Tiefe hat, beschreiben Sie die drei Ebenen getrennt und der Reihe nach. Das ist die wirksamste Technik für Bilder, die sich nach Orten und nicht nach Kulissen anfühlen sollen, und fast niemand nutzt sie. Ohne sie bekommen Sie Flachheit: Alles, was der Prompt erwähnt, landet ungefähr in derselben Entfernung und konkurriert um dasselbe mittlere Band des Bildes. Ebenen zu benennen gibt dem Modell ein Tiefenbudget zum Ausgeben.
In the foreground, a cracked concrete ledge with a half-empty
paper coffee cup and a scattering of cigarette ash, slightly out
of focus. In the midground, a bicycle courier in a yellow rain
jacket wheels her bike across a wet plaza, caught mid-stride. In
the background, a glass office tower dissolves into low fog.
Shot on a 50mm lens at f/2.8, flat overcast light.
Zwei Verfeinerungen. Setzen Sie etwas in den Vordergrund, das absichtlich unscharf ist — echte Fotos tiefer Szenen haben fast immer so etwas, und sein Fehlen ist ein häufiges Verräterzeichen. Und sagen Sie, welche Ebene das Motiv belegt: Wenn die Fahrradkurierin der Punkt des Bildes ist, gehört sie in den Mittelgrund, sonst kämpfen der Turm und der Kaffeebecher mit ihr um den Rahmen.
07Exakte Farben: Hex-Codes, an Objekte gehängt
Für Markenarbeit, Kostümkontinuität oder überall dort, wo „rot“ nicht genau genug ist, schreiben Sie den Hex-Code als color #RRGGBB und hängen Sie ihn an ein benanntes Objekt:
...wearing a heavy wool peacoat, color #8B0000, over a cream
turtleneck, against a studio backdrop, color #1E3A5F.
...#8B0000, #1E3A5F, dark red and navy color palette, moody...
Drei Faustregeln. Nutzen Sie Hex für die zwei oder drei Farben, auf die es wirklich ankommt, und einfache Wörter für den Rest — ein Prompt mit sechs Hex-Codes gibt den Großteil seines Budgets für Farbmuster aus. Binden Sie den Code an ein Objekt mit Kanten, nie an „das Licht“ oder „die Stimmung“. Und denken Sie daran, dass er die Farbe des Objekts angibt, nicht den finalen Pixelwert: Ein Mantel in #8B0000 im Gegenlicht der goldenen Stunde rendert wärmer als das Farbmuster, genau wie im echten Leben.
08Das Seitenverhältnis wählen
Fünf Verhältnisse stehen zur Verfügung, und das richtige ergibt sich meist aus dem Motiv, aber eine ausdrückliche Vorgabe von Ihnen gewinnt immer — verlangen Sie ein Handy-Hintergrundbild, bekommen Sie tall, egal was der Inhalt nahelegt.
| Verhältnis | Am besten für | Warum |
|---|---|---|
| square | Voreinstellung. Einzelne zentrierte Objekte, Icons, symmetrische Kompositionen, Social-Media-Posts | Keine dominante Achse, also schneidet die Eigentendenz des Rahmens nichts ab |
| portrait | Menschen, ganz oder halb; hohe Motive wie Türme, Bäume, Flaschen | Gibt einer stehenden Figur von Kopf bis Fuß Raum, ohne sie zu verkleinern |
| landscape | Landschaften, Innenräume, Personengruppen, Produkt-im-Kontext-Aufnahmen | Horizontaler Raum, damit der Schauplatz tatsächlich ein Schauplatz ist |
| wide | Kinoartige Bilder, Filmstills, Banner, Kopfgrafiken | Die breiteste Option; starke Leerräume, anamorphotisches Gefühl |
| tall | Plakate, Buchcover, Handy-Hintergründe, vertikale Social-Formate | Höher als portrait; lässt bewusst Platz für Schrift oder Himmel |
Das falsch zu wählen richtet mehr Schaden an, als es aussieht. Eine ganzfigurige stehende Person in einem wide-Rahmen gibt Ihnen keine kleine Figur in einem großen Rahmen — sie gibt Ihnen meist eine angeschnittene, weil das Modell die Breite füllt und Kopf oder Füße aus dem Bild wandern. Passen Sie den Rahmen an die dominante Achse des Motivs an, und die meisten Kompositionsbeschwerden verschwinden.
Zwei Verhaltensweisen, die man sich merken sollte: Die Bearbeitung übernimmt automatisch das Seitenverhältnis des Ausgangsbildes, Sie können also nicht durch Bearbeiten neu rahmen, während das Zusammenführen Ihnen erlaubt, eine neue Leinwand zu wählen — oft der sauberste Weg, die Form von etwas zu ändern, das Sie schon haben.
09Antimuster: womit Sie aufhören sollten
Qualitätstoken: „masterpiece, best quality, 8k, ultra detailed“
Das waren von der Community entdeckte Griffe für eine bestimmte ältere Trainingsverteilung, in der bestimmte Bildunterschriften mit bestimmten Bildquellen korrelierten. Sie übertragen sich nicht. Hier werden sie als gewöhnliche englische Wörter gelesen, tragen nichts bei und fressen einen Teil eines Wortbudgets, von dem Ihnen schon gesagt wurde, dass es knapp ist. Der Ersatz besteht darin zu sagen, welches Detail Sie wollen: nicht „ultra detailed“, sondern „visible weave in the coat fabric and fine stubble along the jaw“ — dieselbe Absicht, ausgedrückt als etwas, das das Modell rendern kann.
Gewichtungssyntax: (word:1.3), [word], {{word}}
Wird nicht ausgewertet. Die Klammern, Doppelpunkte und Zahlen landen als wörtlicher Text und machen den umgebenden Satzteil eher schwerer lesbar. Wenn Sie etwas stärker betonen wollen, nutzen Sie die zwei Hebel, die tatsächlich wirken: Verschieben Sie es nach vorn im Prompt und geben Sie ihm mehr Wörter. „A crimson silk scarf, its fringed ends lifting in the wind“ wiegt „(red scarf:1.4)“ nach jedem relevanten Maßstab auf.
Widersprüchliche Angaben
Unvereinbare Anweisungen zu mischen verschmilzt sie nicht; es erzeugt einen instabilen Mittelwert, der meist keine von beiden erfüllt. Die häufigen Verstöße:
- Medium — „photorealistic“ plus „watercolor“; „oil painting“ plus „shot on 85mm“. Entscheiden Sie sich für eines.
- Bildausschnitt — „wide establishing shot“ plus „extreme close-up on her eyes“; „full body“ plus „detailed facial pores“.
- Licht — „harsh midday sun“ plus „soft golden hour glow“; „low key, deep shadows“ plus „bright and airy“.
- Epoche — „1970s film aesthetic“ plus „modern minimalist“ plus „cyberpunk“.
- Stilstapelei — vier Künstler oder vier Genres auf einmal. Zwei verwandte Referenzen können funktionieren; vier heben sich zu Beliebigkeit auf.
- Wildwuchs — „rustic, weathered, ancient, timeworn wooden door“ ist ein Gedanke, viermal geschrieben, und jede Wiederholung verdünnt den Rest des Prompts.
10Bei Text-zu-Bild gibt es keinen negativen Prompt
Das ist das Antimuster, das erfahrene Nutzer am härtesten erwischt, denn in älteren Stacks war der negative Prompt die halbe Handwerkskunst.
| Operation | Negativer Prompt | Was zu tun ist |
|---|---|---|
| Text-zu-Bild (erzeugen) | Nicht unterstützt | Beschreiben Sie nur, was Sie wollen. Schreiben Sie nie „kein X“. |
| Ein Bild bearbeiten | Unterstützt | Unerwünschte Artefakte dorthin, die Anweisung positiv halten. |
| Zwei oder mehr zusammenführen | Unterstützt | Ebenso — Artefakte ins Negative, Rollen ins Positive. |
Für die Generierung gilt die Regel absolut und leicht widersinnig: „kein Text, kein Wasserzeichen, keine überzähligen Finger“ in den Prompt zu schreiben macht diese Dinge wahrscheinlicher, nicht unwahrscheinlicher. Das Modell liest „kein Text“ als Satz, der den Begriff Text enthält; die Verneinung ist ein schwaches Signal und das Substantiv ein starkes. Sie haben faktisch um Text gebeten. Formulieren Sie stattdessen immer die positive Form:
| Statt | Schreiben Sie |
|---|---|
| kein Hintergrunddurcheinander | ein sauberer, nahtloser grauer Hintergrund |
| nicht unscharf | knackscharf auf den Augen, f/8 |
| keine anderen Menschen | allein in einer leeren Straße im Morgengrauen |
| keine modernen Gegenstände | eine Küche der 1930er mit Emaillegeschirr und einem gusseisernen Herd |
| kein Comic-Stil | shot on Kodak Portra 400, 85mm, natural skin texture |
Bei Bearbeitung und Zusammenführung existiert der negative Prompt und Sie sollten ihn nutzen — aber für Artefakte, nicht für Inhalt. Gutes Material: Wasserzeichen, Textüberlagerung, doppelte Gliedmaßen, verdrehte Hände, Überschärfungssäume, JPEG-Blockbildung, Nahtlinien an einer Montagekante. Schlechtes Material: alles darüber, wovon das Bild handelt — das gehört in die Anweisung.
11Den Prompt lesen, den Shannon für Sie schreibt
Hier wird dieser Leitfaden sofort brauchbar statt theoretisch. Sie müssen den Generierungs-Prompt nicht selbst schreiben. Sie fragen in normaler Sprache, in jeder Sprache; Shannon erkennt, dass ein Bild angefragt wird, verfasst den englischen Generierungs-Prompt und zeigt ihn Ihnen auf einer Bestätigungskarte, bevor etwas gerendert wird. Nichts wird erzeugt und nichts abgerechnet, bevor Sie bestätigen.
Die Fertigkeit, die sich am meisten auszahlt, ist also nicht, Prompts von Grund auf zu schreiben — sondern den auf der Karte zu lesen. Gehen Sie diese Liste durch:
- Ist das Motiv konkret? Wenn auf der Karte „a person“ oder „a woman“ steht, haben Sie die größte verfügbare Verbesserung gefunden. Geben Sie ihm ein Alter, eine Statur, ein Merkmal.
- Steht das Motiv zuerst? Wenn der Prompt mit einem Stil oder einer Kamera beginnt, verlangen Sie, dass er stattdessen mit dem Motiv anfängt.
- Liegt er in der Spanne? Unter 30 Wörtern verlangen Sie mehr Genauigkeit bei Licht und Schauplatz. Über 100 verlangen Sie eine Kürzung.
- Gibt es eine Lichtquelle? Kein Stimmungswort — ein tatsächliches Licht: Fenster, Straßenlaterne, Blitz, bedeckter Himmel, Softbox.
- Irgendwelche Widersprüche? Suchen Sie nach zwei Medien, zwei Bildausschnitten oder zwei Lichtsituationen im selben Prompt.
- Eingeschmuggelte Verneinungen? Wenn die Karte „without“, „no“ oder „avoid“ enthält, ist das ein Text-zu-Bild-Prompt, der um genau das bittet, was er benennt.
- Passt das Verhältnis zum Motiv? Ganzfigur in
wideist die klassische Fehlpaarung.
Korrekturen laufen im Gespräch: „Mach sie Anfang dreißig mit einer Narbe durch eine Augenbraue, nimm es auf Portra mit 85mm auf und nutze portrait“ ist eine völlig taugliche Anweisung. Sie bekommen eine neue Karte und bestätigen stattdessen diese. Es gibt keine Strafe fürs Nachbessern, weil noch nichts gerendert wurde.
Und Shannon generiert nicht ungefragt. Eine Begrüßung, eine Frage oder ein Foto, das Sie zur Besprechung anhängen, löst kein Rendern aus. Shannon zu bitten, ein Bild anzusehen — es zu beschreiben, zu lesen, zu analysieren — ist gewöhnliche Vision-Arbeit, keine Generierung, und kostet nichts zusätzlich.
12Wie sich das Handwerk beim Bearbeiten und Zusammenführen verschiebt
Die obigen Regeln sind für die Generierung geschrieben. Zwei benachbarte Modi verändern die Form des Prompts.
Ein Bild bearbeiten
Ein Bearbeitungs-Prompt ist eine Anweisung, keine Beschreibung: Sagen Sie, was sich ändert und was bleibt. Die unveränderten Teile zu benennen ist der größte einzelne Qualitätshebel im Produkt — „Change the background to a rainy night city street with neon reflections, keep the woman exactly as she is“ hält zusammen, wo dieselbe Anfrage ohne diesen Zusatz stillschweigend ihr Gesicht neu zeichnet. Seien Sie beim Anker konkret: Gesicht, Pose, Haare und Kleidung identisch halten. Genau ein Ausgangsbild wird verwendet, und die Ausgabe behält dessen Seitenverhältnis.
Zwei oder mehr Bilder zusammenführen
Immer wenn Elemente aus mehr als einem Bild stammen — Kleidungsübertragung, ein Objekt in eine Szene, zwei Personen in einem Bild, Produkt an Person, ein Stil aus dem einen Bild mit einem Motiv aus dem anderen — muss der Prompt die Rolle jedes Bildes der Reihe nach benennen: „The woman from the first image wearing the red knitted sweater from the second image, standing in the same park.“ Das erste Bild ist das Hauptmotiv oder die Szene; spätere Bilder liefern die eingebrachten Teile. Verkürzen Sie eine Mehrbild-Anfrage nicht auf eine Quelle plus eine Textbeschreibung — die echten Bilder zusammenzuführen ist es, was bewahrt, wie diese Dinge tatsächlich aussehen.
13Unzensiertes Prompting: Sagen Sie, was Sie meinen
Es gibt keinen Inhaltsfilter auf dem Generierungspfad und keine Ablehnungsschicht auf dem Modell, das den Prompt schreibt. Das ist der ganze Sinn des Produkts: Gefilterte Generatoren lehnen regelmäßig legitime Arbeit ab — Aktkunst, medizinische und forensische Illustration, Bilder für Sicherheitsforschung, Gewalt in Fiktion, politische Satire, Marken- und Bildnisarbeit durch die Rechteinhaber. Die halbe Prompt-Kunst auf gefilterten Plattformen ist Euphemismus-Bastelei, und Euphemismus ist der Feind eines präzisen Bildes.
Es gibt also eine Sache mehr, die man auf der Karte prüfen sollte: dass sie das tatsächliche Motiv in klaren Worten beschreibt und nicht in dem abgesicherten Vokabular, das man sich an gefilterten Werkzeugen antrainiert. Eine forensische Illustration einer Verletzung sollte sagen, was die Verletzung ist. Abgesicherte Sprache erzeugt überall ein schlechteres Bild, weil das Modell rendert, was die Wörter sagen.
Fähigkeit und Beurteilung sind zwei verschiedene Dinge. Shannon Lab LLC betreibt das unter einer veröffentlichten Richtlinie zur verantwortungsvollen Nutzung: Ungefilterte Generierung ist ein Berufswerkzeug, und Einwilligung, Rechte und das Gesetz gelten weiterhin für das, was Sie erschaffen.
Die Checkliste auf einer Seite
- Prosa in ganzen Sätzen, keine kommagetrennten Tags.
- 30–80 Wörter. Streichen Sie alles, was das Bild nicht verändern würde.
- Motiv → Handlung → Stil → Schauplatz und Licht → Technik.
- Konkretes Motiv: Alter, ein strukturelles Merkmal, eine Unregelmäßigkeit.
- Fotos: Kamera, Objektiv und Filmtyp oder Lichtquelle benennen.
- Tiefe Szenen: Vordergrund, Mittelgrund, Hintergrund, getrennt benannt.
- Exakte Farben als
color #RRGGBB, an ein benanntes Objekt gebunden. - Wählen Sie das Verhältnis nach der dominanten Achse des Motivs.
- Zwei oder drei erdende Texturen, passend zum Bildausschnitt.
- Keine Qualitätstoken, keine Gewichtungssyntax, keine widersprüchlichen Angaben.
- Keine Verneinungen bei Text-zu-Bild. Verneinungen sind für Bearbeitung und Zusammenführung, und nur für Artefakte.
14Wo die API hineinpasst
Ein Punkt der Genauigkeit für Leserinnen und Leser, die von einer API-Suche kommen: Bildgenerierung, Bildbearbeitung und Zusammenführung leben in der Shannon-Chat-App, nicht in der /v1-API. Die API liefert Text und Vision — sie kann Bilder lesen, beschreiben und analysieren, die Sie ihr über alle drei Dialekte schicken (/v1/chat/completions, /v1/messages, /v1/responses, alle mit Streaming) —, aber sie erstellt keine. Wenn Sie eine Pipeline bauen, die Bilder verstehen muss, ist die API-Dokumentation der richtige Startpunkt. Wenn Sie Bilder machen wollen, ist das die Chat-App, und alles in diesem Leitfaden gilt dort. Bilder werden auf unserem eigenen GPU-Cluster gerendert.
15Häufig gestellte Fragen
Wie lang sollte ein KI-Bild-Prompt sein?
Zielen Sie auf 30 bis 80 Wörter und gehen Sie nie viel über 100 hinaus. Unter 30 Wörtern überlassen Sie Komposition, Licht und Bildausschnitt dem Zufall. Über 100 Wörtern konkurrieren die späteren Satzteile mit den früheren, und Detail beginnt sich auszuwaschen, statt sich anzureichern.
Soll ich Stichwort-Tags oder ganze Sätze schreiben?
Ganze Sätze. Shannons Bildmodell liest einen Prompt so, wie ein Sprachmodell Text liest, also trägt Grammatik Information. „A woman in her 30s at a rain-soaked Tokyo crosswalk at night“ erzeugt eine kohärente Szene; „woman, 30s, Tokyo, rain, night“ erzeugt einen Haufen loser Eigenschaften ohne Beziehungen untereinander.
Kann ich bei Text-zu-Bild einen negativen Prompt verwenden?
Nein. Text-zu-Bild nimmt bei Shannon keinen negativen Prompt entgegen, beschreiben Sie also nur, was Sie wollen, und schreiben Sie nie „kein X“ in den Prompt selbst — etwas zu benennen ruft es eher herbei. Bildbearbeitung und Bildzusammenführung unterstützen einen negativen Prompt, und dort gehören unerwünschte Artefakte wie Wasserzeichen, Textüberlagerungen oder doppelte Gliedmaßen hin.
Verbessern Token wie „masterpiece, best quality, 8k“ das Bild?
Nein. Das waren Griffe für eine ältere Modellgeneration, und sie tragen hier keine Information — sie werden schlicht als Wörter gelesen und verbrauchen einen Teil Ihres Budgets von 30–80 Wörtern, ohne etwas zu sagen. Gewichtungssyntax wie (word:1.3) wird ebenfalls nicht ausgewertet; sie landet als wörtlicher Text. Beschreiben Sie stattdessen das tatsächliche Detail, das Sie wollen.
Wie bekomme ich eine exakte Farbe?
Schreiben Sie den Hex-Code als color #RRGGBB und hängen Sie ihn an ein konkret benanntes Objekt, zum Beispiel „a wool jacket, color #8B0000“. Ein Hex-Code, der frei von einem Objekt schwebt, hat nichts, woran er sich binden kann. Nutzen Sie ihn für die zwei oder drei Farben, auf die es wirklich ankommt, und beschreiben Sie den Rest in Worten.
Kann ich Bilder über die Shannon-API erzeugen?
Nein. Bildgenerierung, Bildbearbeitung und Zusammenführung passieren in der Shannon-Chat-App. Die /v1-API liefert Text und Vision — sie kann Bilder lesen und analysieren, die Sie ihr schicken, aber sie erstellt keine. Alles in diesem Leitfaden gilt für die Chat-App.
Probieren Sie es an einem echten Prompt
Fragen Sie in jeder Sprache. Lesen Sie die Karte. Passen Sie sie an. Dann bestätigen Sie.
Shannon-Chat öffnen Mehr ResearchNichts wird gerendert und nichts abgerechnet, bevor Sie den Prompt bestätigen
Weiterführend: Unzensierte KI-Bildgenerierung · Unzensierte KI-Bildbearbeitung · Richtlinie zur verantwortungsvollen Nutzung · API-Dokumentation · Alle Shannon-Forschungsartikel. Die Hinweise hier stammen aus unseren eigenen Tests mit Shannons Bildmodell; Ratschläge, die für frühere Diffusions-Stacks geschrieben wurden, übertragen sich in der Regel nicht.