AI 이미지 프롬프트 가이드
Shannon의 이미지 모델은 프롬프트를 언어 모델처럼 읽습니다. 이 사실 하나가 프롬프트 쓰는 법을 전부 바꿔 놓습니다 — 쉼표로 나열한 태그를 버리는 것부터 시작해서요.
요약
키워드 태그가 아니라 완전한 문장으로 흐르는 산문을 쓰세요. 30–80 단어를 목표로 하세요. 모델이 읽는 순서대로 배열하세요. 주제 → 동작 → 스타일 → 배경과 조명 → 기술적 요소, 중요한 것이 먼저입니다. 주제는 구체적으로 쓰세요. 사진을 원한다면 사진처럼 쓰세요 — 카메라, 렌즈, 그리고 필름이나 광원을 명시하세요. 정확한 색은 color #RRGGBB 형태로 이름 붙은 대상에 붙이세요. 다섯 가지 화면 비율 중 하나를 고르세요. 그리고 SDXL 시절의 습관은 버리세요. "masterpiece, best quality, 8k" 금지, (word:1.3) 가중치 금지, 텍스트-이미지에 네거티브 프롬프트 금지 — 원하는 것만 묘사하세요. 편집과 합성은 네거티브 프롬프트를 받습니다.
대부분의 사람은 SDXL에서 익힌 프롬프트 습관을 가지고 옵니다. 쉼표로 이어진 명사 문자열, 품질 토큰 서두, 괄호 친 가중치 몇 개, 그리고 긍정 프롬프트만큼 긴 네거티브 프롬프트. 그 습관은 그 모델들에는 옳았지만 여기서는 역효과를 냅니다. 이 글은 실제로 통하는 것을 짧게 정리한 것이며, Shannon이 생성 프롬프트를 대신 써서 렌더링 전에 보여 주므로 Shannon이 제안한 것을 읽고 고치는 가이드이기도 합니다.
01산문이 태그를 이기는 이유: 모델이 언어 모델처럼 읽는다
대부분의 프롬프트 조언이 쓰인 대상이었던 예전 확산 모델들은 실제로 개념 주머니처럼 동작하는 텍스트 인코더를 썼습니다. 문법은 거의 중요하지 않았고, 관련 명사를 쌓아 올린 뒤 가중치로 편향을 주는 것이 승리 전략이었습니다. 태그 수프는 그 인코더에는 올바른 프롬프트 형태였습니다.
Shannon의 이미지 모델은 그렇게 작동하지 않습니다. 언어 모델이 텍스트를 읽듯 프롬프트를 읽으므로 구문이 의미를 실어 나릅니다. "어깨에 우산을 받쳐 들고"는 사람, 사물, 신체 부위 사이의 관계입니다. "우산, 어깨"는 그저 함께 존재하는 두 가지입니다. 전치사는 사물을 배치합니다. 동사는 자세를 만듭니다. 절은 디테일을 이미지 전체에 떠다니게 두는 대신 알맞은 명사에 붙입니다.
같은 그림을 두 방식으로 요청한 예입니다.
woman, 30s, tokyo, rain, night, crosswalk, neon signs, umbrella,
wet asphalt, reflections, masterpiece, best quality, 8k, ultra
detailed, (bokeh:1.3), cinematic lighting, photorealistic
A woman in her early thirties waits at a rain-soaked Tokyo
crosswalk at night, holding a clear vinyl umbrella against her
shoulder and glancing down the street. Neon storefront signs
bleed red and cyan into the wet asphalt at her feet. Shot on
Kodak Portra 400, 85mm f/1.4, shallow depth of field, the
traffic signal behind her thrown out of focus.
태그 버전이 표현하지 못하는 것을 보세요. 우산을 들고 있다고 말하지 않으므로 우산이 바닥에 놓여 있을 수도 있습니다. 네온이 아스팔트에 반사된다고 말하지 않고 둘 다 존재한다고만 하므로, 간판과 젖은 거리가 광학적 관계 없이 따로 놉니다. 여자가 어디를 보는지 말하지 않으므로 자세는 동전 던지기입니다. "cinematic lighting"은 광원이 아니라 분위기 라벨입니다. 그리고 마지막 다섯 토큰은 잡음이며, 제어 손잡이가 아니라 사진에 관한 영어 단어로 읽힙니다.
산문 버전이 긴 것은 미사여구 때문이 아닙니다. 태그 버전이 열어 둔 질문들에 답하기 때문에 깁니다. 요령의 전부가 그것입니다.
02이미지 프롬프트는 얼마나 길어야 하는가
30에서 80 단어를 목표로 하세요. 100 단어를 크게 넘기지 마세요. 여러분이 쓸 수 있는 가장 손쉬운 품질 지렛대이며, 범위의 양쪽 끝이 모두 중요합니다.
대략 30 단어 아래에서는 구도, 빛, 프레이밍이 지정되지 않으므로 모델이 통계적으로 가장 평범한 것을 고릅니다. "커피숍의 여자"는 유효한 프롬프트지만 기억에 남지 않는 이미지를 만듭니다. 흥미로운 결정을 전부 위임했기 때문입니다.
대략 100 단어 위에서는 다른 실패가 나타납니다. 뒤쪽 절이 이미지의 같은 영역을 두고 앞쪽 절과 경쟁하고, 디테일이 쌓이는 대신 희석됩니다. 세 번째 조명 묘사가 첫 번째를 무효화하고, 처음 여덟 단어에서 확립한 주제는 문장을 더할 때마다 상대적 주의를 잃습니다. 긴 프롬프트는 꼼꼼해 보입니다. 하지만 꼼꼼하게 렌더링되지는 않습니다.
훈련 방법: 원하는 프롬프트를 다 쓴 다음, 빼면 그림이 달라지는 문장만 남기고 줄이세요.
03순서의 규율: 가장 중요한 것이 먼저
모델이 순차적으로 읽기 때문에 위치가 곧 강조입니다. 앞에 오는 것이 이미지를 고정하고, 뒤에 오는 것이 그것을 조정합니다. 모델이 필요로 하는 순서로 배열하세요.
- 주제 — 이 그림이 누구 또는 무엇에 관한 것인지, 구체적으로.
- 동작 또는 자세 — 무엇을 하고 있는지, 어떤 자세인지.
- 스타일 또는 분위기 — 사진, 유화, 기술 일러스트, 그리고 그 어조.
- 배경과 조명 — 어디서 벌어지고 어떤 빛이 떨어지는지.
- 기술적 요소 — 프레이밍, 렌즈, 심도, 색의 구체값.
가장 흔한 자해는 기술적 절로 시작하는 것입니다. "Cinematic wide shot, anamorphic lens flare, teal and orange grade, of a man reading a newspaper"로 시작하면 모델에게 룩이 주제이고 남자는 부속물이라고 말하는 셈입니다. 그러면 작고 흐릿한 인물이 들어 있는, 아름답지만 텅 빈 화면을 얻게 됩니다.
Cinematic wide shot, anamorphic lens flare, teal and orange
color grade, shallow depth of field, golden hour, of a man
reading a newspaper on a park bench.
A man in his sixties in a gray wool overcoat sits on a park
bench reading a folded broadsheet newspaper, one ankle crossed
over his knee. Late golden-hour sun rakes across him from the
left through bare plane trees. Photographed wide on a 35mm
anamorphic lens, shallow depth of field, warm highlights and
cool shadows.
첫 번째 버전의 모든 요소가 두 번째에도 살아 있습니다. 빠진 것은 없습니다. 다만 모델이 이제 어떻게 찍을지를 듣기 전에 이 그림이 무엇에 관한 것인지 알게 되었을 뿐입니다. 그 순서 변경만으로 주제가 부수적인 것에서 중심으로 옮겨 갑니다.
04주제를 구체적으로 쓰기
"사람"은 주제가 아니라 자리표시자입니다. 그리고 모델은 자리표시자를 본 것 전부의 평균으로 채웁니다. 그 매끈하고 나이 없고 개성 없는 룩이 나오는 지점이 바로 거기입니다. 구체성은 다섯 단어를 쓰고 특정한 한 인간을 사 옵니다.
| 모호함 | 구체적 |
|---|---|
| 사람 한 명 | 희끗한 수염과 깊은 웃음주름을 가진 40대 남성 |
| 여자 한 명 | 어두운 언더컷 머리에 앞니가 살짝 깨진 20대 후반 여성 |
| 낡은 건물 | 덧칠된 간판과 널빤지로 막은 위층 창을 가진 4층 벽돌 창고 |
| 음식 | 반으로 가른 반숙 달걀이 올라간, 김이 오르는 라멘 한 그릇 |
패턴을 보세요. 나이나 시대, 구조적 특징 하나, 구별되는 결점 하나. 결과물을 생성된 것이 아니라 촬영된 것처럼 느끼게 하는 것은 세 번째 항목입니다. 깨진 이, 닳은 밑단, 덧칠된 간판 같은 작은 비대칭은 가장 강력한 반플라스틱 신호이며, 단어 예산도 거의 쓰지 않습니다.
05사진 사실주의: 요청을 사진처럼 쓰기
아트, 일러스트, 애니메이션을 요청하지 않으면 사진 사실주의가 기본 어조입니다. 그런데 "photorealistic"이라는 단어 자체는 하는 일이 거의 없습니다. 사진을 만들어 내는 것은 사진 찍는 행위를 묘사하는 것입니다. 실제 카메라, 실제 렌즈, 그리고 실제 필름이나 광원입니다.
이유는 단순합니다. "Kodak Portra 400"이라는 캡션이 붙은 모든 이미지는 특정한 입자 구조, 하이라이트 롤오프, 피부 표현을 가진 특정 공정으로 만들어졌고, 그 필름 이름을 부르면 그 전부가 소환됩니다. "8k ultra detailed"는 스톡 사이트 스팸에서나 나타났으므로 스톡 사이트 스팸을 소환합니다. 같은 주제로 확연히 다른 이미지를 만드는, 믿을 만한 조합 몇 가지입니다.
| 조합 | 얻게 되는 것 |
|---|---|
| Kodak Portra 400, 85mm f/1.4, soft window light | 따뜻하고 관대한 피부 톤, 부드러운 분리감, 에디토리얼 초상 |
| Ilford HP5 pushed to 1600, 35mm, available light | 입자가 굵은 흑백, 강한 대비, 스트리트 다큐멘터리의 기운 |
| Digital medium format, 80mm, single softbox at 45° | 깔끔한 상업 스튜디오 룩, 통제된 광량 감쇠, 제품 사진 수준 |
| 135mm f/2, backlit at golden hour, atmospheric haze | 압축된 배경, 림 라이트, 낭만적인 망원 룩 |
근거 묘사는 조합에 맞추세요 — 얼굴이 세로 80픽셀인 24mm 광각에서 모공 수준의 피부 질감은 아무 의미가 없습니다 — 그런 다음 더하세요. 근거가 되는 디테일이란 렌즈가 실제로 이것을 기록했다는 질감의 증거입니다. 보이는 모공과 잔털. 리넨 셔츠의 조직. 빛줄기 속의 먼지. 가죽 부츠의 긁힌 자국. 밝은 배경에 흩날리는 잔머리. 두세 개면 충분하며, 그것이 사람의 렌더링과 사람의 사진을 가릅니다.
06층이 있는 장면: 전경, 중경, 배경
장면에 깊이가 있을 때는 세 평면을 따로, 순서대로 묘사하세요. 배경 그림이 아니라 실제 장소처럼 느껴져야 하는 이미지에 가장 효과적인 기법인데, 거의 아무도 하지 않습니다. 이것 없이는 평평해집니다. 프롬프트가 언급한 모든 것이 대략 같은 거리에 놓여 화면의 같은 중간 띠를 두고 경쟁합니다. 평면을 명시하면 모델에 쓸 깊이 예산이 생깁니다.
In the foreground, a cracked concrete ledge with a half-empty
paper coffee cup and a scattering of cigarette ash, slightly out
of focus. In the midground, a bicycle courier in a yellow rain
jacket wheels her bike across a wet plaza, caught mid-stride. In
the background, a glass office tower dissolves into low fog.
Shot on a 50mm lens at f/2.8, flat overcast light.
두 가지 개선점. 전경에 의도적으로 초점이 나간 무언가를 두세요 — 깊은 장면을 담은 실제 사진에는 거의 항상 그런 요소가 있고, 그 부재가 흔한 단서가 됩니다. 그리고 주제가 어느 평면에 있는지 말하세요. 자전거 배달원이 그림의 요점이라면 중경에 있어야 하고, 그러지 않으면 타워와 커피컵이 화면을 두고 그녀와 다툽니다.
07정확한 색: 16진수 코드를 대상에 붙이기
브랜드 작업, 의상 연속성, 또는 "빨강"만으로는 충분하지 않은 모든 경우에는 16진수 코드를 color #RRGGBB 형태로 쓰고 이름 붙은 대상에 붙이세요.
...wearing a heavy wool peacoat, color #8B0000, over a cream
turtleneck, against a studio backdrop, color #1E3A5F.
...#8B0000, #1E3A5F, dark red and navy color palette, moody...
어림 규칙 셋. 정말 중요한 두세 가지 색에만 16진수를 쓰고 나머지는 평범한 말로 쓰세요 — 16진수 코드가 여섯 개인 프롬프트는 예산 대부분을 색상 칩에 씁니다. 코드는 "조명"이나 "분위기"가 아니라 윤곽이 있는 대상에 묶으세요. 그리고 그것은 최종 픽셀 값이 아니라 대상의 색을 지정한다는 점을 기억하세요. 골든아워 역광 속의 #8B0000 코트는 색상 견본보다 따뜻하게 렌더링됩니다. 실제 세계에서와 똑같이요.
08화면 비율 고르기
다섯 가지 비율이 있고 알맞은 것은 대개 주제가 암시하지만, 여러분의 명시적 요청이 항상 이깁니다 — 배경화면을 요청하면 내용이 무엇을 시사하든 tall이 나옵니다.
| 비율 | 적합한 용도 | 이유 |
|---|---|---|
| square | 기본값. 가운데 놓인 단일 오브젝트, 아이콘, 대칭 구도, 소셜 게시물 | 지배적인 축이 없어 프레임 자체의 편향으로 잘리는 것이 없음 |
| portrait | 인물의 전신 또는 반신, 타워·나무·병처럼 세로로 긴 대상 | 서 있는 인물을 축소하지 않고 머리부터 발까지 담을 여유를 줌 |
| landscape | 풍경, 실내, 여러 사람, 맥락 속 제품 사진 | 배경이 실제로 배경 역할을 할 가로 여유를 줌 |
| wide | 영화적 화면, 필름 스틸, 배너, 헤더 이미지 | 가장 넓은 선택지. 강한 여백, 아나모픽한 느낌 |
| tall | 포스터, 책 표지, 휴대폰 배경화면, 세로형 소셜 포맷 | portrait보다 김. 글자나 하늘을 위한 의도적 여백을 남김 |
이걸 틀리면 생각보다 피해가 큽니다. wide 프레임에 전신 인물을 넣으면 큰 화면 속 작은 인물이 나오는 것이 아니라 대개 잘린 인물이 나옵니다. 모델이 가로를 채우면서 머리나 발이 화면 밖으로 나가기 때문입니다. 주제의 지배적 축에 프레임을 맞추면 구도 관련 불만은 대부분 사라집니다.
기억해 둘 동작 두 가지. 편집은 원본 이미지의 화면 비율을 자동으로 유지하므로 편집으로 프레임을 다시 잡을 수 없고, 합성에서는 새 캔버스를 고를 수 있습니다 — 이미 가진 것의 형태를 바꾸는 가장 깔끔한 방법인 경우가 많습니다.
09안티패턴: 그만둬야 할 것들
품질 토큰: "masterpiece, best quality, 8k, ultra detailed"
이것들은 특정 캡션 문구가 특정 이미지 출처와 상관관계를 갖던 예전 학습 분포에서 커뮤니티가 찾아낸 손잡이였습니다. 여기로 이전되지 않습니다. 여기서는 평범한 영어 단어로 읽히고, 아무것도 기여하지 않으며, 빠듯하다고 이미 말한 단어 예산의 일부를 잡아먹습니다. 대체법은 어떤 디테일을 원하는지 말하는 것입니다. "ultra detailed"가 아니라 "코트 원단에 보이는 직조와 턱선의 잔수염" — 같은 의도를, 모델이 렌더링할 수 있는 것으로 표현한 것입니다.
가중치 문법: (word:1.3), [word], {{word}}
해석되지 않습니다. 괄호, 대괄호, 콜론, 숫자는 문자 그대로의 텍스트로 들어가고, 오히려 주변 절을 읽기 어렵게 만듭니다. 무언가를 더 강조하고 싶다면 실제로 통하는 두 지렛대를 쓰세요. 프롬프트에서 앞으로 옮기고, 더 많은 단어를 주는 것입니다. "끝단 술이 바람에 들리는 진홍색 실크 스카프"는 중요한 모든 척도에서 "(red scarf:1.4)"를 능가합니다.
상충하는 지시
양립할 수 없는 지시를 섞는다고 그것들이 혼합되지는 않습니다. 대개 어느 쪽도 만족시키지 못하는 불안정한 평균이 나옵니다. 자주 나오는 위반들입니다.
- 매체 — "photorealistic"에 "watercolor"를 더하기, "oil painting"에 "shot on 85mm"를 더하기. 하나를 골라 밀고 나가세요.
- 프레이밍 — "wide establishing shot"에 "extreme close-up on her eyes"를 더하기, "full body"에 "detailed facial pores"를 더하기.
- 조명 — "harsh midday sun"에 "soft golden hour glow"를 더하기, "low key, deep shadows"에 "bright and airy"를 더하기.
- 시대 — "1970s film aesthetic"에 "modern minimalist"와 "cyberpunk"를 더하기.
- 스타일 쌓기 — 작가 넷이나 장르 넷을 한꺼번에. 관련 있는 참조 둘은 통할 수 있지만, 넷은 서로 상쇄되어 평범해집니다.
- 중언부언 — "rustic, weathered, ancient, timeworn wooden door"는 하나의 아이디어를 네 번 쓴 것이고, 반복할 때마다 프롬프트의 나머지가 희석됩니다.
10텍스트-이미지에는 네거티브 프롬프트가 없습니다
숙련된 사용자를 가장 심하게 걸고 넘어지는 안티패턴입니다. 예전 스택에서는 네거티브 프롬프트가 기술의 절반이었기 때문입니다.
| 작업 | 네거티브 프롬프트 | 해야 할 일 |
|---|---|---|
| 텍스트-이미지(생성) | 미지원 | 원하는 것만 묘사하세요. 절대 "no X"라고 쓰지 마세요. |
| 이미지 한 장 편집 | 지원 | 원치 않는 아티팩트를 거기에 넣고, 지시문은 긍정형으로 유지하세요. |
| 둘 이상 합성 | 지원 | 동일 — 아티팩트는 네거티브에, 역할은 긍정에. |
생성에서 이 규칙은 절대적이고 다소 직관에 반합니다. 프롬프트에 "no text, no watermark, no extra fingers"라고 쓰면 그것들이 덜 나오는 게 아니라 더 나옵니다. 모델은 "no text"를 text라는 개념이 들어 있는 문장으로 읽습니다. 부정은 약한 신호이고 명사는 강한 신호입니다. 사실상 글자를 요청한 셈입니다. 항상 긍정형으로 진술하세요.
| 이렇게 말고 | 이렇게 |
|---|---|
| 배경이 지저분하지 않게 | 이음매 없는 깔끔한 회색 배경 |
| 흐리지 않게 | 눈에 칼같이 초점, f/8 |
| 다른 사람 없이 | 새벽 빈 거리에 혼자 |
| 현대적 물건 없이 | 법랑 그릇과 무쇠 난로가 있는 1930년대 부엌 |
| 만화풍 아니게 | Kodak Portra 400으로 촬영, 85mm, 자연스러운 피부 질감 |
편집과 합성에서는 네거티브 프롬프트가 존재하고 써야 합니다 — 다만 내용이 아니라 아티팩트에 씁니다. 좋은 재료: 워터마크, 텍스트 오버레이, 중복된 팔다리, 뒤틀린 손, 과도한 샤프닝 후광, JPEG 블록, 합성 경계의 이음선. 나쁜 재료: 그림이 무엇에 관한 것인지에 대한 모든 내용. 그것은 지시문에 들어가야 합니다.
11Shannon이 대신 써 주는 프롬프트 읽기
이 가이드를 이론이 아니라 당장 쓸 수 있게 만드는 부분입니다. 생성 프롬프트를 직접 쓸 필요는 없습니다. 어떤 언어로든 평범한 말로 요청하면, Shannon이 이미지 요청임을 알아보고 영어 생성 프롬프트를 구성한 뒤 무언가 렌더링되기 전에 확인 카드로 보여 줍니다. 여러분이 확인하기 전에는 아무것도 생성되지 않고 과금되지도 않습니다.
그러므로 가장 큰 보상을 주는 기술은 프롬프트를 백지에서 쓰는 것이 아니라 카드에 뜬 것을 읽는 것입니다. 다음 목록을 훑어보세요.
- 주제가 구체적인가? 카드에 "a person"이나 "a woman"이라고 적혀 있다면, 가능한 가장 큰 개선 지점을 찾은 것입니다. 나이, 체형, 특징을 주세요.
- 주제가 맨 앞인가? 프롬프트가 스타일이나 카메라로 시작한다면, 주제로 시작하도록 요청하세요.
- 길이가 범위 안인가? 30 단어 미만이면 빛과 배경을 더 구체화해 달라고 하세요. 100 단어를 넘으면 줄여 달라고 하세요.
- 광원이 있는가? 분위기 단어가 아니라 실제 빛 말입니다. 창문, 가로등, 플래시, 흐린 하늘, 소프트박스.
- 충돌이 있는가? 한 프롬프트에 매체 둘, 프레이밍 둘, 조명 조건 둘이 들어 있지 않은지 살피세요.
- 숨어든 부정형이 있는가? 카드에 "without", "no", "avoid"가 있다면, 그것은 자기가 이름 부른 것을 요청하는 텍스트-이미지 프롬프트입니다.
- 비율이 주제에 맞는가? 전신 인물에
wide가 고전적인 불일치입니다.
수정은 대화로 합니다. "30대 초반으로 하고 한쪽 눈썹에 흉터를 넣어 줘, Portra로 85mm에서 찍은 느낌으로, portrait 비율로"는 아주 좋은 지시입니다. 새 카드를 받아 그것을 확인하면 됩니다. 아직 아무것도 렌더링되지 않았으므로 반복에 대한 벌금은 없습니다.
그리고 Shannon은 요청하지 않은 이미지를 만들지 않습니다. 인사, 질문, 이야기하려고 첨부한 사진은 렌더링을 유발하지 않습니다. Shannon에게 이미지를 봐 달라고 하는 것 — 설명, 판독, 분석 — 은 생성이 아니라 평범한 비전 작업이며 추가 비용이 들지 않습니다.
12편집과 합성에서 기술이 달라지는 지점
위의 규칙들은 생성을 위해 쓰였습니다. 인접한 두 모드는 프롬프트의 형태를 바꿉니다.
이미지 한 장 편집
편집 프롬프트는 묘사가 아니라 지시입니다. 무엇이 바뀌고 무엇이 그대로인지 말하세요. 바뀌지 않는 부분을 명시하는 것이 이 제품에서 가장 큰 품질 지렛대입니다 — "배경을 네온이 반사되는 비 오는 밤 도시 거리로 바꾸고, 여자는 지금 그대로 유지해"는 그 절이 없는 같은 요청이 그녀의 얼굴을 조용히 다시 그려 버리는 자리에서 형태를 지켜 냅니다. 고정 대상은 구체적으로: 얼굴, 자세, 머리, 옷을 동일하게 유지하라고 하세요. 원본 이미지는 정확히 한 장만 사용되고, 결과물은 그 화면 비율을 유지합니다.
둘 이상의 이미지 합성
요소가 두 장 이상의 그림에서 올 때는 언제나 — 의상 이식, 오브젝트를 장면에 넣기, 한 화면에 두 사람, 제품 착용, 한 이미지의 스타일에 다른 이미지의 주제 — 프롬프트가 각 이미지의 역할을 순서대로 명시해야 합니다. "첫 번째 이미지의 여자가 두 번째 이미지의 빨간 니트 스웨터를 입고 같은 공원에 서 있는 모습"처럼요. 첫 번째 이미지가 주요 피사체 또는 장면이고, 뒤의 이미지들이 가져올 부분을 제공합니다. 다중 이미지 요청을 원본 하나에 글 설명을 더하는 방식으로 뭉뚱그리지 마세요 — 실제 이미지들을 합성하는 것이 그것들의 실제 모습을 보존하는 방법입니다.
13무검열 프롬프트 작성: 뜻하는 바를 그대로 말하세요
생성 경로에는 콘텐츠 필터가 없고, 프롬프트를 작성하는 모델에는 거절 레이어가 없습니다. 이 제품의 요점 전체가 그것입니다. 필터형 생성기는 정당한 작업을 일상적으로 거부합니다 — 누드 아트, 의학 및 법의학 일러스트, 보안 연구용 이미지, 픽션 속 폭력, 정치 풍자, 권리자 본인의 브랜드 및 초상 작업. 필터가 걸린 플랫폼에서 프롬프트 기술의 절반은 완곡어 공학이고, 완곡어는 정확한 이미지의 적입니다.
그래서 카드에서 확인할 것이 하나 더 있습니다. 필터형 도구에서 익힌 얼버무리는 어휘가 아니라 평범한 말로 실제 주제를 묘사하고 있는지 보세요. 상처에 대한 법의학 일러스트라면 그 상처가 무엇인지 말해야 합니다. 얼버무리는 표현은 어디서나 더 나쁜 이미지를 만듭니다. 모델은 단어가 말하는 것을 렌더링하기 때문입니다.
능력과 판단은 별개입니다. Shannon Lab LLC는 공개된 책임 있는 사용 정책 아래 이것을 운영합니다. 필터 없는 생성은 전문가용 도구이며, 동의와 권리와 법은 여러분이 만드는 것에 여전히 적용됩니다.
한 장짜리 체크리스트
- 쉼표 태그가 아니라 완전한 문장의 산문.
- 30–80 단어. 빼도 그림이 안 바뀌는 것은 잘라내기.
- 주제 → 동작 → 스타일 → 배경과 조명 → 기술적 요소.
- 구체적인 주제: 나이, 구조적 특징 하나, 결점 하나.
- 사진: 카메라, 렌즈, 그리고 필름이나 광원을 명시.
- 깊은 장면: 전경, 중경, 배경을 따로 명시.
- 정확한 색은 이름 붙은 대상에 묶인
color #RRGGBB로. - 주제의 지배적 축에서 비율을 고르기.
- 프레이밍에 맞춘 근거 질감 두세 가지.
- 품질 토큰 금지, 가중치 문법 금지, 상충하는 지시 금지.
- 텍스트-이미지에는 부정형 금지. 부정형은 편집과 합성에서, 아티팩트에만.
14API의 자리
API를 검색해 오신 분들을 위한 정확성 하나. 이미지 생성, 편집, 합성은 /v1 API가 아니라 Shannon 채팅 앱에 있습니다. API는 텍스트와 비전을 제공합니다 — 세 가지 방언(/v1/chat/completions, /v1/messages, /v1/responses, 모두 스트리밍) 전부에서 보내는 이미지를 읽고, 설명하고, 분석할 수 있지만 — 만들지는 않습니다. 이미지를 이해해야 하는 파이프라인을 만들고 있다면 API 문서에서 시작하세요. 이미지를 만들고 싶다면 그것은 채팅 앱이고, 이 가이드의 모든 내용이 거기에 적용됩니다. 이미지는 자체 GPU 클러스터에서 렌더링됩니다.
15자주 묻는 질문
AI 이미지 프롬프트는 얼마나 길어야 합니까?
30에서 80 단어를 목표로 하고 100 단어를 크게 넘기지 마세요. 30 단어 미만이면 구도, 조명, 프레이밍을 우연에 맡기게 됩니다. 100 단어를 넘어서면 뒤쪽 절이 앞쪽 절과 경쟁하기 시작하고, 디테일이 쌓이는 대신 씻겨 나가기 시작합니다.
키워드 태그로 써야 합니까, 완전한 문장으로 써야 합니까?
완전한 문장입니다. Shannon의 이미지 모델은 언어 모델이 텍스트를 읽듯 프롬프트를 읽으므로 문법이 정보를 실어 나릅니다. "A woman in her 30s at a rain-soaked Tokyo crosswalk at night"는 일관된 장면을 만들어 내지만, "woman, 30s, Tokyo, rain, night"는 서로 아무 관계도 없는 속성 더미를 만들어 냅니다.
텍스트-이미지 생성에 네거티브 프롬프트를 쓸 수 있습니까?
아니요. Shannon의 텍스트-이미지 생성은 네거티브 프롬프트를 받지 않습니다. 원하는 것만 묘사하고 프롬프트 안에 "no X"라고 쓰지 마세요 — 어떤 것을 이름 부르면 그것을 불러오게 됩니다. 이미지 편집과 이미지 합성은 네거티브 프롬프트를 지원하며, 워터마크, 텍스트 오버레이, 중복된 팔다리 같은 원치 않는 아티팩트를 넣을 자리가 바로 그곳입니다.
"masterpiece, best quality, 8k" 같은 토큰이 이미지를 개선합니까?
아니요. 그것들은 이전 세대 모델을 위한 손잡이였고 여기서는 아무 정보도 담지 않습니다 — 그저 단어로 읽힐 뿐이며, 아무 말도 하지 않으면서 30–80 단어 예산의 일부를 씁니다. (word:1.3) 같은 가중치 문법도 해석되지 않고 문자 그대로의 텍스트로 들어갑니다. 대신 원하는 실제 디테일을 묘사하세요.
정확한 색을 얻으려면 어떻게 합니까?
16진수 코드를 color #RRGGBB 형태로 쓰고 이름이 붙은 특정 대상에 붙이세요. 예를 들면 "a wool jacket, color #8B0000"입니다. 대상에서 떨어져 떠 있는 16진수 코드는 결합할 곳이 없습니다. 실제로 중요한 두세 가지 색에만 쓰고 나머지는 말로 묘사하세요.
Shannon API로 이미지를 생성할 수 있습니까?
아니요. 이미지 생성, 편집, 합성은 Shannon 채팅 앱에서 이루어집니다. /v1 API는 텍스트와 비전을 제공합니다 — 보내는 이미지를 읽고 분석할 수는 있지만 만들지는 않습니다. 이 가이드의 모든 내용은 채팅 앱에 적용됩니다.
실제 프롬프트로 시험해 보세요
어떤 언어로든 요청하세요. 카드를 읽으세요. 고치세요. 그런 다음 확인하세요.
Shannon 채팅 열기 리서치 더 보기프롬프트를 확인하기 전에는 아무것도 렌더링되지 않고 과금되지도 않습니다
함께 읽기: 무검열 AI 이미지 생성 · 무검열 AI 이미지 편집 · 책임 있는 사용 정책 · API 문서 · Shannon 리서치 전체. 이 글의 지침은 Shannon 이미지 모델에 대한 우리 자체 테스트에서 나온 것입니다. 예전 확산 스택을 위해 쓰인 조언은 대체로 이전되지 않습니다.