Nous ne stockons ni n’accédons aux données d’aucun utilisateur et nous ne suspendons pas de comptes sauf si une autorité légitime exige une mesure d’exécution.
Guide image · Composition multi-images

Transfert de tenue par IA, sans censure

Comment combiner deux images ou plus en une seule sur Shannon — transfert de vêtement, objet dans une scène, personne à côté d'une personne, produit sur une personne — et la règle unique qui fait tout fonctionner.

Mis à jour le 5 septembre 2026Guide imageShannon 3 · application de chat

En bref

Joignez les images et décrivez le résultat en nommant ce que chaque image apporte, dans l'ordre. La première image est le sujet principal ou la scène ; les images suivantes fournissent les éléments rapportés. « La femme de la première image portant le pull rouge en maille de la deuxième image, debout dans le même parc. » Ne réduisez pas un travail à deux images à une image plus une description textuelle de l'autre — un vêtement décrit devient un vêtement générique ; le vrai reste le vrai. La combinaison accepte un prompt négatif et vous laisse choisir un nouveau format de canevas. Il n'y a aucun filtre de contenu et aucune couche de refus — et aucune génération vidéo.

L'essentiel du travail sur l'image dont les gens ont réellement besoin n'est pas « fais-moi l'image d'une chose ». C'est « mets cette veste sur cette personne », « pose ce fauteuil dans cette pièce », « photographie ce produit dans cette main ». Tout cela réclame de la matière venue de plus d'une photographie, et tout cela échoue de la même façon : une image est jointe, l'autre est décrite avec des mots, et il revient quelque chose de plausible qui n'est pas la chose que vous possédez. Le remède est plus petit que vous ne le croiriez, et il fonctionne partout.

2+
Images par composition
5
Formats de canevas
Oui
Prompt négatif
0
Couches de refus

01Ce qu'est « combiner des images », et où cela se passe

Shannon 3 fait trois choses distinctes avec les images : il génère une nouvelle image à partir d'une description, il modifie une image existante, et il combine deux images ou plus en une seule nouvelle. Elles ont des règles différentes, et choisir la mauvaise est le premier endroit où la qualité se perd.

Utilisez la combinaison chaque fois que l'image finie a besoin de matière venue de plus d'une photographie : transfert de tenue et de vêtements, insertion d'un objet dans une scène, personne A à côté de personne B, un vrai produit tenu par un vrai mannequin, le style d'une image appliqué au sujet d'une autre. Si vous vous surprenez à vouloir désigner deux images à la fois, c'est de cette opération qu'il s'agit.

Tout cela se passe dans l'application de chat Shannon, en conversation ordinaire. Ce n'est pas sur l'API /v1 — l'API sert le texte et la vision, c'est-à-dire qu'elle lit les images que vous envoyez plutôt que d'en produire de nouvelles. Si vous arrivez d'une recherche sur l'API, voilà la réponse honnête ; voyez la documentation de l'API pour ce que les points de terminaison servent réellement. Les images sont rendues sur notre propre grappe de GPU.

Vous demandez en langage courant, dans la langue que vous parlez. Shannon détermine qu'une image est demandée, rédige lui-même l'instruction de génération en anglais, et vous la montre sur une carte de confirmation avant tout rendu. Rien n'est généré et rien n'est facturé tant que vous n'avez pas confirmé — et pour le travail multi-images, cette carte est l'endroit où vous vérifiez que les rôles et l'ordre sont bien ceux que vous vouliez. Shannon ne génère jamais sans y être invité : une salutation, une question ou une photo jointe en passant ne déclenche pas de rendu.

02La règle : nommez le rôle de chaque image, dans l'ordre

L'instruction doit dire ce que chaque image apporte, et elle doit le dire dans l'ordre où les images ont été fournies. C'est toute la technique ; tout ce qui suit n'est que cette règle appliquée à un travail précis.

La première image est la base — le sujet principal, ou la scène, selon ce dont l'image finie est majoritairement faite. Elle fixe l'identité, la pose, le cadrage, l'éclairage et tout ce que vous n'avez pas demandé de changer. Les images suivantes sont des sources : les éléments rapportés. Écrivez la phrase de sorte qu'un inconnu tenant les images dans l'ordre puisse exécuter le travail à la main.

Fonctionne
La femme de la première image portant le pull rouge en maille
de la deuxième image, debout dans le même parc, même pose et
même lumière d'après-midi, son visage et ses cheveux inchangés.
Échoue
Combine ces deux images.   Fusionne les photos.   Assemble-les.

Les versions qui échouent échouent non parce qu'elles sont courtes mais parce qu'elles ne disent jamais quelle image est la personne et laquelle est le pull. Trois habitudes rendent la règle fiable :

  • Utilisez explicitement le langage ordinal. « De la première image », « de la deuxième image ». Quatre mots, et l'ambiguïté disparaît.
  • Dites ce qui reste identique. « Garde son visage, ses cheveux et sa pose identiques. » Nommer les parties inchangées est le plus grand levier de qualité dans toutes les opérations sur l'image que fait Shannon, et cela compte le plus ici, car une composition a deux choses ou plus dont elle peut s'écarter.
  • Écrivez de la prose, pas des étiquettes. Le Modèle d'Image lit les instructions comme un modèle de langage lit une phrase, donc les phrases complètes l'emportent sur les mots-clés séparés par des virgules. Visez 30 à 80 mots, et laissez tomber la ferraille de l'ère SDXL (« masterpiece, best quality, 8k ») et la syntaxe de pondération du type (word:1.3).

Quand une image contient plus d'une chose, nommez la partie que vous voulez en tirer. Si la deuxième image est une photo catalogue d'un mannequin portant le pull, « le pull rouge en maille porté par la femme de la deuxième image » indique que vous voulez le vêtement, pas le mannequin. Restez-en à « la deuxième image » et vous risquez d'obtenir son visage aussi.

Modèles de rôles par type de travail

TravailPremière imageDeuxième imageForme de l'instruction
Transfert de tenueLa personneLe vêtement« La [personne] de la première image portant le [vêtement] de la deuxième image, [ce qui reste] »
Objet dans une scèneLa scèneL'objet« La [pièce] de la première image avec le [objet] de la deuxième image placé [où], en accord avec [la lumière] »
Personne + personnePersonne A et décorPersonne B« L'[homme] de la première image debout à côté de la [femme] de la deuxième image, [positions, lignes de regard] »
Produit sur une personneLe mannequin ou la scèneLe produit« La [mannequin] de la première image tenant le [produit] de la deuxième image, [prise en main, étiquette face à] »
Transfert de styleLe sujetLa référence de style« Le [sujet] de la première image rendu dans les [axes de style] de la deuxième image, [sujet inchangé] »

03L'erreur qui ruine la plupart des tentatives : décrire au lieu de joindre

C'est l'erreur qui mérite qu'on en fasse toute une histoire, parce qu'elle est de loin la plus fréquente et parce qu'elle donne l'impression d'avoir marché. L'utilisateur a deux photographies — son client et le produit de son client, ou lui-même et une veste qu'il possède. Il en joint une, et il tape l'autre.

L'erreur
[joint une seule photo d'une femme]
« Mets-lui un pull rouge en maille, à torsades, un peu épais,
avec un col roulé. »

Ce qui revient, c'est une femme dans un pull rouge en maille. C'est un bon pull. Ce n'est pas le pull. Le motif de torsades est inventé, la teinture est un autre rouge, la profondeur des côtes est fausse, le col se roule dans le mauvais sens, et les petites asymétries qui rendent un vrai vêtement reconnaissable — une reprise, un fil tiré, l'étirement aux coudes — ont disparu, parce que rien dans la phrase ne les contenait.

Le texte est un canal avec perte, la photographie non. Une phrase soignée porte peut-être une douzaine d'attributs d'un objet ; la photographie en porte des milliers, y compris tous ceux que vous n'auriez jamais pensé à écrire et ceux que vous ne savez pas nommer. Décrire au lieu de joindre jette tout ce à quoi vous n'avez pas pensé, c'est-à-dire l'essentiel. Joindre préserve l'apparence réelle parce que l'apparence réelle est présente.

Le test est simple. Si tout l'intérêt de l'image tient à ce que ce soit celle-là — ce vêtement précis, cette personne, ce produit exact, cette pièce — joignez-la. Si vous pourriez reconnaître l'objet dans une rangée et qu'il importe que le résultat corresponde à celui que vous désigneriez, une description n'y suffira pas.

La version en une ligne

Un vêtement décrit devient un vêtement générique. Le vrai reste le vrai. Il en va de même pour le deuxième visage, le produit, le fauteuil et la pièce : joindre préserve l'identité, décrire la remplace par une moyenne.

Il existe un cas légitime pour décrire : quand la chose n'existe pas encore, ou quand une version générique est exactement ce que vous voulez. Concevoir un pull que personne n'a tricoté, dégrossir un concept — c'est du travail texte-vers-image, et une description convient parce qu'il n'y a pas d'objet réel dont vous conservez l'identité. Dès qu'un objet réel entre dans le brief, sa photographie aussi.

Une demi-erreur apparentée : joindre les deux images puis décrire quand même la seconde en détail. Les adjectifs peuvent entrer en conflit avec la photographie — écrivez « épais » quand le vrai vêtement est en maille fine et vous avez introduit une contradiction. Ne décrivez la deuxième image que juste assez pour identifier la partie que vous voulez.

04Transfert de tenue et de vêtements

Le travail canonique à deux images. Joignez la personne en premier et le vêtement en second. L'image du vêtement peut être une mise à plat, une photo sur cintre, une photo catalogue, ou quelqu'un d'autre qui le porte — tout fonctionne, tant que vous dites de quelle partie vous parlez.

Transfert de tenue
La femme de la première image portant le pull rouge en maille
de la deuxième image. Garde son visage, ses cheveux, sa pose et
l'arrière-plan du parc exactement tels qu'ils sont, avec la même
lumière douce de ciel couvert. Le pull doit tomber naturellement
sur sa silhouette, avec le motif de torsades et le col du
vêtement d'origine intacts.

Prompt négatif : motif de torsades déformé, manches en trop,
mains distordues, tissu d'aspect plastique, éclairage discordant

Trois choses font le travail : les rôles sont nommés dans l'ordre, les parties inchangées sont énumérées à voix haute (c'est ce qui empêche le visage de dériver), et la dernière proposition dit au modèle que les détails propres au vêtement sont le sujet — sans elle, les compositions tendent à conserver la couleur et la silhouette tout en lissant discrètement la texture.

  • Le tombé est une affirmation physique, alors formulez-la. « Tombe naturellement sur sa silhouette », « ajusté à la taille », « manches s'arrêtant au poignet » — sinon le vêtement peut arriver aux proportions de sa source plutôt qu'à celles de la personne qui le porte.
  • L'occlusion est le cas difficile. Si les bras sont croisés ou qu'une bandoulière traverse la poitrine, dites ce qu'il en advient. L'ambiguïté à cet endroit produit le classique artefact de manche fondue.
  • Plus de vêtements veut dire plus d'images. La personne d'abord, puis le haut, puis le pantalon, puis les chaussures — et désignez-les comme la deuxième, la troisième et la quatrième image de façon cohérente. Ne passez pas à « l'image des chaussures » en cours de route.

05Mettre un objet dans une scène

Ici les rôles s'inversent : la scène passe en premier, parce que c'est d'elle que l'image finie est majoritairement faite, et l'objet est l'élément rapporté. Maquettes d'intérieur, mise en scène d'une pièce avec des meubles que vous n'avez pas achetés, dépose d'un véhicule sur une route, installation d'une sculpture dans une galerie — la même forme à chaque fois.

Objet dans une scène
Le salon de la première image avec le fauteuil en velours vert
de la deuxième image placé à côté de la fenêtre à gauche,
légèrement tourné vers la caméra et arrivant à peu près à
hauteur de taille dans l'image. Accorde-le à la lumière chaude
de fin d'après-midi de la pièce, avec une ombre douce tombant à
droite du fauteuil sur le tapis. Garde le reste de la pièce et
l'angle de caméra inchangés.

Prompt négatif : objet flottant, bords découpés, ombres
dupliquées, température de couleur discordante

Le mode de défaillance ici n'est pas l'identité, c'est la physique. Un objet qui garde son propre éclairage a l'air collé, et les spectateurs le repèrent instantanément même sans pouvoir dire pourquoi. Dépensez vos mots sur les trois choses que la photographie d'un objet isolé ne peut pas connaître : le placement (où dans l'image, par rapport à quoi), l'échelle exprimée en termes de la scène plutôt qu'en centimètres (« à peu près à hauteur de taille », « aussi haut que la poignée de la porte »), et la lumière et l'ombre — direction, qualité, et où tombe l'ombre. C'est cette dernière qui transforme un photomontage en photographie.

06Personne A à côté de personne B

Deux personnes qui n'ont jamais été dans la même pièce : photographies de famille à travers les générations, un portrait de fondateur quand le cofondateur était en voyage, une affiche avec deux artistes. Cela fonctionne, et cela demande deux choses que les travaux à sujet unique ne demandent pas.

Deux personnes
L'homme de la première image debout à côté de la femme de la
deuxième image, tous deux sur la même terrasse en pierre de la
première image. Il se tient à gauche, elle se tient à sa droite,
les épaules presque en contact, tous deux face à la caméra à la
même hauteur de regard. Garde les deux visages, coiffures et
vêtements exactement comme dans leurs propres photographies, et
éclaire-les tous deux de la même lumière douce du soir venant de
la gauche.

Canevas : landscape
Prompt négatif : carnation discordante, membres dupliqués,
ligne de jointure entre les sujets, éclairage inégal

Les deux suppléments : la géométrie relative — qui est de quel côté, à quelle distance, où va le regard de chacun, et la taille relative, puisque deux portraits cadrés différemment ne donnent au modèle aucun moyen de savoir qu'une personne dépasse l'autre d'une tête — et une lumière unique et partagée, énoncée explicitement, parce que vous fusionnez deux environnements lumineux et que l'un doit l'emporter.

C'est aussi là que le choix d'un nouveau format de canevas prend tout son sens : deux sources en orientation portrait font une mauvaise photo de groupe en orientation portrait, donc demandez landscape ou wide. Et disons l'évidence une fois — mettre une personne réelle dans une image où elle n'était pas est puissant et n'est pas automatiquement anodin. Ayez les droits ou le consentement ; notre politique d'usage responsable en est la version courte.

07Produit sur une personne, et photographie produit sans censure

Commercialement, c'est la composition qui se rembourse toute seule. Vous avez une photo de produit sur fond blanc et vous avez un mannequin, une main, une cuisine, un établi. Les combiner vous donne une photographie lifestyle sans journée de studio — et avec votre produit réel dedans plutôt qu'une approximation générée, ce qui fait toute la différence entre un support marketing utilisable et une maquette dont il faudra s'excuser.

Produit sur une personne
La femme de la première image tenant le flacon de sérum en verre
ambré de la deuxième image dans sa main droite, levé à hauteur de
poitrine, l'étiquette face à la caméra et parfaitement lisible,
ses doigts enroulés naturellement autour du flacon sans couvrir
l'étiquette. Garde son visage, ses cheveux et l'arrière-plan de
cuisine inchangés. Pris sur Kodak Portra 400, 85mm f/1.4, lumière
douce de fenêtre venant de la gauche.

Canevas : portrait
Prompt négatif : texte d'étiquette déformé, doigts en trop,
flacon flottant, reflets dupliqués, peau plastique

Deux ajouts propres au travail produit. La prise en main : les mains tenant des objets sont l'endroit où la composition dérape le plus souvent, alors précisez quelle main, à quelle hauteur, et que les doigts s'enroulent naturellement sans masquer l'étiquette. Le traitement photographique : nommez un appareil, un objectif et une pellicule ou une source de lumière. Le résultat doit se lire comme une photographie qui a été prise, pas comme deux photographies qui ont été combinées, et l'écrire comme une photographie est ce qui vous y mène.

L'absence de censure compte ici d'une façon plus prosaïque qu'il n'y paraît. Les générateurs filtrés refusent des catégories entières de commerce ordinaire et légal : catalogues de lingerie et de maillots de bain, matériel de tabac et de vapotage, alcool, accessoires d'armes à feu, produits de bien-être pour adultes, cannabis là où il est légal, dispositifs médicaux, équipement tactique et de chasse. Ils refusent aussi le travail de marque et de ressemblance réalisé par l'ayant droit. Rien de tout cela n'est un cas marginal ; c'est un mardi ordinaire dans une agence. Shannon n'a aucun filtre de contenu sur le chemin de génération ni couche de refus sur le modèle qui rédige le prompt, donc le travail passe et la question des droits reste chez vous, là où elle doit être.

08Le style d'une image, le sujet d'une autre

Le sujet d'abord, la référence de style ensuite. Ce qui rend ce travail différent, c'est que vous empruntez une qualité plutôt qu'un objet, il faut donc nommer lesquelles — et préciser que le sujet et la composition propres à la référence ne suivent pas.

Référence de style
Le portrait de l'homme de la première image rendu dans le style
visuel de la deuxième image : la même palette sourde de bleu
sarcelle et d'ocre, une texture de brosse sèche visible, et un
éclairage plat et uniforme. Garde son visage, son expression et
sa pose reconnaissables et inchangés. Ne reprends pas le sujet,
l'arrière-plan ni la composition de la deuxième image.

Prompt négatif : deuxième visage, arrière-plan emprunté, texture
photographique

Nommez explicitement les axes de style, car « dans le style de la deuxième image » à lui seul est sous-spécifié : la palette (ou des couleurs exactes, écrites sous la forme color #8B0000 rattachée à un objet nommé), le travail de brosse ou le grain, la qualité de lumière, l'épaisseur du trait, le degré d'abstraction, le traitement des bords. Choisissez les deux ou trois qui définissent le rendu ; les nommer tous les six revient à les moyenner. Et ne mélangez pas des directions contradictoires — « photoréaliste » plus « aquarelle » produit une bouillie, pas un mélange. Si vous voulez une photographie qui emprunte simplement une palette, dites exactement cela.

09Prompts négatifs et choix d'un nouveau format de canevas

Deux capacités qui existent pour la combinaison et l'édition mais pas pour le texte-vers-image, et toutes deux sous-utilisées.

Le prompt négatif

La combinaison d'images accepte un prompt négatif. Les artefacts indésirables y vont — et il importe qu'ils y aillent plutôt que dans l'instruction, car écrire « pas de doigts en trop » dans l'instruction principale nomme la chose que vous cherchez à éviter dans le même souffle que tout ce que vous voulez. Mettez les exclusions dans leur propre canal. Les entrées qui méritent systématiquement leur place :

  • Anatomie — doigts en trop, membres dupliqués, mains difformes, deuxième visage.
  • Signes de photomontage — bords découpés, ligne de jointure visible, objet flottant, ombres dupliquées, halo autour du sujet.
  • Discordance d'éclairage — température de couleur discordante, direction d'ombre incohérente, exposition inégale entre les sujets.
  • Défauts de texture — peau plastique, tissu lissé, texte d'étiquette déformé, logo illisible.

Limitez-vous à la poignée d'entrées plausibles pour votre image. Un prompt négatif énumérant trente choses est une instruction diffuse, pas une instruction forte.

Le format du canevas

La modification d'une image unique hérite automatiquement du format de l'image source — il y a une source, et sa forme est la réponse. La combinaison n'a pas de défaut de ce genre, donc vous pouvez choisir un nouveau format de canevas, et vous le devriez souvent, car la forme qui convenait à une source convient rarement à la composition.

FormatIdéal pourUsage typique en composition
squarePar défaut, fils sociauxSujet unique avec un élément transféré
portraitPersonnes, sujets en hauteurTransfert de tenue, produit tenu par un seul mannequin
landscapePaysages, groupesDeux personnes côte à côte, objet placé dans une pièce
wideCadrage cinématiquePhotos de groupe, scènes produit en environnement, bannières
tallAffiches, fonds d'écran de téléphoneTenues en pied, mises en page d'affiche

Une demande explicite l'emporte toujours. Ne dites rien et vous obtenez square — la mauvaise forme pour la plupart des travaux à deux personnes et des tenues en pied, cela vaut donc bien un mot.

10Quelles images Shannon utilise : la conversation ou ce message-ci

Il y a deux façons pour une image d'entrer dans une composition, et savoir sur laquelle vous vous appuyez évite la plupart des confusions d'ordre.

Jointe au message actuel. La voie directe : joignez tout au message qui porte l'instruction, dans l'ordre où vous comptez y faire référence, et « première image » et « deuxième image » signifient exactement ce dont elles ont l'air. Faites-en votre choix par défaut.

Déjà dans la conversation. Les images envoyées plus tôt dans le fil restent disponibles et peuvent être désignées en langage courant — « la photo que j'ai envoyée tout à l'heure », « l'image du pull d'avant », « la deuxième version que tu as faite ». Shannon résout la référence dans le fil, ce qui est réellement pratique sur une longue session : vous pouvez itérer sur un résultat puis amener un nouvel élément sans tout re-téléverser.

Le garde-fou est le même dans les deux cas. La carte de confirmation montre l'instruction avant tout rendu, y compris l'ordre retenu. Lisez-la. Si les rôles sont inversés — le pull comme base, la personne comme source — dites-le et c'est corrigé avant qu'un seul pixel ne soit généré ou facturé. Cela dit, quand un fil est long et rempli d'images, rejoignez celles dont vous avez besoin ; six images plus haut, « la deuxième image » est ambiguë pour n'importe quel lecteur.

Demander à Shannon de regarder une image — la décrire, lire l'étiquette, vous dire quel est le tissu — relève du travail de vision ordinaire, pas d'une génération. Cela ne coûte rien de plus et c'est une bonne vérification avant de composer : si la description de Shannon ne mentionne pas le détail qui vous importe, votre instruction doit le nommer.

11Sans censure, et ce que cela veut vraiment dire

Il n'y a aucun filtre de contenu sur le chemin de génération et aucune couche de refus sur le modèle qui rédige le prompt. La composition est l'endroit où les outils filtrés échouent le plus visiblement, parce qu'un système de refus ne peut pas faire la différence entre combiner des images qui vous appartiennent et combiner des images que vous ne devriez pas avoir — alors il bloque les deux.

Le travail que ces outils refusent régulièrement n'a rien d'exotique : nus artistiques et étude d'après modèle, illustration médicale et médico-légale, imagerie pour la recherche en sécurité, violence en fiction pour des couvertures de livres et des visuels de jeu, satire politique, et les catégories de produits légaux énumérées plus haut. Chacune est un travail professionnel légitime qu'un filtre à mots-clés ne peut pas distinguer d'un abus.

Sans censure ne veut pas dire sans responsabilité. Vous fournissez des photographies d'objets réels et souvent de personnes réelles ; les droits et le consentement vous appartiennent, tout comme la responsabilité du résultat. Shannon Lab LLC est une société du Nouveau-Mexique opérant sous une politique d'usage responsable publiée — cinq minutes bien employées avant de commencer un travail impliquant la ressemblance d'autrui.

12Limites à connaître avant de commencer

Il n'y a aucune génération vidéo. Shannon n'anime pas les images et ne produit pas de vidéo, sous aucune forme, à partir d'aucune de ces opérations — ni depuis une image unique, ni depuis une composition, ni comme option expérimentale. Si votre brief se termine par du mouvement, ce n'est pas l'outil pour la dernière étape. C'est ce qu'est le produit, pas un indice de feuille de route.

D'autres limites honnêtes, toutes avec des contournements :

  • Le texte fin est le point le plus faible. Les petits caractères, les textes d'emballage denses et les longs numéros de série peuvent ressortir imparfaits. Cadrez le produit de sorte que le texte important soit grand, mettez texte d'étiquette déformé dans le prompt négatif, et vérifiez en taille réelle.
  • Un écart d'échelle extrême est difficile. Une photo produit de 4000 pixels combinée à une petite vignette d'une pièce laisse peu de matière au modèle. Utilisez la meilleure copie disponible de chaque source.
  • Une forte occlusion limite ce qui peut être transféré. Un vêtement photographié plié, dont le dos n'est jamais visible, ne peut pas voir son dos inventé fidèlement. Si la composition montre le dos, fournissez le dos.
  • Plus d'images veut dire plus de place pour la confusion. Quatre sources restent gérables avec un nommage ordinal discipliné, mais ce n'est pas le moment d'être approximatif — utilisez le nombre que le travail exige, pas un de plus.
  • Deux gros changements à la fois se disputent l'attention. Transférez la tenue, confirmez, puis changez l'arrière-plan. Les modifications successives l'emportent presque toujours sur une seule instruction surchargée, et chaque étape est peu coûteuse à vérifier.

13Questions fréquentes

Comment combiner deux images en une seule avec l'IA ?

Joignez les deux images dans le chat Shannon et décrivez le résultat en nommant ce que chaque image apporte, dans l'ordre. La première image est le sujet principal ou la scène ; les images suivantes fournissent les éléments rapportés. Par exemple : la femme de la première image portant le pull rouge en maille de la deuxième image, debout dans le même parc. Shannon rédige lui-même l'instruction finale en anglais, vous la montre sur une carte de confirmation, et rien n'est rendu tant que vous n'avez pas confirmé.

Pourquoi la tenue est-elle ratée quand je décris le vêtement au lieu de le joindre ?

Parce qu'une phrase est une description avec perte d'une photographie. Écrire un pull rouge en maille vous donne un pull rouge en maille plausible, pas le vôtre — le motif torsadé, les côtes, la teinture, le tombé, l'emplacement des coutures et l'usure sont tous inventés. Joindre la deuxième image conserve l'apparence réelle du vrai vêtement. Si tout l'intérêt de l'image tient à ce que ce soit cet article, cette personne ou ce produit précis, joignez-le au lieu de le décrire.

La composition multi-images accepte-t-elle un prompt négatif et un nouveau format ?

Oui aux deux. La combinaison d'images accepte un prompt négatif, si bien que les artefacts indésirables comme les doigts en trop, les membres dupliqués, le texte de logo déformé ou les jointures visibles ont leur place là plutôt que dans l'instruction. Vous pouvez aussi choisir un nouveau format de canevas — square, portrait, landscape, wide ou tall. Cela diffère de la modification d'une image unique, qui hérite automatiquement du format de l'image source.

Shannon peut-il utiliser des images déjà présentes dans la conversation, ou seulement celles que je joins maintenant ?

Les deux. Vous pouvez joindre les images au message actuel, ou renvoyer à des images déjà présentes dans le fil — la photo que j'ai envoyée tout à l'heure, l'image du pull d'avant. Shannon résout ces références et la carte de confirmation montre l'ordre qu'il a retenu, ce qui vous permet de corriger l'ordre avant tout rendu. Tout joindre dans un seul message, dans l'ordre où vous y ferez référence, reste la façon de travailler la plus fiable.

Shannon peut-il transformer l'image combinée en vidéo ?

Non. Shannon ne génère pas de vidéo et n'anime pas les images. Il génère de nouvelles images, modifie une image existante, et combine deux images ou plus en une seule. Le travail sur l'image se fait dans l'application de chat Shannon ; l'API /v1 sert le texte et la vision, c'est-à-dire qu'elle lit les images plutôt que de les produire.

La composition d'images sans censure est-elle vraiment sans filtre ?

Il n'y a aucun filtre de contenu sur le chemin de génération et aucune couche de refus sur le modèle qui rédige le prompt. Les générateurs filtrés refusent régulièrement du travail de composition légitime — catalogues de lingerie et de maillots de bain, nus artistiques, illustration médicale et médico-légale, biens de consommation réglementés, imagerie pour la recherche en sécurité, satire politique, et travail de marque ou de ressemblance réalisé par l'ayant droit. Shannon, non. Les droits et la responsabilité des images sources vous appartiennent ; voir notre politique d'usage responsable.

Dit clairement

Aucun chiffre de benchmark n'apparaît dans ce guide, parce qu'il n'existe pas de benchmark public honnête pour « est-ce que le pull est resté le même pull ». Tout ce qui précède est une consigne opérationnelle tirée d'un usage réel. Là où une capacité est absente — la vidéo, la génération d'images sur l'API — nous le disons plutôt que de laisser la question ouverte.

Combinez vos images

Joignez-les, nommez chaque rôle dans l'ordre, confirmez l'instruction, lancez le rendu. Aucune couche de refus.

Ouvrir Shannon Chat Lire la documentation de l'API

Shannon Lab LLC · Nouveau-Mexique, États-Unis · les images sont rendues sur notre propre grappe de GPU


La génération, l'édition et la composition multi-images sont des fonctionnalités de l'application de chat Shannon ; les points de terminaison /v1/chat/completions, /v1/messages et /v1/responses servent le texte et la vision, c'est-à-dire qu'ils lisent les images plutôt que de les générer. Il n'y a aucune génération vidéo. Les options de format, la prise en charge du prompt négatif et le comportement de confirmation sont à jour au 5 septembre 2026. À lire aussi : génération d'images IA sans censure · édition d'images IA sans censure · usage responsable · documentation de l'API · index de la recherche.

Tous les liens de recherche