Partir du bruit
Le système commence avec une configuration aléatoire, comparable à une télévision brouillée.
Du texte vers les pixels
Elle ne dessine pas comme une personne et ne cherche pas simplement une photo toute faite. Beaucoup de générateurs partent d’un bruit aléatoire puis le transforment progressivement, guidés par votre texte et par ce que le modèle a appris.
Démonstration
Choisissez un élément. Le panneau montre ce qu’il apporte, ce qu’il ne garantit pas et la demande complète obtenue.
Une explication simplifiée
Le générateur commence par une image bruitée, puis la transforme progressivement en tenant compte des mots « chat », « vélo » et « rouge ». Une autre graine aléatoire donnera une composition différente avec la même consigne : il ne retrouve pas une image unique cachée dans sa mémoire.
Les modèles n’utilisent pas tous exactement la même technique. Pour les modèles de diffusion, très répandus, le mécanisme général peut se résumer en quatre étapes.
Le système commence avec une configuration aléatoire, comparable à une télévision brouillée.
Un encodeur transforme les mots du prompt en représentations numériques qui orientent les corrections.
À chaque étape, le modèle estime une version un peu plus cohérente avec la demande.
Une représentation interne est finalement convertie en pixels visibles.
Cette métaphore aide à comprendre le principe, mais elle simplifie les calculs réels. Certains modèles récents utilisent des variantes comme les transformeurs de diffusion ou les flux rectifiés.
Ce que le système fait vraiment
Pendant l’entraînement, le modèle ajuste de très nombreux paramètres pour apprendre des relations statistiques entre des descriptions et des caractéristiques visuelles.
Lorsqu’il génère, il calcule une nouvelle sortie à partir de ces paramètres, du prompt et d’un point de départ aléatoire. Il ne récupère pas normalement une image précise dans une galerie pour la recoller.
Mais « nouvelle » ne veut pas dire « sans histoire ». Les données d’entraînement, une éventuelle mémorisation et la proximité avec des œuvres existantes restent des sujets importants. L’origine du modèle et ses conditions d’utilisation comptent.
Une image déjà publiée et son adresse.
Une sortie à partir du modèle et de la demande.
Pourquoi le résultat change
Le point de départ aléatoire, souvent contrôlé par une « graine » ou seed, influence le résultat. Le modèle, le nombre d’étapes, les dimensions et le niveau de guidage comptent aussi.
Deux générations peuvent donc respecter la même idée tout en changeant la pose, la lumière ou l’arrière-plan. Conserver la même graine aide parfois à comparer une petite modification, sans garantir une identité parfaite entre outils ou versions.
Sujet centré, horizon bas
Sujet décalé, horizon haut
Quatre opérations à distinguer
Créer une composition à partir d’une description.
Remplacer une zone, ajouter un élément ou changer l’ambiance.
Produire plusieurs interprétations proches d’un visuel.
Ajouter des détails plausibles pour augmenter la définition, sans retrouver magiquement des détails réels absents.
Une méthode facile à retenir
Commencez simple, générez, observez puis modifiez un élément à la fois. Une longue liste d’adjectifs n’est pas forcément plus efficace.
Les limites à connaître
Nombre d’objets, texte intégré, anatomie, ombres ou perspective peuvent être erronés.
Les associations apprises peuvent reproduire des visions déséquilibrées des métiers, cultures, âges ou genres.
Une fausse scène crédible peut tromper, nuire à la réputation ou utiliser l’image d’une personne sans accord.
Les règles du service, la licence, les marques et la ressemblance avec une œuvre doivent être examinées avant publication.
Avant de publier
Ne créez pas une fausse scène impliquant une personne réelle sans son accord.
Inspectez les détails, le texte, les symboles et les stéréotypes visibles.
Vérifiez les conditions d’utilisation et les droits nécessaires à votre projet.
Indiquez qu’un visuel est synthétique lorsque le contexte pourrait créer une confusion.
Conservez le prompt, l’outil et la date si vous devez expliquer comment l’image a été produite.
Trois idées à corriger
Elle calcule des relations apprises. Elle n’a ni intention artistique, ni expérience de la scène.
Ce n’est pas son fonctionnement normal, mais des ressemblances et une mémorisation partielle peuvent exister.
Le réalisme visuel ne prouve ni l’événement, ni le lieu, ni l’identité d’une personne.
Sources techniques et institutionnelles
Ces références décrivent le fonctionnement des modèles de diffusion et les précautions liées aux images synthétiques.
La suite logique
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.