0.1 · L'IA générative d'images : comment ça marche ?

Niveau 0 · Fondamentaux de l'IA générative d'images

0.1L'IA générative d'images : comment ça marche ?

Objectif : comprendre les diffusion models et la génération à partir d'un prompt texte, en bref et sans jargon.
Temps estimé : 11 min

Une IA générative d'images transforme une phrase (le prompt) en une image. Le principe dominant aujourd'hui s'appelle le modèle de diffusion (diffusion model), et il est plus simple qu'il n'y paraît. Pendant l'entraînement, on montre au modèle des millions d'images auxquelles on ajoute progressivement du bruit (une « neige » aléatoire) jusqu'à les rendre méconnaissables, et on lui apprend à faire le chemin inverse : retirer le bruit étape par étape pour retrouver une image nette. Une fois entraîné, il sait donc partir d'un pur bruit aléatoire et le « débruiter » jusqu'à faire apparaître une image.

Reste à savoir quelle image faire apparaître : c'est le rôle du prompt. Votre texte est converti en une représentation mathématique (des embeddings) qui guide le débruitage à chaque étape, pour que le résultat corresponde à votre description. C'est pour cela que la formulation compte tant (section 1.2) : le modèle ne « comprend » pas au sens humain, il oriente une génération vers ce qui, statistiquement, ressemble à votre description. Deux conséquences pratiques à retenir. D'abord, le résultat est probabiliste : deux générations avec le même prompt donnent des images différentes (sauf à figer le hasard avec un seed, section 2.2). Ensuite, l'IA ne copie pas des images existantes : elle produit une image nouvelle à partir de régularités apprises — ce qui n'évacue pas pour autant les questions juridiques et éthiques (section 0.4). Comprendre ce fonctionnement évite deux erreurs de débutant : croire qu'un prompt « magique » existe, et s'étonner de la variabilité des résultats.

Vocabulaire de la section

Prompt
Description textuelle envoyée au modèle ; elle guide la génération de l'image.
Modèle de diffusion
Modèle qui apprend à retirer du bruit étape par étape ; il part d'un bruit aléatoire pour faire émerger une image.
Débruitage (denoising)
Processus itératif de retrait du bruit qui fait apparaître progressivement l'image.
Embedding
Représentation mathématique du texte qui permet au modèle d'orienter la génération.
Génération probabiliste
Caractère aléatoire du résultat : un même prompt donne des images différentes à chaque essai.
Vérifiez votre compréhension

Comment fonctionne un modèle de diffusion ?

Midjourney a changé : voici comment l'utiliser en 2026
Vidéo hébergée sur YouTube — ouvrir dans un nouvel onglet ↗

En pratique — Observer le caractère probabiliste de la génération

  1. Choisissez un outil accessible (voir sections 0.2 et 1.4) et saisissez un prompt simple, par exemple « un phare sur une falaise, au coucher du soleil ».
  2. Générez une première fois, puis relancez EXACTEMENT le même prompt.
  3. Comparez : les deux images diffèrent — c'est normal, la génération part d'un bruit aléatoire différent.
  4. Ajoutez un détail au prompt (« vu de loin, ciel orageux ») et observez à quel point la formulation oriente le résultat.
Vous comprenez qu'une image est « débruitée » sous la guidance de votre texte, et que la variabilité est inhérente au procédé.

Points clés à retenir

Questions fréquentes

L'IA copie-t-elle des images existantes pour fabriquer la mienne ?

Non, pas au sens d'un copier-coller. Un modèle de diffusion ne stocke pas une base d'images qu'il découperait et recollerait : il a appris des régularités statistiques (à quoi ressemble un ciel au coucher du soleil, la texture d'une pierre, la structure d'un visage) et il génère une image nouvelle en débruitant un point de départ aléatoire. Les modèles pèsent quelques gigaoctets alors qu'ils ont été entraînés sur des centaines de millions d'images : il est matériellement impossible qu'ils les contiennent. Cela dit, deux nuances importantes empêchent de conclure trop vite. D'abord, des cas de mémorisation existent : sur des images très répétées dans les données d'entraînement (une œuvre ultra-célèbre, un logo), un modèle peut produire un résultat très proche de l'original — c'est un phénomène marginal mais documenté, et une raison de plus de vérifier ce qu'on publie. Ensuite, le fait que le résultat soit « nouveau » ne règle pas la question juridique des données d'entraînement : plusieurs procès sont en cours dans le monde sur la légalité de l'usage d'images protégées pour entraîner ces modèles, et le droit varie selon les pays et évolue vite (voir section 0.4). Retenez donc la nuance utile en pratique : techniquement, votre image est générée, pas copiée ; juridiquement, le sujet reste mouvant, et il faut rester prudent sur les styles d'artistes vivants identifiables et sur les marques ou personnes reconnaissables.

Pourquoi le même prompt ne donne-t-il jamais deux fois la même image ?

Parce que la génération démarre d'un bruit aléatoire différent à chaque fois. Le modèle transforme ce bruit initial en image en le débruitant sous la guidance de votre texte : changez le point de départ, et vous obtenez une image différente, même avec un prompt identique. C'est une propriété voulue du procédé : elle permet d'explorer plusieurs interprétations d'une même idée, ce qui est précieux en création (on relance jusqu'à trouver la piste qui plaît). Ce hasard n'est toutefois pas incontrôlable. La plupart des outils exposent un paramètre seed (graine) : c'est le nombre qui détermine le bruit de départ. En fixant le seed et en gardant le même prompt, la même version de modèle et les mêmes paramètres, vous obtenez un résultat reproductible ou très proche (section 2.2). C'est la technique de base pour faire varier une seule chose à la fois : vous figez le seed, puis vous modifiez un mot du prompt, et vous voyez précisément l'effet de ce mot. À l'inverse, si vous cherchez de la diversité, vous laissez le seed libre et vous relancez (re-roll). Deux réflexes en découlent. Pour explorer : relancez plusieurs fois, ne jugez pas une idée sur une seule image. Pour itérer sérieusement : figez le seed et changez un paramètre à la fois, sinon vous ne saurez jamais quel élément a produit l'amélioration.

⚠️ Signaler un lien cassé ou erroné

Autres ressources

📘
Futura Sciences — Tutoriel : comment bien utiliser Midjourney
futura-sciences.comFR
Recherche : « comment marche l'IA générative d'images »
YouTube · résultats à jourFR