Stable Diffusion 3 : comment une IA fabrique une image
Durée 4:12
Stability AI a publié Stable Diffusion 3 en mars 2025, sur une architecture appelée rectified flow transformers. Ce film explique le mécanisme réel de la diffusion : partir d'une image de bruit pur, puis retirer ce bruit étape après étape sous le guidage du texte. On y voit la nouveauté de la version 3.0 — générer des modèles 3D à partir d'images plates, présentée à la conférence ICML en juillet 2025 — et les acteurs du domaine : DALL·E d'OpenAI, Midjourney, Firefly d'Adobe. Deux obstacles restent ouverts : les droits d'auteur des images générées, et la qualité encore imparfaite.
Chapitres
Chaque chapitre ci-dessous est cliquable.
Transcription
En mars 2025, Stability AI publie Stable Diffusion trois, un générateur d'images. Il repose sur une architecture précise : les rectified flow transformers. Ces outils transforment une phrase écrite en image. On tape une description, le modèle produit un visuel correspondant. La fidélité au texte a longtemps été le vrai défi. Stability AI n'est pas seul sur ce terrain. OpenAI propose DALL·E, Midjourney propose son modèle, Adobe propose Firefly. Quatre approches concurrentes de la même idée. Le choix de Stability AI a été l'open source dès le départ. Le modèle est ouvert, chacun peut l'inspecter et l'améliorer. Cette décision a accéléré son adoption. Comment une image naît-elle réellement ? Tout part d'une image de bruit pur, entièrement aléatoire. Aucune forme n'y est encore visible, rien qu'un grain. En parallèle, la consigne écrite est encodée. Le texte devient une représentation que le modèle sait manipuler. Elle va guider toute la suite. Le modèle retire alors un peu de bruit. Puis encore un peu, étape après étape. À chaque passage, l'image se précise davantage. À chaque étape, la consigne oriente ce qui est retiré. Le bruit ne disparaît pas au hasard. Il s'efface dans la direction du texte demandé. Ce cycle se répète jusqu'à un nombre d'étapes suffisant. Alors l'image finale apparaît, nette. Le bruit de départ est devenu une composition cohérente. Deux réglages comptent vraiment ici. Le nombre d'étapes, et la force de l'orientation. Plus l'orientation est forte, plus l'image colle à la consigne. C'est là qu'intervient l'architecture de Stable Diffusion trois. Les rectified flow transformers raccourcissent le chemin entre bruit et image. Résultat : plus de fidélité, et plus de rapidité. La version trois apporte une nouveauté marquante. Elle génère des modèles en trois dimensions à partir d'images plates. Une image devient un objet manipulable. Cette méthode a été présentée en juillet 2025, à la conférence ICML. Elle extrapole des dimensions absentes de l'image de départ. Le design industriel et l'animation en profitent. Les usages sont déjà concrets dans le divertissement. Studios de cinéma et de jeux vidéo génèrent décors et concepts. Les délais de production s'en trouvent raccourcis. La personnalisation ouvre une autre voie. Chacun peut produire des visuels adaptés à ses préférences exactes. Le contenu sur mesure devient rapide à obtenir. L'intégration récente touche la réalité virtuelle. Le modèle ne crée plus seulement des images fixes. Il compose des environnements entiers, où l'on se déplace. Ces avancées posent une question non résolue. Qui détient les droits d'une image produite par une IA ? Régulateurs et industriels cherchent encore des règles claires. La qualité reste un second obstacle. Le résultat ne correspond pas toujours à l'intention demandée. Des défauts techniques subsistent, malgré les progrès. Deux forces poussent ces modèles vers l'avant. La puissance de calcul disponible, et le raffinement des algorithmes. La collaboration entre chercheurs et industriels fait le reste. À plus long terme, une bascule se dessine. On ne consommera plus seulement du contenu numérique. On créera des mondes entiers, personnalisés et immersifs. La création d'images n'est pas le métier de Koaee. Nous suivons pourtant ces architectures génératives de très près. Elles nous rappellent ce qu'exige un modèle rapide et fidèle. Notre travail, ce sont les assistants conversationnels pour les entreprises. Nous les construisons avec cette même exigence technique. La même rigueur, appliquée à la conversation plutôt qu'à l'image. L'article complet est en commentaire de la vidéo. Le film survole, le texte détaille tout. Abonnez-vous si l'IA vous intéresse, et aimez cette vidéo. À bientôt sur koaee.ai.