Une sortie sans tapis rouge, mais pas sans traces
Le 20 septembre 2026, l'équipe Qwen a mis en ligne les poids de Qwen-Image 2.1 sur Hugging Face et ModelScope, accompagnés de la fiche du modèle, d'un article de blog et d'un dépôt GitHub actualisé le même jour. Aucune keynote, aucun embargo sur des benchmarks, aucun cycle médiatique préparé : le seul signal antérieur remonte au 17 septembre, avec une note proposant 50 places d'accès anticipé via ModelScope, les testeurs sélectionnés devant publier un échantillon ou un avis avant le 29 septembre. Trois jours plus tard, les poids étaient publics pour tous.
Ce mode de publication a une conséquence directe pour qui évalue le modèle aujourd'hui : il n'existe encore aucune évaluation indépendante établie. Les seuls chiffres de qualité disponibles proviennent du graphique comparatif Qwen-Image-Bench fourni par l'éditeur lui-même, et aucun laboratoire tiers ne les avait reproduits au moment de la rédaction.
Un modèle, trois checkpoints : le détail qui change la donne pour l'édition d'image
La sortie ne contient pas un seul téléchargement mais trois, et cette distinction est rarement mise en avant dans les premières reprises de l'annonce.
| Composant | Rôle | Base technique | Taille approximative |
|---|---|---|---|
| Qwen/Qwen-Image-2.1 | Modèle de génération et d'édition d'image | DiT mono-flux 32 couches, 7 milliards de paramètres ; encodeur de texte Qwen3-VL 8B ; VAE RGBA 64 canaux, compression spatiale 16x | Environ 33 Go pour l'ensemble |
| Qwen/Qwen-Image-2.1-PE-T2I | Réécrivain de prompt pour la génération texte-vers-image | Qwen3.5-VL 9B affiné | Environ 18,8 Go |
| Qwen/Qwen-Image-2.1-PE-I2I | Réécrivain de prompt pour l'édition image-à-image | Qwen3.5-VL 9B affiné, téléversé à 08:46 UTC le 20 septembre | Environ 18,8 Go |
Le modèle d'image propose une sortie native en 2K, 2048x2048 par défaut sur 40 étapes d'inférence, sept préréglages de ratio d'aspect, jusqu'à dix images de référence par édition, l'édition locale par cercle, annotation peinte ou masque séparé, ainsi que la génération et l'édition de calques RGBA transparents et l'extraction de sujet à partir de photos classiques. La fiche du modèle recommande le délestage vers le CPU (pipe.enable_model_cpu_offload()) pour les configurations aux ressources limitées, l'encodeur de texte pesant à lui seul davantage que le transformateur de diffusion proprement dit.
PE-I2I : le rewriter qui tranche la langue de vos visuels avant le rendu
Le checkpoint PE-I2I ne génère pas d'image : il prend une instruction de modification vague, une ou plusieurs images d'entrée, et produit une consigne précise destinée au modèle de diffusion en aval. C'est cette étape qui résout l'ambiguïté du prompt, et un prompt système livré avec les poids (system_prompt.txt) fixe deux règles linguistiques distinctes qui intéressent directement un usage francophone.
La langue de la description, la prose interne que le réécrivain rédige pour lui-même, suit la langue de l'instruction seulement si celle-ci est en chinois ou en anglais. Une instruction en français, comme en japonais, coréen ou thaï, donne lieu à une description en anglais.
La langue du texte réellement peint dans l'image obéit en revanche à un ordre de priorité différent : d'abord la langue explicitement demandée par l'utilisateur, ensuite la langue dominante du texte déjà présent dans l'image d'entrée même si l'instruction est rédigée dans une autre langue, et enfin, en l'absence de texte existant et de consigne explicite, la langue de l'instruction elle-même, sans la forcer en anglais. Le prompt système illustre ce comportement avec un exemple concret où une image en thaï, modifiée par une instruction en anglais sans mention de langue, doit conserver du texte thaï en sortie.
Pour une PME qui produit des visuels d'emballage, des fiches produit ou des affiches destinées à un marché francophone, cette hiérarchie détermine si une étiquette existante reste lisible ou se retrouve traduite sans qu'on l'ait demandé. Comme la règle est écrite dans un fichier texte livré avec le dépôt, elle peut être lue, comparée et surchargée, ce qui n'est pas le cas pour l'étape équivalente dans un service fermé hébergé.
La licence Qwen Research : la vraie frontière pour une PME française
Les générations précédentes de la famille Qwen-Image (Qwen-Image, Qwen-Image-Edit, Qwen-Image-Layered et Qwen-Image-2512) étaient distribuées sous Apache 2.0. Qwen-Image 2.1 change de régime.
| Version | Date | Paramètres | Licence |
|---|---|---|---|
| Qwen-Image | Août 2025 | 20,4 milliards | Apache 2.0 |
| Qwen-Image-Edit | Août 2025 | 20,4 milliards | Apache 2.0 |
| Qwen-Image-Layered | Décembre 2025 | 20,4 milliards | Apache 2.0 |
| Qwen-Image-2512 | Décembre 2025 | 20,4 milliards | Apache 2.0 |
| Qwen-Image 2.0 / 2.0 Pro | Février 2026 | Non publié | API uniquement, Alibaba Cloud Model Studio |
| Qwen-Image 2.1 | 20 septembre 2026 | 7,1 milliards | Qwen Research License Agreement |
Le fichier de licence, daté du 20 septembre 2026, accorde des droits d'usage, de modification et de distribution des poids exclusivement pour la recherche ou l'évaluation, et précise qu'une utilisation commerciale nécessite une licence distincte, obtenue en écrivant à l'éditeur. Aucun prix, aucun seuil de volume, aucune condition n'est communiqué dans le document public. En clair : les poids sont ouverts au sens où ils sont téléchargeables et modifiables librement, mais l'usage commercial reste fermé au sens où il dépend d'une négociation individuelle dont personne, hors Alibaba, ne connaît les termes à ce jour.
Pour une PME française, cela signifie que l'évaluation, les tests internes et la recherche appliquée sont autorisés sans restriction, mais qu'aucun livrable produit par ce modèle ne peut être facturé ou intégré à un produit commercial tant qu'une licence séparée n'a pas été obtenue. Le fichier de licence doit se lire avant de construire un pipeline de production, pas après.
Poids ouverts, données en Europe : ce que change et ne change pas l'auto-hébergement
Le fait que les poids soient publics permet à une organisation de les faire tourner sur sa propre infrastructure, y compris sur des serveurs situés en France ou dans l'Union européenne, plutôt que de transiter par une API tierce. Pour des flux de travail impliquant des images potentiellement porteuses de données personnelles, portraits, photos de collaborateurs, visuels contenant des éléments identifiables, ce choix d'hébergement donne davantage de contrôle sur la localisation du traitement pendant la phase d'évaluation.
Ce contrôle sur l'hébergement ne résout cependant pas la question de la licence : rien dans le fait de faire tourner le modèle sur une machine européenne ne transforme un usage commercial en usage de recherche. Les deux sujets, localisation des données et droit d'usage, restent distincts et doivent être traités séparément.
C'est un des points où une couche d'accès mutualisée change la nature du problème plutôt que de le déplacer. Moon AI, plateforme éditée par Stellarr Studio SAS, propose par exemple un abonnement unique en euros TTC regroupant plus de 70 modèles de familles variées, dont la famille Qwen figure parmi les modèles inclus, avec une application et un stockage hébergés chez OVHcloud, à Strasbourg et Roubaix. Le procédé Moon Blur y remplace les données personnelles par des jetons avant l'envoi aux modèles tiers, puis les rétablit au retour : il s'agit d'une pseudonymisation au sens de l'article 4-5 du RGPD, réversible par construction, et non d'une anonymisation. Les requêtes adressées aux modèles tiers partent bien chez leurs fournisseurs respectifs une fois pseudonymisées. Cette architecture ne dispense pas de lire les conditions spécifiques de chaque modèle proposé, mais elle évite à une PME de gérer elle-même le téléchargement, l'hébergement et la négociation de licence pour chaque nouveau modèle qu'elle souhaite tester.
Ce qui est confirmé, ce qui reste à vérifier
Sur le plan technique, plusieurs éléments sont confirmés par la fiche du modèle et le dépôt : l'architecture DiT mono-flux 32 couches et 7 milliards de paramètres, l'encodeur Qwen3-VL 8B, le VAE RGBA 64 canaux, le support natif jusqu'à dix images de référence, et une prise en charge des frameworks disponible dès le jour de la sortie : Diffusers avec un pipeline QwenImage21Pipeline, ComfyUI avec des modèles de workflow natifs, vLLM-Omni, LightX2V, et SGLang dont la pull request de support avait été intégrée le 17 septembre, trois jours avant la publication des poids, validée sur des configurations allant du H200 au RTX 4090.
Sur le plan de la qualité, en revanche, la prudence reste de mise. Le graphique Qwen-Image-Bench communiqué par l'éditeur place Qwen-Image 2.1 devant Nano Banana 2.0 et devant tous les autres modèles à poids ouverts du classement, mais derrière six modèles fermés, et ces chiffres n'avaient été reproduits par aucun tiers au moment de la rédaction. Un seul retour pratique en accès anticipé, obtenu via le programme Qwen Ambassador sur une interface ModelScope Studio, rapportait des temps de génération de l'ordre de 10 à 15 secondes pour le texte-vers-image et de 18 à 23 secondes pour l'édition, ainsi qu'une dégradation de la cohérence multi-références à partir d'environ trois images d'entrée. Il s'agit d'un signal isolé, sur une interface d'accès anticipé, sans protocole de mesure publié, pas d'un benchmark.
Aucun prix n'est publié pour un point de terminaison hébergé de Qwen-Image 2.1, et aucune condition n'est énoncée pour la licence commerciale. La question de savoir si une variante sous licence permissive suivra reste, elle aussi, sans réponse à ce jour.
Questions fréquentes
Qwen-Image 2.1 est-il utilisable commercialement par une entreprise française ?
Non, pas dans l'état actuel de la licence publique. Le Qwen Research License Agreement autorise l'usage pour la recherche ou l'évaluation uniquement et exige une demande de licence séparée auprès de l'éditeur pour tout usage commercial. Aucun prix ni aucune condition de cette licence commerciale n'a été communiqué.
Le réécrivain PE-I2I gère-t-il correctement le français dans les visuels ?
Le prompt système livré avec le modèle prévoit qu'un texte déjà présent dans l'image d'entrée conserve sa langue dominante lors de l'édition, même si l'instruction est rédigée dans une autre langue, et qu'en l'absence de texte existant et de consigne explicite, le texte rendu suit la langue de l'instruction sans être forcé en anglais. Cette règle est vérifiable directement dans le fichier system_prompt.txt, mais aucun benchmark indépendant spécifique au français n'existe pour l'instant.
Héberger Qwen-Image 2.1 en France rend-il son usage conforme au RGPD ?
Le fait de faire tourner les poids sur une infrastructure située en France permet de contrôler la localisation du traitement pendant les phases d'évaluation, mais cela ne modifie ni les termes de la licence de recherche ni les obligations propres au traitement de données personnelles. Localisation des données et droit d'usage du modèle restent deux questions distinctes.
Faut-il intégrer Qwen-Image 2.1 dans un produit dès maintenant ?
La situation actuelle combine une licence qui interdit l'usage commercial sans accord séparé, l'absence de benchmarks indépendants reproduits, et un unique retour d'accès anticipé signalant une dégradation au-delà de trois images de référence. C'est une base raisonnable pour évaluer le modèle, pas encore pour construire un pipeline de production dessus.