← Blog
August 17, 2026

Wan 2.2 sur une RTX 5090 : ComfyUI, configuration GPU et génération vidéo

Wan 2.2 peut générer des vidéos en 720p sur une seule RTX 5090.

Mais cette réponse ne s'applique clairement qu'à une partie de la famille Wan 2.2.

Le Wan2.2-TI2V-5B est un modèle hybride de 5 milliards de paramètres conçu à la fois pour la génération de texte vers vidéo et d'image vers vidéo. Son implémentation officielle prend en charge une sortie 720p à 24 images par seconde et peut fonctionner avec 24 Go de mémoire GPU lorsque le déchargement du modèle et de l'encodeur de texte est activé. ComfyUI va plus loin en affirmant que son déchargement natif permet au flux de travail 5B de tenir dans environ 8 Go de VRAM.

Les modèles Wan2.2-A14B plus volumineux sont différents. Ils utilisent une architecture de mélange d'experts (Mixture-of-Experts) contenant environ 27 milliards de paramètres au total répartis sur deux experts de 14 milliards. Un seul expert est actif à chaque étape du débruitage, mais le chemin d'inférence officiel de Wan spécifie tout de même au moins 80 Go de VRAM pour une inférence 14B sur un seul GPU.

Donc, si vous disposez d'un GPU cloud RTX 5090 de 32 Go, je commencerais par le Wan2.2-TI2V-5B.

Cela vous offre la génération de texte vers vidéo et d'image vers vidéo dans un seul modèle, une marge de mémoire suffisante pour un flux de travail ComfyUI pratique, et une sortie 720p sans avoir à lutter contre la mémoire GPU dès le début du projet.

Qu'est-ce que Wan 2.2 ?

Wan 2.2 est une famille de modèles de génération vidéo open source créée par l'équipe Wan d'Alibaba.

La version initiale couvre trois modèles principaux de génération vidéo :

Model Parameters Main job Resolution
Wan2.2-TI2V-5B 5B Text-to-video + image-to-video 720p
Wan2.2-T2V-A14B 27B total / ~14B active per step Text-to-video 480p and 720p
Wan2.2-I2V-A14B 27B total / ~14B active per step Image-to-video 480p and 720p

La famille s'est depuis agrandie avec Wan2.2-S2V-14B pour la vidéo pilotée par la parole et Wan2.2-Animate-14B pour l'animation et le remplacement de personnages. Le dépôt officiel décrit Animate comme un modèle unifié permettant de transférer des mouvements et des expressions ou de remplacer un personnage tout en préservant le mouvement.

Les modèles open source Wan 2.2 sont publiés sous licence Apache 2.0, ce qui autorise un usage commercial sous réserve du respect des conditions de la licence.

Cela rend la situation en matière de licence nettement plus simple que pour certains des modèles de génération d'images que nous avons abordés plus tôt dans cette série.

Qu'est-ce qui différencie Wan 2.2 ?

Deux concepts techniques sont particulièrement importants.

Le premier est la diffusion vidéo par mélange d'experts.

Le second est une représentation vidéo beaucoup plus compressée dans le modèle 5B.

Ensemble, ils s'attaquent à deux problèmes distincts : augmenter la capacité du modèle sans supporter le coût de calcul complet à chaque étape de débruitage, et rendre la vidéo haute définition réalisable avec beaucoup moins de matériel.

Les modèles 14B utilisent deux experts différents

L'architecture A14B de Wan 2.2 sépare le processus de débruitage en deux étapes.

Un expert en haut niveau de bruit gère la première partie de la génération, lorsque le modèle établit la composition globale et le mouvement.

Un expert en bas niveau de bruit prend le relais plus tard, lorsque la vidéo nécessite des détails plus fins.

Chaque expert compte environ 14 milliards de paramètres.

Ensemble, ils totalisent environ 27 milliards de paramètres, mais un seul expert est actif à chaque étape de débruitage. L'équipe Wan précise que cela permet de maintenir les besoins en calcul actif et en mémoire GPU beaucoup plus proches d'un modèle de 14 milliards que d'un modèle dense de 27 milliards.

Cela ne signifie pas pour autant que le modèle devient soudainement une charge de travail légère pour le GPU.

Les deux ensembles de poids des experts sont toujours présents.

L'architecture économise du calcul en choisissant quel expert intervient à chaque étape. Elle ne supprime pas l'autre expert du stockage.

Pourquoi le modèle 5B est plus intéressant pour un seul GPU

Wan2.2-TI2V-5B adopte une approche différente.

Il s'agit d'un modèle dense de 5 milliards de paramètres associé à un VAE vidéo à haute compression.

L'équipe Wan indique que le VAE compresse la vidéo dans le temps, en hauteur et en largeur selon un ratio de 4 × 16 × 16. Avec une étape supplémentaire de découpage en patchs, la représentation globale devient encore plus compacte.

Le résultat pratique est bien plus important que la terminologie de compression :

le modèle 5B peut générer une vidéo 720p à 24 fps sur un seul GPU grand public.

Le dépôt officiel rapporte la génération d'un clip 720p de cinq secondes en moins de neuf minutes sur un seul GPU grand public, sans optimisation spécifique.

On est encore loin de la génération vidéo en temps réel.

Mais cela déplace le problème d'infrastructure, passant d'un « GPU de centre de données massif » à « un seul GPU haut de gamme ».

Configuration GPU requise pour Wan 2.2

Voici le résumé le plus utile :

Wan 2.2 model Official single-GPU guidance One 32 GB RTX 5090?
TI2V-5B ≥24 GB with official offloading; ComfyUI can use considerably less Yes
T2V-A14B ≥80 GB in official Wan implementation Not through the reference single-GPU path
I2V-A14B ≥80 GB in official Wan implementation Not through the reference single-GPU path
S2V-14B ≥80 GB in official Wan implementation Not through the reference single-GPU path
Animate-14B Workflow-dependent Treat as a heavier 14B-class workflow

La ligne 5B est celle autour de laquelle je commencerais à construire.

Les instances RTX 5090 de Hivenet offrent 32 Go de VRAM GDDR7 par GPU, ce qui place la carte confortablement au-dessus de la recommandation officielle de 24 Go pour le TI2V-5B, tout en offrant plus de marge qu'une configuration de 24 Go.

Pourquoi ComfyUI indique-t-il que le modèle 5B peut tenir dans 8 Go ?

Parce que l'architecture logicielle est déterminante.

La commande officielle Wan maintient une plus grande partie du pipeline d'inférence dans le runtime conventionnel et préconise une configuration de 24 Go avec :

--offload_model True
--convert_model_dtype
--t5_cpu

Le workflow natif de ComfyUI peut transférer les composants du modèle entre le GPU et la mémoire système de manière plus dynamique, et sa documentation officielle précise que le modèle 5B devrait tenir aisément dans environ 8 Go de VRAM avec le déchargement natif.

Cela ne signifie pas pour autant que 8 Go et 32 Go offrent la même expérience.

Le déchargement économise la VRAM en déplaçant la charge de travail ailleurs.

Le transfert des poids et autres données entre la mémoire système et la mémoire du GPU prend du temps.

Avec 32 Go disponibles, l'objectif n'est pas de prouver que le workflow peut fonctionner avec l'empreinte mémoire la plus réduite possible. Il s'agit de conserver une partie suffisante du pipeline à proximité du GPU pour que la génération reste efficace.

Que peut faire Wan2.2-TI2V-5B ?

Le modèle 5B gère deux tâches au sein du même point de contrôle :

Texte vers vidéo

Vous fournissez une description et le modèle génère le clip.

Image vers vidéo

Vous fournissez une image de départ accompagnée, en option, d'un prompt textuel décrivant le mouvement ou l'évolution de la scène souhaités.

Ce second mode rend Wan 2.2 particulièrement intéressant, en complément de la partie génération d'images de cet ensemble de contenus.

Vous pourriez, par exemple :

  1. créer une image de départ contrôlée avec FLUX
  2. affiner la composition jusqu'à ce que l'image fixe soit parfaite
  3. envoyer cette image à Wan 2.2
  4. décrire le mouvement plutôt que de demander à un modèle vidéo d'inventer simultanément l'intégralité du cadre et du mouvement

Notre guide des GPU cloud pour FLUX.1 [dev] couvre la première moitié de ce flux de travail.

Wan 2.2 gère la seconde.

Texte vers vidéo ou image vers vidéo ?

J'utiliserais le texte vers vidéo lorsque le concept lui-même est encore au stade exploratoire.

Vous demandez au modèle de décider de :

  • la composition
  • les sujets
  • les détails visuels
  • le mouvement
  • le comportement de la caméra
  • le développement de la scène

Cela vous offre une plus grande liberté créative, mais augmente également le nombre de variables susceptibles de poser problème.

Utilisez image-to-video lorsque la composition initiale est importante.

Une image fournit au modèle vidéo un point d'ancrage visuel pour :

  • l'apparence des personnages
  • le design du produit
  • le lieu
  • les couleurs
  • le cadrage
  • l'éclairage
  • la direction artistique

Ainsi, le prompt peut se concentrer davantage sur le mouvement.

Pour une production créative contrôlée, cette division du travail est souvent plus facile à gérer.

Étape 1 : commencez par la configuration GPU cloud de ComfyUI

Ce tutoriel suppose que vous disposez déjà de l'environnement décrit dans notre guide GPU cloud pour ComfyUI:

  • une machine virtuelle RTX 5090
  • un environnement NVIDIA/PyTorch fonctionnel
  • une version récente de ComfyUI
  • un accès au navigateur via SSH
  • suffisamment d'espace disque pour les fichiers de modèles volumineux et les sorties vidéo

Si ce n'est pas le cas, configurez-le d'abord.

Il est inutile de répéter l'installation de ComfyUI tout en essayant de diagnostiquer un modèle vidéo en même temps.

Pour un accès privé, Hivenet recommande le transfert de port SSH plutôt que d'exposer directement une interface web personnelle sur Internet.

Étape 2 : mettez à jour ComfyUI avant de charger le workflow Wan

La prise en charge de Wan 2.2 est intégrée à la version actuelle de ComfyUI.

La documentation officielle avertit que des nœuds manquants dans le workflow Wan signifient souvent que l'installation de ComfyUI n'est pas à jour.

Mettez à jour votre installation en utilisant la méthode adaptée à votre installation de ComfyUI.

Si vous l'avez cloné manuellement :

cd ComfyUI
git pull

Réactivez ensuite le même environnement Python et mettez à jour les dépendances si la version l'exige.

N'installez pas de nœud personnalisé Wan tiers simplement parce qu'un ancien tutoriel vous dit que c'est nécessaire.

Il existe des implémentations communautaires utiles, mais la prise en charge native de ComfyUI existe déjà.

Commencez par là.

Étape 3 : charger le workflow officiel Wan2.2 5B

Dans ComfyUI, ouvrez :

Workflow → Browse Templates → Video

Recherchez :

Wan2.2 5B

Le workflow officiel prend en charge à la fois le texte vers vidéo et l'image vers vidéo.

L'utilisation du modèle nous permet de disposer d'un graphe fonctionnel avant de commencer à modifier les chemins des modèles, le nombre d'images, les résolutions ou les nœuds personnalisés.

C'est la même règle que celle que nous avons utilisée pour FLUX :

faites d'abord fonctionner le workflow officiel. Ensuite, personnalisez-le.

Étape 4 : télécharger les trois composants du modèle

Le workflow natif 5B de ComfyUI utilise actuellement trois fichiers.

Modèle de diffusion

wan2.2_ti2v_5B_fp16.safetensors

Placez-le dans :

ComfyUI/models/diffusion_models/

Encodeur de texte

umt5_xxl_fp8_e4m3fn_scaled.safetensors

Placez-le dans :

ComfyUI/models/text_encoders/

VAE

wan2.2_vae.safetensors

Placez-le dans :

ComfyUI/models/vae/

La structure obtenue devrait ressembler à ceci :

ComfyUI/
└── models/
   ├── diffusion_models/
   │   └── wan2.2_ti2v_5B_fp16.safetensors
   │
   ├── text_encoders/
   │   └── umt5_xxl_fp8_e4m3fn_scaled.safetensors
   │
   └── vae/
       └── wan2.2_vae.safetensors

Redémarrez ComfyUI ou actualisez les listes de modèles si nécessaire.

Étape 5 : vérifiez le workflow avant toute modification

Vérifiez que les nœuds de chargement de modèles du workflow pointent vers :

wan2.2_ti2v_5B_fp16.safetensors

pour le modèle de diffusion,

umt5_xxl_fp8_e4m3fn_scaled.safetensors

pour l'encodeur de texte, et

wan2.2_vae.safetensors

pour le VAE.

Ce sont les composants exacts documentés par ComfyUI pour le workflow 5B natif.

Si un chargeur est en rouge, résolvez d'abord le problème de chemin d'accès au fichier.

Modifier les paramètres d'échantillonnage ne réparera pas un modèle que ComfyUI ne parvient pas à trouver.

Étape 6 : générez votre premier clip texte-vidéo

Laissez l'entrée d'image désactivée.

Utilisez un prompt décrivant une scène avec un mouvement clair.

Par exemple :

Plan cinématographique large d'un kayak jaune dérivant lentement sur
un lac de montagne calme au lever du soleil. Une fine brume se déplace sur
l'eau. La caméra effectue un lent mouvement vers l'avant en direction du kayak.
Lumière naturelle douce, reflets réalistes sur l'eau, mouvement calme.

C'est plus utile pour un premier test que :

Un chef-d'œuvre cinématographique épique avec des mouvements incroyables
et des visuels à couper le souffle.

Le premier prompt indique au modèle :

  • ce qui existe
  • ce qui bouge
  • comment cela bouge
  • ce que fait la caméra
  • ce que fait l'environnement
  • l'aspect visuel de la scène

Les prompts vidéo nécessitent des informations temporelles.

Une belle description d'une image fixe n'indique pas à un modèle vidéo ce qui doit se passer ensuite.

Un prompt Wan 2.2 utile se compose de quatre parties

Pour des tests pratiques, je concevrais les prompts comme suit :

Sujet + action + caméra + environnement

Par exemple :

Sujet :
Une voiture de sport vintage rouge

Action :
roule lentement sur une route de montagne humide

Caméra :
travelling bas longeant la voiture

Environnement :
brume matinale, reflets sur l'asphalte mouillé,
lumière douce et nuageuse, photographie cinématographique réaliste

Combiné :

Une voiture de sport vintage rouge roule lentement sur une route
de montagne humide. Travelling bas longeant la voiture. La brume
matinale s'infiltre entre les arbres et les reflets scintillent
sur l'asphalte mouillé. Lumière douce et nuageuse, photographie
cinématographique réaliste.

Vous pourrez ajouter de la complexité plus tard.

Commencez par des mouvements que le modèle peut comprendre.

Décrivez le mouvement explicitement

Les prompts d'image se concentrent souvent presque uniquement sur l'apparence.

Les prompts vidéo ont besoin de verbes.

Comparez :

Une femme en long manteau rouge debout sur un quai de gare.

avec :

Une femme en long manteau rouge marche lentement le long d'un train vide
plateforme tandis que le vent agite son manteau et ses cheveux. La caméra
la suit à côté d'elle à une vitesse de marche. Un train passe en
arrière-plan.

La seconde version décrit un changement au fil du temps.

C'est ce que le modèle doit générer.

Le langage de mouvement utile inclut :

  • marche vers
  • tourne lentement
  • lève
  • tombe
  • dérive
  • balance
  • tourne
  • accélère
  • panoramique
  • suit
  • zoom avant
  • zoom arrière
  • inclinaison
  • cercle

Plus un mouvement est important, moins je le laisse implicite.

Gardez le premier clip court

La génération vidéo multiplie les erreurs d'une image à l'autre.

Un clip plus long signifie :

  • plus d'images
  • plus de calcul
  • plus de risques de dérive temporelle
  • des fichiers plus lourds
  • des cycles de rétroaction plus longs

Commencez avec la durée par défaut du flux de travail.

Ne transformez pas votre première génération réussie en une expérience de 20 secondes.

Assurez-vous d'abord que le mouvement est correct.

Consacrez ensuite de la puissance de calcul à la durée.

Étape 7 : surveillez la mémoire GPU pendant la génération

Sur la machine virtuelle :

watch -n 1 nvidia-smi

La génération vidéo est un meilleur test de résistance que de surveiller la VRAM au repos après le chargement du modèle.

Surveillez :

  • la VRAM allouée
  • l'utilisation du GPU
  • pics de mémoire
  • si la génération sature la mémoire système
  • si le processus approche la limite de 32 Go

La RTX 5090 offre 32 Go de VRAM, tandis que l'instance à un GPU de Hivenet dispose également d'une mémoire système distincte accessible au runtime.

Ces deux espaces ne sont pas interchangeables.

Le déchargement vers la RAM système peut permettre d'exécuter un flux de travail.

Cela peut aussi le ralentir.

Étape 8 : essayer l'image vers vidéo

Activez l'entrée d'image du flux de travail.

Le flux de travail natif de ComfyUI utilise le même modèle 5B pour l'image vers vidéo. Vous fournissez une image, et Wan 2.2 utilise son format d'image lors de la création du latent vidéo.

Choisissez une image nette avec une composition que vous souhaitez conserver.

Ensuite, rédigez votre prompt principalement autour du mouvement.

Par exemple, si l'entrée est le portrait d'une personne près d'une fenêtre :

La personne se tourne lentement vers la fenêtre et regarde à l'extérieur.
Une légère brise fait bouger les rideaux et quelques mèches de cheveux.
La caméra effectue un très lent travelling avant. Lumière naturelle
d'après-midi, mouvement réaliste subtil.

Remarquez ce que le prompt ne prend pas le temps de décrire.

L'apparence de la personne est déjà présente dans l'image.

Utilisez le budget de votre prompt pour ce qui change.

La conversion d'image en vidéo offre souvent un flux de travail plus contrôlable.

La conversion de texte en vidéo demande à un seul modèle de résoudre deux problèmes majeurs :

  1. concevoir le cadre
  2. l'animer

La conversion d'image en vidéo vous permet de les résoudre séparément.

C'est utile pour :

  • les vidéos de produits
  • la cohérence des personnages
  • les styles visuels de marque
  • les scènes architecturales
  • les compositions contrôlées
  • les campagnes à direction artistique

Vous pouvez itérer sur l'image de départ à moindre coût avec un modèle d'image, puis n'utiliser la puissance de calcul vidéo, plus lourde, qu'une fois que l'image mérite d'être animée.

Un flux de travail pratique pourrait être :

FLUX
 ↓
image de départ approuvée
 ↓
Image-vers-vidéo Wan 2.2
 ↓
clip sélectionné
 ↓
upscale / édition / encodage

Nos guides FLUX.1 [dev] et de workflow ComfyUI couvrent les deux premières étapes de ce pipeline.

Le 720p à 24 ips représente déjà une charge de calcul importante

Wan2.2-TI2V-5B prend nativement en charge une sortie 720p à 24 images par seconde.

Cinq secondes à 24 ips représentent environ :

5 × 24 = 120 images

qui doivent rester temporellement cohérentes.

C'est pourquoi la vidéo par IA est nettement plus gourmande en ressources de calcul que la création d'une image 1024 × 1024.

Le modèle doit résoudre :

  • la qualité d'image
  • le mouvement
  • la persistance des objets
  • cohérence des personnages
  • mouvement de caméra
  • continuité temporelle

sur toute une séquence.

Un clip de cinq secondes ne représente pas « cinq secondes de travail GPU ».

Qu'en est-il des modèles Wan 2.2 14B ?

Utilisez-les lorsque vous avez besoin d'une capacité de modèle suffisante pour justifier l'infrastructure.

Les modèles A14B utilisent deux experts spécialisés :

expert en bruit élevé
       ↓
transition pendant le débruitage
       ↓
expert en faible bruit

Chacun compte environ 14 milliards de paramètres, ce qui donne au modèle un total d'environ 27 milliards de paramètres tout en maintenant environ 14 milliards actifs à chaque étape de débruitage.

Le flux de travail natif actuel de ComfyUI pour le text-to-video 14B utilise des fichiers de modèle distincts en FP8 pour le bruit élevé et le faible bruit :

wan2.2_t2v_high_noise_14B_fp8_scaled.safetensors
wan2.2_t2v_low_noise_14B_fp8_scaled.safetensors

ainsi qu'un encodeur de texte UMT5 en FP8 et le VAE Wan 2.1 compatible.

C'est beaucoup plus d'état de modèle que pour le workflow 5B.

Le modèle 14B peut-il tourner sur une RTX 5090 ?

C'est là que j'éviterais de répondre par un oui trop confiant.

L' implémentation de référence officielle de Wan spécifie au moins 80 Go de VRAM pour l'inférence T2V-A14B et I2V-A14B sur un seul GPU, même avec le déchargement du modèle et la conversion de type activés.

Les modèles FP8 et le déchargement natif de ComfyUI peuvent modifier la gestion de la mémoire, et les implémentations de la communauté proposent des approches plus agressives pour réduire la consommation de mémoire.

Mais c'est différent de dire :

Wan2.2 14B nécessite 32 Go.

La source officielle ne confirme pas cette affirmation.

Si votre objectif est une seule RTX 5090, utilisez le modèle 5B.

Si vous avez spécifiquement besoin du modèle 14B, considérez-le comme une charge de travail nécessitant plus de mémoire ou un déchargement intensif, et testez l'implémentation ComfyUI exacte que vous prévoyez d'utiliser.

Ne confondez pas les 14B de paramètres actifs avec les 14B de poids stockés.

C'est le même piège que celui dont nous avons discuté avec les modèles de langage à mélange d'experts (MoE).

Wan appelle ces modèles A14B car environ 14B de paramètres sont actifs à chaque étape.

Mais l'architecture à deux experts contient environ 27B de paramètres au total.

Cela a une importance pour :

  • le stockage des points de contrôle
  • le chargement du modèle
  • la mémoire CPU
  • déchargement
  • planification de la mémoire GPU

« 14B actifs » décrit le calcul.

Cela ne signifie pas que le modèle complet ne contient que 14 milliards de paramètres.

C'est précisément le genre de distinction qui disparaît dans les tableaux simplistes de configuration GPU.

Qu'est-ce que Wan 2.2 Animate ?

Wan2.2-Animate-14B est un modèle ultérieur de la famille Wan 2.2 conçu pour l'animation et le remplacement de personnages.

Il peut utiliser le mouvement et l'expression d'une performance de référence pour animer un autre personnage, ou remplacer un personnage tout en préservant le mouvement directeur. L'équipe Wan a publié le modèle et le code d'inférence en septembre 2025, et il a été intégré par la suite dans Diffusers.

Cela en fait un problème différent de la simple conversion de texte en vidéo.

Au lieu de demander :

Générer une personne qui danse.

vous pouvez travailler avec une performance source et demander au modèle de transférer cette performance à un autre personnage.

ComfyUI dispose désormais également d'un workflow natif dédié à Wan2.2 Animate.

Si l'animation de personnages devient une opportunité majeure de recherche ou de produit pour nous, elle mérite son propre tutoriel plutôt que d'être intégrée à celui-ci.

Qu'en est-il de la conversion parole-vidéo ?

Wan2.2-S2V-14B génère de la vidéo à partir de :

  • audio
  • une image de référence
  • une invite de texte optionnelle

et peut également utiliser le guidage de pose.

L'implémentation officielle prend en charge le 480p et le 720p et utilise la durée de l'audio en entrée pour déterminer la durée de la vidéo lorsqu'aucun nombre de clips n'est défini.

Encore une fois, le chemin d'accès officiel pour GPU unique nécessite un GPU de classe 80 Go.

Cela fait de S2V une cible de déploiement très différente du modèle hybride 5B.

La famille Wan 2.2 est vaste.

Vous n'avez pas besoin d'exécuter toutes ses branches sur le même matériel.

De combien d'espace disque les flux de travail Wan 2.2 ont-ils besoin ?

Prévoyez large.

Les environnements de vidéo par IA accumulent plus de données que les environnements de génération d'images, car vous stockez :

  • les poids du modèle
  • les encodeurs de texte
  • les VAE
  • les images de départ
  • le JSON du flux de travail
  • les rendus de prévisualisation
  • la vidéo finale
  • les images intermédiaires
  • les générations alternatives

Et les flux de travail 14B utilisent plusieurs fichiers de modèles volumineux plutôt qu'un seul petit point de contrôle.

La configuration RTX 5090 à un GPU sur Hivenet inclut actuellement 250 Go de disque local ; les configurations multi-GPU augmentent proportionnellement l'espace de stockage inclus.

Il s'agit d'un espace de travail utile.

Ce n'est toutefois pas un espace d'archivage.

Transférez vos résultats importants et vos fichiers de workflow réutilisables vers un stockage persistant avant de terminer une instance.

Enregistrez le workflow avec la vidéo

C'est encore plus crucial pour la vidéo que ça ne l'était pour FLUX.

Un clip généré ne vous indique pas par lui-même :

  • quel modèle Wan l'a produit
  • la graine (seed)
  • le nombre d'images
  • la résolution
  • le prompt
  • le prompt négatif
  • l'encodeur de texte
  • la version du workflow
  • les nœuds personnalisés
  • l'image de départ
  • la précision du modèle

Conservez le fichier JSON de ComfyUI.

Par exemple :

wan-product-shot/
├── workflows/
│   ├── product-i2v-v01.json
│   ├── product-i2v-v02-motion.json
│   └── product-i2v-v03-camera.json
├── input/
│   └── product-frame.png
├── output/
│   ├── test-01.mp4
│   └── final.mp4
└── notes.md

Cette structure suffit à transformer vos expérimentations en un processus reproductible.

Modifiez un seul type de mouvement à la fois

Le prompting vidéo devient complexe lorsqu'une requête demande trop d'événements simultanés.

Par exemple :

L'acteur marche vers la caméra, se retourne, saute par-dessus une
chaise, la caméra tourne autour de lui, les lumières passent au rouge,
la pluie commence à tomber et la pièce se transforme en forêt.

Le modèle doit alors coordonner de nombreuses relations temporelles.

Un test plus simple :

L'acteur marche lentement vers la caméra tandis que celle-ci
recule pour conserver le même cadrage.

vous permet d'évaluer si le mouvement principal fonctionne.

Ajoutez ensuite :

Une pluie fine commence à tomber en arrière-plan.

Puis, changez éventuellement de caméra.

Procéder ainsi par itérations consomme moins de prompts et permet de comprendre beaucoup plus rapidement ce qui ne fonctionne pas.

Le langage cinématographique est particulièrement utile pour les prompts vidéo

Les prompts de génération d'images peuvent décrire une caméra sans qu'il y ait de mouvement réel.

En vidéo, la caméra peut faire partie intégrante de l'action.

Voici quelques instructions utiles :

  • caméra fixe
  • travelling avant lent
  • travelling arrière lent
  • travelling latéral
  • panoramique vers la gauche
  • panoramique vers la droite
  • inclinaison vers le haut
  • mouvement orbital autour du sujet
  • caméra à l'épaule
  • plan large fixe
  • travelling en contre-plongée

Si le mouvement de caméra est important, précisez-le.

Sinon, le modèle devra décider à votre place.

Privilégiez une physique réaliste avant de chercher le spectaculaire.

Un bon moyen de tester les limites d'un modèle vidéo est de commencer par des lois physiques simples.

Essayez :

Un verre d'eau est posé sur une table en bois.
Une main entre par la droite, saisit le verre,
et le déplace lentement hors du champ.
Caméra fixe.

Cela permet de tester :

  • la persistance des objets
  • l'interaction main/objet
  • l'occlusion
  • le mouvement
  • la cohérence de la scène

Si le modèle ne parvient pas à maintenir la cohérence du verre durant cette interaction, ajouter des explosions n'aidera probablement pas à établir un diagnostic.

Les démonstrations impressionnantes sont utiles pour le marketing.

Les mouvements simples sont préférables pour l'évaluation.

Comment évaluer un modèle vidéo d'IA

Ne jugez pas le modèle uniquement sur la séquence la plus impressionnante que vous pouvez générer.

Créez un ensemble de prompts reproductibles couvrant les besoins réels de votre application.

Analysez :

Adhérence au prompt
L'action demandée a-t-elle été effectuée ?

Cohérence temporelle
Les personnes et les objets restent-ils reconnaissables d'une image à l'autre ?

Qualité du mouvement
Le mouvement semble-t-il physiquement plausible ?

Qualité des interactions
Les mains, les outils, les vêtements et les objets interagissent-ils correctement ?

Contrôle de la caméra
Le mouvement demandé a-t-il eu lieu ?

Stabilité de la scène
L'arrière-plan et la géométrie dérivent-ils ?

Cohérence de l'identité
Le sujet reste-t-il la même personne ou le même objet ?

Taux d'échec
Combien de générations doivent être écartées ?

Ce dernier indicateur a une importance commerciale.

Un modèle capable de créer un clip exceptionnel une fois sur dix peut coûter plus cher qu'un modèle légèrement moins impressionnant qui réussit huit fois sur dix.

Le coût de la vidéo doit être mesuré par résultat exploitable

Hivenet propose actuellement du calcul RTX 5090 à partir de 0,75 € par heure de GPU avec une facturation à la seconde.

Le calcul de l'infrastructure est donc le suivant :

Temps d'exécution du GPU en heures × 0,75 €

Mais le « coût par vidéo générée » est généralement un mauvais indicateur.

Il vaut mieux utiliser celui-ci :

coût total du GPU
÷
nombre de clips exploitables

Imaginons qu'un flux de travail crée vingt clips et que seuls deux soient acceptables.

Votre coût de génération réel est réparti sur ces deux clips.

C'est pourquoi la qualité des prompts, la stabilité du flux de travail et le choix du modèle ont des conséquences économiques.

Un GPU plus rapide ne corrigera pas un flux de travail qui produit des résultats inexploitables.

La génération vidéo favorise une utilisation intensive et ponctuelle des GPU

Le travail de création vidéo se fait généralement par pics d'activité :

lancement
générer
inspecter
ajuster
générer à nouveau
exporter
arrêter

C'est une solution parfaitement adaptée au calcul à la demande.

Hivenet facture le calcul à la seconde tant que l'instance est active.

La discipline est essentielle.

Si vous passez deux heures à examiner des clips alors que le GPU reste inactif dans un autre onglet, vous continuez à payer la location du GPU.

Enregistrez le flux de travail.

Arrêtez l'instance une fois la session terminée.

Redémarrez-la lorsque vous en avez à nouveau besoin.

Wan 2.2 ou un générateur vidéo commercial ?

Héberger Wan 2.2 vous offre des avantages qu'un service vidéo en ligne ne propose pas forcément :

  • accès au modèle
  • contrôle du flux de travail
  • reproductibilité
  • pipelines ComfyUI personnalisés
  • fichiers de modèles locaux
  • automatisation programmatique
  • contrôle sur le moment des mises à jour des modèles
  • la possibilité de combiner le modèle avec d'autres composants ouverts

Un service vidéo commercial hébergé vous apporte un avantage tout aussi précieux :

quelqu'un d'autre gère l'infrastructure.

Si vous avez besoin de dix clips et que le service hébergé les produit déjà correctement, faire tourner Linux et télécharger les poids du modèle n'améliorera probablement pas votre quotidien.

Hébergez vous-même lorsque le contrôle est essentiel.

Utilisez un service géré lorsque ce n'est pas le cas.

Wan 2.2 s'intègre naturellement dans un pipeline ComfyUI plus large

Ce qui est intéressant avec l'exécution de Wan via ComfyUI, c'est que le modèle vidéo n'a plus besoin d'être l'application entière.

Vous pouvez créer des flux de travail tels que :

Générer l'image de départ avec FLUX
           ↓
     traitement d'image
           ↓
    Wan 2.2 I2V
           ↓
      mise à l'échelle des images
           ↓
     post-traitement
           ↓
        résultat

ou :

image produit d'entrée
       ↓
préparation de l'arrière-plan
       ↓
Wan 2.2 image vers vidéo
       ↓
traitement vidéo
       ↓
résultat

C'est là que le modèle de workflow ComfyUI devient précieux.

Le GPU exécute un pipeline plutôt qu'un modèle isolé.

Wan 2.2 vaut-il encore le coup ?

Oui, si son écosystème ouvert et le contrôle du workflow sont importants pour vous.

La génération vidéo évolue rapidement. Il y aura toujours un modèle plus récent.

Wan 2.2 présente encore plusieurs avantages pratiques :

  • poids ouverts
  • licence Apache 2.0
  • prise en charge native de ComfyUI
  • text-to-video et image-to-video
  • une option 5B relativement légère
  • des modèles plus lourds pour des flux de travail à plus haute capacité
  • animation de personnages
  • génération pilotée par la voix
  • intégration Diffusers
  • une collection mature d'optimisations communautaires

Ce sont des qualités opérationnelles.

Le choix du modèle doit en tenir compte.

Le leader actuel des benchmarks n'est pas forcément le modèle le plus simple à intégrer.

Quel modèle Wan 2.2 devriez-vous utiliser ?

Pour une RTX 5090, commencez par :

Wan2.2-TI2V-5B

Il vous offre :

  • text-to-video
  • image vers vidéo
  • 720p
  • 24 fps
  • une solution confortable sur un seul GPU
  • prise en charge native de ComfyUI

Utilisez T2V-A14B lorsque la qualité de la conversion texte-vidéo justifie une charge de travail bien plus importante.

Utilisez I2V-A14B lorsque vous avez besoin d'une conversion image-vidéo de plus grande capacité.

Utilisez S2V-14B lorsque l'audio pilote la vidéo.

Utilisez Animate-14B pour le transfert de performance ou le remplacement de personnage.

Ne choisissez pas la version 14B simplement parce que 14 est supérieur à 5.

Choisissez-la si la qualité du résultat justifie l'infrastructure nécessaire.

FAQ Wan 2.2

Qu'est-ce que Wan 2.2 ?

Wan 2.2 est une famille de modèles de génération vidéo open source développée par l'équipe Wan d'Alibaba. Elle comprend des modèles pour la conversion de texte en vidéo, d'image en vidéo, hybride texte/image en vidéo, de parole en vidéo et l'animation de personnages.

Wan 2.2 est-il open source ?

Les modèles Wan 2.2 sont publiés sous licence Apache 2.0, qui autorise l'utilisation commerciale, la modification et la redistribution sous réserve de respecter ses conditions.

Wan 2.2 peut-il fonctionner sur une RTX 5090 ?

Oui. Le modèle Wan2.2-TI2V-5B peut fonctionner sur un seul GPU disposant d'au moins 24 Go de VRAM en utilisant la configuration de déchargement officielle ; une RTX 5090 de 32 Go est donc une cible adaptée.

De combien de VRAM Wan 2.2 a-t-il besoin ?

Cela dépend du modèle et de l'implémentation. Le code officiel de Wan spécifie au moins 24 Go pour le TI2V-5B avec déchargement, et au moins 80 Go pour les modèles A14B T2V et I2V. ComfyUI indique que son workflow natif 5B peut tenir dans environ 8 Go de VRAM en utilisant le déchargement.

Qu'est-ce que Wan2.2-TI2V-5B ?

Il s'agit d'un modèle Wan 2.2 dense de 5 milliards de paramètres prenant en charge à la fois la génération de texte en vidéo et d'image en vidéo dans un seul point de contrôle. Il utilise le VAE Wan2.2 à haute compression.

Wan 2.2 génère-t-il des vidéos en 720p ?

Oui. Le modèle hybride 5B et les modèles A14B T2V/I2V prennent en charge la génération en 720p. Le modèle 5B prend en charge le 720p à 24 images par seconde.

Quelle est la vitesse de Wan2.2-TI2V-5B ?

L'équipe Wan rapporte que le modèle 5B peut générer une vidéo 720p de cinq secondes en moins de neuf minutes sur un seul GPU grand public sans optimisation spécialisée. Les performances réelles dépendent du GPU, de l'environnement d'exécution, de la précision, du déchargement, du workflow et des paramètres de génération.

Que signifie A14B dans Wan 2.2 ?

Les modèles A14B utilisent deux experts d'environ 14 milliards de paramètres chacun. Au total, l'architecture contient environ 27 milliards de paramètres, dont environ 14 milliards sont actifs à chaque étape de débruitage.

Pourquoi Wan 2.2 utilise-t-il deux experts ?

Un expert gère l'étape initiale de débruitage à fort bruit et se concentre davantage sur la disposition globale, tandis que le second gère l'étape finale à faible bruit et affine les détails.

Wan 2.2 fonctionne-t-il dans ComfyUI ?

Oui. ComfyUI propose des modèles de workflow natifs pour la génération Wan2.2 5B texte/image vers vidéo, 14B texte vers vidéo, 14B image vers vidéo, ainsi que la génération vidéo à partir de la première/dernière image.

De quels fichiers le workflow ComfyUI pour Wan2.2 5B a-t-il besoin ?

Le workflow natif actuel utilise wan2.2_ti2v_5B_fp16.safetensors, umt5_xxl_fp8_e4m3fn_scaled.safetensors, et wan2.2_vae.safetensors.

Wan 2.2 peut-il transformer une image en vidéo ?

Oui. Le modèle hybride 5B prend en charge l'image vers vidéo ainsi que le texte vers vidéo. Wan publie également un modèle I2V-A14B distinct à plus grande capacité.

Qu'est-ce que Wan 2.2 Animate ?

Wan2.2-Animate-14B est un modèle d'animation et de remplacement de personnages. Il permet de transférer des mouvements et des expressions à partir d'une performance de référence ou de remplacer un personnage tout en conservant le mouvement directeur.

Wan 2.2 prend-il en charge l'audio ?

Wan2.2-S2V-14B prend en charge la vidéo pilotée par la parole à partir d'un fichier audio, d'une image de référence et, en option, de texte. L'implémentation officielle prend également en charge le guidage par pose.

Dois-je utiliser Wan 2.2 5B ou 14B ?

Utilisez le 5B si vous souhaitez un workflow pratique sur un seul GPU. Passez aux modèles A14B lorsque leur capacité supérieure vous apporte une amélioration suffisante pour justifier des besoins en mémoire et en calcul bien plus importants.

Wan 2.2 est-il meilleur pour le texte vers vidéo ou l'image vers vidéo ?

Il prend en charge les deux. Le texte vers vidéo offre au modèle plus de liberté créative, tandis que l'image vers vidéo vous donne plus de contrôle sur la composition initiale, l'identité et le design visuel.

Your next workload belongs on Hivenet.

Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.

Shader gradient background