
Wan 2.2 peut générer des vidéos en 720p sur une seule RTX 5090.
Mais cette réponse ne s'applique clairement qu'à une partie de la famille Wan 2.2.
Le Wan2.2-TI2V-5B est un modèle hybride de 5 milliards de paramètres conçu à la fois pour la génération de texte vers vidéo et d'image vers vidéo. Son implémentation officielle prend en charge une sortie 720p à 24 images par seconde et peut fonctionner avec 24 Go de mémoire GPU lorsque le déchargement du modèle et de l'encodeur de texte est activé. ComfyUI va plus loin en affirmant que son déchargement natif permet au flux de travail 5B de tenir dans environ 8 Go de VRAM.
Les modèles Wan2.2-A14B plus volumineux sont différents. Ils utilisent une architecture de mélange d'experts (Mixture-of-Experts) contenant environ 27 milliards de paramètres au total répartis sur deux experts de 14 milliards. Un seul expert est actif à chaque étape du débruitage, mais le chemin d'inférence officiel de Wan spécifie tout de même au moins 80 Go de VRAM pour une inférence 14B sur un seul GPU.
Donc, si vous disposez d'un GPU cloud RTX 5090 de 32 Go, je commencerais par le Wan2.2-TI2V-5B.
Cela vous offre la génération de texte vers vidéo et d'image vers vidéo dans un seul modèle, une marge de mémoire suffisante pour un flux de travail ComfyUI pratique, et une sortie 720p sans avoir à lutter contre la mémoire GPU dès le début du projet.
Wan 2.2 est une famille de modèles de génération vidéo open source créée par l'équipe Wan d'Alibaba.
La version initiale couvre trois modèles principaux de génération vidéo :
La famille s'est depuis agrandie avec Wan2.2-S2V-14B pour la vidéo pilotée par la parole et Wan2.2-Animate-14B pour l'animation et le remplacement de personnages. Le dépôt officiel décrit Animate comme un modèle unifié permettant de transférer des mouvements et des expressions ou de remplacer un personnage tout en préservant le mouvement.
Les modèles open source Wan 2.2 sont publiés sous licence Apache 2.0, ce qui autorise un usage commercial sous réserve du respect des conditions de la licence.
Cela rend la situation en matière de licence nettement plus simple que pour certains des modèles de génération d'images que nous avons abordés plus tôt dans cette série.
Deux concepts techniques sont particulièrement importants.
Le premier est la diffusion vidéo par mélange d'experts.
Le second est une représentation vidéo beaucoup plus compressée dans le modèle 5B.
Ensemble, ils s'attaquent à deux problèmes distincts : augmenter la capacité du modèle sans supporter le coût de calcul complet à chaque étape de débruitage, et rendre la vidéo haute définition réalisable avec beaucoup moins de matériel.
L'architecture A14B de Wan 2.2 sépare le processus de débruitage en deux étapes.
Un expert en haut niveau de bruit gère la première partie de la génération, lorsque le modèle établit la composition globale et le mouvement.
Un expert en bas niveau de bruit prend le relais plus tard, lorsque la vidéo nécessite des détails plus fins.
Chaque expert compte environ 14 milliards de paramètres.
Ensemble, ils totalisent environ 27 milliards de paramètres, mais un seul expert est actif à chaque étape de débruitage. L'équipe Wan précise que cela permet de maintenir les besoins en calcul actif et en mémoire GPU beaucoup plus proches d'un modèle de 14 milliards que d'un modèle dense de 27 milliards.
Cela ne signifie pas pour autant que le modèle devient soudainement une charge de travail légère pour le GPU.
Les deux ensembles de poids des experts sont toujours présents.
L'architecture économise du calcul en choisissant quel expert intervient à chaque étape. Elle ne supprime pas l'autre expert du stockage.
Wan2.2-TI2V-5B adopte une approche différente.
Il s'agit d'un modèle dense de 5 milliards de paramètres associé à un VAE vidéo à haute compression.
L'équipe Wan indique que le VAE compresse la vidéo dans le temps, en hauteur et en largeur selon un ratio de 4 × 16 × 16. Avec une étape supplémentaire de découpage en patchs, la représentation globale devient encore plus compacte.
Le résultat pratique est bien plus important que la terminologie de compression :
le modèle 5B peut générer une vidéo 720p à 24 fps sur un seul GPU grand public.
Le dépôt officiel rapporte la génération d'un clip 720p de cinq secondes en moins de neuf minutes sur un seul GPU grand public, sans optimisation spécifique.
On est encore loin de la génération vidéo en temps réel.
Mais cela déplace le problème d'infrastructure, passant d'un « GPU de centre de données massif » à « un seul GPU haut de gamme ».
Voici le résumé le plus utile :
La ligne 5B est celle autour de laquelle je commencerais à construire.
Les instances RTX 5090 de Hivenet offrent 32 Go de VRAM GDDR7 par GPU, ce qui place la carte confortablement au-dessus de la recommandation officielle de 24 Go pour le TI2V-5B, tout en offrant plus de marge qu'une configuration de 24 Go.
Parce que l'architecture logicielle est déterminante.
La commande officielle Wan maintient une plus grande partie du pipeline d'inférence dans le runtime conventionnel et préconise une configuration de 24 Go avec :
--offload_model True
--convert_model_dtype
--t5_cpu
Le workflow natif de ComfyUI peut transférer les composants du modèle entre le GPU et la mémoire système de manière plus dynamique, et sa documentation officielle précise que le modèle 5B devrait tenir aisément dans environ 8 Go de VRAM avec le déchargement natif.
Cela ne signifie pas pour autant que 8 Go et 32 Go offrent la même expérience.
Le déchargement économise la VRAM en déplaçant la charge de travail ailleurs.
Le transfert des poids et autres données entre la mémoire système et la mémoire du GPU prend du temps.
Avec 32 Go disponibles, l'objectif n'est pas de prouver que le workflow peut fonctionner avec l'empreinte mémoire la plus réduite possible. Il s'agit de conserver une partie suffisante du pipeline à proximité du GPU pour que la génération reste efficace.
Le modèle 5B gère deux tâches au sein du même point de contrôle :
Texte vers vidéo
Vous fournissez une description et le modèle génère le clip.
Image vers vidéo
Vous fournissez une image de départ accompagnée, en option, d'un prompt textuel décrivant le mouvement ou l'évolution de la scène souhaités.
Ce second mode rend Wan 2.2 particulièrement intéressant, en complément de la partie génération d'images de cet ensemble de contenus.
Vous pourriez, par exemple :
Notre guide des GPU cloud pour FLUX.1 [dev] couvre la première moitié de ce flux de travail.
Wan 2.2 gère la seconde.
J'utiliserais le texte vers vidéo lorsque le concept lui-même est encore au stade exploratoire.
Vous demandez au modèle de décider de :
Cela vous offre une plus grande liberté créative, mais augmente également le nombre de variables susceptibles de poser problème.
Utilisez image-to-video lorsque la composition initiale est importante.
Une image fournit au modèle vidéo un point d'ancrage visuel pour :
Ainsi, le prompt peut se concentrer davantage sur le mouvement.
Pour une production créative contrôlée, cette division du travail est souvent plus facile à gérer.
Ce tutoriel suppose que vous disposez déjà de l'environnement décrit dans notre guide GPU cloud pour ComfyUI:
Si ce n'est pas le cas, configurez-le d'abord.
Il est inutile de répéter l'installation de ComfyUI tout en essayant de diagnostiquer un modèle vidéo en même temps.
Pour un accès privé, Hivenet recommande le transfert de port SSH plutôt que d'exposer directement une interface web personnelle sur Internet.
La prise en charge de Wan 2.2 est intégrée à la version actuelle de ComfyUI.
La documentation officielle avertit que des nœuds manquants dans le workflow Wan signifient souvent que l'installation de ComfyUI n'est pas à jour.
Mettez à jour votre installation en utilisant la méthode adaptée à votre installation de ComfyUI.
Si vous l'avez cloné manuellement :
cd ComfyUI
git pull
Réactivez ensuite le même environnement Python et mettez à jour les dépendances si la version l'exige.
N'installez pas de nœud personnalisé Wan tiers simplement parce qu'un ancien tutoriel vous dit que c'est nécessaire.
Il existe des implémentations communautaires utiles, mais la prise en charge native de ComfyUI existe déjà.
Commencez par là.
Dans ComfyUI, ouvrez :
Workflow → Browse Templates → Video
Recherchez :
Wan2.2 5B
Le workflow officiel prend en charge à la fois le texte vers vidéo et l'image vers vidéo.
L'utilisation du modèle nous permet de disposer d'un graphe fonctionnel avant de commencer à modifier les chemins des modèles, le nombre d'images, les résolutions ou les nœuds personnalisés.
C'est la même règle que celle que nous avons utilisée pour FLUX :
faites d'abord fonctionner le workflow officiel. Ensuite, personnalisez-le.
Le workflow natif 5B de ComfyUI utilise actuellement trois fichiers.
wan2.2_ti2v_5B_fp16.safetensors
Placez-le dans :
ComfyUI/models/diffusion_models/
umt5_xxl_fp8_e4m3fn_scaled.safetensors
Placez-le dans :
ComfyUI/models/text_encoders/
wan2.2_vae.safetensors
Placez-le dans :
ComfyUI/models/vae/
La structure obtenue devrait ressembler à ceci :
ComfyUI/
└── models/
├── diffusion_models/
│ └── wan2.2_ti2v_5B_fp16.safetensors
│
├── text_encoders/
│ └── umt5_xxl_fp8_e4m3fn_scaled.safetensors
│
└── vae/
└── wan2.2_vae.safetensors
Redémarrez ComfyUI ou actualisez les listes de modèles si nécessaire.
Vérifiez que les nœuds de chargement de modèles du workflow pointent vers :
wan2.2_ti2v_5B_fp16.safetensors
pour le modèle de diffusion,
umt5_xxl_fp8_e4m3fn_scaled.safetensors
pour l'encodeur de texte, et
wan2.2_vae.safetensors
pour le VAE.
Ce sont les composants exacts documentés par ComfyUI pour le workflow 5B natif.
Si un chargeur est en rouge, résolvez d'abord le problème de chemin d'accès au fichier.
Modifier les paramètres d'échantillonnage ne réparera pas un modèle que ComfyUI ne parvient pas à trouver.
Laissez l'entrée d'image désactivée.
Utilisez un prompt décrivant une scène avec un mouvement clair.
Par exemple :
Plan cinématographique large d'un kayak jaune dérivant lentement sur
un lac de montagne calme au lever du soleil. Une fine brume se déplace sur
l'eau. La caméra effectue un lent mouvement vers l'avant en direction du kayak.
Lumière naturelle douce, reflets réalistes sur l'eau, mouvement calme.
C'est plus utile pour un premier test que :
Un chef-d'œuvre cinématographique épique avec des mouvements incroyables
et des visuels à couper le souffle.
Le premier prompt indique au modèle :
Les prompts vidéo nécessitent des informations temporelles.
Une belle description d'une image fixe n'indique pas à un modèle vidéo ce qui doit se passer ensuite.
Pour des tests pratiques, je concevrais les prompts comme suit :
Sujet + action + caméra + environnement
Par exemple :
Sujet :
Une voiture de sport vintage rouge
Action :
roule lentement sur une route de montagne humide
Caméra :
travelling bas longeant la voiture
Environnement :
brume matinale, reflets sur l'asphalte mouillé,
lumière douce et nuageuse, photographie cinématographique réaliste
Combiné :
Une voiture de sport vintage rouge roule lentement sur une route
de montagne humide. Travelling bas longeant la voiture. La brume
matinale s'infiltre entre les arbres et les reflets scintillent
sur l'asphalte mouillé. Lumière douce et nuageuse, photographie
cinématographique réaliste.
Vous pourrez ajouter de la complexité plus tard.
Commencez par des mouvements que le modèle peut comprendre.
Les prompts d'image se concentrent souvent presque uniquement sur l'apparence.
Les prompts vidéo ont besoin de verbes.
Comparez :
Une femme en long manteau rouge debout sur un quai de gare.
avec :
Une femme en long manteau rouge marche lentement le long d'un train vide
plateforme tandis que le vent agite son manteau et ses cheveux. La caméra
la suit à côté d'elle à une vitesse de marche. Un train passe en
arrière-plan.
La seconde version décrit un changement au fil du temps.
C'est ce que le modèle doit générer.
Le langage de mouvement utile inclut :
Plus un mouvement est important, moins je le laisse implicite.
La génération vidéo multiplie les erreurs d'une image à l'autre.
Un clip plus long signifie :
Commencez avec la durée par défaut du flux de travail.
Ne transformez pas votre première génération réussie en une expérience de 20 secondes.
Assurez-vous d'abord que le mouvement est correct.
Consacrez ensuite de la puissance de calcul à la durée.
Sur la machine virtuelle :
watch -n 1 nvidia-smi
La génération vidéo est un meilleur test de résistance que de surveiller la VRAM au repos après le chargement du modèle.
Surveillez :
La RTX 5090 offre 32 Go de VRAM, tandis que l'instance à un GPU de Hivenet dispose également d'une mémoire système distincte accessible au runtime.
Ces deux espaces ne sont pas interchangeables.
Le déchargement vers la RAM système peut permettre d'exécuter un flux de travail.
Cela peut aussi le ralentir.
Activez l'entrée d'image du flux de travail.
Le flux de travail natif de ComfyUI utilise le même modèle 5B pour l'image vers vidéo. Vous fournissez une image, et Wan 2.2 utilise son format d'image lors de la création du latent vidéo.
Choisissez une image nette avec une composition que vous souhaitez conserver.
Ensuite, rédigez votre prompt principalement autour du mouvement.
Par exemple, si l'entrée est le portrait d'une personne près d'une fenêtre :
La personne se tourne lentement vers la fenêtre et regarde à l'extérieur.
Une légère brise fait bouger les rideaux et quelques mèches de cheveux.
La caméra effectue un très lent travelling avant. Lumière naturelle
d'après-midi, mouvement réaliste subtil.
Remarquez ce que le prompt ne prend pas le temps de décrire.
L'apparence de la personne est déjà présente dans l'image.
Utilisez le budget de votre prompt pour ce qui change.
La conversion de texte en vidéo demande à un seul modèle de résoudre deux problèmes majeurs :
La conversion d'image en vidéo vous permet de les résoudre séparément.
C'est utile pour :
Vous pouvez itérer sur l'image de départ à moindre coût avec un modèle d'image, puis n'utiliser la puissance de calcul vidéo, plus lourde, qu'une fois que l'image mérite d'être animée.
Un flux de travail pratique pourrait être :
FLUX
↓
image de départ approuvée
↓
Image-vers-vidéo Wan 2.2
↓
clip sélectionné
↓
upscale / édition / encodage
Nos guides FLUX.1 [dev] et de workflow ComfyUI couvrent les deux premières étapes de ce pipeline.
Wan2.2-TI2V-5B prend nativement en charge une sortie 720p à 24 images par seconde.
Cinq secondes à 24 ips représentent environ :
5 × 24 = 120 images
qui doivent rester temporellement cohérentes.
C'est pourquoi la vidéo par IA est nettement plus gourmande en ressources de calcul que la création d'une image 1024 × 1024.
Le modèle doit résoudre :
sur toute une séquence.
Un clip de cinq secondes ne représente pas « cinq secondes de travail GPU ».
Utilisez-les lorsque vous avez besoin d'une capacité de modèle suffisante pour justifier l'infrastructure.
Les modèles A14B utilisent deux experts spécialisés :
expert en bruit élevé
↓
transition pendant le débruitage
↓
expert en faible bruit
Chacun compte environ 14 milliards de paramètres, ce qui donne au modèle un total d'environ 27 milliards de paramètres tout en maintenant environ 14 milliards actifs à chaque étape de débruitage.
Le flux de travail natif actuel de ComfyUI pour le text-to-video 14B utilise des fichiers de modèle distincts en FP8 pour le bruit élevé et le faible bruit :
wan2.2_t2v_high_noise_14B_fp8_scaled.safetensors
wan2.2_t2v_low_noise_14B_fp8_scaled.safetensors
ainsi qu'un encodeur de texte UMT5 en FP8 et le VAE Wan 2.1 compatible.
C'est beaucoup plus d'état de modèle que pour le workflow 5B.
C'est là que j'éviterais de répondre par un oui trop confiant.
L' implémentation de référence officielle de Wan spécifie au moins 80 Go de VRAM pour l'inférence T2V-A14B et I2V-A14B sur un seul GPU, même avec le déchargement du modèle et la conversion de type activés.
Les modèles FP8 et le déchargement natif de ComfyUI peuvent modifier la gestion de la mémoire, et les implémentations de la communauté proposent des approches plus agressives pour réduire la consommation de mémoire.
Mais c'est différent de dire :
Wan2.2 14B nécessite 32 Go.
La source officielle ne confirme pas cette affirmation.
Si votre objectif est une seule RTX 5090, utilisez le modèle 5B.
Si vous avez spécifiquement besoin du modèle 14B, considérez-le comme une charge de travail nécessitant plus de mémoire ou un déchargement intensif, et testez l'implémentation ComfyUI exacte que vous prévoyez d'utiliser.
C'est le même piège que celui dont nous avons discuté avec les modèles de langage à mélange d'experts (MoE).
Wan appelle ces modèles A14B car environ 14B de paramètres sont actifs à chaque étape.
Mais l'architecture à deux experts contient environ 27B de paramètres au total.
Cela a une importance pour :
« 14B actifs » décrit le calcul.
Cela ne signifie pas que le modèle complet ne contient que 14 milliards de paramètres.
C'est précisément le genre de distinction qui disparaît dans les tableaux simplistes de configuration GPU.
Wan2.2-Animate-14B est un modèle ultérieur de la famille Wan 2.2 conçu pour l'animation et le remplacement de personnages.
Il peut utiliser le mouvement et l'expression d'une performance de référence pour animer un autre personnage, ou remplacer un personnage tout en préservant le mouvement directeur. L'équipe Wan a publié le modèle et le code d'inférence en septembre 2025, et il a été intégré par la suite dans Diffusers.
Cela en fait un problème différent de la simple conversion de texte en vidéo.
Au lieu de demander :
Générer une personne qui danse.
vous pouvez travailler avec une performance source et demander au modèle de transférer cette performance à un autre personnage.
ComfyUI dispose désormais également d'un workflow natif dédié à Wan2.2 Animate.
Si l'animation de personnages devient une opportunité majeure de recherche ou de produit pour nous, elle mérite son propre tutoriel plutôt que d'être intégrée à celui-ci.
Wan2.2-S2V-14B génère de la vidéo à partir de :
et peut également utiliser le guidage de pose.
L'implémentation officielle prend en charge le 480p et le 720p et utilise la durée de l'audio en entrée pour déterminer la durée de la vidéo lorsqu'aucun nombre de clips n'est défini.
Encore une fois, le chemin d'accès officiel pour GPU unique nécessite un GPU de classe 80 Go.
Cela fait de S2V une cible de déploiement très différente du modèle hybride 5B.
La famille Wan 2.2 est vaste.
Vous n'avez pas besoin d'exécuter toutes ses branches sur le même matériel.
Prévoyez large.
Les environnements de vidéo par IA accumulent plus de données que les environnements de génération d'images, car vous stockez :
Et les flux de travail 14B utilisent plusieurs fichiers de modèles volumineux plutôt qu'un seul petit point de contrôle.
La configuration RTX 5090 à un GPU sur Hivenet inclut actuellement 250 Go de disque local ; les configurations multi-GPU augmentent proportionnellement l'espace de stockage inclus.
Il s'agit d'un espace de travail utile.
Ce n'est toutefois pas un espace d'archivage.
Transférez vos résultats importants et vos fichiers de workflow réutilisables vers un stockage persistant avant de terminer une instance.
C'est encore plus crucial pour la vidéo que ça ne l'était pour FLUX.
Un clip généré ne vous indique pas par lui-même :
Conservez le fichier JSON de ComfyUI.
Par exemple :
wan-product-shot/
├── workflows/
│ ├── product-i2v-v01.json
│ ├── product-i2v-v02-motion.json
│ └── product-i2v-v03-camera.json
├── input/
│ └── product-frame.png
├── output/
│ ├── test-01.mp4
│ └── final.mp4
└── notes.md
Cette structure suffit à transformer vos expérimentations en un processus reproductible.
Le prompting vidéo devient complexe lorsqu'une requête demande trop d'événements simultanés.
Par exemple :
L'acteur marche vers la caméra, se retourne, saute par-dessus une
chaise, la caméra tourne autour de lui, les lumières passent au rouge,
la pluie commence à tomber et la pièce se transforme en forêt.
Le modèle doit alors coordonner de nombreuses relations temporelles.
Un test plus simple :
L'acteur marche lentement vers la caméra tandis que celle-ci
recule pour conserver le même cadrage.
vous permet d'évaluer si le mouvement principal fonctionne.
Ajoutez ensuite :
Une pluie fine commence à tomber en arrière-plan.
Puis, changez éventuellement de caméra.
Procéder ainsi par itérations consomme moins de prompts et permet de comprendre beaucoup plus rapidement ce qui ne fonctionne pas.
Les prompts de génération d'images peuvent décrire une caméra sans qu'il y ait de mouvement réel.
En vidéo, la caméra peut faire partie intégrante de l'action.
Voici quelques instructions utiles :
Si le mouvement de caméra est important, précisez-le.
Sinon, le modèle devra décider à votre place.
Un bon moyen de tester les limites d'un modèle vidéo est de commencer par des lois physiques simples.
Essayez :
Un verre d'eau est posé sur une table en bois.
Une main entre par la droite, saisit le verre,
et le déplace lentement hors du champ.
Caméra fixe.
Cela permet de tester :
Si le modèle ne parvient pas à maintenir la cohérence du verre durant cette interaction, ajouter des explosions n'aidera probablement pas à établir un diagnostic.
Les démonstrations impressionnantes sont utiles pour le marketing.
Les mouvements simples sont préférables pour l'évaluation.
Ne jugez pas le modèle uniquement sur la séquence la plus impressionnante que vous pouvez générer.
Créez un ensemble de prompts reproductibles couvrant les besoins réels de votre application.
Analysez :
Adhérence au prompt
L'action demandée a-t-elle été effectuée ?
Cohérence temporelle
Les personnes et les objets restent-ils reconnaissables d'une image à l'autre ?
Qualité du mouvement
Le mouvement semble-t-il physiquement plausible ?
Qualité des interactions
Les mains, les outils, les vêtements et les objets interagissent-ils correctement ?
Contrôle de la caméra
Le mouvement demandé a-t-il eu lieu ?
Stabilité de la scène
L'arrière-plan et la géométrie dérivent-ils ?
Cohérence de l'identité
Le sujet reste-t-il la même personne ou le même objet ?
Taux d'échec
Combien de générations doivent être écartées ?
Ce dernier indicateur a une importance commerciale.
Un modèle capable de créer un clip exceptionnel une fois sur dix peut coûter plus cher qu'un modèle légèrement moins impressionnant qui réussit huit fois sur dix.
Hivenet propose actuellement du calcul RTX 5090 à partir de 0,75 € par heure de GPU avec une facturation à la seconde.
Le calcul de l'infrastructure est donc le suivant :
Temps d'exécution du GPU en heures × 0,75 €
Mais le « coût par vidéo générée » est généralement un mauvais indicateur.
Il vaut mieux utiliser celui-ci :
coût total du GPU
÷
nombre de clips exploitables
Imaginons qu'un flux de travail crée vingt clips et que seuls deux soient acceptables.
Votre coût de génération réel est réparti sur ces deux clips.
C'est pourquoi la qualité des prompts, la stabilité du flux de travail et le choix du modèle ont des conséquences économiques.
Un GPU plus rapide ne corrigera pas un flux de travail qui produit des résultats inexploitables.
Le travail de création vidéo se fait généralement par pics d'activité :
lancement
générer
inspecter
ajuster
générer à nouveau
exporter
arrêter
C'est une solution parfaitement adaptée au calcul à la demande.
Hivenet facture le calcul à la seconde tant que l'instance est active.
La discipline est essentielle.
Si vous passez deux heures à examiner des clips alors que le GPU reste inactif dans un autre onglet, vous continuez à payer la location du GPU.
Enregistrez le flux de travail.
Arrêtez l'instance une fois la session terminée.
Redémarrez-la lorsque vous en avez à nouveau besoin.
Héberger Wan 2.2 vous offre des avantages qu'un service vidéo en ligne ne propose pas forcément :
Un service vidéo commercial hébergé vous apporte un avantage tout aussi précieux :
quelqu'un d'autre gère l'infrastructure.
Si vous avez besoin de dix clips et que le service hébergé les produit déjà correctement, faire tourner Linux et télécharger les poids du modèle n'améliorera probablement pas votre quotidien.
Hébergez vous-même lorsque le contrôle est essentiel.
Utilisez un service géré lorsque ce n'est pas le cas.
Ce qui est intéressant avec l'exécution de Wan via ComfyUI, c'est que le modèle vidéo n'a plus besoin d'être l'application entière.
Vous pouvez créer des flux de travail tels que :
Générer l'image de départ avec FLUX
↓
traitement d'image
↓
Wan 2.2 I2V
↓
mise à l'échelle des images
↓
post-traitement
↓
résultat
ou :
image produit d'entrée
↓
préparation de l'arrière-plan
↓
Wan 2.2 image vers vidéo
↓
traitement vidéo
↓
résultat
C'est là que le modèle de workflow ComfyUI devient précieux.
Le GPU exécute un pipeline plutôt qu'un modèle isolé.
Oui, si son écosystème ouvert et le contrôle du workflow sont importants pour vous.
La génération vidéo évolue rapidement. Il y aura toujours un modèle plus récent.
Wan 2.2 présente encore plusieurs avantages pratiques :
Ce sont des qualités opérationnelles.
Le choix du modèle doit en tenir compte.
Le leader actuel des benchmarks n'est pas forcément le modèle le plus simple à intégrer.
Pour une RTX 5090, commencez par :
Wan2.2-TI2V-5B
Il vous offre :
Utilisez T2V-A14B lorsque la qualité de la conversion texte-vidéo justifie une charge de travail bien plus importante.
Utilisez I2V-A14B lorsque vous avez besoin d'une conversion image-vidéo de plus grande capacité.
Utilisez S2V-14B lorsque l'audio pilote la vidéo.
Utilisez Animate-14B pour le transfert de performance ou le remplacement de personnage.
Ne choisissez pas la version 14B simplement parce que 14 est supérieur à 5.
Choisissez-la si la qualité du résultat justifie l'infrastructure nécessaire.
Wan 2.2 est une famille de modèles de génération vidéo open source développée par l'équipe Wan d'Alibaba. Elle comprend des modèles pour la conversion de texte en vidéo, d'image en vidéo, hybride texte/image en vidéo, de parole en vidéo et l'animation de personnages.
Les modèles Wan 2.2 sont publiés sous licence Apache 2.0, qui autorise l'utilisation commerciale, la modification et la redistribution sous réserve de respecter ses conditions.
Oui. Le modèle Wan2.2-TI2V-5B peut fonctionner sur un seul GPU disposant d'au moins 24 Go de VRAM en utilisant la configuration de déchargement officielle ; une RTX 5090 de 32 Go est donc une cible adaptée.
Cela dépend du modèle et de l'implémentation. Le code officiel de Wan spécifie au moins 24 Go pour le TI2V-5B avec déchargement, et au moins 80 Go pour les modèles A14B T2V et I2V. ComfyUI indique que son workflow natif 5B peut tenir dans environ 8 Go de VRAM en utilisant le déchargement.
Il s'agit d'un modèle Wan 2.2 dense de 5 milliards de paramètres prenant en charge à la fois la génération de texte en vidéo et d'image en vidéo dans un seul point de contrôle. Il utilise le VAE Wan2.2 à haute compression.
Oui. Le modèle hybride 5B et les modèles A14B T2V/I2V prennent en charge la génération en 720p. Le modèle 5B prend en charge le 720p à 24 images par seconde.
L'équipe Wan rapporte que le modèle 5B peut générer une vidéo 720p de cinq secondes en moins de neuf minutes sur un seul GPU grand public sans optimisation spécialisée. Les performances réelles dépendent du GPU, de l'environnement d'exécution, de la précision, du déchargement, du workflow et des paramètres de génération.
Les modèles A14B utilisent deux experts d'environ 14 milliards de paramètres chacun. Au total, l'architecture contient environ 27 milliards de paramètres, dont environ 14 milliards sont actifs à chaque étape de débruitage.
Un expert gère l'étape initiale de débruitage à fort bruit et se concentre davantage sur la disposition globale, tandis que le second gère l'étape finale à faible bruit et affine les détails.
Oui. ComfyUI propose des modèles de workflow natifs pour la génération Wan2.2 5B texte/image vers vidéo, 14B texte vers vidéo, 14B image vers vidéo, ainsi que la génération vidéo à partir de la première/dernière image.
Le workflow natif actuel utilise wan2.2_ti2v_5B_fp16.safetensors, umt5_xxl_fp8_e4m3fn_scaled.safetensors, et wan2.2_vae.safetensors.
Oui. Le modèle hybride 5B prend en charge l'image vers vidéo ainsi que le texte vers vidéo. Wan publie également un modèle I2V-A14B distinct à plus grande capacité.
Wan2.2-Animate-14B est un modèle d'animation et de remplacement de personnages. Il permet de transférer des mouvements et des expressions à partir d'une performance de référence ou de remplacer un personnage tout en conservant le mouvement directeur.
Wan2.2-S2V-14B prend en charge la vidéo pilotée par la parole à partir d'un fichier audio, d'une image de référence et, en option, de texte. L'implémentation officielle prend également en charge le guidage par pose.
Utilisez le 5B si vous souhaitez un workflow pratique sur un seul GPU. Passez aux modèles A14B lorsque leur capacité supérieure vous apporte une amélioration suffisante pour justifier des besoins en mémoire et en calcul bien plus importants.
Il prend en charge les deux. Le texte vers vidéo offre au modèle plus de liberté créative, tandis que l'image vers vidéo vous donne plus de contrôle sur la composition initiale, l'identité et le design visuel.
Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.