
DeepSeek-R1 n'a pas une seule exigence en matière de RAM ou de VRAM.
Le modèle complet DeepSeek-R1 compte 671 milliards de paramètres au total, dont 37 milliards sont activés pour chaque jeton. DeepSeek a également publié six modèles distillés plus petits de 1,5B, 7B, 8B, 14B, 32B et 70B paramètres. Il s'agit de modèles différents avec des exigences matérielles radicalement distinctes.
Cette distinction est le premier point à bien comprendre.
Un modèle distillé DeepSeek-R1 de 14B peut fonctionner sur un seul GPU moderne avec une précision adaptée. Un modèle 32B quantifié peut tenir dans la catégorie des 32 Go de VRAM. Un modèle 70B nécessite généralement une mémoire plus importante ou plusieurs GPU. Le modèle complet DeepSeek-R1 de 671B est un modèle à l'échelle d'un centre de données, même si seuls 37B de paramètres sont actifs pour chaque jeton.
Voici la version courte :
Ces chiffres estiment uniquement le poids du modèle.
L'inférence réelle nécessite de la mémoire supplémentaire pour le cache KV, l'exécution, les allocations temporaires, les métadonnées de quantification et les requêtes actives. La longueur du contexte et la concurrence peuvent modifier considérablement les besoins réels.
Si vous choisissez du matériel pour des modèles d'IA de manière plus générale, notre guide sur la VRAM de la RTX 5090 explique ce calcul plus en détail.
L'expression « exécuter DeepSeek-R1 » est devenue un raccourci trompeur.
La version officielle de R1 par DeepSeek contient deux types de modèles distincts :
DeepSeek a officiellement publié ces variantes distillées :
Cette distinction est importante car les modèles plus petits ne sont pas le modèle de 671B compressé en 14B ou 32B.
DeepSeek a affiné des modèles de base Qwen et Llama existants en utilisant des échantillons de raisonnement générés par DeepSeek-R1. Les modèles distillés Qwen, par exemple, ont été affinés à l'aide de 800 000 échantillons sélectionnés avec R1.
Un modèle R1 distill de 32B reste donc un modèle dense de 32B basé sur Qwen2.5-32B.
Il a appris à partir des résultats de R1. Il ne contient pas 671 milliards de paramètres cachés dans un point de contrôle de 32B.
Les recherches sur la « configuration RAM requise pour DeepSeek » mélangent souvent deux types de mémoire.
La VRAM est la mémoire dédiée au GPU. Si vous souhaitez que le modèle s'exécute entièrement sur le GPU, ses poids et son état d'inférence doivent y tenir.
La RAM système appartient à l'hôte CPU. Il stocke le système d'exploitation, les processus des applications, les fichiers de modèles lors du chargement, les jeux de données, les caches et tout ce que vous déchargez délibérément du GPU.
Pour Calculer avec Hivenet, une RTX 5090 fournit 32 Go de VRAM GPU, tandis que l'instance inclut également une mémoire vive système ECC distincte. La documentation de Hivenet distingue explicitement les deux, car ils répondent à des besoins différents.
Si tous les poids du modèle résident sur le GPU, l'ajout de centaines de gigaoctets de RAM CPU ne transforme pas un GPU de 32 Go en un GPU de 200 Go.
Si vous déchargez délibérément des couches du modèle vers la mémoire CPU, une plus grande quantité de RAM système peut vous permettre d'exécuter des modèles qui dépassent la VRAM disponible.
Le compromis réside dans le transfert de données.
Un GPU qui attend constamment que les poids transitent via le PCIe n'est pas la même chose que de conserver l'intégralité du modèle dans la mémoire locale rapide du GPU.
L'estimation la plus simple est :
paramètres × octets par paramètre = mémoire approximative pour les poids
Les précisions courantes nous donnent :
Pour un modèle 14B :
14 milliards × 2 octets ≈ 28 Go en BF16
14 milliards × 1 octet ≈ 14 Go en 8 bits
14 milliards × 0,5 octet ≈ 7 Go en 4 bits
Pour un modèle de 32B :
32 milliards × 2 octets ≈ 64 Go en BF16
32 milliards × 1 octet ≈ 32 Go en 8 bits
32 milliards × 0,5 octet ≈ 16 Go en 4 bits
Il s'agit ici de calculs volontairement simplifiés.
Les formats de quantification réels ajoutent des échelles et des métadonnées. Certaines couches peuvent rester dans une précision supérieure. Le moteur d'inférence nécessite sa propre mémoire. Le cache KV augmente avec le contexte et les séquences actives.
Considérez donc ces chiffres comme le minimum requis pour la mémoire des poids du modèle, plutôt que comme le budget VRAM total.
Le modèle 1.5B est minuscule selon les standards actuels des LLM.
Ses poids nécessitent approximativement :
Il peut donc fonctionner sur des GPU modestes et, selon le moteur d'exécution et les performances acceptées, sur des CPU.
Cela le rend utile pour expérimenter le comportement de raisonnement de type R1 sans avoir à louer du matériel coûteux.
La limite réside dans les capacités du modèle.
Les évaluations de DeepSeek montrent une progression claire à mesure que ses modèles distillés gagnent en taille. Le modèle 1.5B offre des performances impressionnantes pour sa taille, mais les versions distillées 14B et 32B sont nettement plus performantes sur les benchmarks de raisonnement, de mathématiques et de codage.
Utilisez le modèle 1,5B si votre charge de travail nécessite un modèle léger, et non parce que tous les modèles distillés R1 sont interchangeables.
Le modèle 7B nécessite environ :
Un GPU de 16 Go peut théoriquement contenir ses poids en BF16, mais cela laisse peu de marge pour la surcharge d'inférence et le cache.
Sur un GPU de 24 Go ou 32 Go, le format BF16 est beaucoup plus confortable.
En 8 bits ou 4 bits, le modèle peut fonctionner sur du matériel nettement plus modeste et laisse davantage d'espace pour le contexte.
Cette catégorie de taille est utile lorsque la latence, le débit ou le coût priment sur la recherche des performances de raisonnement maximales de la famille des modèles distillés.
Le modèle distillé basé sur Llama 8B est similaire :
DeepSeek a conçu cette variante à partir de Llama 3.1 8B plutôt que de Qwen.
Une carte de 16 Go est là encore plus limitée que ne le suggère le poids brut des paramètres. Un modèle 8B en BF16 peut occuper environ 16 Go avant même que le moteur de service n'ait alloué un cache KV utile.
Si votre GPU dispose de 16 Go, la quantification est une option plus sûre.
Avec 24 Go ou 32 Go, vous bénéficiez d'une bien plus grande liberté.
Il s'agit de l'une des tailles de modèle les plus utiles de la gamme, car elle se situe entre les modèles distillés, petits et peu coûteux, et le modèle 32B, plus lourd.
DeepSeek-R1-Distill-Qwen-14B nécessite environ :
Alors, de combien de VRAM le DeepSeek-R1 14B quantifié a-t-il réellement besoin ?
En 4 bits, 7 Go est l'estimation du poids brut. Un déploiement réel nécessite plus de 7 Go, car le moteur d'exécution, le cache, les données de quantification et le contexte actif consomment également de la mémoire.
Cela signifie qu'un GPU de 8 Go ne doit pas être considéré comme suffisant pour un déploiement 14B simplement parce que les poids en 4 bits totalisent 7 Go.
Avec 16 Go, un point de contrôle 4 bits validé dispose d'une marge de manœuvre bien plus confortable.
Avec 24 Go ou 32 Go, vous pouvez offrir au modèle plus d'espace pour le contexte et les requêtes simultanées, ou expérimenter avec une quantification moins agressive.
Sur un GPU cloud RTX 5090, je préférerais généralement exécuter le modèle 14B quantifié plutôt que de charger 28 Go de poids en BF16 simplement parce qu'ils tiennent tout juste.
Laisser de la VRAM inutilisée n'est pas un gaspillage. C'est là que votre charge de travail s'exécute.
Oui.
Une RTX 5090 de 32 Go dispose d'une capacité suffisante pour un modèle 14B quantifié et peut théoriquement accueillir également les poids en BF16. NVIDIA spécifie 32 Go de VRAM GDDR7 pour la RTX 5090 de bureau.
Je privilégierais tout de même la quantification pour la plupart des charges de travail d'inférence.
La raison ne se limite pas au simple démarrage du modèle.
Un modèle 14B quantifié libère beaucoup plus de VRAM pour :
Si vos évaluations montrent que le point de contrôle quantifié préserve la qualité dont vous avez besoin, cette mémoire disponible constitue une capacité utile.
Le modèle 32B change la donne :
Le format BF16 ne tient clairement pas sur une seule RTX 5090.
Le format 8 bits n'est pas non plus une option viable pour une seule 5090. Les poids seuls occupent la totalité des 32 Go nominaux de la carte avant même que l'inférence ne commence.
Le format 4 bits est la solution pratique pour un GPU unique.
Un point de contrôle 32B quantifié en 4 bits nécessite environ 16 Go de stockage pour les poids, laissant le reste de la VRAM de la RTX 5090 disponible pour le moteur d'inférence et la charge de travail.
C'est pourquoi le modèle 32B est probablement la taille de distillation R1 la plus intéressante pour un GPU de 32 Go si la qualité du raisonnement prime sur la concurrence maximale.
L'évaluation publiée par DeepSeek place son modèle distillé Qwen 32B devant son modèle 14B sur les principaux benchmarks de mathématiques, de raisonnement et de codage qu'il rapporte.
Cela ne rend pas le modèle 32B universellement meilleur.
Si le modèle 14B répond déjà aux exigences de votre application, le modèle plus petit vous offre une consommation mémoire réduite et une plus grande marge de manœuvre pour le service.
Pour 70 milliards de paramètres :
Cela place le modèle hors de portée d'une seule RTX 5090, même avec un calcul simple en 4 bits.
Un déploiement 70B en 4 bits nécessite généralement :
Deux GPU de 32 Go offrent 64 Go de VRAM totale, mais la mémoire multi-GPU n'est pas un pool partagé magique. Le moteur de service doit explicitement fragmenter le modèle, et chaque GPU a également besoin d'espace pour l'état d'exécution.
Notre futur guide des exigences GPU pour Llama 3.3 70B approfondira cette limite, car le même calcul matériel sous-jacent s'applique au modèle distillé 70B de DeepSeek basé sur Llama.
C'est ici que survient le malentendu le plus courant.
DeepSeek-R1 possède :
Il utilise une architecture de mélange d'experts (Mixture-of-Experts) héritée de DeepSeek-V3.
Seule une partie du réseau est utilisée pour chaque jeton, ce qui réduit la puissance de calcul nécessaire par rapport à l'activation simultanée des 671 milliards de paramètres.
Mais 37 milliards de paramètres activés ne signifie pas que le modèle nécessite uniquement la mémoire correspondant à 37 milliards de paramètres.
L'ensemble des poids des experts est toujours présent.
Si vous souhaitez qu'ils soient chargés dans la mémoire de l'accélérateur, vous devez disposer d'un espace de stockage pour le modèle complet.
Le calcul basé uniquement sur les poids est colossal :
Ce n'est pas une charge de travail adaptée aux GPU grand public.
Pas dans le cadre d'un déploiement conventionnel en 4 bits avec le modèle entièrement chargé en mémoire.
Huit RTX 5090 offrent :
8 × 32 Go = 256 Go de VRAM totale
Le calcul du poids brut en 4 bits pour 671 milliards de paramètres est le suivant :
671 G × 0,5 octet ≈ 335,5 Go
C'est déjà environ 79,5 Go de plus que la capacité totale de VRAM de huit GPU, avant même que le moteur d'exécution ou le cache KV n'aient besoin de mémoire.
Hivenet prend en charge des configurations RTX 5090 allant jusqu'à huit GPU par instance. C'est utile pour l'entraînement et l'inférence multi-GPU intensifs, mais cela ne fait pas pour autant du modèle R1 complet une charge de travail adaptée à une RTX 5090.
Vous pouvez trouver des implémentations spécialisées qui utilisent une quantification agressive, le déchargement sur CPU ou la répartition distribuée des experts.
Il s'agit là de projets d'ingénierie.
Ils ne doivent pas être confondus avec l'idée que « DeepSeek-R1 tourne sur quelques GPU grand public ».
Pour le parc actuel de RTX chez Hivenet, les modèles R1 distillés constituent la cible réaliste.
S'il ne nous indique pas les besoins en mémoire, pourquoi DeepSeek le publie-t-il ?
Parce qu'il nous renseigne sur le calcul.
Dans un modèle de type « Mixture-of-Experts » (mélange d'experts), le routeur sélectionne un sous-ensemble d'experts pour chaque jeton au lieu de faire passer chaque jeton par l'ensemble des paramètres.
Cela rend la quantité de calcul actif bien inférieure à celle d'un modèle dense de 671 milliards de paramètres.
Ainsi, ces deux chiffres répondent à des questions différentes :
671 milliards de paramètres au total aide à comprendre le volume de stockage nécessaire pour les poids du modèle.
37 milliards de paramètres activés aide à expliquer quelle part de ce réseau participe au traitement de chaque jeton.
Confondre les deux transforme une fonctionnalité architecturale utile en un mauvais conseil matériel.
Pour un GPU de 32 Go, voici comment j'envisagerais les versions distillées :
Si je voulais expérimenter à moindre coût, je commencerais par le 7B ou le 8B.
Si je recherchais un bon équilibre entre capacité de raisonnement et marge de manœuvre confortable sur une seule RTX 5090, je testerais le 14B.
Si la qualité du modèle justifiait d'utiliser davantage la VRAM de la carte, j'évaluerais un bon point de contrôle 32B en 4 bits.
Ensuite, je les évaluerais sur le même jeu de tests spécifique à mon application.
Cette dernière étape compte bien plus que le nombre de paramètres.
Il n'y a pas de gagnant universel.
Le modèle 32B est plus performant sur les benchmarks de raisonnement publiés par DeepSeek.
Le modèle 14B est beaucoup plus léger.
Cela confère au 14B des avantages en termes de :
Le modèle 32B offre une plus grande capacité, mais consomme beaucoup plus de ressources sur la même carte.
Si votre application nécessite des capacités de raisonnement ou de codage complexes, testez le modèle 32B.
S'il s'agit d'extraction, de classification, de transformation structurée ou d'une tâche plus spécifique, le modèle 14B pourrait déjà suffire.
Utilisez le plus petit modèle capable de réussir les évaluations qui vous importent.
Il existe une autre comparaison pertinente au sein de la même catégorie de GPU.
DeepSeek-R1-Distill-Qwen-32B est basé sur Qwen2.5-32B et a été entraîné sur des exemples de raisonnement générés par R1.
Qwen3.6-27B est un modèle multimodal 27B plus récent, doté d'une architecture différente et de capacités de raisonnement natives.
Bien que les deux puissent tenir dans une configuration GPU unique similaire après une quantification appropriée, il s'agit de familles de modèles distinctes conçues pour des usages différents.
Nous traitons le cas de Qwen séparément dans notre guide Qwen3.6-27B RTX 5090.
Cela nous permet d'établir une comparaison plus utile que de se baser uniquement sur le nombre de paramètres comme s'il s'agissait d'un classement.
DeepSeek recommande officiellement vLLM ou SGLang pour le déploiement des modèles distillés. Son dépôt de référence présente un déploiement vLLM pour le modèle 32B.
Pour une expérimentation simple sur un seul GPU, commencez par un modèle plus petit.
Par exemple :
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B \
--max-model-len 16384 \
--reasoning-parser deepseek_r1
vLLM prend actuellement en charge un deepseek_r1 analyseur de raisonnement dédié, qui sépare la sortie de raisonnement de la réponse finale du modèle dans son API compatible OpenAI.
Le choix de commencer avec un contexte maximal de 16K est délibéré.
Le modèle peut en supporter davantage, mais chaque jeton de contexte supplémentaire consomme de la mémoire cache. Une fois que le serveur fonctionne sous une charge de travail réaliste, augmentez la limite si l'application en a réellement besoin.
Si vous n'avez jamais utilisé vLLM sur Hivenet, consultez notre guide vLLM.
Le dépôt officiel de DeepSeek-R1 recommande :
Il est judicieux de respecter ces consignes lors de la comparaison des modèles.
Si vous testez un point de contrôle avec ses paramètres recommandés et un autre avec une configuration arbitraire, la comparaison devient en partie un test de votre configuration de service.
DeepSeek note également que les modèles de la famille R1 peuvent parfois contourner leur schéma de réflexion habituel. C'est une raison supplémentaire d'utiliser un moteur de service capable de comprendre les sorties de raisonnement plutôt que d'analyser <think> vous-même les balises.
Ne commencez pas par le maximum simplement parce qu'il est disponible.
Le contexte consomme de la mémoire.
Un point de contrôle quantifié de 32B peut tenir confortablement au démarrage, puis rencontrer des problèmes lorsque vous combinez :
Ceci est particulièrement pertinent pour les modèles de raisonnement, car ils peuvent générer de longues séquences de réflexion interne avant de fournir la réponse finale.
Commencez par le contexte dont votre application a besoin.
Mesurez la VRAM avec des requêtes réalistes.
Augmentez-la ensuite.
Un serveur qui annonce une immense fenêtre de contexte mais qui devient inutilisable sous une charge concurrente n'a pas résolu le problème.
Il n'existe pas de règle de correspondance directe du type « 32 Go de VRAM nécessitent 32 Go de RAM ».
Pour un modèle résidant sur GPU, la RAM système prend principalement en charge :
Si vous utilisez le déchargement sur CPU, la RAM est intégrée au budget mémoire du modèle et les besoins augmentent en conséquence.
Par exemple, tenter de décharger une partie d'un modèle de 70B ou 671B peut consommer des dizaines, voire des centaines de gigaoctets de mémoire hôte.
Cela peut rendre un modèle techniquement exécutable.
Cela ne signifie pas pour autant qu'il offrira les performances d'un déploiement résidant sur GPU.
Considérez le déchargement comme un compromis de performance délibéré plutôt que comme de la VRAM gratuite.
Hivenet propose actuellement le calcul sur RTX 5090 à partir de 0,75 € par heure et par GPU, avec une facturation à la seconde.
Cela fournit une base de référence simple pour le coût du matériel :
Ces chiffres ne prennent pas vous indiquer le coût par jeton.
Un modèle 14B et un modèle 32B fonctionnant pendant une heure sur un GPU consomment la même quantité de temps GPU, mais peuvent traiter un nombre de requêtes très différent durant cette même heure.
Pour l'économie de l'inférence, mesurez :
Calculez ensuite le coût en fonction de la charge de travail.
Un serveur de raisonnement inactif reste un GPU inactif.
Les tarifs actuels sont disponibles sur la page de tarification Hivenet.
Commencez par le plus petit modèle capable d'effectuer la tâche.
Choisissez le 1.5B pour des expérimentations légères, l'éducation ou les environnements où le matériel est très limité.
Choisissez 7B ou 8B lorsque la vitesse, le coût et un matériel modeste importent plus qu'une capacité de raisonnement maximale.
Choisissez 14B lorsque vous souhaitez une amélioration significative du raisonnement tout en conservant une grande flexibilité sur un seul GPU haut de gamme.
Choisissez 32B lorsque des tâches complexes de raisonnement et de codage justifient d'utiliser davantage la mémoire d'une carte de 32 Go.
Choisissez 70B lorsque vos évaluations montrent un avantage suffisant pour justifier une infrastructure à plus haute mémoire ou multi-GPU.
Choisissez R1 complet uniquement si vous disposez réellement de l'infrastructure et de la nécessité opérationnelle d'exécuter un modèle Mixture-of-Experts de 671B.
« Plus gros » n'est pas une stratégie de déploiement.
Cela dépend du modèle DeepSeek-R1 auquel vous faites référence. Les modèles distillés vont de 1,5B à 70B de paramètres, tandis que le DeepSeek-R1 complet compte 671B de paramètres au total. Les besoins en VRAM GPU varient donc de quelques gigaoctets pour les petites versions distillées quantifiées à des centaines de gigaoctets pour le R1 complet.
Ses poids nécessitent environ 28 Go en BF16, 14 Go en 8 bits ou 7 Go en 4 bits. L'inférence réelle nécessite de la VRAM supplémentaire pour le moteur d'exécution, le cache KV, les données de quantification et les requêtes actives.
Un point de contrôle 4 bits adapté peut tenir confortablement dans le budget de poids brut d'un GPU de 16 Go. L'utilisation réelle de la mémoire dépend du format de quantification, de la longueur du contexte et du moteur de service.
Oui. Une RTX 5090 de 32 Go dispose de suffisamment de VRAM pour le modèle distill 14B, la quantification laissant une marge considérable pour le contexte et la gestion du service.
Le poids brut requis est d'environ 64 Go en BF16, 32 Go en 8 bits et 16 Go en 4 bits. Un point de contrôle 4 bits adapté peut donc tenir sur un GPU de 32 Go.
Oui, avec une quantification appropriée. Le format BF16 ne tient pas et le 8 bits ne laisse pratiquement aucune marge de manœuvre. Le 4 bits est la solution pratique pour une carte unique de 32 Go.
En général, non. L'estimation du poids brut en 4 bits est d'environ 35 Go, ce qui dépasse déjà la VRAM de 32 Go de la RTX 5090 avant même de prendre en compte la surcharge liée à l'inférence.
DeepSeek-R1 possède 671 milliards de paramètres au total, dont 37 milliards sont activés pour chaque jeton. Il utilise une architecture de mélange d'experts (Mixture-of-Experts).
Le modèle contient de nombreux réseaux experts, mais son système de routage n'en sélectionne qu'un sous-ensemble pour chaque jeton. L'intégralité des poids doit être stockée quelque part, même si seule une partie du modèle participe au calcul de chaque jeton.
Pas dans le cadre d'un déploiement standard en 4 bits entièrement résident. Huit RTX 5090 offrent 256 Go de VRAM agrégée, alors que les 671 milliards de paramètres nécessitent environ 335,5 Go rien que pour les poids bruts en 4 bits.
Non. Il s'agit de modèles Qwen et Llama plus petits, affinés à l'aide d'échantillons générés par DeepSeek-R1. DeepSeek a publié des versions distillées de 1,5B, 7B, 8B, 14B, 32B et 70B paramètres.
Il n'existe pas de meilleur modèle universel. Un modèle distill 14B laisse plus de mémoire pour le contexte et la concurrence, tandis qu'un modèle 32B en 4 bits offre une plus grande capacité de modèle. Évaluez les deux en fonction de votre tâche réelle.
Oui. DeepSeek fournit un exemple vLLM officiel pour ses modèles distillés, et les versions actuelles de vLLM incluent un deepseek_r1 analyseur de raisonnement.
DeepSeek distribue son code R1 et les poids de ses modèles sous licence MIT, autorisant explicitement l'usage commercial et les œuvres dérivées. Les modèles distillés étant basés sur les architectures Qwen et Llama, il convient également de vérifier les licences de ces modèles sous-jacents lors de la distribution de travaux dérivés.
Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.