← Blog
Comparaison de benchmark entre RTX 4090, RTX 5090 et A100
August 4, 2025

RTX 4090, RTX 5090 et A100 : un benchmark d’inférence avec Llama 3.1 8B

Cette page présente un seul benchmark d'inférence avec Llama 3.1 8B Instruct en BF16. Les résultats s'appliquent au protocole et aux profils de charge indiqués, pas à tous les modèles ni à toutes les charges de travail d'IA.

Nous avons comparé une RTX 4090, une RTX 5090 et une A100 80 Go avec vLLM 0.8.3, des requêtes ShareGPT, un contexte de 8 192 jetons et une sortie de 512 jetons. Le test comprenait un scénario de latence à charge modérée et un scénario de débit à forte charge.

Les résultats mesurés sur un seul GPU sont utiles pour ce protocole. Ils ne désignent pas un vainqueur général pour d'autres modèles, précisions, longueurs de contexte, tâches d'entraînement ou systèmes multi-GPU.

La version courte

  • À 1 requête/s, la RTX 5090 a enregistré une latence inférieure à celle de l'A100 80 Go. Le temps moyen jusqu'au premier jeton était de 45,41 ms sur la RTX 5090 et de 296,44 ms sur l'A100. La latence moyenne de bout en bout était respectivement de 6 058,57 ms et de 7 080,9 ms.
  • À forte charge, la RTX 5090 et l'A100 ont enregistré des débits de jetons en sortie proches. La RTX 5090 a atteint 3 802,09 jetons/s et l'A100 3 748,16 jetons/s, soit un écart d'environ 1,4 % lors de cette exécution. Le tableau source indique 7,58 requêtes/s soutenues pour les deux cartes.
  • La RTX 4090 était derrière les deux autres cartes dans ce protocole. Elle a atteint 737,65 jetons/s et 1,47 requête/s soutenue lors du test à forte charge.
  • Aucun résultat avec deux RTX 5090 n'a été mesuré. L'ancien chiffre de 7 604 jetons/s provenait d'une extrapolation linéaire du résultat mono-GPU et a été retiré.

En l'absence de répétitions et de données de variance, le faible écart de débit entre la RTX 5090 et l'A100 doit être lu comme le résultat de cette exécution, et non comme la preuve d'un avantage constant.

Objectif du benchmark

  • Comparer la latence et le débit de jetons en sortie des trois GPU enregistrés.
  • Présenter les résultats mono-GPU mesurés sans les étendre à des modèles ou configurations multi-GPU non testés.
  • Donner suffisamment d'informations pour évaluer la pertinence du résultat pour une charge d'inférence donnée.

La page sur la méthodologie et les règles de publication des benchmarks Hivenet présente les informations attendues dans les rapports plus récents.

Configuration statique

ParamètreValeur
Longueur du contexte8 192 jetons
Longueur de sortie512 jetons
Modèlemeta-llama/Meta-Llama-3.1-8B-Instruct
PrécisionBF16
Taille de lotAutomatique, selon la mémoire du GPU
Jeu de donnéesShareGPT
Outil de benchmarkvLLM 0.8.3 benchmark_serving.py

Scénarios de test

1. Charge modérée : latence

AttributValeur
Taux de requêtes1 requête/s
Nombre de requêtes de test100
ObjectifMesurer le TTFT moyen et la latence de bout en bout

2. Forte charge : débit

AttributValeur
Taux de requêtes1 100 requêtes/s
Nombre de requêtes de test1 500
ObjectifMesurer le débit de jetons en sortie et les requêtes/s soutenues

Résultats et analyse

Scénario 1 : latence à 1 requête/s

GPUITL moyen (ms)TPOT moyen (ms)TTFT moyen (ms)Latence moyenne de bout en bout (ms)
RTX 40901919349,99 759,07
RTX 509012,1412,1445,416 058,57
A100 80 Go13,2513,25296,447 080,9
Résultats de latence des RTX 4090, RTX 5090 et A100 80 Go à une requête par seconde
  • La RTX 5090 a enregistré un TTFT moyen de 45,41 ms, contre 296,44 ms pour l'A100 80 Go et 349,9 ms pour la RTX 4090.
  • La latence moyenne de bout en bout était de 6 058,57 ms sur la RTX 5090, 7 080,9 ms sur l'A100 et 9 759,07 ms sur la RTX 4090.
  • Ces valeurs décrivent ce modèle, cette forme de requête, cette version du logiciel et cette charge. Elles ne doivent pas être généralisées à d'autres tâches d'inférence ou d'entraînement.

Scénario 2 : débit à 1 100 requêtes/s

GPUDébit moyen de jetons en sortie (jetons/s)Requêtes/s soutenues
RTX 4090737,651,47
RTX 50903 802,097,58
A100 80 Go3 748,167,58
Débit de jetons en sortie des RTX 4090, RTX 5090 et A100 80 Go à forte charge
  • La RTX 5090 a enregistré 3 802,09 jetons en sortie par seconde, contre 3 748,16 pour l'A100.
  • Le tableau source indique 7,58 requêtes/s soutenues pour la RTX 5090 et l'A100.
  • La RTX 4090 a enregistré 737,65 jetons en sortie par seconde et 1,47 requête/s soutenue.

Limites

Il s'agit d'un benchmark historique, dont les éléments conservés ne comprennent pas toutes les informations exigées par la méthodologie actuelle de Hivenet. Le format exact de l'A100, le processeur hôte et la mémoire système, les versions du pilote NVIDIA et de CUDA, la commande et les options complètes, la date du test, le nombre d'exécutions, la variance ainsi que les erreurs ou le comportement à saturation ne figurent ni dans l'article ni dans le PDF source. Nous n'avons pas comblé ces lacunes par des suppositions.

Le test porte sur un seul modèle 8B en BF16, avec des longueurs de contexte et de sortie fixes. Il n'établit aucun résultat pour les modèles quantifiés, les autres tailles de modèles, l'entraînement, l'ajustement fin, les contextes plus longs, d'autres paramètres de mise en lot ou de concurrence, ni le passage à plusieurs GPU.

Ce que cela signifie pour vous

Pour ce protocole d'inférence Llama 3.1 8B en BF16, la RTX 5090 a enregistré un TTFT nettement inférieur à celui de l'A100 et un débit proche à forte charge. La RTX 4090 était plus lente dans les deux scénarios enregistrés. Le choix du matériel dépend toujours de la capacité mémoire, des fonctions de fiabilité, de la compatibilité logicielle, de la concurrence et de la charge réelle.

Pour comprendre plus largement les usages et les limites de la RTX 4090, consultez le guide RTX 4090 pour l'IA. Pour connaître les tarifs et la disponibilité actuels, consultez la page Tarifs de Hivenet et confirmez le preset actif dans la console Compute.

Your next workload belongs on Hivenet.

Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.

Shader gradient background