
Cette page présente un seul benchmark d'inférence avec Llama 3.1 8B Instruct en BF16. Les résultats s'appliquent au protocole et aux profils de charge indiqués, pas à tous les modèles ni à toutes les charges de travail d'IA.
Nous avons comparé une RTX 4090, une RTX 5090 et une A100 80 Go avec vLLM 0.8.3, des requêtes ShareGPT, un contexte de 8 192 jetons et une sortie de 512 jetons. Le test comprenait un scénario de latence à charge modérée et un scénario de débit à forte charge.
Les résultats mesurés sur un seul GPU sont utiles pour ce protocole. Ils ne désignent pas un vainqueur général pour d'autres modèles, précisions, longueurs de contexte, tâches d'entraînement ou systèmes multi-GPU.
En l'absence de répétitions et de données de variance, le faible écart de débit entre la RTX 5090 et l'A100 doit être lu comme le résultat de cette exécution, et non comme la preuve d'un avantage constant.
La page sur la méthodologie et les règles de publication des benchmarks Hivenet présente les informations attendues dans les rapports plus récents.
| Paramètre | Valeur |
|---|---|
| Longueur du contexte | 8 192 jetons |
| Longueur de sortie | 512 jetons |
| Modèle | meta-llama/Meta-Llama-3.1-8B-Instruct |
| Précision | BF16 |
| Taille de lot | Automatique, selon la mémoire du GPU |
| Jeu de données | ShareGPT |
| Outil de benchmark | vLLM 0.8.3 benchmark_serving.py |
| Attribut | Valeur |
|---|---|
| Taux de requêtes | 1 requête/s |
| Nombre de requêtes de test | 100 |
| Objectif | Mesurer le TTFT moyen et la latence de bout en bout |
| Attribut | Valeur |
|---|---|
| Taux de requêtes | 1 100 requêtes/s |
| Nombre de requêtes de test | 1 500 |
| Objectif | Mesurer le débit de jetons en sortie et les requêtes/s soutenues |
| GPU | ITL moyen (ms) | TPOT moyen (ms) | TTFT moyen (ms) | Latence moyenne de bout en bout (ms) |
|---|---|---|---|---|
| RTX 4090 | 19 | 19 | 349,9 | 9 759,07 |
| RTX 5090 | 12,14 | 12,14 | 45,41 | 6 058,57 |
| A100 80 Go | 13,25 | 13,25 | 296,44 | 7 080,9 |

| GPU | Débit moyen de jetons en sortie (jetons/s) | Requêtes/s soutenues |
|---|---|---|
| RTX 4090 | 737,65 | 1,47 |
| RTX 5090 | 3 802,09 | 7,58 |
| A100 80 Go | 3 748,16 | 7,58 |

Il s'agit d'un benchmark historique, dont les éléments conservés ne comprennent pas toutes les informations exigées par la méthodologie actuelle de Hivenet. Le format exact de l'A100, le processeur hôte et la mémoire système, les versions du pilote NVIDIA et de CUDA, la commande et les options complètes, la date du test, le nombre d'exécutions, la variance ainsi que les erreurs ou le comportement à saturation ne figurent ni dans l'article ni dans le PDF source. Nous n'avons pas comblé ces lacunes par des suppositions.
Le test porte sur un seul modèle 8B en BF16, avec des longueurs de contexte et de sortie fixes. Il n'établit aucun résultat pour les modèles quantifiés, les autres tailles de modèles, l'entraînement, l'ajustement fin, les contextes plus longs, d'autres paramètres de mise en lot ou de concurrence, ni le passage à plusieurs GPU.
Pour ce protocole d'inférence Llama 3.1 8B en BF16, la RTX 5090 a enregistré un TTFT nettement inférieur à celui de l'A100 et un débit proche à forte charge. La RTX 4090 était plus lente dans les deux scénarios enregistrés. Le choix du matériel dépend toujours de la capacité mémoire, des fonctions de fiabilité, de la compatibilité logicielle, de la concurrence et de la charge réelle.
Pour comprendre plus largement les usages et les limites de la RTX 4090, consultez le guide RTX 4090 pour l'IA. Pour connaître les tarifs et la disponibilité actuels, consultez la page Tarifs de Hivenet et confirmez le preset actif dans la console Compute.
Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.