GPU cloud
Des performances A100 pour le prix d'une 4090. Facturation à la seconde. Sans files d'attente. Sans frais de sortie.


Benchmark à GPU unique sur l'infrastructure Hivenet :
TTFT : 349,9 ms à 1 reque/s (base de référence pour une seule demande).
Débit maximal : 737 jetons/stout en délivrant 737 jetons/s dans des conditions de charge maintenue.¹
¹ Méthodologie de référence et conditions de test ici.
Spécification
Valeur
Pourquoi c'est important
Architecture
Ada Lovelace
Processus de fabrication 4 nm — efficace sous une charge lourde et soutenue
Mémoire
24 Go GDDR6X
Prend en charge Llama-3 70B (quantification 4 bits) sur une seule carte
Bande passante
1 008 Go/s
Évite les blocages de tenseurs lors de l'inférence par lots importants
Débit FP16
165 TFLOPS
Marge de manœuvre pour les modèles de diffusion à 1024×1024
TDP
450 W
Inférieur à un A100 40 Go avec un débit d'inférence équivalent
Démarrez une course QLoRa en moins de 60 secondes. Faites une pause et reprenez à tout moment, sans frais pour les périodes d'inactivité.
24 Go de VRAM prennent en charge 14 Go de cache KV avec une précision maximale. Aucune quantification n'est requise pour la plupart des modèles de diffusion à 1024 × 1024.
L'inférence reste dans votre compte. Aucun journal d'API tiers.
La bande passante mémoire de 1 008 Go/s gère les images 4K sans blocages d'E/S.
1 × - 8 ×
vCPU - - - Go
RAM - - - Go
Espace disque - - - Go
Bande passante - Mb/s
Inférence de moins de 13 milliards de paramètres, affinage, génération d'images, travail GPU rentable
Facturation à la seconde. Pas de frais de sortie. Stockage inclus.
Joignez-nous à support@hivenet.com ou via le chat intégré à l'application.