Inférence avec calcul

Exécutez l'inférence GPU sans les frais habituels

Lancez des charges de travail d'inférence sur des instances RTX 4090 et RTX 5090, démarrez rapidement avec le vLLM géré et ne payez que pour le temps que vous utilisez.

Essayez Compute

Pourquoi les équipes choisissent Compute pour l'inférence

Inférence gérée avec vLLM

Commencez à diffuser en quelques minutes avec un modèle vLLM géré au lieu de créer toute la couche de service à partir de zéro.

Tarification simple

Utilisez la facturation à la seconde sans frais de sortie distincts et une tarification qui inclut déjà le calcul, le stockage et le volume du réseau.

Mise en réseau flexible

Exposez les ports dont votre service a besoin et exécutez-le en HTTPS, TCP ou UDP.

Options de déploiement régional

Exécutez les charges de travail plus près de l'endroit où vos utilisateurs et vos systèmes fonctionnent lorsque les choix en matière de latence et de déploiement sont importants.

Comment ça marche

1

Choisissez le niveau 4090 ou 5090 qui correspond à votre modèle et à votre profil de trafic.

2

Lancez à partir d'une image PyTorch ou vLLM propre et commencez par une configuration qui correspond déjà à la tâche.

3

Activez HTTPS, TCP ou UDP et dirigez votre application vers le terminal dont elle a besoin.

4

Transformez votre configuration en un modèle personnalisé pour que le prochain lancement soit moins fastidieux.

Ce que les gens utilisent sur Compute

L'IA conversationnelle pour le soutien et le tutorat

Terminaux LLM adaptés aux applications et aux API

Modèles vocaux pour la transcription ou les sous-titres en temps réel

Les prix en un coup d'œil

Les charges de travail d'inférence restent souvent inactives pendant de longues périodes, ce qui fait que le modèle de tarification est aussi important que la vitesse brute du GPU. Compute simplifie les choses grâce à la facturation à la seconde et à la tarification groupée.

RTX 5090

- à - /h

1 × - 8 ×

vCPU - - - Go

RAM - - - Go

Espace disque - - - Go

Bande passante - Mb/s

Inférence inférieure à 30B, tâches GPU exigeantes, performances GPU uniques les plus élevées sur Compute

RTX 4090

- - - /h

1 × - 8 ×

vCPU - - - Go

RAM - - - Go

Espace disque - - - Go

Bande passante - Mb/s

Inférence inférieure à 13B, réglage fin, génération d'images, travail GPU rentable

Essayez Compute

FAQ

Questions que les équipes se posent habituellement

Start self-serve, go deeper when needed

Try Compute directly if you want to test inference pricing, setup, and workflow fit for yourself. Talk to sales if your team needs regional planning, larger deployments, or a more structured rollout. The docs are there when you want to move faster.

Shader gradient background