
Compute - API d’inférence
Déployez l’inférence en production sans gérer vous-même la couche de service. L’API d’inférence Hivenet vous fournit un endpoint compatible OpenAI, une capacité de répliques dédiée et un déploiement régional sur l’infrastructure Hivenet.
API compatible OpenAI
Endpoints dédiés
1 à 4 répliques
Tarification par réplique
Facturation à la seconde
Déploiement régional
Qwen · Llama · Mistral · Falcon · GPT OSS · Gemma
Gérer vous-même l’inférence vous donne le contrôle, mais oblige aussi votre équipe à gérer les GPU, les moteurs de service, le routage, l’authentification, la supervision et la capacité. Les API de modèles gérées enlèvent une grande partie de ce travail, mais donnent souvent moins de contrôle sur l’emplacement de l’infrastructure et sur la manière dont vous payez les charges soutenues.
L’API d’inférence Hivenet se situe entre ces deux approches.
Choisissez un modèle et la capacité dont vous avez besoin. Hivenet gère l’infrastructure, le routeur, l’environnement de service, l’endpoint et la couche opérationnelle qui les sous-tend.
Utilisez un endpoint compatible OpenAI avec les schémas clients habituels. Pointez votre application vers l’URL de base Hivenet, authentifiez-vous avec une clé API et appelez le modèle.
Payez la capacité de réplique derrière l’endpoint plutôt qu’un compteur distinct pour chaque jeton entrant et sortant. Le temps d’exécution est facturé à la seconde.
L’API d’inférence Hivenet s’adresse aux équipes qui veulent utiliser des modèles à poids ouverts en production sans devenir responsables de l’infrastructure qui les sert.
Utilisez une capacité dédiée pour les charges dont le volume de requêtes est assez soutenu pour justifier la réservation de l’endpoint.
Déplacez les charges de production adaptées depuis des API facturées au jeton vers une tarification adossée à l’infrastructure, visible avant le déploiement.
Choisissez parmi les emplacements de déploiement disponibles et gardez l’endpoint lié à l’emplacement d’infrastructure sélectionné.
Conservez les schémas de requête familiers de l’OpenAI SDK et d’autres clients compatibles, sans reconstruire l’application autour d’une autre API propriétaire.
Utilisez l’API d’inférence Hivenet lorsque vous voulez l’endpoint. Utilisez Compute avec Hivenet lorsque vous voulez la machine et un contrôle total sur l’environnement d’exécution. Utilisez Hivenet Router lorsque vous voulez exploiter vous-même la couche de routage.
Besoin
Solution
Pourquoi
Je veux un endpoint compatible OpenAI
API d’inférence Hivenet
Hivenet gère la couche de service et l’endpoint
Je veux une capacité d’inférence dédiée et prévisible
API d’inférence Hivenet
Choisissez la capacité en répliques et payez son temps d’exécution
Je veux exécuter moi-même vLLM, SGLang, llama.cpp, PyTorch, des modèles personnalisés ou du fine-tuning
Location de GPU/CPU avec Hivenet
Vous contrôlez l’instance, l’environnement d’exécution et la pile logicielle
Je veux router entre des moteurs d’inférence que j’exploite moi-même
Hivenet Router
Vous exploitez la couche de routage open source et contrôlez ses règles
J’ai besoin d’un système d’IA personnalisé pour des données sensibles ou des contraintes de déploiement inhabituelles
Private AI
Hivenet peut vous aider à cadrer le modèle, les données, l’infrastructure et le niveau d’accompagnement
Les modèles à poids ouverts peuvent prendre en charge de nombreuses tâches de production lorsque le modèle est adapté à la charge et testé sur des données réelles.
Prenez en charge des workflows de génération augmentée par récupération pour les connaissances internes, le support client, la documentation et les données métier.
Extrayez des dates, des entités, des catégories et des champs structurés à partir de documents, messages, tickets, factures ou enregistrements.
Résumez des documents, des conversations, des fils de support, des travaux de recherche et du contenu opérationnel.
Classez les messages, enregistrements, tickets, documents et entrées de workflow via un endpoint dédié.
Exécutez des workflows liés au code lorsque le modèle disponible répond à vos exigences de qualité, de contexte, de latence et de coût.
Créez des assistants, des automatisations et des fonctions d’IA internes sans exploiter la pile d’inférence qui les sous-tend.
L’API d’inférence est disponible dans la console Compute de Hivenet. Choisissez le déploiement dont vous avez besoin ; Hivenet gère l’environnement de service qui le sous-tend.
Sélectionnez l’un des emplacements de déploiement actuellement disponibles pour votre charge.
Choisissez un modèle dans le catalogue géré, puis la variante disponible qui correspond à vos besoins de contexte, de qualité, de performance et de coût.
La variante détermine la configuration de service sous-jacente. Vous n’avez pas à configurer vous-même le GPU, la précision ou le moteur de service.
Choisissez entre 1 et 4 répliques, selon la capacité disponible.
La console affiche le débit attendu et le prix à mesure que vous ajustez le déploiement.
Nommez l’endpoint et vérifiez le modèle, l’emplacement, le nombre de répliques, le tarif horaire et le coût estimé avant de le démarrer.
Générez une clé API pour votre organisation et utilisez l’URL de déploiement avec un client compatible OpenAI.
L’endpoint expose les choix opérationnels importants au lieu de les masquer derrière un forfait API générique.
Définissez le nombre de répliques au déploiement et modifiez-le ensuite sans reconstruire l’endpoint.
Le temps d’exécution des répliques est mesuré à la seconde au lieu d’être arrondi dans un engagement mensuel.
Utilisez des clients et des schémas de requête compatibles OpenAI avec l’endpoint Hivenet.
Vos déploiements partagent un routeur propre à votre compte, plutôt qu’un routeur unique partagé avec des clients sans lien avec vous.
Arrêtez la capacité lorsque vous n’en avez pas besoin, redémarrez-la plus tard ou supprimez le déploiement lorsque la charge est terminée.
L’API d’inférence Hivenet part d’un catalogue géré plutôt que d’une machine GPU vide. Les modèles, variantes et emplacements exacts dépendent de la disponibilité et de leur état de validation par benchmark.
Famille de modèles
Bon point de départ pour
À évaluer
Qwen
Extraction, RAG, sorties structurées, charges multilingues
Contexte, qualité, débit, sorties structurées
Llama
RAG, résumé, assistants, outils internes
Contexte, latence, prise en charge des outils, adéquation à la charge
Mistral
Suivi d’instructions, résumé, outils
Contexte, débit, prise en charge des outils
Falcon
Inférence généraliste efficace
Taille du modèle, débit, adéquation à la charge
GPT OSS
Charges généralistes d’instructions et de raisonnement
Qualité, taille du modèle, latence
Gemma
Charges sur modèles compacts et expérimentation
Taille du modèle, qualité, débit
Qwen constitue un bon point de départ pour les équipes qui testent l’extraction structurée, le RAG et l’automatisation de workflows de production.
Exécutez des familles de modèles largement adoptées pour le RAG, le résumé, les outils internes et les expériences de service de modèles.
Le catalogue géré est le point de départ de l’API d’inférence.
Si vous avez besoin de poids personnalisés, de modèles fine-tunés ou d’un contrôle direct sur l’environnement de service, utilisez Compute avec Hivenet ou contactez Hivenet pour un déploiement personnalisé.
L’API d’inférence Hivenet utilise une tarification par réplique facturée à la seconde. Vous payez la capacité d’inférence provisionnée pendant son exécution, plutôt que chaque jeton généré séparément.
La variante du modèle détermine la configuration d’infrastructure et le tarif derrière chaque réplique.
Payez le temps d’exécution réel des répliques. Arrêtez le déploiement lorsque vous n’avez plus besoin de la capacité ; la facturation s’interrompt une fois l’arrêt terminé.
Les jetons d’entrée et de sortie sont inclus dans le tarif de l’endpoint dédié pour le produit actuel.
Le modèle tarifaire actuel des endpoints dédiés ne facture pas séparément les appels API ni le trafic sortant.
Niveau
Exemple d’usage
Prix
1 × RTX 5090
Modèles plus petits et variantes tenant sur un seul GPU
à partir de 1,10 €/h
2 × RTX 5090
Variantes de production nécessitant plus de mémoire ou de débit
à partir de 2,10 €/h
4 × RTX 5090
Variantes de modèles plus grandes ou à capacité supérieure
à partir de 3,80 €/h
L’API d’inférence Hivenet fonctionne sur une infrastructure exploitée par Hivenet et adossée à Policloud. L’emplacement du déploiement reste une caractéristique du produit au lieu de disparaître derrière un endpoint API abstrait.
Choisissez un emplacement disponible pour votre premier déploiement Inference. Les déploiements suivants héritent actuellement de cet emplacement.
Un routeur par client isole le chemin de routage du trafic d’autres clients et le rend plus simple à comprendre sur le plan opérationnel.
Hivenet exploite le routeur, l’environnement d’exécution du service, l’infrastructure de l’endpoint, la couche d’authentification, la supervision et la facturation derrière le service géré.
Exécutez l’inférence sur un chemin adossé à Policloud au lieu de faire passer toute votre IA de production par les API standard des hyperscalers.
Les performances d’inférence dépendent du modèle, de la variante, du contexte, de la forme des requêtes, de la longueur des sorties, du nombre de répliques et du profil de trafic. Un benchmark n’est utile que si ces conditions sont visibles.
Les résultats de benchmark Hivenet doivent indiquer le modèle, la variante, la configuration matérielle, le taux de requêtes et les conditions de charge derrière le résultat.
Testez le modèle avec vos entrées réelles, les sorties attendues, vos exigences de qualité, votre cible de latence et votre trafic avant de déplacer le volume de production.
Suivez les requêtes, les jetons, la latence, les erreurs, le coût et le délai jusqu’au premier jeton lorsque ces métriques sont disponibles.
L’API d’inférence Hivenet utilise une API compatible OpenAI, ce qui permet généralement de conserver le même schéma client et de ne modifier que la configuration de l’endpoint.
Chaque déploiement possède sa propre URL d’endpoint. Utilisez-la comme base_url du client.
Créez une clé API Hivenet Inference et utilisez-la pour authentifier les appels vers les endpoints de votre organisation.
Indiquez dans la requête le nom du modèle servi au lieu de vous appuyer sur une valeur par défaut générique.
# Utilisez le client OpenAI, pointé vers Hivenet
from openai import OpenAI
client = OpenAI(
api_key="HIVENET_API_KEY",
base_url="https://api.hivenet.example/v1"
)
response = client.chat.completions.create(
model="qwen-example",
messages=[{"role": "user", "content": "Summarize this document."}]
)
L’API d’inférence Hivenet est conçue pour les charges de production où la capacité dédiée, le choix du modèle, la visibilité des coûts et l’emplacement de l’infrastructure comptent.
Un client spécialisé dans l’automatisation métier utilise un endpoint Qwen dédié pour une partie d’un workflow d’extraction en production.
La bonne question n’est pas de savoir si un modèle ouvert peut remplacer chaque appel API. Elle est de savoir si un modèle testé peut traiter assez bien une charge de production précise pour déplacer ce trafic vers une capacité dédiée.
Les endpoints dédiés ont le plus de sens lorsqu’une équipe dispose déjà d’un trafic de production et peut identifier des charges dont la demande est suffisamment prévisible.
Les expériences variables et les petites charges sporadiques peuvent être mieux adaptées à une autre solution d’infrastructure.
L’API d’inférence Hivenet est la solution avec endpoint géré. Si vous voulez exploiter davantage de la pile vous-même, ou si vous avez besoin d’une autre configuration de données et d’infrastructure, choisissez le produit Hivenet adapté au besoin.

Louez des instances RTX 5090 ou vCPU lorsque votre équipe veut un contrôle total sur l’instance, le framework et la pile de service.

Travaillez avec Hivenet sur des projets d’IA accompagnés impliquant des données sensibles, le choix du modèle, un support au déploiement ou des besoins personnalisés.

Créez des systèmes de recherche sur vos propres données en utilisant les solutions IA et de stockage de Hivenet.

Stockez des jeux de données, des documents et des artefacts de pipeline IA avec des outils compatibles S3 et sans frais de trafic sortant.
FAQ
Apportez votre usage actuel des API, vos besoins en modèles, votre cible de latence, vos exigences régionales et votre niveau de qualité attendu. Nous vous aiderons à déterminer si un endpoint géré pour modèle fondamental est la bonne solution.