Compute - API d’inférence

Exécutez des modèles à poids ouverts via des endpoints dédiés et gérés.

Déployez l’inférence en production sans gérer vous-même la couche de service. L’API d’inférence Hivenet vous fournit un endpoint compatible OpenAI, une capacité de répliques dédiée et un déploiement régional sur l’infrastructure Hivenet.

API compatible OpenAI

Endpoints dédiés

1 à 4 répliques

Tarification par réplique

Facturation à la seconde

Déploiement régional

Qwen · Llama · Mistral · Falcon · GPT OSS · Gemma

Une inférence gérée, avec une capacité dédiée et une API familière.

Gérer vous-même l’inférence vous donne le contrôle, mais oblige aussi votre équipe à gérer les GPU, les moteurs de service, le routage, l’authentification, la supervision et la capacité. Les API de modèles gérées enlèvent une grande partie de ce travail, mais donnent souvent moins de contrôle sur l’emplacement de l’infrastructure et sur la manière dont vous payez les charges soutenues.

L’API d’inférence Hivenet se situe entre ces deux approches.

Hivenet gère la couche de service.

Choisissez un modèle et la capacité dont vous avez besoin. Hivenet gère l’infrastructure, le routeur, l’environnement de service, l’endpoint et la couche opérationnelle qui les sous-tend.

L’API reste familière.

Utilisez un endpoint compatible OpenAI avec les schémas clients habituels. Pointez votre application vers l’URL de base Hivenet, authentifiez-vous avec une clé API et appelez le modèle.

Le coût suit la capacité dédiée.

Payez la capacité de réplique derrière l’endpoint plutôt qu’un compteur distinct pour chaque jeton entrant et sortant. Le temps d’exécution est facturé à la seconde.

Pour les équipes qui exécutent de l’inférence en production à volume soutenu.

L’API d’inférence Hivenet s’adresse aux équipes qui veulent utiliser des modèles à poids ouverts en production sans devenir responsables de l’infrastructure qui les sert.

Équipes de production avec un trafic d’inférence régulier

Utilisez une capacité dédiée pour les charges dont le volume de requêtes est assez soutenu pour justifier la réservation de l’endpoint.

PME dont la facture IA augmente

Déplacez les charges de production adaptées depuis des API facturées au jeton vers une tarification adossée à l’infrastructure, visible avant le déploiement.

Équipes avec des exigences de résidence des données

Choisissez parmi les emplacements de déploiement disponibles et gardez l’endpoint lié à l’emplacement d’infrastructure sélectionné.

Développeurs utilisant des outils compatibles OpenAI

Conservez les schémas de requête familiers de l’OpenAI SDK et d’autres clients compatibles, sans reconstruire l’application autour d’une autre API propriétaire.

Endpoint géré ou instance de calcul ?

Utilisez l’API d’inférence Hivenet lorsque vous voulez l’endpoint. Utilisez Compute avec Hivenet lorsque vous voulez la machine et un contrôle total sur l’environnement d’exécution. Utilisez Hivenet Router lorsque vous voulez exploiter vous-même la couche de routage.

Besoin

Solution

Pourquoi

Je veux un endpoint compatible OpenAI

API d’inférence Hivenet

Hivenet gère la couche de service et l’endpoint

Je veux une capacité d’inférence dédiée et prévisible

API d’inférence Hivenet

Choisissez la capacité en répliques et payez son temps d’exécution

Je veux exécuter moi-même vLLM, SGLang, llama.cpp, PyTorch, des modèles personnalisés ou du fine-tuning

Location de GPU/CPU avec Hivenet

Vous contrôlez l’instance, l’environnement d’exécution et la pile logicielle

Je veux router entre des moteurs d’inférence que j’exploite moi-même

Hivenet Router

Vous exploitez la couche de routage open source et contrôlez ses règles

J’ai besoin d’un système d’IA personnalisé pour des données sensibles ou des contraintes de déploiement inhabituelles

Private AI

Hivenet peut vous aider à cadrer le modèle, les données, l’infrastructure et le niveau d’accompagnement

Faites glisser vers la gauche pour en voir plus

Découvrez nos produits

Conçu pour les charges de travail d’IA que les équipes exécutent réellement.

Les modèles à poids ouverts peuvent prendre en charge de nombreuses tâches de production lorsque le modèle est adapté à la charge et testé sur des données réelles.

RAG

Prenez en charge des workflows de génération augmentée par récupération pour les connaissances internes, le support client, la documentation et les données métier.

Extraction structurée

Extrayez des dates, des entités, des catégories et des champs structurés à partir de documents, messages, tickets, factures ou enregistrements.

Résumé

Résumez des documents, des conversations, des fils de support, des travaux de recherche et du contenu opérationnel.

Classification

Classez les messages, enregistrements, tickets, documents et entrées de workflow via un endpoint dédié.

Assistance au code

Exécutez des workflows liés au code lorsque le modèle disponible répond à vos exigences de qualité, de contexte, de latence et de coût.

Outils internes

Créez des assistants, des automatisations et des fonctions d’IA internes sans exploiter la pile d’inférence qui les sous-tend.

Du modèle à l’endpoint en quelques étapes.

L’API d’inférence est disponible dans la console Compute de Hivenet. Choisissez le déploiement dont vous avez besoin ; Hivenet gère l’environnement de service qui le sous-tend.

1

Choisir un emplacement

Sélectionnez l’un des emplacements de déploiement actuellement disponibles pour votre charge.

2

Choisir un modèle et une variante

Choisissez un modèle dans le catalogue géré, puis la variante disponible qui correspond à vos besoins de contexte, de qualité, de performance et de coût.

La variante détermine la configuration de service sous-jacente. Vous n’avez pas à configurer vous-même le GPU, la précision ou le moteur de service.

3

Définir la capacité en répliques

Choisissez entre 1 et 4 répliques, selon la capacité disponible.

La console affiche le débit attendu et le prix à mesure que vous ajustez le déploiement.

4

Vérifier et déployer

Nommez l’endpoint et vérifiez le modèle, l’emplacement, le nombre de répliques, le tarif horaire et le coût estimé avant de le démarrer.

5

Créer une clé et se connecter

Générez une clé API pour votre organisation et utilisez l’URL de déploiement avec un client compatible OpenAI.

Des contrôles clairs pour votre endpoint dédié.

L’endpoint expose les choix opérationnels importants au lieu de les masquer derrière un forfait API générique.

Capacité

1 à 4 répliques

Définissez le nombre de répliques au déploiement et modifiez-le ensuite sans reconstruire l’endpoint.

Facturation

À la seconde

Le temps d’exécution des répliques est mesuré à la seconde au lieu d’être arrondi dans un engagement mensuel.

Intégration

Compatible OpenAI

Utilisez des clients et des schémas de requête compatibles OpenAI avec l’endpoint Hivenet.

Routage

Un routeur par client

Vos déploiements partagent un routeur propre à votre compte, plutôt qu’un routeur unique partagé avec des clients sans lien avec vous.

Cycle de vie

Démarrer · arrêter · supprimer

Arrêtez la capacité lorsque vous n’en avez pas besoin, redémarrez-la plus tard ou supprimez le déploiement lorsque la charge est terminée.

Un catalogue de modèles sélectionnés pour les charges de production.

L’API d’inférence Hivenet part d’un catalogue géré plutôt que d’une machine GPU vide. Les modèles, variantes et emplacements exacts dépendent de la disponibilité et de leur état de validation par benchmark.

Famille de modèles

Bon point de départ pour

À évaluer

Qwen

Extraction, RAG, sorties structurées, charges multilingues

Contexte, qualité, débit, sorties structurées

Llama

RAG, résumé, assistants, outils internes

Contexte, latence, prise en charge des outils, adéquation à la charge

Mistral

Suivi d’instructions, résumé, outils

Contexte, débit, prise en charge des outils

Falcon

Inférence généraliste efficace

Taille du modèle, débit, adéquation à la charge

GPT OSS

Charges généralistes d’instructions et de raisonnement

Qualité, taille du modèle, latence

Gemma

Charges sur modèles compacts et expérimentation

Taille du modèle, qualité, débit

Faites glisser vers la gauche pour en voir plus

Qwen pour l’extraction et le RAG en production

Qwen constitue un bon point de départ pour les équipes qui testent l’extraction structurée, le RAG et l’automatisation de workflows de production.

Charges Llama et Mistral

Exécutez des familles de modèles largement adoptées pour le RAG, le résumé, les outils internes et les expériences de service de modèles.

Besoin de vos propres poids ?

Le catalogue géré est le point de départ de l’API d’inférence.

Si vous avez besoin de poids personnalisés, de modèles fine-tunés ou d’un contrôle direct sur l’environnement de service, utilisez Compute avec Hivenet ou contactez Hivenet pour un déploiement personnalisé.

Une tarification prévisible pour des endpoints dédiés.

L’API d’inférence Hivenet utilise une tarification par réplique facturée à la seconde. Vous payez la capacité d’inférence provisionnée pendant son exécution, plutôt que chaque jeton généré séparément.

Tarification par réplique

La variante du modèle détermine la configuration d’infrastructure et le tarif derrière chaque réplique.

Facturation à la seconde

Payez le temps d’exécution réel des répliques. Arrêtez le déploiement lorsque vous n’avez plus besoin de la capacité ; la facturation s’interrompt une fois l’arrêt terminé.

Jetons inclus

Les jetons d’entrée et de sortie sont inclus dans le tarif de l’endpoint dédié pour le produit actuel.

Appels API et trafic sortant inclus

Le modèle tarifaire actuel des endpoints dédiés ne facture pas séparément les appels API ni le trafic sortant.

Niveau

Exemple d’usage

Prix

1 × RTX 5090

Modèles plus petits et variantes tenant sur un seul GPU

à partir de 1,10 €/h

2 × RTX 5090

Variantes de production nécessitant plus de mémoire ou de débit

à partir de 2,10 €/h

4 × RTX 5090

Variantes de modèles plus grandes ou à capacité supérieure

à partir de 3,80 €/h

Faites glisser vers la gauche pour en voir plus

Parler tarifs avec l’équipe commerciale

Une infrastructure régionale pour des endpoints d’IA dédiés.

L’API d’inférence Hivenet fonctionne sur une infrastructure exploitée par Hivenet et adossée à Policloud. L’emplacement du déploiement reste une caractéristique du produit au lieu de disparaître derrière un endpoint API abstrait.

Un emplacement dans la version actuelle

Choisissez un emplacement disponible pour votre premier déploiement Inference. Les déploiements suivants héritent actuellement de cet emplacement.

Routage mono-client

Un routeur par client isole le chemin de routage du trafic d’autres clients et le rend plus simple à comprendre sur le plan opérationnel.

Exploitation de bout en bout

Hivenet exploite le routeur, l’environnement d’exécution du service, l’infrastructure de l’endpoint, la couche d’authentification, la supervision et la facturation derrière le service géré.

Policloud logotype

Nous possédons le matériel

Exécutez l’inférence sur un chemin adossé à Policloud au lieu de faire passer toute votre IA de production par les API standard des hyperscalers.

Testez la qualité et le débit sur votre charge réelle.

Les performances d’inférence dépendent du modèle, de la variante, du contexte, de la forme des requêtes, de la longueur des sorties, du nombre de répliques et du profil de trafic. Un benchmark n’est utile que si ces conditions sont visibles.

Benchmarks contextualisés

Voyez ce qui a réellement été testé

Les résultats de benchmark Hivenet doivent indiquer le modèle, la variante, la configuration matérielle, le taux de requêtes et les conditions de charge derrière le résultat.

Évaluation du modèle

Vos prompts déterminent l’adéquation

Testez le modèle avec vos entrées réelles, les sorties attendues, vos exigences de qualité, votre cible de latence et votre trafic avant de déplacer le volume de production.

Métriques de l’endpoint

Surveillez les signaux qui comptent

Suivez les requêtes, les jetons, la latence, les erreurs, le coût et le délai jusqu’au premier jeton lorsque ces métriques sont disponibles.

Gardez un code client familier.

L’API d’inférence Hivenet utilise une API compatible OpenAI, ce qui permet généralement de conserver le même schéma client et de ne modifier que la configuration de l’endpoint.

Pointez le client vers votre déploiement

Chaque déploiement possède sa propre URL d’endpoint. Utilisez-la comme base_url du client.

Utilisez une clé API d’organisation

Créez une clé API Hivenet Inference et utilisez-la pour authentifier les appels vers les endpoints de votre organisation.

Envoyez le modèle réellement déployé

Indiquez dans la requête le nom du modèle servi au lieu de vous appuyer sur une valeur par défaut générique.

# Utilisez le client OpenAI, pointé vers Hivenet
from openai import OpenAI

client = OpenAI(
   api_key="HIVENET_API_KEY",
   base_url="https://api.hivenet.example/v1"
)

response = client.chat.completions.create(
   model="qwen-example",
   messages=[{"role": "user", "content": "Summarize this document."}]
)

Conçue autour de besoins de production réels.

L’API d’inférence Hivenet est conçue pour les charges de production où la capacité dédiée, le choix du modèle, la visibilité des coûts et l’emplacement de l’infrastructure comptent.

Charge de production

Automatisation documentaire à fort volume

Un client spécialisé dans l’automatisation métier utilise un endpoint Qwen dédié pour une partie d’un workflow d’extraction en production.

La bonne question n’est pas de savoir si un modèle ouvert peut remplacer chaque appel API. Elle est de savoir si un modèle testé peut traiter assez bien une charge de production précise pour déplacer ce trafic vers une capacité dédiée.

Profil le plus adapté

Équipes avec des dépenses API significatives et régulières

Les endpoints dédiés ont le plus de sens lorsqu’une équipe dispose déjà d’un trafic de production et peut identifier des charges dont la demande est suffisamment prévisible.

Les expériences variables et les petites charges sporadiques peuvent être mieux adaptées à une autre solution d’infrastructure.

Discuter de votre cas d’usage

Besoin d’une autre solution d’infrastructure IA ?

L’API d’inférence Hivenet est la solution avec endpoint géré. Si vous voulez exploiter davantage de la pile vous-même, ou si vous avez besoin d’une autre configuration de données et d’infrastructure, choisissez le produit Hivenet adapté au besoin.

Location de GPU/CPU

Louez des instances RTX 5090 ou vCPU lorsque votre équipe veut un contrôle total sur l’instance, le framework et la pile de service.

Private AI

Travaillez avec Hivenet sur des projets d’IA accompagnés impliquant des données sensibles, le choix du modèle, un support au déploiement ou des besoins personnalisés.

RAG

Créez des systèmes de recherche sur vos propres données en utilisant les solutions IA et de stockage de Hivenet.

Stockage compatible S3

Stockez des jeux de données, des documents et des artefacts de pipeline IA avec des outils compatibles S3 et sans frais de trafic sortant.

FAQ

Questions fréquentes

Déplacez une charge d’IA en production vers Hivenet.

Apportez votre usage actuel des API, vos besoins en modèles, votre cible de latence, vos exigences régionales et votre niveau de qualité attendu. Nous vous aiderons à déterminer si un endpoint géré pour modèle fondamental est la bonne solution.

Shader gradient background

PoliCloud + Hivenet

30 % de réduction sur les forfaits Hivenet !

PoliCloud, propulsé par la technologie de Hivenet, redéfinit le stockage cloud souverain. Pour célébrer notre partenariat, nous offrons 30 % de réduction sur tous les forfaits Hivenet—pour une durée limitée !

*L'offre se termine le 31 mars 2025. Ne la manquez pas !

Lisez nos Conditions Générales