← Blog
Flux de requêtes et de réponses d’une API compatible avec OpenAI
October 6, 2025

Guide d’achat des API compatibles avec OpenAI

La mention « compatible avec OpenAI » décrit une interface d’API précise. Elle ne garantit pas une compatibilité complète avec chaque point de terminaison, nom de modèle, champ de requête, champ de réponse ou fonctionnalité des SDK OpenAI. Avant toute migration, vérifiez l’interface exacte documentée par le fournisseur et testez-la avec votre propre charge de travail.

Hivenet propose deux approches compatibles avec OpenAI, avec des niveaux de gestion différents. Hivenet Inference API fournit des points de terminaison dédiés et gérés. Compute with Hivenet fournit une infrastructure GPU ou CPU sur laquelle vous installez et exploitez vous-même vLLM ou un autre moteur d’inférence.

Choisir l’approche Hivenet adaptée

  • Utilisez Hivenet Inference API si vous voulez que Hivenet exploite la couche de service, la passerelle, le moteur d’exécution, les réplicas et l’infrastructure du point de terminaison. Vous choisissez un modèle du catalogue géré et un emplacement actuellement disponible dans la console.
  • Utilisez Compute with Hivenet si vous avez besoin de poids personnalisés, d’un autre moteur d’inférence, d’un accès au système d’exploitation ou d’un contrôle complet de l’authentification, du réseau, des mises à jour et de la supervision.

N’utilisez pas la liste des fonctionnalités d’une approche comme preuve de ce que l’autre prend en charge. Un serveur vLLM autogéré expose les fonctionnalités de la version et de la configuration que vous déployez. L’Inference API gérée expose l’interface décrite dans la documentation Hivenet actuelle et dans les exemples générés par la console.

Ce qu’il faut vérifier avant de migrer

1. Les routes documentées

Demandez la liste exacte des points de terminaison pris en charge au lieu de vous fier à la seule mention « compatible avec OpenAI ». La documentation actuelle de l’Inference API gérée de Hivenet couvre Chat Completions. Ne supposez pas que les anciennes complétions, les embeddings, la liste des modèles, la modération ou une autre route OpenAI sont disponibles, sauf si la documentation actuelle ou l’exemple généré pour le point de terminaison le précise.

2. L’URL de base et l’authentification

Vérifiez si l’URL fournie contient déjà /v1. C’est le cas des URL de Hivenet Inference API : utilisez l’URL copiée depuis la console sans ajouter un second /v1. Créez la clé API dans l’organisation active, conservez-la hors du code source et utilisez-la uniquement avec les points de terminaison de cette organisation.

3. La valeur exacte du modèle

Utilisez la valeur du modèle indiquée dans l’exemple de démarrage du point de terminaison. Elle peut différer du nom du point de terminaison ou de la famille de modèles affichée dans le catalogue. Conservez l’URL, la clé API et la valeur du modèle dans la configuration afin de pouvoir changer de fournisseur ou de déploiement sans réécrire la logique de l’application.

4. Les requêtes et les réponses

Commencez par une petite requête Chat Completions sans streaming. Vérifiez le code d’état et les champs lus par votre application. Testez ensuite les comportements facultatifs, comme le streaming, l’appel d’outils, les sorties structurées, les séquences d’arrêt ou les champs d’utilisation des jetons, uniquement si le fournisseur les documente pour le point de terminaison évalué.

5. Les erreurs et les nouvelles tentatives

Enregistrez le code d’état et le corps de réponse réellement renvoyés par le service. Ne développez pas votre intégration à partir d’un exemple de schéma d’erreur ou d’un en-tête de limitation qui n’est pas documenté. Pour les erreurs temporaires, utilisez des tentatives limitées avec un délai exponentiel, respectez Retry-After lorsqu’il est présent et ne répétez pas une erreur d’authentification ou de validation sans corriger la requête.

6. La qualité, la latence et le coût

Créez un jeu de prompts représentatif de votre charge de travail. Comparez la qualité des réponses, le délai avant le premier jeton lorsqu’il est disponible, la latence totale, le débit et le coût avec le même profil de requêtes. Testez le modèle et la configuration de réplicas que vous prévoyez d’utiliser, pas un nom de modèle proche ni un benchmark marketing.

7. L’emplacement et le traitement des données

Choisissez parmi les emplacements actuellement disponibles pour le point de terminaison et confirmez que l’emplacement sélectionné et les conditions contractuelles répondent à vos exigences. Ne déduisez pas de garanties de journalisation, de conservation, de résidence ou de conformité à partir du seul nom de la région.

Se connecter à un point de terminaison Hivenet géré

Créez un point de terminaison dans la console Hivenet Compute, attendez qu’il soit actif, créez une clé Inference API et copiez les valeurs de l’exemple de démarrage généré. L’URL du point de terminaison contient déjà /v1.

Python

import os
from openai import OpenAI

client = OpenAI(
  base_url=os.environ["HIVENET_ENDPOINT_URL"],
  api_key=os.environ["HIVENET_INFERENCE_API_KEY"],
)

response = client.chat.completions.create(
  model=os.environ["HIVENET_MODEL"],
  messages=[
    {"role": "user", "content": "Rédige une mise à jour en une phrase."}
  ],
)

print(response.choices[0].message.content)

JavaScript

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: process.env.HIVENET_ENDPOINT_URL,
  apiKey: process.env.HIVENET_INFERENCE_API_KEY,
});

const response = await client.chat.completions.create({
  model: process.env.HIVENET_MODEL,
  messages: [
    { role: "user", content: "Donne-moi un risque clé pour ce projet." },
  ],
});

console.log(response.choices[0].message.content);

Utilisez l’URL et la valeur de modèle exactes affichées pour votre point de terminaison. Si la première requête échoue, consultez le guide de dépannage de l’Inference API avant de modifier le comportement du client.

Exploiter votre propre serveur compatible avec OpenAI sur Compute

Choisissez Compute si vous voulez déployer vous-même vLLM, TGI, SGLang, llama.cpp ou un autre moteur. Dans cette approche, vous êtes responsable de la version du moteur, des routes prises en charge, des fichiers du modèle, de l’authentification, de la connectivité, des mises à jour, de la mise à l’échelle et de la supervision.

Commencez par le guide de démarrage de Compute et la FAQ Compute actuelle. Lorsque le serveur fonctionne, testez l’interface documentée pour ce moteur et cette configuration. Une route prise en charge par une version ou un modèle de déploiement vLLM ne doit pas être considérée comme disponible sur tous les déploiements autogérés.

Une liste de contrôle pratique pour la migration

  1. Choisissez l’Inference API gérée ou Compute en mode autogéré.
  2. Copiez l’URL et la valeur de modèle exactes depuis la source actuelle.
  3. Envoyez une requête Chat Completions sans streaming.
  4. Testez uniquement les routes et les champs facultatifs documentés par le fournisseur.
  5. Comparez la qualité, la latence, le débit et le coût avec des prompts représentatifs.
  6. Vérifiez la gestion des erreurs sans supposer un schéma ou un en-tête particulier.
  7. Confirmez les exigences d’emplacement, de traitement des données et de contrat avant la mise en production.
  8. Conservez les valeurs propres au fournisseur dans la configuration et prévoyez un retour en arrière.

Questions fréquentes

La compatibilité avec OpenAI signifie-t-elle que tous les points de terminaison OpenAI fonctionnent ?

Non. La compatibilité se limite généralement aux routes et aux champs documentés par le fournisseur. Testez l’interface exacte dont vous avez besoin.

Quel produit Hivenet choisir ?

Utilisez Hivenet Inference API pour un point de terminaison dédié et géré. Utilisez Compute with Hivenet si vous voulez exploiter vous-même la couche de service et contrôler le moteur d’exécution.

Puis-je réutiliser le même nom de modèle que chez OpenAI ?

Ne le supposez pas. Utilisez la valeur exacte indiquée dans l’exemple généré pour le point de terminaison et conservez-la dans la configuration.

Dois-je ajouter /v1 à l’URL de Hivenet Inference API ?

Non. L’URL copiée depuis la console Hivenet contient déjà /v1.

Où vérifier les modèles et les emplacements disponibles ?

Consultez la console Hivenet et la documentation sur les modèles et variantes. La disponibilité peut varier selon le modèle, la variante, la capacité et l’emplacement.

Lorsque vous êtes prêt, ouvrez la console Hivenet Compute et choisissez l’approche gérée ou autogérée qui correspond à votre charge de travail.

Your next workload belongs on Hivenet.

Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.

Shader gradient background