
La mention « compatible avec OpenAI » décrit une interface d’API précise. Elle ne garantit pas une compatibilité complète avec chaque point de terminaison, nom de modèle, champ de requête, champ de réponse ou fonctionnalité des SDK OpenAI. Avant toute migration, vérifiez l’interface exacte documentée par le fournisseur et testez-la avec votre propre charge de travail.
Hivenet propose deux approches compatibles avec OpenAI, avec des niveaux de gestion différents. Hivenet Inference API fournit des points de terminaison dédiés et gérés. Compute with Hivenet fournit une infrastructure GPU ou CPU sur laquelle vous installez et exploitez vous-même vLLM ou un autre moteur d’inférence.
N’utilisez pas la liste des fonctionnalités d’une approche comme preuve de ce que l’autre prend en charge. Un serveur vLLM autogéré expose les fonctionnalités de la version et de la configuration que vous déployez. L’Inference API gérée expose l’interface décrite dans la documentation Hivenet actuelle et dans les exemples générés par la console.
Demandez la liste exacte des points de terminaison pris en charge au lieu de vous fier à la seule mention « compatible avec OpenAI ». La documentation actuelle de l’Inference API gérée de Hivenet couvre Chat Completions. Ne supposez pas que les anciennes complétions, les embeddings, la liste des modèles, la modération ou une autre route OpenAI sont disponibles, sauf si la documentation actuelle ou l’exemple généré pour le point de terminaison le précise.
Vérifiez si l’URL fournie contient déjà /v1. C’est le cas des URL de Hivenet Inference API : utilisez l’URL copiée depuis la console sans ajouter un second /v1. Créez la clé API dans l’organisation active, conservez-la hors du code source et utilisez-la uniquement avec les points de terminaison de cette organisation.
Utilisez la valeur du modèle indiquée dans l’exemple de démarrage du point de terminaison. Elle peut différer du nom du point de terminaison ou de la famille de modèles affichée dans le catalogue. Conservez l’URL, la clé API et la valeur du modèle dans la configuration afin de pouvoir changer de fournisseur ou de déploiement sans réécrire la logique de l’application.
Commencez par une petite requête Chat Completions sans streaming. Vérifiez le code d’état et les champs lus par votre application. Testez ensuite les comportements facultatifs, comme le streaming, l’appel d’outils, les sorties structurées, les séquences d’arrêt ou les champs d’utilisation des jetons, uniquement si le fournisseur les documente pour le point de terminaison évalué.
Enregistrez le code d’état et le corps de réponse réellement renvoyés par le service. Ne développez pas votre intégration à partir d’un exemple de schéma d’erreur ou d’un en-tête de limitation qui n’est pas documenté. Pour les erreurs temporaires, utilisez des tentatives limitées avec un délai exponentiel, respectez Retry-After lorsqu’il est présent et ne répétez pas une erreur d’authentification ou de validation sans corriger la requête.
Créez un jeu de prompts représentatif de votre charge de travail. Comparez la qualité des réponses, le délai avant le premier jeton lorsqu’il est disponible, la latence totale, le débit et le coût avec le même profil de requêtes. Testez le modèle et la configuration de réplicas que vous prévoyez d’utiliser, pas un nom de modèle proche ni un benchmark marketing.
Choisissez parmi les emplacements actuellement disponibles pour le point de terminaison et confirmez que l’emplacement sélectionné et les conditions contractuelles répondent à vos exigences. Ne déduisez pas de garanties de journalisation, de conservation, de résidence ou de conformité à partir du seul nom de la région.
Créez un point de terminaison dans la console Hivenet Compute, attendez qu’il soit actif, créez une clé Inference API et copiez les valeurs de l’exemple de démarrage généré. L’URL du point de terminaison contient déjà /v1.
import os
from openai import OpenAI
client = OpenAI(
base_url=os.environ["HIVENET_ENDPOINT_URL"],
api_key=os.environ["HIVENET_INFERENCE_API_KEY"],
)
response = client.chat.completions.create(
model=os.environ["HIVENET_MODEL"],
messages=[
{"role": "user", "content": "Rédige une mise à jour en une phrase."}
],
)
print(response.choices[0].message.content)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: process.env.HIVENET_ENDPOINT_URL,
apiKey: process.env.HIVENET_INFERENCE_API_KEY,
});
const response = await client.chat.completions.create({
model: process.env.HIVENET_MODEL,
messages: [
{ role: "user", content: "Donne-moi un risque clé pour ce projet." },
],
});
console.log(response.choices[0].message.content);
Utilisez l’URL et la valeur de modèle exactes affichées pour votre point de terminaison. Si la première requête échoue, consultez le guide de dépannage de l’Inference API avant de modifier le comportement du client.
Choisissez Compute si vous voulez déployer vous-même vLLM, TGI, SGLang, llama.cpp ou un autre moteur. Dans cette approche, vous êtes responsable de la version du moteur, des routes prises en charge, des fichiers du modèle, de l’authentification, de la connectivité, des mises à jour, de la mise à l’échelle et de la supervision.
Commencez par le guide de démarrage de Compute et la FAQ Compute actuelle. Lorsque le serveur fonctionne, testez l’interface documentée pour ce moteur et cette configuration. Une route prise en charge par une version ou un modèle de déploiement vLLM ne doit pas être considérée comme disponible sur tous les déploiements autogérés.
Non. La compatibilité se limite généralement aux routes et aux champs documentés par le fournisseur. Testez l’interface exacte dont vous avez besoin.
Utilisez Hivenet Inference API pour un point de terminaison dédié et géré. Utilisez Compute with Hivenet si vous voulez exploiter vous-même la couche de service et contrôler le moteur d’exécution.
Ne le supposez pas. Utilisez la valeur exacte indiquée dans l’exemple généré pour le point de terminaison et conservez-la dans la configuration.
/v1 à l’URL de Hivenet Inference API ?Non. L’URL copiée depuis la console Hivenet contient déjà /v1.
Consultez la console Hivenet et la documentation sur les modèles et variantes. La disponibilité peut varier selon le modèle, la variante, la capacité et l’emplacement.
Lorsque vous êtes prêt, ouvrez la console Hivenet Compute et choisissez l’approche gérée ou autogérée qui correspond à votre charge de travail.
Pick one AI, compute, or storage workload and see the difference for yourself. Spin it up in minutes, or let our team map your fastest path to production.