Remarque : cet article fournit un aperçu général. Les informations de configuration technique sont disponibles sur le site web gpt-oss, GitHub, Hugging Face et les OpenAI Cookbooks.
Aperçu
Présentation de deux modèles de raisonnement à poids ouverts : gpt‑oss‑120b et gpt‑oss‑20b. Ils s’exécutent sur l’infrastructure que vous contrôlez, ou via des fournisseurs d’hébergement.
Remarque : ces modèles ne sont pas servis via l’API OpenAI et ne sont pas disponibles dans ChatGPT.
Pourquoi des poids ouverts
Choix et contrôle : exécutez les modèles sur site ou dans votre cloud privé, conservez la résidence des données et adaptez les performances à vos besoins.
Personnalisation : affinez ou adaptez les modèles avec les outils ouverts de votre choix.
Disponibilité et licence
Licence : Apache 2.0 permet une large utilisation, modification et redistribution, y compris à des fins commerciales (sous réserve de notre politique d’utilisation gpt-oss).
Service : non disponible via l’API OpenAI ; la tarification et les limites de débit de l’API ne s’appliquent donc pas.
Compatibilité : peut être exécuté avec des piles d’inférence ouvertes courantes comme vLLM, Ollama, llama.cpp, ainsi que dans des environnements GPU cloud ou autogérés.
Bien démarrer
Pour obtenir les poids du modèle et les ressources associées, vous pouvez :
Consulter le site web de gpt-oss pour obtenir une vue d’ensemble et des liens directs.
Télécharger les poids depuis la collection Hugging Face, une plateforme communautaire où vous pouvez trouver les deux modèles, consulter des exemples d’utilisation et, si vous le souhaitez, exécuter directement l’inférence grâce aux services de Hugging Face.
Accéder à notre dépôt GitHub pour consulter le code d’inférence de référence.
Utiliser les guides des recettes OpenAI pour configurer des environnements d’exécution compatibles tels qu’Ollama, vLLM et Transformers. Les recettes comprennent également des instructions détaillées pour exécuter les modèles localement, utiliser les environnements d’exécution courants et, lorsque cela est pris en charge, affiner les modèles gpt-oss.
gpt‑oss‑safeguard (version préliminaire de recherche)
gpt‑oss‑safeguard est une paire de modèles de raisonnement de sécurité à poids ouverts reposant sur gpt‑oss. Ils sont conçus pour la classification de sécurité fondée sur des politiques et les tâches connexes de confiance et de sécurité que vous exécutez sur une infrastructure que vous contrôlez. Comme pour les autres modèles gpt‑oss, ces poids ne sont pas proposés via l’API OpenAI ni ChatGPT.
Modèles uniquement textuels avec des schémas de référence pour les sorties structurées (p. ex., verdict selon la politique, justification).
Utilisez votre propre politique : le modèle interprète votre politique écrite afin de pouvoir s’adapter à différents produits avec un minimum d’ingénierie.
Décisions raisonnées : traces de raisonnement facultatives pour faciliter le débogage et les audits (destinées aux développeurs et aux spécialistes de la sécurité, et non à être présentées aux utilisateurs finaux).
Effort de raisonnement configurable : choisissez Faible / Moyen / Élevé pour trouver le bon compromis entre latence et profondeur.
Licence : Apache 2.0 (voir Disponibilité et licences ci-dessous).
gpt‑oss‑safeguard convient bien au filtrage des entrées/sorties des LLM, à l’étiquetage de contenu en ligne ainsi qu’aux workflows d’étiquetage par lots ou de révision hors ligne. Pour les applications générales (chat, agents, etc.), nous recommandons les modèles gpt‑oss principaux.
Vous pouvez adapter le schéma à vos besoins. Consultez l’OpenAI Cookbook pour obtenir des guides sur la rédaction de prompts et des exemples.
Variantes et dimensionnement des modèles
| Modèle | Utilisation prévue | Notes |
|---|---|---|
| gpt‑oss‑safeguard‑120b | Production, raisonnement de sécurité haute capacité | 117 Md de paramètres (≈5,1 Md actifs). Conçu pour tenir sur un seul GPU de 80 Go (p. ex., NVIDIA H100 ; fonctionne aussi sur des GPU à mémoire plus importante comme AMD MI300X). |
| gpt‑oss‑safeguard‑20b | Latence plus faible / environnements contraints | 21 Md de paramètres (≈3,6 Md actifs). |
Les deux modèles sont affinés à partir de gpt‑oss sans changement d’architecture. Ils utilisent le même gabarit de chat que gpt‑oss ; vous pouvez conserver votre configuration existante. Un schéma de prompting recommandé consiste à placer votre politique dans un message développeur et le contenu à évaluer dans un message utilisateur.
Assistance et communauté
Les déploiements à poids ouverts sont autogérés et pris en charge en libre-service. Voici où obtenir de l’aide :
Questions, discussion, conseils : utilisez les pages des modèles Hugging Face pour échanger avec la communauté.
Bugs reproductibles dans le code d’inférence de référence d’OpenAI : ouvrez une issue dans le dépôt GitHub gpt-oss.
Problèmes avec un runtime tiers (p. ex., vLLM, Ollama, llama.cpp) : utilisez le système de suivi des issues, les forums ou le processus d’assistance du projet concerné.
OpenAI ne fournit pas d’assistance, de mise en œuvre pratique ni de support au débogage pour les configurations, environnements ou applications à poids ouverts auto-hébergés ou hébergés par des tiers.
Nous continuerons à collaborer avec la communauté pour améliorer les outils ouverts de sécurité, notamment via la ROOST Model Community (RMC). La RMC réunit des spécialistes et chercheurs en sécurité afin de partager les bonnes pratiques pour intégrer des modèles d’IA open source aux workflows de sécurité, y compris les résultats d’évaluation et les retours sur les modèles. Consultez le dépôt GitHub de la RMC pour en savoir plus sur ce partenariat et découvrir comment participer.
Assistance et communauté
Les déploiements à poids ouverts sont autogérés et pris en charge en libre-service. Voici où obtenir de l’aide :
Questions, discussion, conseils : utilisez les pages des modèles Hugging Face pour échanger avec la communauté.
Bugs reproductibles dans le code d’inférence de référence d’OpenAI : ouvrez une issue dans le dépôt GitHub gpt-oss.
Problèmes avec un runtime tiers (p. ex., vLLM, Ollama, llama.cpp) : utilisez le système de suivi des issues, les forums ou le processus d’assistance du projet concerné.
OpenAI ne fournit pas d’assistance, de mise en œuvre pratique ni de support au débogage pour les configurations, environnements ou applications à poids ouverts auto-hébergés ou hébergés par des tiers.
Confidentialité et sécurité
Confidentialité et données
Ces modèles sont conçus pour s’exécuter sur l’infrastructure que vous contrôlez (sur site, ou dans votre cloud ou chez votre partenaire d’hébergement). OpenAI ne reçoit ni ne traite les données que vous envoyez à ces modèles auto-hébergés, sauf si vous les partagez explicitement avec OpenAI ou si vous utilisez l’un de nos partenaires d’hébergement géré.
Sécurité
Ces modèles ont fait l’objet d’un entraînement et de tests de sécurité approfondis. Pour plus de détails, consultez notre fiche modèle et notre rapport technique.
Signaler des violations de contenu
Si vous pensez qu’un contenu généré avec des modèles gpt‑oss enfreint nos politiques, vous pouvez le signaler via notre formulaire de signalement de contenu. Veuillez fournir autant de détails que possible pour aider notre équipe à examiner votre soumission.
FAQ
Ces modèles sont-ils gratuits ?
Les poids des modèles gpt-oss peuvent être téléchargés et utilisés gratuitement sous la licence Apache 2.0 et la politique d’utilisation de gpt-oss. Cependant, vous êtes responsable de tous les coûts associés à leur exécution — comme le calcul, le stockage ou les frais d’hébergement tiers. La tarification correspondante dépendra de l’infrastructure ou du fournisseur que vous choisirez.
Ces modèles sont-ils « open source » ?
Nous utilisons les termes modèles ouverts ou à poids ouverts pour indiquer que les poids entraînés sont publiquement disponibles sous la licence permissive Apache 2.0 et la politique d’utilisation de gpt-oss. Cela signifie que vous pouvez télécharger les modèles, les exécuter sur votre propre infrastructure ou avec des frameworks d’hébergement pris en charge, et les personnaliser ou les affiner.
Les modèles ouverts donnent aux développeurs et aux organisations davantage de contrôle et de flexibilité. Vous pouvez choisir où les héberger, les adapter à des cas d’utilisation spécifiques et bénéficier d’une licence permettant une large utilisation, modification et redistribution. Même si les poids entraînés sont ouverts, certaines infrastructures ou certains outils associés peuvent rester propriétaires à leurs fournisseurs.
Puis-je accéder à ces modèles via l’API OpenAI ou ChatGPT ?
Non. Ces modèles ne sont pas servis dans l’API OpenAI et n’apparaissent pas dans ChatGPT.
Puis-je affiner les modèles ?
Oui. Vous pouvez les affiner avec des outils open source et l’infrastructure de votre choix. Nous ne proposons pas de fine-tuning via les API OpenAI pour ces modèles.
Les modèles à poids ouverts sont-ils moins chers que l’utilisation de l’API ?
Les coûts varient selon l’infrastructure, la charge de travail et l’approche opérationnelle. L’auto-hébergement peut être moins cher dans certains cas, tandis que notre plateforme API peut être plus efficace en tenant compte de l’hébergement, de la maintenance et des mises à niveau.
Quelles fonctionnalités ces modèles prennent-ils en charge ?
Ces modèles sont actuellement des modèles de raisonnement uniquement textuels. Les runtimes courants prennent en charge le streaming, l’appel de fonction et les sorties structurées. Consultez la documentation de votre runtime pour connaître les capacités exactes.
En quoi est-ce différent de ModAPI ?
Il s’agit d’un modèle de raisonnement très performant qui vous permet d’apporter votre propre politique. Il peut fonctionner en tandem avec ModAPI, mais ne remplace probablement pas les cas d’utilisation à faible latence.
