Pourquoi OpenAI utilise-t-elle des robots d’exploration Web?
Nous utilisons des robots d’exploration pour valider la sécurité des pages Web soumises comme publicités dans ChatGPT. Lorsque vous soumettez une publicité, OpenAI peut visiter la page de destination pour vérifier qu’elle respecte nos politiques. Nous pouvons aussi utiliser le contenu de la page de destination pour déterminer quand il est le plus pertinent de présenter la publicité aux utilisateurs.
Quels robots d’exploration d’OpenAI devez-vous autoriser?
Vous devez autoriser OAI-AdsBot. Nous recommandons d’autoriser OAI-AdsBot et OAI-SearchBot.
Pour les flux de produits, autorisez aussi OAI-SearchBot à explorer les URL des images de produits. Vérifiez les règles du pare-feu, du CDN et de protection contre les robots sur l’hôte des images; une réponse 403 peut bloquer le traitement du flux.
Les robots d’exploration d’OpenAI n’arrivent pas à explorer mon site Web. Que dois-je faire?
La plupart des sites Web comportent plusieurs couches de protection qu’un robot d’exploration doit franchir avant de pouvoir accéder à une page Web. Demandez à votre équipe d’ingénierie ou de sécurité de vérifier que les robots d’exploration d’OpenAI peuvent franchir chacune des couches suivantes.
1. robots.txt
Le fichier robots.txt indique aux robots d’exploration s’ils peuvent accéder à certaines parties de votre site Web. Les robots d’exploration d’OpenAI respectent ces règles. Si l’accès est interdit dans robots.txt, l’exploration s’arrête immédiatement.
Vérifiez la configuration de votre fichier robots.txt et confirmez que les robots d’exploration d’OpenAI sont explicitement autorisés à accéder aux pages et aux chemins pertinents. Par exemple : User-agent: OAI-SearchBot Allow: / User-agent: OAI-AdsBot Allow: /
2. Protection Web et atténuation des robots
De nombreux sites Web utilisent des services comme Cloudflare, Akamai ou d’autres fournisseurs de protection Web pour se défendre contre les attaques DDoS, l’extraction de données et le trafic non autorisé. Ces systèmes peuvent bloquer par erreur des robots d’exploration légitimes et renvoyer souvent des erreurs 403 Forbidden. Comme les robots d’exploration d’OpenAI peuvent ressembler à du trafic automatisé, leur accès peut être refusé s’ils ne figurent pas expressément sur une liste d’autorisation.
Vérifiez la configuration de votre protection Web ou de votre pare-feu et, si possible, ajoutez le trafic des robots d’exploration d’OpenAI à la liste d’autorisation, idéalement selon nos agents utilisateurs. Votre équipe d’ingénierie ou d’infrastructure devrait aussi examiner les règles automatisées d’atténuation des robots qui pourraient générer de faux positifs.
3. Vérification humaine et logique antirobots
Certains sites Web appliquent des contrôles supplémentaires au niveau de l’application pour vérifier qu’un visiteur est humain, comme des CAPTCHA, des défis JavaScript, une analyse comportementale ou une validation de session. Comme les robots d’exploration d’OpenAI sont des systèmes automatisés, ces contrôles peuvent bloquer leur accès même s’ils ont franchi les couches précédentes.
Examinez toute logique de vérification humaine ou anti-automatisation mise en œuvre dans votre application et veillez à ce que les robots d’exploration d’OpenAI en soient exemptés lorsque cela convient, idéalement en ajoutant nos agents utilisateurs à la liste d’autorisation.
Remarque sur les plages d’adresses IP stables
Certains systèmes de sécurité exigent que le trafic des robots d’exploration provienne de plages d’adresses IP stables et documentées publiquement avant de pouvoir l’ajouter de façon fiable à une liste d’autorisation. Comme l’infrastructure des robots d’exploration peut évoluer au fil du temps, votre équipe d’ingénierie ne devrait pas se fier uniquement aux observations à court terme des adresses IP dans les journaux. Validez plutôt le trafic en combinant l’identification des agents utilisateurs, les programmes de robots vérifiés lorsqu’ils sont pris en charge, les listes d’autorisation du pare-feu, le comportement de robots.txt et les systèmes de vérification des robots des fournisseurs.
Si vous devez autoriser une liste stable de plages d’adresses IP, consultez https://openai.com/searchbot.json et https://openai.com/adsbot.json.
Remarque sur la limitation du débit
Les téléversements par lots volumineux ou les hausses soudaines du trafic des robots d’exploration peuvent parfois déclencher une limitation automatisée du débit ou des systèmes de protection contre les robots.
Si vous soupçonnez une limitation du débit, demandez à votre équipe d’ingénierie d’examiner les codes de réponse HTTP, en particulier 429 Too Many Requests, les journaux du pare-feu ou du CDN, les événements d’atténuation des robots, les règles de limitation des requêtes et les analyses du trafic au moment où le robot d’exploration a tenté d’accéder au site. Cela peut aider à déterminer si les requêtes sont intentionnellement ralenties ou bloquées par les protections de l’infrastructure.
Vous pouvez aussi envisager de téléverser les publicités en plus petits lots sur une période plus longue.
Remarque sur Cloudflare
OAI-AdsBot est officiellement vérifié et inscrit sur la liste d’autorisation de Cloudflare.
FAQ sur les robots d’exploration et les pages de destination
Quel robot d’exploration est requis pour l’examen des publicités?
OAI-AdsBot est requis pour la validation et l’examen des pages de destination des Publicités ChatGPT. OAI-SearchBot est recommandé, car il peut aider OpenAI à comprendre le contenu Web public, mais OAI-AdsBot est le robot d’exploration que les annonceurs devraient privilégier pour préparer leurs publicités.
Le service d’assistance peut-il contourner manuellement la validation par le robot d’exploration?
Ne comptez pas sur un contournement manuel. Rendez la page de destination explorable par OAI-AdsBot en corrigeant les blocages liés à robots.txt, au WAF, au CDN, à l’atténuation des robots, à l’authentification et à la limitation du débit. Il peut être nécessaire de téléverser de nouveau les publicités ou de les soumettre de nouveau à l’examen une fois la page de destination accessible.
Que devrait vérifier mon équipe d’ingénierie en premier?
Vérifiez si la page de destination renvoie une réponse HTTP indiquant une réussite à OAI-AdsBot, si robots.txt autorise le chemin pertinent et si le WAF, le CDN, l’atténuation des robots, les défis JavaScript, les CAPTCHA, l’authentification ou les règles géographiques bloquent l’accès automatisé.
Les liens vers une boutique d’applications, les liens profonds ou les destinations non Web sont-ils pris en charge comme pages de destination?
Dans la mesure du possible, utilisez une page de destination Web directement accessible. Les liens vers une boutique d’applications, les liens profonds, les documents ou les destinations qui exigent une application, une connexion, un accès propre à une région ou des redirections non prises en charge pourraient ne pas fournir assez de contenu explorable pour la validation ou l’examen.
Quand dois-je téléverser de nouveau les publicités ou demander un nouvel examen?
Après avoir corrigé l’accès du robot d’exploration, téléversez de nouveau ou resoumettez les publicités touchées si leur état ne se met pas à jour automatiquement. Pour les publicités téléversées en lot, de plus petits lots peuvent réduire le déclenchement de la limitation du débit ou de la protection contre les robots pendant que votre équipe valide le correctif.
