Porque é que a OpenAI utiliza rastreadores Web?
Utilizamos rastreadores para validar a segurança das páginas Web submetidas como anúncios no ChatGPT. Quando submete um anúncio, a OpenAI pode visitar a página de destino para garantir que esta cumpre as nossas políticas. Também podemos utilizar o conteúdo da página de destino para determinar quando é mais relevante apresentar o anúncio aos utilizadores.
Que rastreadores da OpenAI deve permitir?
Tem de permitir o OAI-AdsBot. Recomendamos que permita tanto o OAI-AdsBot como o OAI-SearchBot.
Para feeds de produtos, permita também que o OAI-SearchBot rastreie os URL das imagens dos produtos. Verifique as regras de firewall, CDN e proteção contra bots no alojamento das imagens; uma resposta 403 pode bloquear o processamento do feed.
Os rastreadores da OpenAI não conseguem rastrear o meu site. O que devo fazer?
A maioria dos sites tem várias camadas de proteção que um rastreador tem de atravessar antes de conseguir aceder a uma página Web. Colabore com a sua equipa de engenharia ou segurança para confirmar que os rastreadores da OpenAI conseguem atravessar cada uma das seguintes camadas.
1. robots.txt
O ficheiro robots.txt indica aos rastreadores se têm permissão para aceder a determinadas partes do seu site. Os rastreadores da OpenAI respeitam estas regras. Se o acesso não for permitido no robots.txt, o rastreio será imediatamente interrompido.
Reveja a configuração do robots.txt e confirme que os rastreadores da OpenAI têm permissão explícita para aceder às páginas e aos caminhos relevantes. Por exemplo: User-agent: OAI-SearchBot Allow: / User-agent: OAI-AdsBot Allow: /
2. Proteção Web e mitigação de bots
Muitos sites utilizam serviços como a Cloudflare, a Akamai ou outros fornecedores de proteção Web para se defenderem de ataques DDoS, extração de dados e tráfego não autorizado. Estes sistemas podem bloquear por engano rastreadores legítimos, devolvendo frequentemente erros 403 Forbidden. Como os rastreadores da OpenAI podem assemelhar-se a padrões de tráfego automatizado, o acesso pode ser-lhes recusado se não forem especificamente incluídos numa lista de permissões.
Reveja a configuração da proteção Web ou da firewall e, sempre que possível, adicione o tráfego dos rastreadores da OpenAI à lista de permissões, de preferência com base nos nossos agentes de utilizador. A sua equipa de engenharia ou infraestrutura também deve analisar quaisquer regras automatizadas de mitigação de bots que possam estar a gerar falsos positivos.
3. Verificação humana e lógica antibot
Alguns sites implementam verificações adicionais ao nível da aplicação para confirmar que um visitante é humano, como CAPTCHAs, desafios de JavaScript, análise comportamental ou validação de sessão. Como os rastreadores da OpenAI são sistemas automatizados, estas verificações podem bloquear o acesso mesmo que o rastreador tenha atravessado com êxito as camadas anteriores.
Reveja qualquer lógica de verificação humana ou antiautomatização implementada na sua aplicação e, quando adequado, isente os rastreadores da OpenAI, de preferência adicionando os nossos agentes de utilizador à lista de permissões.
Nota sobre intervalos de IP estáveis
Alguns sistemas de segurança exigem que o tráfego dos rastreadores tenha origem em intervalos de IP estáveis e documentados publicamente antes de poder ser adicionado de forma fiável à lista de permissões. Como a infraestrutura dos rastreadores pode evoluir ao longo do tempo, a sua equipa de engenharia não deve depender apenas de observações de IP de curto prazo obtidas nos registos. Em vez disso, valide o tráfego através de uma combinação da identificação do agente de utilizador, programas de bots verificados quando disponíveis, listas de permissões da firewall, comportamento do robots.txt e sistemas de verificação de bots ao nível do fornecedor.
Se tiver de permitir uma lista estável de intervalos de IP, consulte https://openai.com/searchbot.json e https://openai.com/adsbot.json.
Nota sobre a limitação da taxa de pedidos
Os carregamentos de grandes lotes ou os picos súbitos de tráfego dos rastreadores podem, por vezes, acionar a limitação automática da taxa de pedidos ou sistemas de proteção contra bots.
Se suspeitar que está a ocorrer uma limitação da taxa de pedidos, peça à sua equipa de engenharia que analise os códigos de resposta HTTP, especialmente 429 Too Many Requests, os registos da firewall ou CDN, os eventos de mitigação de bots, as regras de limitação de pedidos e a análise do tráfego no período em que o rastreador tentou aceder. Isto pode ajudar a determinar se os pedidos estão a ser intencionalmente atrasados ou bloqueados pelas proteções da infraestrutura.
Também pode considerar carregar os anúncios em lotes mais pequenos ao longo de um período mais alargado.
Nota sobre a Cloudflare
O OAI-AdsBot é oficialmente verificado e está incluído na lista de permissões da Cloudflare.
Perguntas frequentes sobre rastreadores e páginas de destino
Que rastreador é necessário para a revisão de anúncios?
O OAI-AdsBot é necessário para validar e rever as páginas de destino do ChatGPT Ads. O OAI-SearchBot é recomendado porque pode ajudar a OpenAI a compreender o conteúdo público da Web, mas o OAI-AdsBot é o rastreador a que os anunciantes devem dar prioridade para preparar os anúncios.
A equipa de suporte pode ignorar manualmente a validação do rastreador?
Não dependa de uma exceção manual. Permita que o OAI-AdsBot rastreie a página de destino, corrigindo os bloqueios do robots.txt, WAF, CDN, sistema de mitigação de bots, autenticação e limitação da taxa de pedidos. Depois de a página de destino ficar acessível, poderá ser necessário voltar a carregar ou submeter os anúncios para revisão.
O que deve a minha equipa de engenharia verificar primeiro?
Verifique se a página de destino devolve uma resposta HTTP bem-sucedida ao OAI-AdsBot, se o robots.txt permite o caminho relevante e se a WAF, a CDN, a mitigação de bots, os desafios de JavaScript, os CAPTCHAs, a autenticação ou as regras geográficas bloqueiam o acesso automatizado.
As ligações para lojas de aplicações, as ligações profundas ou os destinos que não sejam páginas Web são suportados como páginas de destino?
Sempre que possível, utilize uma página Web de destino diretamente acessível. As ligações para lojas de aplicações, ligações profundas, documentos ou destinos que exijam uma aplicação, início de sessão, acesso específico de uma região ou redirecionamentos não suportados podem não disponibilizar conteúdo rastreável suficiente para validação ou revisão.
Quando devo voltar a carregar ou solicitar novamente uma revisão?
Depois de corrigir o acesso do rastreador, volte a carregar ou submeter os anúncios afetados se o estado não for atualizado automaticamente. No caso de anúncios carregados em massa, utilizar lotes mais pequenos pode reduzir os acionamentos da limitação da taxa de pedidos ou da proteção contra bots enquanto a sua equipa valida a correção.
