Bakit gumagamit ang OpenAI ng mga web crawler?
Gumagamit kami ng mga crawler upang tiyaking ligtas ang mga web page na isinusumite bilang mga ad sa ChatGPT. Kapag nagsumite ka ng ad, maaaring bisitahin ng OpenAI ang landing page upang matiyak na sumusunod ito sa aming mga patakaran. Maaari rin naming gamitin ang content ng landing page upang matukoy kung kailan ito pinakanauugnay na ipakita sa mga user.
Aling mga crawler ng OpenAI ang dapat mong payagan?
Dapat mong payagan ang OAI-AdsBot. Inirerekomenda naming payagan ang OAI-AdsBot at OAI-SearchBot.
Para sa mga product feed, payagan din ang OAI-SearchBot na i-crawl ang mga URL ng larawan ng produkto. Suriin ang mga panuntunan sa firewall, CDN, at proteksiyon laban sa bot sa image host; maaaring hadlangan ng 403 response ang pagproseso ng feed.
Hindi ma-crawl ng mga crawler ng OpenAI ang website ko. Ano ang dapat kong gawin?
Karamihan ng mga website ay may maraming antas ng proteksiyon na kailangang malampasan bago matagumpay na ma-access ng crawler ang isang web page. Makipagtulungan sa iyong engineering o security team upang matiyak na makakalampas ang mga crawler ng OpenAI sa bawat sumusunod na antas.
1. robots.txt
Isinasaad ng robots.txt file sa mga crawler kung pinapayagan silang mag-access ng ilang bahagi ng iyong website. Sinusunod ng mga crawler ng OpenAI ang mga panuntunang ito. Kung hindi pinapayagan ang access sa robots.txt, agad na hihinto ang pag-crawl.
Suriin ang configuration ng iyong robots.txt at kumpirmahing tahasang pinapayagan ang mga crawler ng OpenAI na i-access ang mga nauugnay na page at path. Halimbawa: User-agent: OAI-SearchBot Allow: / User-agent: OAI-AdsBot Allow: /
2. Proteksiyon sa web at pagpigil sa mga bot
Maraming website ang gumagamit ng mga serbisyong gaya ng Cloudflare, Akamai, o iba pang provider ng proteksiyon sa web upang ipagtanggol ang sarili laban sa mga pag-atake ng DDoS, scraping, at hindi awtorisadong traffic. Maaaring mapagkamalang i-block ng mga system na ito ang mga lehitimong crawler, na madalas magresulta sa mga 403 Forbidden error. Dahil maaaring magmukhang automated traffic ang mga crawler ng OpenAI, maaaring tanggihan ang mga ito maliban kung partikular na idinagdag sa allowlist.
Suriin ang configuration ng iyong proteksiyon sa web o firewall at, kung maaari, idagdag sa allowlist ang traffic ng mga crawler ng OpenAI, mas mainam kung batay sa aming mga crawler user agent. Dapat ding suriin ng iyong engineering o infrastructure team ang anumang automated na panuntunan sa pagpigil sa bot na maaaring magdulot ng mga false positive.
3. Pag-verify na tao ang user at anti-bot logic
Nagpapatupad ang ilang website ng mga karagdagang pagsusuri sa application upang tiyaking tao ang bisita, gaya ng mga CAPTCHA, JavaScript challenge, behavioral analysis, o session validation. Dahil automated system ang mga crawler ng OpenAI, maaaring hadlangan ng mga pagsusuring ito ang access kahit matagumpay na nakalampas ang crawler sa mga naunang antas.
Suriin ang anumang logic sa iyong application para sa pag-verify na tao ang user o pagpigil sa automation, at tiyaking hindi saklaw nito ang mga crawler ng OpenAI kung naaangkop—mas mainam sa pamamagitan ng pagdaragdag sa aming mga crawler user agent sa allowlist.
Paalala tungkol sa mga stable na IP range
Kinakailangan ng ilang security system na magmula ang crawler traffic sa mga stable at pampublikong nakadokumentong IP range bago ito maaasahang maidagdag sa allowlist. Dahil maaaring magbago ang infrastructure ng crawler sa paglipas ng panahon, hindi dapat umasa lamang ang iyong engineering team sa panandaliang obserbasyon ng IP mula sa mga log. Sa halip, i-validate ang traffic gamit ang kumbinasyon ng pagkilala sa user agent, mga verified bot program kung sinusuportahan, mga allowlist ng firewall, gawi ng robots.txt, at mga bot verification system ng provider.
Kung kailangan mong magpayag ng stable na listahan ng mga IP range, sumangguni sa https://openai.com/searchbot.json at https://openai.com/adsbot.json.
Paalala tungkol sa rate limiting
Kung minsan, maaaring ma-trigger ng malalaking batch upload o biglaang pagdami ng crawler traffic ang automated rate limiting o mga system ng proteksiyon laban sa bot.
Kung sa palagay mo ay may rate limiting, hilingin sa iyong engineering team na suriin ang mga HTTP response code, lalo na ang 429 Too Many Requests; mga log ng firewall o CDN; mga kaganapan sa pagpigil sa bot; mga panuntunan sa request throttling; at traffic analytics noong sinubukan ng crawler na mag-access. Makakatulong ito upang matukoy kung sinasadyang pabagalin o i-block ng mga proteksiyon sa infrastructure ang mga request.
Maaari mo ring isaalang-alang ang pag-upload ng mga ad sa mas maliliit na batch sa loob ng mas mahabang panahon.
Paalala tungkol sa Cloudflare
Opisyal nang na-verify at idinagdag ng Cloudflare sa allowlist ang OAI-AdsBot.
FAQ tungkol sa crawler at landing page
Aling crawler ang kinakailangan para sa pagsusuri ng mga ad?
Kinakailangan ang OAI-AdsBot para sa pag-validate at pagsusuri ng mga landing page ng ChatGPT Ads. Inirerekomenda ang OAI-SearchBot dahil maaaring makatulong ito sa OpenAI na maunawaan ang pampublikong content sa web, ngunit OAI-AdsBot ang dapat unahin ng mga advertiser upang maging handa ang kanilang mga ad.
Maaari bang manu-manong laktawan ng support team ang pag-validate ng crawler?
Huwag umasa sa manu-manong paglaktaw. Gawing nako-crawl ng OAI-AdsBot ang landing page sa pamamagitan ng pag-aayos ng mga pag-block sa robots.txt, WAF, CDN, pagpigil sa bot, authentication, at rate limiting. Maaaring kailangang i-upload muli o muling isumite para sa pagsusuri ang mga ad kapag naa-access na ang landing page.
Ano ang unang dapat suriin ng aking engineering team?
Suriin kung nagbibigay ang landing page ng matagumpay na HTTP response sa OAI-AdsBot, kung pinapayagan ng robots.txt ang nauugnay na path, at kung bina-block ng WAF, CDN, pagpigil sa bot, mga JavaScript challenge, CAPTCHA, authentication, o geo rule ang automated access.
Sinusuportahan ba bilang mga landing page ang mga app-store link, deep link, o destinasyong wala sa web?
Hangga't maaari, gumamit ng web landing page na direktang naa-access. Maaaring walang sapat na nako-crawl na content para sa pag-validate o pagsusuri ang mga app-store link, deep link, dokumento, o destinasyong nangangailangan ng app, pag-log in, access na partikular sa rehiyon, o hindi sinusuportahang redirect.
Kailan ako dapat muling mag-upload o humiling ulit ng pagsusuri?
Pagkatapos ayusin ang access ng crawler, i-upload muli o muling isumite ang mga apektadong ad kung hindi kusang mag-update ang status. Para sa mga ad na na-upload nang maramihan, makababawas ang mas maliliit na batch sa mga pag-trigger ng rate limit o proteksiyon laban sa bot habang bine-validate ng iyong team ang pag-aayos.
