OpenAI
Trang này được dịch bằng máy học. Xem bài viết gốc bằng tiếng Anh.

Hướng dẫn cho nhà quảng cáo về việc cho phép trình thu thập dữ liệu web của OpenAI

Tìm hiểu cách giúp OpenAI truy cập các trang đích quảng cáo của bạn và khắc phục các sự cố truy cập thường gặp.

Đã cập nhật: 10 days ago

Tại sao OpenAI sử dụng trình thu thập dữ liệu web?

Chúng tôi sử dụng trình thu thập dữ liệu để xác thực độ an toàn của các trang web được gửi làm quảng cáo trên ChatGPT. Khi bạn gửi quảng cáo, OpenAI có thể truy cập trang đích để đảm bảo trang đó tuân thủ các chính sách của chúng tôi. Chúng tôi cũng có thể dùng nội dung trên trang đích để xác định thời điểm quảng cáo phù hợp nhất với người dùng.

Bạn nên cho phép những trình thu thập dữ liệu nào của OpenAI?

Bạn phải cho phép OAI-AdsBot. Chúng tôi khuyên bạn nên cho phép cả OAI-AdsBot và OAI-SearchBot.

Đối với nguồn cấp dữ liệu sản phẩm, hãy cho phép cả OAI-SearchBot thu thập dữ liệu từ URL hình ảnh sản phẩm. Kiểm tra các quy tắc về tường lửa, CDN và bảo vệ khỏi bot trên máy chủ hình ảnh; phản hồi 403 có thể chặn quá trình xử lý nguồn cấp dữ liệu.

Trình thu thập dữ liệu của OpenAI không thể thu thập dữ liệu trên trang web của tôi. Tôi nên làm gì?

Hầu hết trang web đều có nhiều lớp bảo vệ mà trình thu thập dữ liệu phải vượt qua mới có thể truy cập thành công một trang. Hãy phối hợp với đội ngũ kỹ thuật hoặc bảo mật để xác nhận rằng trình thu thập dữ liệu của OpenAI có thể vượt qua từng lớp sau đây.

1. robots.txt

Tệp robots.txt cho trình thu thập dữ liệu biết chúng có được phép truy cập một số phần nhất định trên trang web của bạn hay không. Trình thu thập dữ liệu của OpenAI tuân thủ các quy tắc này. Nếu robots.txt không cho phép truy cập, quá trình thu thập dữ liệu sẽ dừng ngay lập tức.

Hãy xem lại cấu hình robots.txt và xác nhận rằng trình thu thập dữ liệu của OpenAI được cho phép rõ ràng để truy cập các trang và đường dẫn liên quan. Ví dụ: User-agent: OAI-SearchBot Allow: / User-agent: OAI-AdsBot Allow: /

2. Bảo vệ web và ngăn chặn bot

Nhiều trang web sử dụng các dịch vụ như Cloudflare, Akamai hoặc nhà cung cấp giải pháp bảo vệ web khác để chống lại các cuộc tấn công DDoS, hoạt động thu thập dữ liệu và lưu lượng truy cập trái phép. Các hệ thống này có thể chặn nhầm trình thu thập dữ liệu hợp lệ và thường trả về lỗi 403 Forbidden. Do trình thu thập dữ liệu của OpenAI có thể giống với các mẫu lưu lượng tự động, chúng có thể bị từ chối nếu không được đưa cụ thể vào danh sách cho phép.

Hãy xem lại cấu hình bảo vệ web hoặc tường lửa và đưa lưu lượng của trình thu thập dữ liệu OpenAI vào danh sách cho phép nếu có thể, lý tưởng nhất là dựa trên chuỗi tác nhân người dùng của trình thu thập dữ liệu. Đội ngũ kỹ thuật hoặc cơ sở hạ tầng của bạn cũng nên kiểm tra mọi quy tắc ngăn chặn bot tự động có thể gây ra kết quả dương tính giả.

3. Xác minh con người và cơ chế chống bot

Một số trang web triển khai thêm các bước kiểm tra ở cấp ứng dụng để xác minh khách truy cập là con người, chẳng hạn như CAPTCHA, thử thách JavaScript, phân tích hành vi hoặc xác thực phiên. Vì trình thu thập dữ liệu của OpenAI là hệ thống tự động nên các bước kiểm tra này có thể chặn quyền truy cập ngay cả khi trình thu thập dữ liệu đã vượt qua các lớp trước đó.

Hãy xem lại mọi cơ chế xác minh con người hoặc chống tự động hóa được triển khai trong ứng dụng và bảo đảm trình thu thập dữ liệu của OpenAI được miễn trừ khi thích hợp, lý tưởng nhất là bằng cách đưa chuỗi tác nhân người dùng của chúng tôi vào danh sách cho phép.

Lưu ý về dải IP ổn định

Một số hệ thống bảo mật yêu cầu lưu lượng của trình thu thập dữ liệu phải bắt nguồn từ các dải IP ổn định và được công bố công khai thì mới có thể đưa vào danh sách cho phép một cách đáng tin cậy. Do cơ sở hạ tầng thu thập dữ liệu có thể thay đổi theo thời gian, đội ngũ kỹ thuật của bạn không nên chỉ dựa vào những quan sát IP ngắn hạn trong nhật ký. Thay vào đó, hãy xác thực lưu lượng bằng cách kết hợp nhận dạng chuỗi tác nhân người dùng, các chương trình bot đã xác minh nếu được hỗ trợ, danh sách cho phép của tường lửa, hành vi robots.txt và hệ thống xác minh bot ở cấp nhà cung cấp.

Nếu phải cho phép một danh sách dải IP ổn định, hãy tham khảo https://openai.com/searchbot.json và https://openai.com/adsbot.json.

Lưu ý về giới hạn tốc độ

Các đợt tải lên hàng loạt lớn hoặc lưu lượng thu thập dữ liệu tăng đột biến đôi khi có thể kích hoạt hệ thống giới hạn tốc độ tự động hoặc bảo vệ khỏi bot.

Nếu nghi ngờ hệ thống đang giới hạn tốc độ, hãy đề nghị đội ngũ kỹ thuật xem lại mã phản hồi HTTP, đặc biệt là 429 Too Many Requests, nhật ký tường lửa hoặc CDN, sự kiện ngăn chặn bot, quy tắc điều tiết yêu cầu và dữ liệu phân tích lưu lượng vào khoảng thời gian trình thu thập dữ liệu cố gắng truy cập. Việc này có thể giúp xác định liệu các yêu cầu có bị biện pháp bảo vệ cơ sở hạ tầng cố ý làm chậm hoặc chặn hay không.

Bạn cũng có thể cân nhắc tải quảng cáo lên theo các lô nhỏ hơn trong khoảng thời gian dài hơn.

Lưu ý về Cloudflare

OAI-AdsBot đã được Cloudflare chính thức xác minh và đưa vào danh sách cho phép.

Câu hỏi thường gặp về trình thu thập dữ liệu và trang đích

Cần trình thu thập dữ liệu nào để xét duyệt quảng cáo?

OAI-AdsBot là trình thu thập dữ liệu bắt buộc để xác thực và xét duyệt trang đích của Quảng cáo ChatGPT. Nên cho phép OAI-SearchBot vì công cụ này có thể giúp OpenAI hiểu nội dung web công khai, nhưng OAI-AdsBot mới là trình thu thập dữ liệu mà nhà quảng cáo nên ưu tiên để quảng cáo sẵn sàng hoạt động.

Bộ phận hỗ trợ có thể bỏ qua bước xác thực bằng trình thu thập dữ liệu theo cách thủ công không?

Đừng dựa vào biện pháp bỏ qua thủ công. Hãy giúp OAI-AdsBot thu thập được dữ liệu trên trang đích bằng cách khắc phục các trường hợp chặn do robots.txt, WAF, CDN, biện pháp ngăn chặn bot, xác thực và giới hạn tốc độ. Có thể cần tải lại hoặc gửi lại quảng cáo để xét duyệt sau khi trang đích có thể truy cập được.

Đội ngũ kỹ thuật của tôi nên kiểm tra gì trước tiên?

Hãy kiểm tra xem trang đích có trả về phản hồi HTTP thành công cho OAI-AdsBot hay không, robots.txt có cho phép đường dẫn liên quan hay không và WAF, CDN, biện pháp ngăn chặn bot, thử thách JavaScript, CAPTCHA, cơ chế xác thực hoặc quy tắc địa lý có chặn truy cập tự động hay không.

Có hỗ trợ dùng liên kết cửa hàng ứng dụng, liên kết sâu hoặc đích đến không phải trang web làm trang đích không?

Hãy sử dụng trang đích web có thể truy cập trực tiếp bất cứ khi nào có thể. Liên kết cửa hàng ứng dụng, liên kết sâu, tài liệu hoặc đích đến yêu cầu ứng dụng, đăng nhập, quyền truy cập theo khu vực hay phương thức chuyển hướng không được hỗ trợ có thể không cung cấp đủ nội dung có thể thu thập để xác thực hoặc xét duyệt.

Khi nào tôi nên tải lên lại hoặc yêu cầu xét duyệt lại?

Sau khi khắc phục quyền truy cập của trình thu thập dữ liệu, hãy tải lại hoặc gửi lại các quảng cáo bị ảnh hưởng nếu trạng thái không tự động cập nhật. Đối với quảng cáo được tải lên hàng loạt, việc chia thành các lô nhỏ hơn có thể giảm nguy cơ kích hoạt cơ chế giới hạn tốc độ hoặc bảo vệ khỏi bot trong khi đội ngũ của bạn xác thực bản sửa lỗi.

Bài viết này có hữu ích không?