
使用 Astra 模型时,为确保智能体正确理解并遵循你的指令,我们部署了一套系统。如果系统检测到智能体在传输敏感数据、访问敏感数据或进行破坏性更改等情况下可能未正确理解你的指令,就会暂停或终止 ChatGPT、Codex 和 API 中的相关对话。
对话被暂停或终止,并不一定意味着智能体犯了错,只是说明有必要检查智能体的操作,以确认它正确理解并遵循了你的指令。
如果我的对话出于安全预防而被暂停,该怎么办?
打开查看检测结果(或查看 API 返回的错误),阅读完整说明。
将检测结果与你希望智能体执行的任务及其最近的操作进行对照。你可以检查相关的更改、工具调用和输出。
如果无法确定是否适合继续,请让任务保持停止状态。
如果可以继续对话,且你认为智能体的操作确实安全并符合你的指令,就可以允许对话继续。
即使你允许对话继续,监控系统仍会保持运行。如果系统发现智能体在遵循指令方面存在其他疑虑,对话可能会再次暂停。
如果我的对话出于安全预防而被终止,该怎么办?
在某些情况下,例如使用移动端,或请求启用了零数据保留 (ZDR) 时,我们无法详细说明检测到的问题,对话也无法恢复。
在这种情况下,我们建议检查智能体已完成的工作,确认其中没有明显的安全问题。
OpenAI 如何防范 API 中的同类问题?
这套系统会监控哪些 API 请求?
如果使用了持久化推理、WebSockets 或 OpenAI 的压缩功能,上述系统就会对 Responses API 中向 Astra 发出的请求进行异步监控。这套特定的监控系统不会扫描 Chat Completions API。
如何检测 API 中的对话是否已被这套系统终止?
当安全系统检测到智能体对指令的理解可能存在重大偏差时,API 会返回错误,错误代码为 misalignment_policy_violation。
在这种情况下,该对话无法恢复。
你可以在我们的 API 文档中进一步了解如何检测和处理这些错误。
如果检测到这种情况,我的应用应如何处理?
你可以考虑建立一套机制,让相关人员检查智能体在这类对话中执行的操作,例如提供一个界面,供最终用户查看。
一旦 API 中的对话因此停止,就无法恢复。
组织如何集中跟踪潜在的对齐偏差事件
我们提供了一套 Webhook 系统,方便企业集中跟踪此类事件。你可以配置 Webhook,接收 API、Codex 和 ChatGPT 中此类事件的告警。
Webhook 会将监控告警发送到你运营的服务器。API(包括通过 API 使用 Codex)和 ChatGPT/Codex 工作空间的 Webhook 需要分别配置。
根据智能体的身份验证方式,选择相应的配置方式:
| 智能体活动 | 配置位置 | 需订阅的事件 |
| API 请求使用 API 密钥的 Codex | API 项目设置 → Webhook | safety.alert.created |
| ChatGPT/Codex 活动 | 管理控制台 → 凭据 → Webhook | safety.org_alert.created |
针对 API 流量(包括使用 API 密钥的 Codex)
对于 API 流量,可以按项目配置 Webhook。
打开 API 平台,选择你希望接收其活动告警的项目。
前往项目的设置 → Webhook,然后选择创建。
输入端点名称,以及 Webhook 接收器的公共 HTTPS URL。
订阅 safety.alert.created 并创建端点。
签名密钥显示后,请立即保存。请妥善保管该密钥;它只会显示一次。
测试接收器,确认它能够验证签名、确认收到消息,并将通知转发给相应团队。
你需要拥有所选项目的 Webhook 管理权限。如果你使用多个 API 项目,请在每个项目中配置相应的端点和订阅。
有关常规配置、测试和签名验证的示例,请参阅 API Webhook 指南。
针对受支持的 ChatGPT 和 Codex 工作空间活动
以符合条件的工作空间的所有者身份登录,并打开管理控制台。
选择工作空间,然后前往凭据 → Webhook。
添加你的公共 HTTPS 端点,并订阅 safety.org_alert.created。
妥善保存签名密钥,并测试接收器。
此配置适用于受支持的工作空间活动,包括使用 ChatGPT 登录的 Codex。它与 API 项目的 Webhook 设置相互独立。必须拥有工作空间所有者身份;仅有管理员或成员角色并不足够。
如果该设置不可用,请检查是否选中了正确的工作空间、你是否为其所有者,以及该工作空间是否支持此功能。如果你使用的是个人账户,请遵循产品中显示的暂停或停止提示;此工作空间配置并非个人 Webhook 设置。
