OpenAI
이 페이지는 기계 번역되었습니다. 영어 원문 보기

패스트 모드 FAQ

패스트 모드와 Ultrafast 서비스 등급에 관한 자주 묻는 질문입니다.

마지막 수정: 2 days ago

특정 모델에서 더 빠르고 일관된 성능을 원하는 API 고객을 위해 패스트 모드를 제공합니다. 아래에서 작동 방식, 요금, 지원 모델, 요청 한도, 안정성, 정책, 이용 자격에 관한 자주 묻는 질문과 답변을 확인하세요.

참고: 2026년 7월 30일부터 우선 처리의 명칭이 패스트 모드로 변경되었습니다. API 요청에는 service_tier: priority 또는 service_tier: fast 중 어느 것이든 사용할 수 있습니다. 

자세한 내용은 여기에서 확인하세요.

모든 지역에서 패스트 모드를 사용할 수 있나요?

패스트 모드 이용 가능 여부는 각 관할 지역의 관련 법률과 규정에 따라 달라집니다. 해당 지역에서의 이용 가능 여부에 관한 질문은 고객 담당자에게 문의하세요.

작동 방식

고객은 기존 service_tier 매개변수에 service_tier = "fast" 옵션을 지정해 요청별로 트래픽을 패스트 모드로 보낼 수 있습니다.

패스트 모드로 처리된 토큰은 토큰 단위로 청구되며, 표준 처리보다 높은 요율이 적용됩니다.

요청별로 설정하는 것 외에도, 프로젝트 설정 > 기본 서비스 등급: 패스트에서 프로젝트의 기본값을 패스트 모드로 설정할 수 있습니다. 이 경우에도 개별 요청에서 기본값을 재정의할 수 있습니다. 프로젝트 설정에서 패스트를 선택하는 것은 우선을 선택하는 것과 동일합니다.

패스트 모드는 스케일 등급과 어떤 관계가 있나요?

스케일 등급은 패스트 모드와 계속 별도로 운영됩니다. 패스트 모드로 전송된 요청은 별도로 청구되며, 구매한 스케일 등급 TPM 번들에서 차감되지 않습니다.

스케일 등급의 초과 트래픽을 자동으로 패스트 모드로 보낼 수 있나요?

아니요. 스케일 등급으로 전송된 트래픽이 할당량을 초과해도 패스트 모드로 자동 전환되지는 않습니다.

패스트 모드 요금은 어떻게 청구되나요?

패스트 모드로 처리된 토큰은 토큰 단위로 청구되며, 표준 처리보다 높은 요율이 적용됩니다.

연간 약정은 특정 처리 모드에만 적용되나요?

아니요. 모든 처리 모드의 사용 금액이 Enterprise 연간 지출 약정에 반영됩니다.

캐시된 입력 토큰에도 할인이 계속 적용되나요?

네! 캐시된 입력에는 표준 처리와 동일하게 50~75% 할인이 적용됩니다.

패스트 모드 사용량과 지출은 어떻게 확인하나요?

패스트 모드(이전 명칭: 우선 처리)로 처리된 토큰을 확인하려면 사용량 대시보드에서 Chat Completions 또는 Responses를 선택한 다음 서비스 등급별로 그룹화하세요.

패스트 모드 비용을 확인하려면 사용량 대시보드에서 항목별 그룹화를 선택하세요.

사용량 대시보드에서는 service_tier에 priority 또는 fast를 사용하는 요청이 계속 priority로 표시됩니다. 향후 출시되는 모델에서는 이 표시가 업데이트될 예정입니다.

모델

긴 컨텍스트, 파인 튜닝된 모델, 임베딩 등에도 패스트 모드를 사용할 수 있나요?

현재는 지원하지 않습니다. 향후 최신 모델 외의 다른 제품에도 패스트 모드를 제공할지 검토할 예정입니다.

패스트 모드에서 다른 모달리티는 어떻게 처리되나요?

패스트 모드는 표준 처리와 동일한 멀티모달 기능을 지원합니다. 특히 이미지를 우선 처리의 입력으로 사용할 수 있으며, 동일하게 짧은 지연 시간으로 처리됩니다.

향후 출시될 모델도 지원되나요?

새로운 GPT 모델에도 패스트 모드를 제공할 계획이지만, 모든 모델의 지원을 보장하지는 않습니다.

요청 한도

요청 한도는 어떻게 적용되나요?

요청 한도 적용 시 우선 처리 사용량은 표준 API 트래픽과 동일하게 취급됩니다.

트래픽 증가 속도 한도란 무엇인가요?

패스트 모드는 유연한 온디맨드 요금제를 제공하면서 모든 고객에게 일관되게 높은 성능을 보장하기 위해 트래픽 증가 속도 한도를 적용합니다. (a) 패스트 모드의 성능이 저하되고 동시에 (b) 고객의 트래픽이 너무 빠르게 증가하는 경우, 드물게 일부 요청이 표준 처리로 하향 전환될 수 있습니다.

현재 패스트 모드의 트래픽 증가 속도 한도는 여기의 기본 문서에 명시되어 있습니다.

트래픽 증가 속도 한도를 넘지 않기 위한 권장 사항

모델을 변경할 때는 트래픽을 점진적으로 늘리세요. 예를 들어 애플리케이션을 이전 스냅샷에서 새 스냅샷으로 전환한다면, 기능 플래그를 사용해 트래픽을 한꺼번에 옮기지 않고 몇 시간에 걸쳐 전환하세요.

패스트 모드에서 대규모 데이터 처리나 비동기 작업을 실행하지 마세요. 이러한 작업은 트래픽을 매우 빠르게 증가시킬 수 있으며, 패스트 모드의 향상된 성능이 필요하지 않은 경우가 많습니다.

트래픽 증가 속도 한도에 자주 도달한다면, 대신 스케일 등급 할당량 구매를 고려해 보세요.

트래픽 증가 속도 한도는 제 프로젝트나 조직 전체에 걸쳐 공유되나요?

네, 모든 트래픽이 하나의 트래픽 증가 속도 한도에 합산됩니다.

정책

패스트 모드가 지연 시간 목표를 충족하지 못하면 어떻게 되나요?

질문이나 우려 사항이 있으면 고객 담당자(AD)에게 문의하세요. 패스트 모드 SLA는 스케일 등급 SLA와 동일하게 적용됩니다. 정해진 기간 동안 SLA를 충족하지 못한 경우, Enterprise 계약 고객에게 서비스 크레딧이 제공됩니다.

패스트 모드는 데이터 레지던시와 호환되나요?

네.

패스트 모드는 ZDR 및 BAA와 호환되나요?

네.

GPT-6 Astra용 Ultrafast

Ultrafast는 대화형 애플리케이션이나 코딩 워크플로처럼 GPT-6 Astra의 응답 지연 시간을 줄여야 하는 워크로드를 위한 별도의 서비스 등급입니다.

패스트 모드의 요금, 요청 한도, 정책 안내는 service_tier="fast"를 사용하는 요청에 적용됩니다. Ultrafast 요청은 별도의 service_tier="ultrafast" 등급을 사용합니다.

Ultrafast 요청은 어떻게 보내나요?

Ultrafast 이용 권한이 있는 조직은 다음 설정으로 Responses API를 사용하세요.

  • 모델: gpt-6-astra

  • 서비스 등급: ultrafast

  • 요청 헤더: OpenAI-Service-Tier: ultrafast

서비스 등급 설정 외에 요청 헤더도 반드시 포함해야 합니다.

도구 호출을 실행하는 애플리케이션에서는 WebSocket 모드를 사용해 여러 턴에 걸쳐 연결을 재사용하고 연결 오버헤드를 줄일 수 있습니다.

다른 서비스 등급에도 같은 요청 헤더를 사용할 수 있나요?

Ultrafast 알파 기간에는 OpenAI-Service-Tier 헤더에 ultrafast만 사용할 수 있습니다. default, fast, flex를 포함한 다른 값을 보내면 HTTP 400 오류가 반환됩니다. 다른 등급을 사용할 때는 이 헤더를 생략하세요.

Work나 Codex에서 Ultrafast를 사용할 수 있나요?

이용 요건을 충족하는 요금제와 워크스페이스에서는 Work와 Codex에서도 Ultrafast를 사용할 수 있습니다. ChatGPT 요금제의 이용 자격과 사용 조건은 API 이용 시와 다릅니다.

이용 가능 여부와 사용에 관한 자세한 내용은 ChatGPT Work 및 Codex를 참고하세요.

이 문서가 도움이 되었나요?