OpenAI
Trang này được dịch bằng máy học. Xem bài viết gốc bằng tiếng Anh.

Câu hỏi thường gặp về Chế độ nhanh

Các câu hỏi thường gặp về Chế độ nhanh và gói dịch vụ Ultrafast.

Đã cập nhật: 4 days ago

Chúng tôi cung cấp Chế độ nhanh cho khách hàng API muốn có hiệu suất nhanh hơn, ổn định hơn trên một số mô hình nhất định. Dưới đây là câu trả lời cho những câu hỏi thường gặp về cách thức hoạt động, giá cả, tính sẵn có của mô hình, giới hạn tốc độ, độ tin cậy, chính sách và điều kiện sử dụng.

Lưu ý: Tính năng Xử lý ưu tiên đã được đổi tên thành Chế độ nhanh vào ngày 30 tháng 7 năm 2026. Bạn có thể sử dụng service_tier: priority hoặc service_tier: fast trong các yêu cầu API. 

Tìm hiểu thêm tại đây.

Chế độ nhanh có được cung cấp ở tất cả các khu vực không?

Tính sẵn có của Chế độ nhanh phụ thuộc vào luật và quy định hiện hành tại từng khu vực pháp lý. Vui lòng liên hệ với Giám đốc phụ trách tài khoản nếu bạn có thắc mắc về tính sẵn có tại khu vực của mình.

Cách hoạt động

Khách hàng có thể chuyển từng yêu cầu sang Chế độ nhanh bằng tham số service_tier hiện có, với tùy chọn service_tier = "fast".

Các token được xử lý bằng Chế độ nhanh sẽ được tính phí theo từng token, với đơn giá cao hơn chế độ xử lý Tiêu chuẩn.

Ngoài việc cấu hình cho từng yêu cầu, bạn cũng có thể đặt Chế độ nhanh làm mặc định cho dự án tại Cài đặt dự án > Gói dịch vụ mặc định: Nhanh. Bạn vẫn có thể ghi đè cài đặt này cho từng yêu cầu. Chọn Nhanh trong cài đặt dự án tương đương với việc chọn Ưu tiên.

Chế độ này có liên hệ như thế nào với Cấp năng lực xử lý?

Cấp năng lực xử lý sẽ vẫn tách biệt với Chế độ nhanh. Các yêu cầu gửi đến Chế độ nhanh sẽ được tính phí riêng và không trừ vào các gói TPM thuộc Cấp năng lực xử lý mà bạn đã mua.

Tôi có thể tự động chuyển lưu lượng vượt hạn mức Cấp năng lực xử lý sang Chế độ nhanh không?

Không. Lưu lượng gửi đến Cấp năng lực xử lý sẽ không tự động chuyển sang Chế độ nhanh khi vượt hạn mức.

Chế độ nhanh được tính phí như thế nào?

Các token được xử lý bằng Chế độ nhanh sẽ được tính phí theo từng token, với đơn giá cao hơn chế độ xử lý Tiêu chuẩn.

Cam kết chi tiêu hằng năm của tôi có gắn với một chế độ xử lý cụ thể không?

Không. Chi phí của tất cả các chế độ xử lý đều được tính vào cam kết chi tiêu Enterprise hằng năm của bạn.

Tôi có còn được giảm giá cho token đầu vào đã lưu trong bộ nhớ đệm không?

Có! Đầu vào đã lưu trong bộ nhớ đệm được giảm giá 50–75%, giống như khi dùng chế độ xử lý Tiêu chuẩn.

Làm cách nào để xem mức sử dụng và chi tiêu cho Chế độ nhanh?

Để xem các token được xử lý bằng Chế độ nhanh (trước đây là chế độ xử lý Ưu tiên), hãy vào bảng điều khiển Mức sử dụng, chọn Chat Completions hoặc Responses, rồi chọn Nhóm theo Gói dịch vụ.

Để xem chi phí của Chế độ nhanh, hãy vào bảng điều khiển Mức sử dụng rồi chọn Nhóm theo Mục chi phí.

Trên bảng điều khiển Mức sử dụng, các yêu cầu có service_tier là priority hoặc fast sẽ tiếp tục hiển thị là priority. Cách hiển thị này sẽ được cập nhật cho các mô hình trong tương lai.

Mô hình

Chế độ nhanh có hỗ trợ ngữ cảnh dài, mô hình đã tinh chỉnh, vectơ nhúng, v.v. không?

Hiện tại thì chưa. Trong tương lai, chúng tôi sẽ cân nhắc việc cung cấp Chế độ nhanh cho các sản phẩm khác ngoài những mô hình mới nhất của mình.

Các phương thức khác hoạt động như thế nào trong Chế độ nhanh?

Chế độ nhanh hỗ trợ các khả năng đa phương thức giống như chế độ Tiêu chuẩn. Cụ thể, bạn có thể dùng hình ảnh làm đầu vào cho chế độ xử lý Ưu tiên và hình ảnh sẽ được xử lý với độ trễ thấp tương đương.

Các mô hình trong tương lai có được hỗ trợ không?

Chúng tôi dự định cung cấp Chế độ nhanh trên các mô hình GPT mới, nhưng không đảm bảo rằng mọi mô hình đều sẽ được hỗ trợ.

Giới hạn tốc độ

Giới hạn tốc độ được áp dụng như thế nào?

Về giới hạn tốc độ, mức sử dụng chế độ xử lý Ưu tiên được tính giống như lưu lượng API tiêu chuẩn.

Giới hạn tốc độ tăng/giảm là gì?

Chế độ nhanh áp dụng giới hạn tốc độ tăng/giảm để đảm bảo hiệu năng luôn ở mức cao cho mọi khách hàng, đồng thời vẫn tính phí linh hoạt theo nhu cầu. Nếu (a) hiệu năng của Chế độ nhanh suy giảm ĐỒNG THỜI (b) lưu lượng của khách hàng tăng quá nhanh, thì trong một số trường hợp hiếm gặp, một số yêu cầu có thể bị hạ xuống chế độ xử lý Tiêu chuẩn.

Giới hạn tốc độ tăng/giảm hiện tại của Chế độ nhanh được quy định trong tài liệu chính của chúng tôi tại đây.

Các phương pháp nên áp dụng để không vượt giới hạn tốc độ tăng/giảm

Tăng dần lưu lượng khi thay đổi mô hình. Ví dụ, nếu ứng dụng của bạn đang chuyển từ một phiên bản mô hình cũ sang phiên bản mới, hãy dùng cờ tính năng để chuyển dần lưu lượng trong vài giờ thay vì chuyển toàn bộ cùng lúc.

Tránh chạy các tác vụ xử lý dữ liệu lớn hoặc tác vụ bất đồng bộ trong Chế độ nhanh. Những tác vụ này có thể khiến lưu lượng tăng rất nhanh và thường không cần đến hiệu năng cao hơn của Chế độ nhanh.

Nếu thường xuyên chạm giới hạn tốc độ tăng/giảm, bạn nên cân nhắc mua hạn mức Cấp năng lực xử lý.

Giới hạn tốc độ tăng/giảm có áp dụng chung cho các dự án hoặc tổ chức của tôi không?

Có, toàn bộ lưu lượng của bạn đều được tính vào cùng một giới hạn tốc độ tăng/giảm.

Chính sách

Điều gì xảy ra nếu Chế độ nhanh không đạt mục tiêu về độ trễ?

Vui lòng liên hệ với AD phụ trách bạn nếu có bất kỳ câu hỏi hay băn khoăn nào. SLA của Chế độ nhanh sẽ được áp dụng giống như SLA của Cấp năng lực xử lý; chúng tôi sẽ cấp credit dịch vụ nếu không đáp ứng các SLA đó cho khách hàng có hợp đồng Enterprise trong một khoảng thời gian nhất định.

Chế độ nhanh có tương thích với nơi lưu trú dữ liệu không?

Có.

Chế độ nhanh có tương thích với ZDR và BAA không?

Có.

Ultrafast dành cho GPT-6 Astra

Ultrafast là một gói dịch vụ riêng dành cho các tác vụ cần phản hồi từ GPT-6 Astra với độ trễ thấp hơn, chẳng hạn như ứng dụng tương tác và quy trình lập trình.

Hướng dẫn về giá, giới hạn tốc độ và chính sách của Chế độ nhanh áp dụng cho các yêu cầu sử dụng service_tier="fast". Các yêu cầu Ultrafast sử dụng gói riêng service_tier="ultrafast".

Làm cách nào để gửi yêu cầu Ultrafast?

Nếu tổ chức có quyền truy cập Ultrafast, hãy dùng Responses API với:

  • Mô hình: gpt-6-astra

  • Gói dịch vụ: ultrafast

  • Tiêu đề yêu cầu: OpenAI-Service-Tier: ultrafast

Ngoài cài đặt gói dịch vụ, bạn bắt buộc phải gửi kèm tiêu đề yêu cầu.

Với các ứng dụng thực hiện lệnh gọi công cụ, chế độ WebSocket cho phép tái sử dụng một kết nối qua nhiều lượt và giảm chi phí thiết lập kết nối.

Tôi có thể dùng cùng tiêu đề yêu cầu cho các gói dịch vụ khác không?

Trong giai đoạn alpha của Ultrafast, tiêu đề OpenAI-Service-Tier chỉ chấp nhận giá trị ultrafast. Nếu gửi một giá trị khác, kể cả default, fast hoặc flex, bạn sẽ nhận được lỗi HTTP 400. Hãy bỏ tiêu đề này khi sử dụng gói khác.

Tôi có thể dùng Ultrafast trong Công việc hoặc Codex không?

Ultrafast cũng có trong Công việc và Codex đối với các gói và không gian làm việc đủ điều kiện. Điều kiện áp dụng theo gói và cách sử dụng trên ChatGPT khác với quyền truy cập qua API.

Xem ChatGPT Công việc và Codex để biết chi tiết về phạm vi cung cấp và cách sử dụng.

Bài viết này có hữu ích không?