برای مشتریان API که میخواهند در برخی مدلها به عملکرد سریعتر و باثباتتری دسترسی داشته باشند، حالت سریع را ارائه میکنیم. در ادامه، به پرسشهای متداول درباره نحوه عملکرد، قیمتگذاری، دسترسپذیری مدلها، محدودیتهای تعداد درخواست، قابلیت اطمینان، خطمشیها و شرایط احراز پاسخ دادهایم.
توجه: نام «پردازش اولویتدار» در ۳۰ ژوئیه ۲۰۲۶ به «حالت سریع» تغییر یافت. در درخواستهای API خود میتوانید از service_tier: priority یا service_tier: fast استفاده کنید.
برای اطلاعات بیشتر، اینجا را ببینید.
آیا حالت سریع در همه مناطق در دسترس است؟
دسترسپذیری حالت سریع به قوانین و مقررات لازمالاجرا در هر حوزه قضایی بستگی دارد. اگر درباره دسترسپذیری در منطقه خود پرسشی دارید، لطفاً با مدیر حساب خود تماس بگیرید.
نحوهٔ کار
مشتریان میتوانند با استفاده از پارامتر موجود service_tier و تنظیم service_tier = "fast"، ترافیک را برای هر درخواست بهصورت جداگانه به حالت سریع هدایت کنند.
هزینهٔ توکنهای پردازششده در حالت سریع، بهازای هر توکن و با نرخی بالاتر از پردازش استاندارد محاسبه میشود.
علاوه بر تنظیم حالت سریع برای هر درخواست، میتوانید آن را از مسیر تنظیمات پروژه > رده خدمات پیشفرض: سریع، بهعنوان پیشفرض پروژه تعیین کنید. همچنان میتوانید برای هر درخواست، تنظیم متفاوتی اعمال کنید. انتخاب «سریع» در تنظیمات پروژه معادل انتخاب «اولویتدار» است.
این حالت چه ارتباطی با رده مقیاسبندی دارد؟
رده مقیاسبندی همچنان از حالت سریع جدا خواهد بود. هزینهٔ درخواستهای ارسالی به حالت سریع جداگانه محاسبه میشود و از بستههای توکنبردقیقه (TPM) خریداریشدهٔ شما در رده مقیاسبندی کسر نخواهد شد.
آیا میتوانم ترافیک مازاد بر ظرفیت رده مقیاسبندی را بهطور خودکار به حالت سریع بفرستم؟
خیر. ترافیک ارسالی به رده مقیاسبندی، در صورت فراتر رفتن از ظرفیت، بهطور خودکار به حالت سریع منتقل نمیشود.
هزینهٔ حالت سریع چگونه محاسبه میشود؟
هزینهٔ توکنهای پردازششده در حالت سریع، بهازای هر توکن و با نرخی بالاتر از پردازش استاندارد محاسبه میشود.
آیا تعهد سالانهٔ من به حالت پردازش خاصی محدود است؟
خیر. هزینهٔ همهٔ حالتهای پردازش در تعهد هزینهٔ سالانهٔ Enterprise شما لحاظ میشود.
آیا همچنان برای توکنهای ورودیِ ذخیرهشده در حافظهٔ نهان تخفیف میگیرم؟
بله! ورودیهای ذخیرهشده در حافظهٔ نهان، همانند پردازش استاندارد، مشمول تخفیف ۵۰ تا ۷۵ درصدی میشوند.
چگونه میزان مصرف و هزینهٔ حالت سریع را ببینم؟
برای مشاهدهٔ توکنهای پردازششده در حالت سریع (با نام قبلی پردازش اولویتدار)، به داشبورد مصرف بروید، Chat Completions یا Responses را انتخاب کنید و گروهبندی را بر اساس رده خدمات تنظیم کنید.
برای مشاهدهٔ هزینهٔ حالت سریع، به داشبورد مصرف بروید و «گروهبندی بر اساس ردیف هزینه» را انتخاب کنید.
در داشبورد مصرف، درخواستهایی که مقدار service_tier آنها priority یا fast است، همچنان با عنوان priority نمایش داده میشوند. این شیوهٔ نمایش برای مدلهای آینده بهروزرسانی خواهد شد.
مدلها
آیا حالت سریع برای زمینهٔ طولانی، مدلهای تنظیم دقیقشده، بردارهای تعبیه و موارد مشابه در دسترس است؟
در حال حاضر خیر. در آینده بررسی خواهیم کرد که آیا حالت سریع را علاوه بر جدیدترین مدلهایمان، برای محصولات دیگری نیز ارائه کنیم یا نه.
سایر انواع داده در حالت سریع چگونه پردازش میشوند؟
حالت سریع از همان قابلیتهای چندوجهیِ موجود در حالت استاندارد پشتیبانی میکند. بهطور مشخص، میتوان از تصاویر بهعنوان ورودیِ پردازش اولویتدار استفاده کرد؛ این تصاویر نیز با همان تأخیر کم پردازش میشوند.
آیا مدلهای آینده پشتیبانی خواهند شد؟
قصد داریم حالت سریع را برای مدلهای جدید GPT ارائه کنیم، اما پشتیبانی از تکتک مدلها را تضمین نمیکنیم.
محدودیت تعداد درخواست
محدودیت تعداد درخواست چقدر است؟
از نظر محدودیت تعداد درخواست، مصرف پردازش اولویتدار همانند ترافیک استاندارد API محاسبه میشود.
محدودیتهای نرخ افزایش چیست؟
حالت سریع دارای محدودیت نرخ افزایش است تا ضمن ارائهٔ قیمتگذاری منعطف و مبتنی بر مصرف، عملکردی همواره مطلوب برای همهٔ مشتریان فراهم کند. اگر هم (الف) عملکرد حالت سریع افت کرده باشد و هم (ب) ترافیک یک مشتری با سرعت بیش از حد افزایش یابد، در موارد نادر ممکن است برخی درخواستها بهجای حالت سریع با پردازش استاندارد انجام شوند.
محدودیت فعلی نرخ افزایش در حالت سریع، در مستندات اصلی ما در اینجا تعریف شده است.
توصیههایی برای رعایت محدودیت نرخ افزایش
هنگام تغییر مدل، ترافیک را بهتدریج افزایش دهید. برای مثال، اگر برنامهٔ شما از نسخهٔ ثابت قبلی مدل به نسخهای جدید منتقل میشود، از یک پرچم قابلیت استفاده کنید تا ترافیک بهجای انتقال یکباره، طی چند ساعت منتقل شود.
از اجرای پردازشهای حجیم داده یا کارهای ناهمگام در حالت سریع خودداری کنید. این کارها میتوانند ترافیک را بسیار سریع افزایش دهند و اغلب به عملکرد بهتر حالت سریع نیازی ندارند.
اگر مرتباً به محدودیت نرخ افزایش میرسید، خرید سهمیهٔ رده مقیاسبندی را بهعنوان جایگزین در نظر بگیرید.
آیا محدودیت نرخ افزایش بین پروژهها یا سازمانهای من مشترک است؟
بله، تمام ترافیک شما در محاسبهٔ یک محدودیت نرخ افزایش مشترک لحاظ میشود.
سیاستها
اگر حالت سریع به تأخیر هدف نرسد، چه میشود؟
برای هرگونه پرسش یا نگرانی، لطفاً با مدیر حساب (AD) خود تماس بگیرید. توافقنامههای سطح خدمات (SLA) حالت سریع همانند توافقنامههای رده مقیاسبندی اعمال میشوند؛ اگر در یک بازهٔ زمانی مشخص نتوانیم این تعهدات را برای مشتریان دارای قرارداد Enterprise برآورده کنیم، اعتبار خدمات به آنها تعلق خواهد گرفت.
آیا حالت سریع با الزامات محل اقامت داده سازگار است؟
بله.
آیا حالت سریع با ZDR و BAA سازگار است؟
بله.
فوقسریع برای GPT-6 Astra
فوقسریع یک رده خدمات مجزا برای بارهای کاریای است که به پاسخهای GPT-6 Astra با تأخیر کمتر نیاز دارند؛ مانند برنامههای تعاملی و گردشکارهای کدنویسی.
راهنمای قیمتگذاری، محدودیت تعداد درخواست و سیاستهای حالت سریع، برای درخواستهایی اعمال میشود که از service_tier="fast" استفاده میکنند. درخواستهای فوقسریع از ردهٔ مجزای service_tier="ultrafast" استفاده میکنند.
چگونه یک درخواست فوقسریع ارسال کنم؟
اگر سازمان شما به فوقسریع دسترسی دارد، از API Responses با تنظیمات زیر استفاده کنید:
مدل:
gpt-6-astraرده خدمات:
ultrafastهدر درخواست:
OpenAI-Service-Tier: ultrafast
علاوه بر تنظیم رده خدمات، ارسال هدر درخواست نیز الزامی است.
در برنامههایی که فراخوانی ابزار اجرا میکنند، حالت WebSocket به شما امکان میدهد در نوبتهای مختلف از یک اتصال استفاده کنید و سربار اتصال را کاهش دهید.
آیا میتوانم از همین هدر درخواست برای سایر ردههای خدمات استفاده کنم؟
در دورهٔ آلفای فوقسریع، هدر OpenAI-Service-Tier فقط مقدار ultrafast را میپذیرد. ارسال هر مقدار دیگری، از جمله default، fast یا flex، خطای HTTP 400 برمیگرداند. هنگام استفاده از ردهای دیگر، این هدر را ارسال نکنید.
آیا میتوانم از فوقسریع در حالت کار یا Codex استفاده کنم؟
فوقسریع در حالت کار و Codex نیز برای طرحها و فضاهای کاری واجد شرایط در دسترس است. شرایط دسترسی و استفاده در طرحهای ChatGPT با دسترسی از طریق API متفاوت است.
برای جزئیات دسترسی و استفاده، به ChatGPT کار و Codex مراجعه کنید.
