OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

پرسش‌های متداول حالت سریع

پرسش‌های متداول دربارهٔ حالت سریع و رده خدمات فوق‌سریع.

به‌روزرسانی: 20 hours ago

برای مشتریان API که می‌خواهند در برخی مدل‌ها به عملکرد سریع‌تر و باثبات‌تری دسترسی داشته باشند، حالت سریع را ارائه می‌کنیم. در ادامه، به پرسش‌های متداول درباره نحوه عملکرد، قیمت‌گذاری، دسترس‌پذیری مدل‌ها، محدودیت‌های تعداد درخواست، قابلیت اطمینان، خط‌مشی‌ها و شرایط احراز پاسخ داده‌ایم.

توجه: نام «پردازش اولویت‌دار» در ۳۰ ژوئیه ۲۰۲۶ به «حالت سریع» تغییر یافت. در درخواست‌های API خود می‌توانید از service_tier: priority یا service_tier: fast استفاده کنید. 

برای اطلاعات بیشتر، اینجا را ببینید.

آیا حالت سریع در همه مناطق در دسترس است؟

دسترس‌پذیری حالت سریع به قوانین و مقررات لازم‌الاجرا در هر حوزه قضایی بستگی دارد. اگر درباره دسترس‌پذیری در منطقه خود پرسشی دارید، لطفاً با مدیر حساب خود تماس بگیرید.

نحوهٔ کار

مشتریان می‌توانند با استفاده از پارامتر موجود service_tier و تنظیم service_tier = "fast"، ترافیک را برای هر درخواست به‌صورت جداگانه به حالت سریع هدایت کنند.

هزینهٔ توکن‌های پردازش‌شده در حالت سریع، به‌ازای هر توکن و با نرخی بالاتر از پردازش استاندارد محاسبه می‌شود.

علاوه بر تنظیم حالت سریع برای هر درخواست، می‌توانید آن را از مسیر تنظیمات پروژه > رده خدمات پیش‌فرض: سریع، به‌عنوان پیش‌فرض پروژه تعیین کنید. همچنان می‌توانید برای هر درخواست، تنظیم متفاوتی اعمال کنید. انتخاب «سریع» در تنظیمات پروژه معادل انتخاب «اولویت‌دار» است.

این حالت چه ارتباطی با رده مقیاس‌بندی دارد؟

رده مقیاس‌بندی همچنان از حالت سریع جدا خواهد بود. هزینهٔ درخواست‌های ارسالی به حالت سریع جداگانه محاسبه می‌شود و از بسته‌های توکن‌بر‌دقیقه (TPM) خریداری‌شدهٔ شما در رده مقیاس‌بندی کسر نخواهد شد.

آیا می‌توانم ترافیک مازاد بر ظرفیت رده مقیاس‌بندی را به‌طور خودکار به حالت سریع بفرستم؟

خیر. ترافیک ارسالی به رده مقیاس‌بندی، در صورت فراتر رفتن از ظرفیت، به‌طور خودکار به حالت سریع منتقل نمی‌شود.

هزینهٔ حالت سریع چگونه محاسبه می‌شود؟

هزینهٔ توکن‌های پردازش‌شده در حالت سریع، به‌ازای هر توکن و با نرخی بالاتر از پردازش استاندارد محاسبه می‌شود.

آیا تعهد سالانهٔ من به حالت پردازش خاصی محدود است؟

خیر. هزینهٔ همهٔ حالت‌های پردازش در تعهد هزینهٔ سالانهٔ Enterprise شما لحاظ می‌شود.

آیا همچنان برای توکن‌های ورودیِ ذخیره‌شده در حافظهٔ نهان تخفیف می‌گیرم؟

بله! ورودی‌های ذخیره‌شده در حافظهٔ نهان، همانند پردازش استاندارد، مشمول تخفیف ۵۰ تا ۷۵ درصدی می‌شوند.

چگونه میزان مصرف و هزینهٔ حالت سریع را ببینم؟

برای مشاهدهٔ توکن‌های پردازش‌شده در حالت سریع (با نام قبلی پردازش اولویت‌دار)، به داشبورد مصرف بروید، Chat Completions یا Responses را انتخاب کنید و گروه‌بندی را بر اساس رده خدمات تنظیم کنید.

برای مشاهدهٔ هزینهٔ حالت سریع، به داشبورد مصرف بروید و «گروه‌بندی بر اساس ردیف هزینه» را انتخاب کنید.

در داشبورد مصرف، درخواست‌هایی که مقدار service_tier آن‌ها priority یا fast است، همچنان با عنوان priority نمایش داده می‌شوند. این شیوهٔ نمایش برای مدل‌های آینده به‌روزرسانی خواهد شد.

مدل‌ها

آیا حالت سریع برای زمینهٔ طولانی، مدل‌های تنظیم دقیق‌شده، بردارهای تعبیه و موارد مشابه در دسترس است؟

در حال حاضر خیر. در آینده بررسی خواهیم کرد که آیا حالت سریع را علاوه بر جدیدترین مدل‌هایمان، برای محصولات دیگری نیز ارائه کنیم یا نه.

سایر انواع داده در حالت سریع چگونه پردازش می‌شوند؟

حالت سریع از همان قابلیت‌های چندوجهیِ موجود در حالت استاندارد پشتیبانی می‌کند. به‌طور مشخص، می‌توان از تصاویر به‌عنوان ورودیِ پردازش اولویت‌دار استفاده کرد؛ این تصاویر نیز با همان تأخیر کم پردازش می‌شوند.

آیا مدل‌های آینده پشتیبانی خواهند شد؟

قصد داریم حالت سریع را برای مدل‌های جدید GPT ارائه کنیم، اما پشتیبانی از تک‌تک مدل‌ها را تضمین نمی‌کنیم.

محدودیت تعداد درخواست

محدودیت تعداد درخواست چقدر است؟

از نظر محدودیت تعداد درخواست، مصرف پردازش اولویت‌دار همانند ترافیک استاندارد API محاسبه می‌شود.

محدودیت‌های نرخ افزایش چیست؟

حالت سریع دارای محدودیت نرخ افزایش است تا ضمن ارائهٔ قیمت‌گذاری منعطف و مبتنی بر مصرف، عملکردی همواره مطلوب برای همهٔ مشتریان فراهم کند. اگر هم (الف) عملکرد حالت سریع افت کرده باشد و هم (ب) ترافیک یک مشتری با سرعت بیش از حد افزایش یابد، در موارد نادر ممکن است برخی درخواست‌ها به‌جای حالت سریع با پردازش استاندارد انجام شوند.

محدودیت فعلی نرخ افزایش در حالت سریع، در مستندات اصلی ما در اینجا تعریف شده است.

توصیه‌هایی برای رعایت محدودیت نرخ افزایش

هنگام تغییر مدل، ترافیک را به‌تدریج افزایش دهید. برای مثال، اگر برنامهٔ شما از نسخهٔ ثابت قبلی مدل به نسخه‌ای جدید منتقل می‌شود، از یک پرچم قابلیت استفاده کنید تا ترافیک به‌جای انتقال یک‌باره، طی چند ساعت منتقل شود.

از اجرای پردازش‌های حجیم داده یا کارهای ناهمگام در حالت سریع خودداری کنید. این کارها می‌توانند ترافیک را بسیار سریع افزایش دهند و اغلب به عملکرد بهتر حالت سریع نیازی ندارند.

اگر مرتباً به محدودیت نرخ افزایش می‌رسید، خرید سهمیهٔ رده مقیاس‌بندی را به‌عنوان جایگزین در نظر بگیرید.

آیا محدودیت نرخ افزایش بین پروژه‌ها یا سازمان‌های من مشترک است؟

بله، تمام ترافیک شما در محاسبهٔ یک محدودیت نرخ افزایش مشترک لحاظ می‌شود.

سیاست‌ها

اگر حالت سریع به تأخیر هدف نرسد، چه می‌شود؟

برای هرگونه پرسش یا نگرانی، لطفاً با مدیر حساب (AD) خود تماس بگیرید. توافق‌نامه‌های سطح خدمات (SLA) حالت سریع همانند توافق‌نامه‌های رده مقیاس‌بندی اعمال می‌شوند؛ اگر در یک بازهٔ زمانی مشخص نتوانیم این تعهدات را برای مشتریان دارای قرارداد Enterprise برآورده کنیم، اعتبار خدمات به آن‌ها تعلق خواهد گرفت.

آیا حالت سریع با الزامات محل اقامت داده سازگار است؟

بله.

آیا حالت سریع با ZDR و BAA سازگار است؟

بله.

فوق‌سریع برای GPT-6 Astra

فوق‌سریع یک رده خدمات مجزا برای بارهای کاری‌ای است که به پاسخ‌های GPT-6 Astra با تأخیر کمتر نیاز دارند؛ مانند برنامه‌های تعاملی و گردش‌کارهای کدنویسی.

راهنمای قیمت‌گذاری، محدودیت تعداد درخواست و سیاست‌های حالت سریع، برای درخواست‌هایی اعمال می‌شود که از service_tier="fast" استفاده می‌کنند. درخواست‌های فوق‌سریع از ردهٔ مجزای service_tier="ultrafast" استفاده می‌کنند.

چگونه یک درخواست فوق‌سریع ارسال کنم؟

اگر سازمان شما به فوق‌سریع دسترسی دارد، از API Responses با تنظیمات زیر استفاده کنید:

  • مدل: gpt-6-astra

  • رده خدمات: ultrafast

  • هدر درخواست: OpenAI-Service-Tier: ultrafast

علاوه بر تنظیم رده خدمات، ارسال هدر درخواست نیز الزامی است.

در برنامه‌هایی که فراخوانی ابزار اجرا می‌کنند، حالت WebSocket به شما امکان می‌دهد در نوبت‌های مختلف از یک اتصال استفاده کنید و سربار اتصال را کاهش دهید.

آیا می‌توانم از همین هدر درخواست برای سایر رده‌های خدمات استفاده کنم؟

در دورهٔ آلفای فوق‌سریع، هدر OpenAI-Service-Tier فقط مقدار ultrafast را می‌پذیرد. ارسال هر مقدار دیگری، از جمله default، fast یا flex، خطای HTTP 400 برمی‌گرداند. هنگام استفاده از رده‌ای دیگر، این هدر را ارسال نکنید.

آیا می‌توانم از فوق‌سریع در حالت کار یا Codex استفاده کنم؟

فوق‌سریع در حالت کار و Codex نیز برای طرح‌ها و فضاهای کاری واجد شرایط در دسترس است. شرایط دسترسی و استفاده در طرح‌های ChatGPT با دسترسی از طریق API متفاوت است.

برای جزئیات دسترسی و استفاده، به ChatGPT کار و Codex مراجعه کنید.

آیا این مقاله مفید بود؟