OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

راهنمای صورتحساب برای API بهبود تقویتی

صورتحساب API ‏RFT چگونه کار می‌کند

به‌روزرسانی: 11 days ago

نحوه محاسبه هزینه برای بهبود تقویتی (RFT)

بهبود تقویتی (RFT) به شما امکان می‌دهد عملکرد مدل‌های استدلال OpenAI را با استفاده از یادگیری تقویتی بهینه کنید. برخلاف خدمات فاین‌تیونینگ نظارت‌شده یا مبتنی بر ترجیح ما، که هزینه‌شان بر اساس تعداد توکن‌های موجود در مجموعه‌داده آموزشی محاسبه می‌شود، هزینه بهبود تقویتی (RFT) بر پایه مدت زمانی محاسبه می‌شود که فرایند آموزش شما صرف انجام کار اصلی یادگیری ماشین می‌کند.

این راهنما توضیح می‌دهد چه چیزی به‌عنوان زمان آموزشی قابل‌صورتحساب محسوب می‌شود، وقفه‌ها و لغوها را چگونه مدیریت می‌کنیم، و انتخاب‌های پیکربندی شما چگونه می‌توانند بر هزینه اثر بگذارند.

قیمت‌گذاری

  • محاسبات: ۱۰۰ دلار به‌ازای هر ساعت زمان سپری‌شده در حلقهٔ اصلی آموزش برای o4-mini-2025-04-16. هزینه‌ها به‌صورت متناسب تا واحد ثانیه محاسبه و در فاکتور تا دو رقم اعشار گرد می‌شوند (مثلاً ۲٫۵۵ ساعت).

  • مصرف مدل ارزیاب: اگر در طول آموزش از یک مدل OpenAI برای «نمره‌گذاری» خروجی‌ها استفاده کنید، توکن‌های مصرف‌شده در این فراخوانی‌های نمره‌گذاری پس از پایان آموزش، جداگانه و با نرخ‌های استاندارد API ما صورتحساب می‌شوند.

ما فقط برای کار آموزشی‌ای هزینه می‌گیریم که واقعاً مدل شما را به‌روزرسانی می‌کند (چیزی که آن را «پیشرفت روبه‌جلوی ثبت‌شده» می‌نامیم).

مواردی که برای آن‌ها هزینه دریافت می‌کنیم

ما برای زمانی هزینه دریافت می‌کنیم که ورکر آموزشی شما فعالانه مدل شما را آموزش می‌دهد؛ مشخصاً:

  • تولید نمونه‌ها از مدل شما در فرایند بهبود تنظیم (معروف به «رول‌اوت‌ها»)

  • ارزیابی آن خروجی‌ها با یک یا چند ارزیابی که در کار تعریف کرده‌اید (درباره ارزیاب‌ها بیشتر بدانید)

  • محاسبه و اعمال به‌روزرسانی‌های وزن بر اساس نمره‌ها (پس‌انتشار).

  • اجرای هر مرحله اعتبارسنجی (ارزیابی) که پیکربندی کرده‌اید.

اجرای بیشتر ارزیاب‌ها «رایگان» است؛ یعنی خارج از زمانی که به حلقه اصلی آموزش اضافه می‌کنند، هزینه اضافی بابت استفاده از آن‌ها دریافت نمی‌کنیم. استثنا مربوط به ارزیاب‌های مدل است؛ در آن‌ها توکن‌هایی را که این ارزیاب‌ها طی فعالیت‌های بالا مصرف می‌کنند نیز محاسبه می‌کنیم. این توکن‌ها به‌صورت یک قلم جداگانه در فاکتور شما ظاهر می‌شوند. توکن‌های مصرف‌شده توسط ارزیاب‌های مدل با نرخ‌های عادی استنتاج محاسبه می‌شوند (قیمت‌گذاری OpenAI).

برای چه چیزهایی هزینه نمی‌گیریم

ما برای زمان صرف‌شده در این موارد هزینه‌ای دریافت نمی‌کنیم:

  • اعتبارسنجی یا بررسی مجموعه‌دادهٔ شما پیش از شروع آموزش.

  • بررسی‌های ایمنی روی مجموعه‌دادهٔ شما.

  • انتظار در صف برای منابع محاسباتی.

  • دانلود وزن‌های مدل یا مجموعه‌داده‌ها.

  • آماده‌سازی (rendering) مجموعه‌دادهٔ شما به قالب آموزشی ما.

  • ارزیابی‌های ایمنیِ پس از آموزش برای مدل ریزتنظیم‌شدهٔ شما.

اگر کار آموزشی به‌دلیل خطا از سمت ما از دست برود (برای مثال، اگر یک کارگر از کار بیفتد و مجبور شود به checkpoint قبلی برگردد)، بابت زمان محاسباتی ازدست‌رفته یا توکن‌های ارزیاب از شما هزینه‌ای دریافت نمی‌شود. جزئیات بیشتر در این‌باره در بخش بعدی آمده است.

پیشرفت روبه‌جلوی ثبت‌شده و رویدادهای صورتحساب

آموزش از به‌روزرسانی‌های کوچک فراوانی برای مدل شما تشکیل شده است. ما پیگیری می‌کنیم چه تعداد از این به‌روزرسانی‌ها با موفقیت کامل می‌شوند. هزینه‌ها بر پایهٔ زمان محاسبات و توکن‌های ارزیابِ مرتبط با این به‌روزرسانی‌های موفق هستند.

وقتی یکی از «رویدادهای صورتحساب» زیر رخ دهد، هزینه صادر می‌کنیم:

  • آموزش با موفقیت کامل می‌شود.

  • شما آموزش را متوقف می‌کنید.

  • شما آموزش را لغو می‌کنید.

  • آموزش شکست می‌خورد.

هر هزینه، کار افزایشی انجام‌شده از زمان آخرین هزینه را پوشش می‌دهد. برای مثال:

  • اگر اجرایی را متوقف کنید، ما یک checkpoint ذخیره می‌کنیم و بابت زمان محاسبات و توکن‌های ارزیابِ استفاده‌شده از زمان آخرین هزینه از شما مبلغ دریافت می‌کنیم.

  • وقتی از سر می‌گیرید، آموزش از checkpoint ادامه پیدا می‌کند. هزینهٔ بعدی (در زمان تکمیل، توقف دیگر، لغو یا شکست) فقط کار اضافی انجام‌شده پس از ازسرگیری را پوشش می‌دهد.

  • اگر اجرایی را لغو کنید، بابت کار انجام‌شده تا زمان لغو از شما هزینه می‌گیریم.

  • اگر آموزش شکست بخورد و کار انجام‌شده از زمان آخرین هزینه از دست برود، بابت بخش ازدست‌رفته از شما صورتحساب گرفته نمی‌شود.

این رویکرد «پیشرفت روبه‌جلوی ثبت‌شده» تضمین می‌کند فقط برای کاری هزینه بپردازید که در مدل شما حفظ می‌شود یا خودتان عمداً از آن صرف‌نظر می‌کنید.

مشاهده پیشرفت کار

کارهای بهبود تقویتی (RFT) فیلدی به نام usage_metrics دارند که کل میزان استفاده کار را تا مرحله فعلی مستند می‌کند. این شامل زمان صرف‌شده برای آموزش و همه توکن‌های استفاده‌شده در همه ارزیاب‌های مدل در آن کار است. این فیلد را می‌توان از طریق API (GET /v1/fine_tuning/jobs/{job_id}) یا از طریق داشبورد بهبود تنظیم بررسی کرد.

عوامل مؤثر بر زمان آموزش

از آنجا که صورتحساب بر پایهٔ زمان است، انتخاب‌های پیکربندی شما مستقیماً بر هزینه اثر می‌گذارند. عوامل کلیدی شامل این موارد هستند:

  • دشواری مسئله: اگر مجموعه‌دادهٔ شما از مسائل دشوار تشکیل شده باشد، مدل احتمالاً زمان بیشتری را صرف استدلال روی هر مسئله می‌کند که زمان لازم برای تولید هر نمونه را افزایش می‌دهد.

  • شدت محاسبات: ابرپارامتر compute_multiplier میزان محاسبه‌ای را که در هر گام آموزش انجام می‌دهید کنترل می‌کند. مقادیر بالاتر مدل را تشویق می‌کنند برای هر نقطه‌داده با شرح‌وبسط بیشتری استدلال کند، که باعث می‌شود هر گام کندتر اجرا شود.

  • تنظیمات اعتبارسنجی:

    • بزرگ‌تر بودن مجموعهٔ اعتبارسنجی زمان صرف‌شده برای ارزیابی را افزایش می‌دهد.

    • افزایش eval_samples (تعداد خروجی‌های مدل که برای هر نمونهٔ اعتبارسنجی نمره‌گذاری می‌شوند) زمان اعتبارسنجی را افزایش می‌دهد.

    • اجرای مکررتر اعتبارسنجی (کاهش eval_interval) سهم زمان صرف‌شده برای اعتبارسنجی را بیشتر می‌کند.

  • عملکرد ارزیاب:

    • مدل‌های ارزیاب بزرگ‌تر یا توانمندتر نسبت به مدل‌های کوچک‌تر زمان بیشتری برای برگرداندن نمره نیاز دارند. برای مثال، نمره‌گذاری با یک مدل استدلال ممکن است ۱۰ برابر بیشتر از نمره‌گذاری با یک مدل غیر استدلالی زمان ببرد.

    • توابع نمره‌گذاری پیچیدهٔ Python نسبت به توابع ساده زمان بیشتری برای اجرا نیاز دارند.

این تنظیمات به شما امکان می‌دهند بین هزینه، سرعت و کیفیت مدل موازنه برقرار کنید. برای مثال، اعتبارسنجی مکرر می‌تواند مشکلات را زودتر آشکار کند اما هزینه را افزایش می‌دهد. نمره‌گذاری با یک مدل پیشرفته‌تر می‌تواند دقت نمره‌گذاری را به‌طور چشمگیری بهبود دهد، اما هر گام نمره‌گذاری را کندتر و کارها را گران‌تر می‌کند.

مدیریت هزینه

برای کنترل هزینه‌های خود:

  • با اجراهای کوتاه‌تر شروع کنید تا بفهمید پیکربندی شما چگونه بر زمان اثر می‌گذارد.

  • از تعداد معقولی نمونهٔ اعتبارسنجی و eval_samples استفاده کنید. بیش از نیاز اعتبارسنجی را تکرار نکنید.

  • کوچک‌ترین مدل ارزیاب را که نیازهای کیفی شما را برآورده می‌کند انتخاب کنید.

  • ارزیاب‌های سفارشی Python را کارآمد نگه دارید.

  • compute_multiplier را برای ایجاد توازن میان سرعت همگرایی و هزینه تنظیم کنید.

  • اجرای خود را در داشبورد یا از طریق API پایش کنید. هر زمان بخواهید می‌توانید آن را متوقف یا لغو کنید.

مثال‌ها

اجرای آموزشی موفق

زمان آموزشزمان صورتحساب‌شدهوضعیتشرح
00:0000:00کاربر کار بهبود تقویتی (RFT) را از طریق API ایجاد می‌کند
00:1000:00VALIDATING_FILES۱۰ دقیقه صرف اعتبارسنجی مجموعه‌داده شد
00:3000:00VALIDATING_FILES۲۰ دقیقه صرف اجرای بررسی‌های ایمنی مجموعه‌داده شد
01:0000:00QUEUED۳۰ دقیقه انتظار برای ورکر در دسترس
01:3000:00RUNNING۳۰ دقیقه صرف آماده‌سازی آموزش شد (دانلود وزن‌ها، پیش‌پردازش و غیره)
05:3004:00RUNNING۴ ساعت صرف آموزش شد
06:0004:00RUNNING۳۰ دقیقه صرف اجرای ارزیابی‌های ایمنی مدل حاصل شد
06:0004:00SUCCEEDEDآموزش به پایان می‌رسد

در این حالت، کل زمان واقعی سپری‌شده ۶ ساعت است، اما فقط ۴ ساعت قابل‌صورتحساب است. هزینه ۴ ساعت × $100/ساعت = $400 خواهد بود.

نمونه کار ناموفق

در این مثال، اجرا ۲ ساعت آموزش می‌بیند، یک چک‌پوینت می‌نویسد، ۱ ساعت دیگر آموزش می‌بیند، اما سپس ناموفق می‌شود. فقط ۲ ساعت آموزش تا زمان چک‌پوینت قابل‌صورتحساب است.

زمان آموزشزمان صورتحساب‌شدهوضعیتشرح
00:0000:00کاربر کار بهبود تقویتی (RFT) را از طریق API ایجاد می‌کند
00:1000:00VALIDATING_FILES۱۰ دقیقه صرف اعتبارسنجی مجموعه‌داده شد
00:3000:00VALIDATING_FILES۲۰ دقیقه صرف اجرای بررسی‌های ایمنی مجموعه‌داده شد
01:0000:00QUEUED۳۰ دقیقه انتظار برای ورکر در دسترس
01:3000:00RUNNING۳۰ دقیقه صرف آماده‌سازی آموزش شد (دانلود وزن‌ها، پیش‌پردازش و غیره)
03:3002:00RUNNING۲ ساعت صرف آموزش شد
03:3002:00RUNNINGچک‌پوینت در مرحله ۵ ایجاد شد
04:3002:00RUNNINGآموزش به‌دلیل خطای داخلی در مرحله ۸ ناموفق می‌شود (پس از ۱ ساعت دیگر)
04:3002:00RUNNING۳۰ دقیقه صرف ارزیابی و اعتبارسنجی چک‌پوینت شد
04:3002:00SUCCEEDEDکار به پایان می‌رسد (با آخرین چک‌پوینت)

اگرچه در مجموع ۳ ساعت صرف آموزش شد، فقط ۲ ساعت در یک چک‌پوینت قابل‌استفاده «ثبت» شده و صورتحساب می‌شود. مسئولیت یک ساعت کار آموزشی که به‌دلیل خرابی از دست رفته، با شما نیست. هزینه ۲ ساعت × $100/ساعت = $200 خواهد بود.

پرسش‌های متداول

چه زمانی از من هزینه دریافت می‌شود؟

وقتی اجرای شما کامل، متوقف موقت، لغو یا ناموفق شود، صورت‌حساب صادر می‌کنیم. هر صورت‌حساب، کار انجام‌شده از زمان صورت‌حساب قبلی را پوشش می‌دهد.

اگر اجرا ناموفق شود، باید هزینه بپردازم؟

اگر اجرا به‌دلیل خطای ما ناموفق شود و کار آموزشی اخیر از دست برود، برای بخش از‌دست‌رفته هزینه‌ای از شما دریافت نمی‌شود. اگر اجرایی را لغو کنید، هزینه کار انجام‌شده تا زمان لغو از شما دریافت می‌شود.

توکن‌های مدل ارزیاب چگونه صورتحساب می‌شوند؟

ما توکن‌های استفاده‌شده توسط هر ارزیاب مدل که پیکربندی می‌کنید را می‌شماریم. پس از پایان آموزش، آن توکن‌ها را با نرخ‌های استاندارد به‌ازای هر توکن صورتحساب می‌کنیم.

آیا می‌توانم یک اجرا را متوقف موقت و از سر بگیرم؟

بله. وقتی توقف موقت می‌کنید، یک چک‌پوینت ذخیره می‌کنیم و هزینه کار انجام‌شده تا آن زمان را دریافت می‌کنیم. وقتی از سر می‌گیرید، فقط برای کار اضافی انجام‌شده پس از ازسرگیری هزینه از شما دریافت می‌شود.

اگر پرسش‌های دیگری درباره صورتحساب Reinforcement Fine‑Tuning دارید، با تیم پشتیبانی ما تماس بگیرید.

آیا این مقاله مفید بود؟