OpenAI
หน้านี้แปลด้วยระบบอัตโนมัติ ดูต้นฉบับภาษาอังกฤษ.

คู่มือการคิดค่าบริการสำหรับ Reinforcement Fine-Tuning API

การคิดค่าบริการสำหรับ RFT API ทำงานอย่างไร

อัปเดตล่าสุด: 20 days ago

การเรียกเก็บเงินสำหรับ RFT ทำงานอย่างไร

Reinforcement Fine‑Tuning (RFT) ช่วยให้คุณปรับประสิทธิภาพของโมเดลการให้เหตุผลของ OpenAI ให้เหมาะสมยิ่งขึ้นโดยใช้การเรียนรู้แบบเสริมกำลัง ต่างจากบริการ fine‑tuning แบบมีผู้สอนหรือแบบอิงความชอบของเรา ซึ่งคิดค่าบริการตามจำนวน Token ในชุดข้อมูลการฝึก RFT จะคิดค่าบริการตามเวลาที่การรันการฝึกของคุณใช้ไปกับการทำงานหลักด้านแมชชีนเลิร์นนิง

คู่มือนี้อธิบายว่าส่วนใดนับเป็นเวลาฝึกที่คิดค่าบริการ วิธีที่เราจัดการกับการหยุดชั่วคราวและการยกเลิก และตัวเลือกการกำหนดค่าของคุณอาจส่งผลต่อต้นทุนอย่างไร

ราคา

  • การประมวลผล: 100 ดอลลาร์ต่อชั่วโมงตามเวลาจริงที่ใช้ในลูปหลักของการฝึกสำหรับ o4-mini-2025-04-16 ระบบคิดค่าบริการตามสัดส่วนถึงระดับวินาที และปัดเป็นทศนิยมสองตำแหน่งในใบแจ้งหนี้ (เช่น 2.55 ชั่วโมง)

  • การใช้งานโมเดลผู้ให้คะแนน: หากคุณใช้โมเดลของ OpenAI เพื่อ "ให้คะแนน" ผลลัพธ์ระหว่างการฝึก Token ที่คำขอให้คะแนนเหล่านั้นใช้จะถูกเรียกเก็บแยกต่างหากตามอัตรา API มาตรฐานของเราหลังการฝึกเสร็จสิ้น

เราคิดค่าบริการเฉพาะงานฝึกที่อัปเดตโมเดลของคุณจริงเท่านั้น (สิ่งที่เราเรียกว่า "ความคืบหน้าที่บันทึกได้")

สิ่งที่เราเรียกเก็บเงิน

เราเรียกเก็บเงินตามเวลาที่ Worker ฝึกของคุณใช้ในการฝึกโมเดลของคุณอย่างจริงจัง โดยเฉพาะ:

  • การสร้างตัวอย่างจากโมเดลของคุณระหว่างกระบวนการปรับแต่งแบบละเอียด (เรียกว่า “rollouts”)

  • การประเมินเอาต์พุตเหล่านั้นด้วยตัวให้คะแนนอย่างน้อยหนึ่งตัวที่คุณกำหนดไว้ในงาน (เรียนรู้เพิ่มเติมเกี่ยวกับตัวให้คะแนน)

  • การคำนวณและใช้การอัปเดตน้ำหนักตามคะแนน (การแพร่ย้อนกลับ)

  • การรันขั้นตอนการตรวจสอบความถูกต้อง (การประเมิน) ใดๆ ที่คุณกำหนดค่าไว้

ตัวให้คะแนนส่วนใหญ่รันได้ “ฟรี” ซึ่งหมายความว่าเราไม่เรียกเก็บเงินเพิ่มสำหรับการใช้งาน นอกเหนือจากเวลาที่ตัวให้คะแนนเหล่านั้นมีส่วนต่อวงจรการฝึกหลัก ข้อยกเว้นคือกรณีตัวให้คะแนนแบบโมเดล ซึ่งเราจะนับรวม Token ที่ตัวให้คะแนนเหล่านั้นใช้ระหว่างกิจกรรมข้างต้นด้วย Token เหล่านี้จะแสดงเป็นรายการแยกต่างหากในใบแจ้งหนี้ของคุณ Token ที่ตัวให้คะแนนแบบโมเดลใช้จะถูกเรียกเก็บเงินตามอัตรา inference ปกติ (ราคาของ OpenAI)

สิ่งที่เราไม่คิดค่าบริการ

เราไม่คิดค่าบริการสำหรับเวลาที่ใช้ไปกับ:

  • การตรวจสอบหรือสำรวจชุดข้อมูลของคุณก่อนเริ่มการฝึก

  • การตรวจสอบความปลอดภัยในชุดข้อมูลของคุณ

  • การรอคิวเพื่อใช้ทรัพยากรประมวลผล

  • การดาวน์โหลดน้ำหนักโมเดลหรือชุดข้อมูล

  • การเตรียม (render) ชุดข้อมูลของคุณให้อยู่ในรูปแบบการฝึกของเรา

  • การประเมินความปลอดภัยหลังการฝึกของโมเดลที่ผ่าน fine-tuning ของคุณ

หากงานฝึกสูญหายเนื่องจากข้อผิดพลาดฝั่งเรา (ตัวอย่างเช่น หาก worker ล่มและต้องย้อนกลับไปยัง checkpoint ก่อนหน้า) คุณจะไม่ถูกคิดค่าบริการสำหรับเวลาในการประมวลผลหรือ Token ของ grader ที่สูญหาย รายละเอียดเพิ่มเติมเกี่ยวกับเรื่องนี้อยู่ในส่วนถัดไป

Captured forward progress และเหตุการณ์การคิดค่าบริการ

การฝึกประกอบด้วยการอัปเดตเล็ก ๆ จำนวนมากต่อโมเดลของคุณ เราติดตามว่าการอัปเดตเหล่านี้สำเร็จสมบูรณ์ไปกี่ครั้ง ค่าบริการจะอิงตามเวลาในการประมวลผลและ Token ของ grader ที่เกี่ยวข้องกับการอัปเดตที่สำเร็จเหล่านี้

เราจะเรียกเก็บเงินเมื่อเกิด "เหตุการณ์การคิดค่าบริการ" อย่างใดอย่างหนึ่งต่อไปนี้:

  • การฝึกเสร็จสมบูรณ์

  • คุณหยุดการฝึกชั่วคราว

  • คุณยกเลิกการฝึก

  • การฝึกไม่สำเร็จ

ค่าบริการแต่ละครั้งครอบคลุมงานส่วนเพิ่มที่ทำไปนับจากการเรียกเก็บเงินครั้งล่าสุด ตัวอย่างเช่น:

  • หากคุณหยุดการรันชั่วคราว เราจะบันทึก checkpoint และเรียกเก็บเงินสำหรับเวลาในการประมวลผลและ Token ของ grader ที่ใช้ไปนับจากการเรียกเก็บเงินครั้งล่าสุด

  • เมื่อคุณกลับมารันต่อ การฝึกจะดำเนินต่อจาก checkpoint ค่าบริการครั้งถัดไป (เมื่อเสร็จสิ้น หยุดอีกครั้ง ยกเลิก หรือไม่สำเร็จ) จะครอบคลุมเฉพาะงานเพิ่มเติมที่ทำหลังจากกลับมารันต่อ

  • หากคุณยกเลิกการรัน เราจะเรียกเก็บเงินสำหรับงานที่ทำไปจนถึงเวลาที่ยกเลิก

  • หากการฝึกล้มเหลวและงานนับจากการเรียกเก็บเงินครั้งล่าสุดสูญหาย คุณจะไม่ถูกเรียกเก็บเงินสำหรับส่วนที่สูญหาย

แนวทาง "captured forward progress" นี้ช่วยให้มั่นใจว่าคุณจ่ายเฉพาะงานที่ถูกรักษาไว้ในโมเดลของคุณ หรือที่คุณตั้งใจละทิ้งเท่านั้น

การดูความคืบหน้าของงาน

งาน RFT มีฟิลด์ชื่อ usage_metrics ซึ่งบันทึกการใช้งานทั้งหมดของงานจนถึงขั้นตอนปัจจุบัน ข้อมูลนี้รวมถึงเวลาที่ใช้ฝึกและ Token ทั้งหมดที่โมเดลผู้ให้คะแนนทุกตัวใช้ในงาน คุณตรวจสอบฟิลด์นี้ได้ผ่าน API (GET /v1/fine_tuning/jobs/{job_id}) หรือผ่านแดชบอร์ดการปรับแต่งโมเดล

ปัจจัยที่ส่งผลต่อเวลาฝึก

เนื่องจากคิดค่าบริการตามเวลา ตัวเลือกการกำหนดค่าของคุณจึงส่งผลโดยตรงต่อต้นทุน ปัจจัยสำคัญ ได้แก่

  • ความยากของโจทย์: หากชุดข้อมูลประกอบด้วยโจทย์ยาก โมเดลอาจใช้เวลาให้เหตุผลกับแต่ละโจทย์มากขึ้น ทำให้การสร้างแต่ละตัวอย่างใช้เวลานานขึ้น

  • ความเข้มข้นในการประมวลผล: ไฮเปอร์พารามิเตอร์ compute_multiplier ควบคุมปริมาณการประมวลผลในแต่ละขั้นตอนการฝึก ค่าที่สูงขึ้นจะกระตุ้นให้โมเดลให้เหตุผลกับข้อมูลแต่ละจุดอย่างละเอียดขึ้น ส่งผลให้แต่ละขั้นตอนทำงานช้าลง

  • การตั้งค่าการตรวจสอบความถูกต้อง:

  • ประสิทธิภาพของตัวให้คะแนน:

  • โมเดลผู้ให้คะแนนที่ใหญ่กว่าหรือมีความสามารถสูงกว่าจะใช้เวลาส่งผลคะแนนนานกว่าโมเดลขนาดเล็ก ตัวอย่างเช่น การให้คะแนนด้วยโมเดลการให้เหตุผลอาจใช้เวลานานกว่าการใช้โมเดลที่ไม่ใช่โมเดลการให้เหตุผลถึง 10 เท่า

  • ฟังก์ชันให้คะแนน Python ที่ซับซ้อนใช้เวลาทำงานนานกว่าฟังก์ชันที่เรียบง่าย

การตั้งค่าเหล่านี้ช่วยให้คุณเลือกสมดุลระหว่างต้นทุน ความเร็ว และคุณภาพของโมเดลได้ ตัวอย่างเช่น การตรวจสอบความถูกต้องบ่อยครั้งช่วยให้พบปัญหาได้เร็วขึ้น แต่ทำให้ต้นทุนสูงขึ้น การใช้โมเดลที่ล้ำหน้ากว่าเพื่อให้คะแนนอาจเพิ่มความแม่นยำในการให้คะแนนได้อย่างมาก แต่จะทำให้แต่ละขั้นตอนช้าลงและงานมีค่าใช้จ่ายสูงขึ้น

การจัดการต้นทุน

วิธีควบคุมค่าใช้จ่าย

  • เริ่มจากการรันระยะสั้นเพื่อทำความเข้าใจว่าการกำหนดค่าของคุณส่งผลต่อเวลาอย่างไร

  • ใช้ตัวอย่างสำหรับการตรวจสอบความถูกต้องและ eval_samples ในจำนวนที่เหมาะสม อย่าตรวจสอบความถูกต้องบ่อยเกินความจำเป็น

  • เลือกโมเดลผู้ให้คะแนนที่เล็กที่สุดซึ่งยังตรงตามข้อกำหนดด้านคุณภาพของคุณ

  • ดูแลให้ตัวให้คะแนน Python แบบกำหนดเองทำงานอย่างมีประสิทธิภาพ

  • ปรับ compute_multiplier เพื่อสร้างสมดุลระหว่างความเร็วในการลู่เข้าและต้นทุน

  • ติดตามการรันของคุณในแดชบอร์ดหรือผ่าน API คุณหยุดชั่วคราวหรือยกเลิกได้ทุกเมื่อ

ตัวอย่าง

การรันการฝึกที่สำเร็จ

เวลาฝึกเวลาที่เรียกเก็บเงินสถานะคำอธิบาย
00:0000:00ผู้ใช้สร้างงาน RFT ผ่าน API
00:1000:00VALIDATING_FILESใช้เวลา 10 นาทีในการตรวจสอบความถูกต้องของชุดข้อมูล
00:3000:00VALIDATING_FILESใช้เวลา 20 นาทีในการตรวจสอบความปลอดภัยของชุดข้อมูล
01:0000:00QUEUEDรอ Worker ที่พร้อมใช้งาน 30 นาที
01:3000:00RUNNINGใช้เวลา 30 นาทีในการตั้งค่าการฝึก (ดาวน์โหลดน้ำหนัก การประมวลผลล่วงหน้า ฯลฯ)
05:3004:00RUNNINGใช้เวลา 4 ชั่วโมงในการฝึก
06:0004:00RUNNINGใช้เวลา 30 นาทีในการประเมินความปลอดภัยของโมเดลที่ได้
06:0004:00SUCCEEDEDการฝึกเสร็จสิ้น

ในกรณีนี้ เวลาตามนาฬิกาจริงรวมคือ 6 ชั่วโมง แต่เรียกเก็บเงินได้เพียง 4 ชั่วโมง ค่าใช้จ่ายจะเป็น 4 ชั่วโมง × $100/ชั่วโมง = $400

ตัวอย่างงานที่ล้มเหลว

ในตัวอย่างนี้ การรันฝึกเป็นเวลา 2 ชั่วโมง เขียนเช็กพอยต์ ฝึกต่ออีก 1 ชั่วโมง แต่จากนั้นล้มเหลว เรียกเก็บเงินได้เฉพาะการฝึก 2 ชั่วโมงจนถึงเช็กพอยต์เท่านั้น

เวลาฝึกเวลาที่เรียกเก็บเงินสถานะคำอธิบาย
00:0000:00ผู้ใช้สร้างงาน RFT ผ่าน API
00:1000:00VALIDATING_FILESใช้เวลา 10 นาทีในการตรวจสอบความถูกต้องของชุดข้อมูล
00:3000:00VALIDATING_FILESใช้เวลา 20 นาทีในการตรวจสอบความปลอดภัยของชุดข้อมูล
01:0000:00QUEUEDรอ Worker ที่พร้อมใช้งาน 30 นาที
01:3000:00RUNNINGใช้เวลา 30 นาทีในการตั้งค่าการฝึก (ดาวน์โหลดน้ำหนัก การประมวลผลล่วงหน้า ฯลฯ)
03:3002:00RUNNINGใช้เวลา 2 ชั่วโมงในการฝึก
03:3002:00RUNNINGสร้างเช็กพอยต์ที่ขั้นตอน 5
04:3002:00RUNNINGการฝึกล้มเหลวเนื่องจากข้อผิดพลาดภายในที่ขั้นตอน 8 (หลังจากอีก 1 ชั่วโมง)
04:3002:00RUNNINGใช้เวลา 30 นาทีในการประเมินและตรวจสอบความถูกต้องของเช็กพอยต์
04:3002:00SUCCEEDEDงานเสร็จสิ้น (พร้อมเช็กพอยต์ล่าสุด)

แม้ว่าโดยรวมจะใช้เวลาฝึก 3 ชั่วโมง แต่มีเพียง 2 ชั่วโมงที่ถูก "บันทึกไว้" ในเช็กพอยต์ที่ใช้งานได้และถูกเรียกเก็บเงิน คุณไม่ต้องรับผิดชอบชั่วโมงของงานฝึกที่สูญเสียไปเนื่องจากความล้มเหลว ค่าใช้จ่ายจะเป็น 2 ชั่วโมง × $100/ชั่วโมง = $200

คำถามที่พบบ่อย

ระบบจะเรียกเก็บเงินเมื่อใด

เราจะเรียกเก็บเงินเมื่อการรันเสร็จสิ้น ถูกหยุดชั่วคราว ถูกยกเลิก หรือล้มเหลว การเรียกเก็บเงินแต่ละครั้งครอบคลุมงานที่ทำไปนับจากการเรียกเก็บเงินครั้งก่อน

ฉันต้องจ่ายเงินไหมหากการรันล้มเหลว

หากการรันล้มเหลวเนื่องจากข้อผิดพลาดของเราและงานฝึกล่าสุดบางส่วนสูญหาย คุณจะไม่ถูกเรียกเก็บเงินสำหรับส่วนที่สูญหาย หากคุณยกเลิกการรัน คุณจะถูกเรียกเก็บเงินสำหรับงานที่ทำจนถึงเวลายกเลิก

Token ของโมเดลตัวให้คะแนนถูกเรียกเก็บเงินอย่างไร

เรานับ Token ที่ใช้โดยตัวให้คะแนนแบบโมเดลใดๆ ที่คุณกำหนดค่า หลังจากการฝึกเสร็จสิ้น เราจะเรียกเก็บเงิน Token เหล่านั้นตามอัตรามาตรฐานต่อ Token ของเรา

ฉันสามารถพักและดำเนินการรันต่อได้ไหม

ได้ เมื่อคุณพัก เราจะบันทึกเช็กพอยต์และเรียกเก็บเงินสำหรับงานที่ทำไปแล้ว เมื่อคุณดำเนินการต่อ คุณจะถูกเรียกเก็บเงินเฉพาะงานเพิ่มเติมที่ทำหลังจากดำเนินการต่อเท่านั้น

หากคุณมีคำถามอื่นเกี่ยวกับการเรียกเก็บเงินสำหรับ Reinforcement Fine‑Tuning โปรดติดต่อทีมสนับสนุนของเรา

บทความนี้มีประโยชน์หรือไม่