OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

پرسش‌های متداول API صوتی

پرسش‌های عمومی درباره Whisper، تبدیل گفتار به متن و API صوتی

به‌روزرسانی: 12 days ago

API صوتی از دو نقطه پایان گفتار به متن پشتیبانی می‌کند:

  • transcriptions

  • translations

برای شروع کار با API صوتی، لطفاً مستندات توسعه‌دهندگان گفتار به متن ما را بخوانید.


هزینه استفاده از API صوتی چقدر است؟

برای جزئیات، صفحه قیمت‌گذاری ما را ببینید.


چه زبان‌هایی پشتیبانی می‌شوند؟

فهرست زبان‌های پشتیبانی‌شده را اینجا ببینید.


چگونه می‌توانیم فایل‌های صوتی بزرگ را مدیریت کنیم؟

برای بارگذاری‌های رونویسی Audio API در legacy/whisper-1، حداکثر اندازه درخواست 25 MiB است. مسیرهای جدیدتر رونویسی gpt-4o ممکن است از اعتبارسنجی متفاوتی، مانند محدودیت مدت‌زمان یا توکن، استفاده کنند؛ بنابراین هنگام مدیریت ورودی‌های صوتی طولانی از کاربران، مستندات مخصوص مدل را بررسی کنید.


چه روش‌های استریمی در دسترس است؟

بسته به مورد استفاده شما و اینکه می‌خواهید یک ضبط صوتیِ ازقبل تکمیل‌شده را رونویسی کنید یا یک جریان صوتیِ در حال اجرا را مدیریت کنید و از OpenAI برای تشخیص نوبت استفاده کنید، دو روش برای استریم کردن رونویسی وجود دارد:

توجه داشته باشید که استریم با مدل whisper-1 پشتیبانی نمی‌شود.

چه قالب‌های فایلی پشتیبانی می‌شوند؟

قالب‌های فایل پشتیبانی‌شده در مستندات API ما آمده‌اند.


آیا می‌توانم پیوندهای فایل‌های صوتی را به API صوتی ارسال کنم؟

خیر، باید یک فایل را در یکی از قالب‌های صوتی پشتیبانی‌شده ارسال کنید.

آیا این مقاله مفید بود؟