OpenAI
Aquesta pàgina s'ha traduït automàticament. Mostra l'article original en anglès.

PMF de l'API d'àudio

Preguntes generals sobre Whisper, veu a text i l'API d'àudio

Actualització: 2 days ago

L'API d'àudio admet dos punts finals de veu a text:

  • transcriptions

  • translations

Per començar a utilitzar l'API d'àudio, llegiu la nostra documentació per a desenvolupadors sobre veu a text.


Quant costa utilitzar l'API d'àudio?

Consulteu la nostra pàgina de preus per obtenir-ne més detalls.


Quins idiomes s'admeten?

Vegeu una llista dels idiomes admesos aquí.


Com podem gestionar fitxers d'àudio grans?

Per a les càrregues de transcripció de l'API d'àudio legacy/whisper-1, la mida màxima de la sol·licitud és de 25 MiB. Les rutes de transcripció més noves de gpt-4o poden utilitzar una validació diferent, com ara límits de durada o de segments; per tant, consulteu la documentació específica del model quan gestioneu entrades d'àudio llargues dels usuaris.


Quins mètodes de transmissió en temps real hi ha disponibles?

Hi ha dues maneres de transmetre la transcripció en temps real, segons el vostre cas d'ús i si intenteu transcriure una gravació d'àudio ja completada o gestionar un flux d'àudio en curs i utilitzar OpenAI per a la detecció de torns:

Tingueu en compte que la transmissió en temps real no és compatible amb el model whisper-1.

Quins formats de fitxer s'admeten?

Els formats de fitxer admesos s'inclouen a la nostra documentació de l'API.


Puc enviar enllaços a fitxers d'àudio a l'API d'àudio?

No, heu d'enviar un fitxer en un dels formats d'àudio admesos.

T'ha estat útil aquest article?