Audio
Format audio OpenAI
Documentation officielle
📝Présentation
L'API OpenAI Audio fournit trois fonctions principales:
- Text-to-Speech (TTS) - Convertissez le texte en parole naturelle
- Speech-to-Text (STT) - Transcrire l'audio en texte
- Traduction audio - Traduire l'audio non anglais en texte anglais
💡 Exemples de requêtes
Synthèse vocale ✅
curl https://88api.ai/v1/audio/speech \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"input": "Hello, world!",
"voice": "alloy"
}' \
--output speech.mp3Synthèse vocale ✅
curl https://88api.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: multipart/form-data" \
-F file="@/path/to/file/audio.mp3" \
-F model="whisper-1"Response Example:
{
"text": "Hello, world!"
}Traduction audio ✅
curl https://88api.ai/v1/audio/translations \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: multipart/form-data" \
-F file="@/path/to/file/chinese.mp3" \
-F model="whisper-1"Response Example:
{
"text": "Hello, world!"
}📮 Demande
Points de terminaison
Synthèse vocale
POST /v1/audio/speechConvertissez le texte en parole.
Synthèse vocale
POST /v1/audio/transcriptionsTranscrivez l'audio en texte dans la langue d'entrée.
Traduction audio
POST /v1/audio/translationsTraduire l'audio en texte anglais.
Méthode d'authentification
Incluez les éléments suivants dans l'en-tête de la demande pour l'authentification par clé API:
Authorization: Bearer $API_KEYOù $API_KEY est votre clé API.
Paramètres du corps de la requête
Synthèse vocale
model
- Type : Chaîne
- Obligatoire : Oui
- Valeurs facultatives: tts-1, tts-1-hd
- Description : Modèle TTS à utiliser
input
- Type : Chaîne
- Obligatoire : Oui
- Longueur maximale: 4096 caractères
- Description: Texte à convertir en parole
voice
- Type : Chaîne
- Obligatoire : Oui
- Valeurs optionnelles: alliage, écho, fable, onyx, nova, miroitement
- Description: Voix à utiliser lors de la génération de la parole
response_format
- Type : Chaîne
- Obligatoire: Non
- Par défaut : mp3
- Valeurs optionnelles: mp3, opus, aac, flac, wav, pcm
- Description: Format de sortie audio
speed
- Type : Numéro
- Obligatoire: Non
- Par défaut: 1,0
- Plage : 0,25 - 4,0
- Description: Vitesse de la parole générée
Synthèse vocale
file
- Type : Fichier
- Obligatoire : Oui
- Formats pris en charge : flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm
- Description : Fichier audio à retranscrire
model
- Type : Chaîne
- Obligatoire : Oui
- Actuellement, ne prend en charge que: murmure-1
- Description: ID du modèle à utiliser
language
- Type : Chaîne
- Obligatoire: Non
- Format: ISO-639-1 (par exemple, "en")
- Description: langue de l'audio, à condition que cela puisse améliorer la précision
prompt
- Type : Chaîne
- Obligatoire: Non
- Description: Texte pour guider le style du modèle ou continuer à partir d'un segment audio précédent
response_format
- Type : Chaîne
- Obligatoire: Non
- Par défaut: json
- Valeurs optionnelles: json, text, srt, verbose_json, vtt
- Description: Format de sortie
temperature
- Type : Numéro
- Obligatoire: Non
- Par défaut : 0
- Plage : 0 - 1
- Description: Température d'échantillonnage, des valeurs plus élevées rendent la sortie plus aléatoire
timestamp_granularities
- Type : Tableau
- Obligatoire: Non
- Par défaut: segment
- Valeurs facultatives: mot, segment
- Description: Granularité des horodatages de transcription
Traduction audio
file
- Type : Fichier
- Obligatoire : Oui
- Formats pris en charge : flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm
- Description : Fichier audio à traduire
model
- Type : Chaîne
- Obligatoire : Oui
- Actuellement, ne prend en charge que: murmure-1
- Description: ID du modèle à utiliser
prompt
- Type : Chaîne
- Obligatoire: Non
- Description : texte anglais pour guider le style du modèle
response_format
- Type : Chaîne
- Obligatoire: Non
- Par défaut: json
- Valeurs optionnelles: json, text, srt, verbose_json, vtt
- Description: Format de sortie
temperature
- Type : Numéro
- Obligatoire: Non
- Par défaut : 0
- Plage : 0 - 1
- Description: Température d'échantillonnage, des valeurs plus élevées rendent la sortie plus aléatoire
📥 Réponse
Réponse réussie
Synthèse vocale
Renvoie le contenu du fichier audio binaire.
Synthèse vocale
Format JSON de base
{
"text": "Transcribed text content"
}Format JSON détaillé
{
"task": "transcribe",
"language": "english",
"duration": 8.47,
"text": "Complete transcribed text",
"segments": [
{
"id": 0,
"seek": 0,
"start": 0.0,
"end": 3.32,
"text": "Segmented transcribed text",
"tokens": [50364, 440, 7534],
"temperature": 0.0,
"avg_logprob": -0.286,
"compression_ratio": 1.236,
"no_speech_prob": 0.009
}
]
}Traduction audio
{
"text": "Translated English text"
}Réponse d'erreur
Lorsqu'une requête rencontre un problème, l'API renvoie un objet de réponse d'erreur, avec des codes d'état HTTP compris entre 4XX et 5XX.
Codes d'état d'erreur courants
400 Bad Request: Paramètres de requête invalides401 Unauthorized: Clé API invalide ou non fournie429 Too Many Requests: limite d'appels API dépassée500 Internal Server Error: Erreur interne du serveur
Exemple de réponse d'erreur:
{
"error": {
"message": "Unsupported file format",
"type": "invalid_request_error",
"param": "file",
"code": "invalid_file_format"
}
}