88API88API
User GuideAI ApplicationsAPI ReferenceHelp & Support
Audio

Format audio OpenAI

Documentation officielle

📝Présentation

L'API OpenAI Audio fournit trois fonctions principales:

  1. Text-to-Speech (TTS) - Convertissez le texte en parole naturelle
  2. Speech-to-Text (STT) - Transcrire l'audio en texte
  3. Traduction audio - Traduire l'audio non anglais en texte anglais

💡 Exemples de requêtes

Synthèse vocale ✅

curl https://88api.ai/v1/audio/speech \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1",
    "input": "Hello, world!",
    "voice": "alloy"
  }' \
  --output speech.mp3

Synthèse vocale ✅

curl https://88api.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F file="@/path/to/file/audio.mp3" \
  -F model="whisper-1"

Response Example:

{
  "text": "Hello, world!"
}

Traduction audio ✅

curl https://88api.ai/v1/audio/translations \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F file="@/path/to/file/chinese.mp3" \
  -F model="whisper-1"

Response Example:

{
  "text": "Hello, world!"
}

📮 Demande

Points de terminaison

Synthèse vocale

POST /v1/audio/speech

Convertissez le texte en parole.

Synthèse vocale

POST /v1/audio/transcriptions

Transcrivez l'audio en texte dans la langue d'entrée.

Traduction audio

POST /v1/audio/translations

Traduire l'audio en texte anglais.

Méthode d'authentification

Incluez les éléments suivants dans l'en-tête de la demande pour l'authentification par clé API:

Authorization: Bearer $API_KEY

$API_KEY est votre clé API.

Paramètres du corps de la requête

Synthèse vocale

model
  • Type : Chaîne
  • Obligatoire : Oui
  • Valeurs facultatives: tts-1, tts-1-hd
  • Description : Modèle TTS à utiliser
input
  • Type : Chaîne
  • Obligatoire : Oui
  • Longueur maximale: 4096 caractères
  • Description: Texte à convertir en parole
voice
  • Type : Chaîne
  • Obligatoire : Oui
  • Valeurs optionnelles: alliage, écho, fable, onyx, nova, miroitement
  • Description: Voix à utiliser lors de la génération de la parole
response_format
  • Type : Chaîne
  • Obligatoire: Non
  • Par défaut : mp3
  • Valeurs optionnelles: mp3, opus, aac, flac, wav, pcm
  • Description: Format de sortie audio
speed
  • Type : Numéro
  • Obligatoire: Non
  • Par défaut: 1,0
  • Plage : 0,25 - 4,0
  • Description: Vitesse de la parole générée

Synthèse vocale

file
  • Type : Fichier
  • Obligatoire : Oui
  • Formats pris en charge : flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm
  • Description : Fichier audio à retranscrire
model
  • Type : Chaîne
  • Obligatoire : Oui
  • Actuellement, ne prend en charge que: murmure-1
  • Description: ID du modèle à utiliser
language
  • Type : Chaîne
  • Obligatoire: Non
  • Format: ISO-639-1 (par exemple, "en")
  • Description: langue de l'audio, à condition que cela puisse améliorer la précision
prompt
  • Type : Chaîne
  • Obligatoire: Non
  • Description: Texte pour guider le style du modèle ou continuer à partir d'un segment audio précédent
response_format
  • Type : Chaîne
  • Obligatoire: Non
  • Par défaut: json
  • Valeurs optionnelles: json, text, srt, verbose_json, vtt
  • Description: Format de sortie
temperature
  • Type : Numéro
  • Obligatoire: Non
  • Par défaut : 0
  • Plage : 0 - 1
  • Description: Température d'échantillonnage, des valeurs plus élevées rendent la sortie plus aléatoire
timestamp_granularities
  • Type : Tableau
  • Obligatoire: Non
  • Par défaut: segment
  • Valeurs facultatives: mot, segment
  • Description: Granularité des horodatages de transcription

Traduction audio

file
  • Type : Fichier
  • Obligatoire : Oui
  • Formats pris en charge : flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm
  • Description : Fichier audio à traduire
model
  • Type : Chaîne
  • Obligatoire : Oui
  • Actuellement, ne prend en charge que: murmure-1
  • Description: ID du modèle à utiliser
prompt
  • Type : Chaîne
  • Obligatoire: Non
  • Description : texte anglais pour guider le style du modèle
response_format
  • Type : Chaîne
  • Obligatoire: Non
  • Par défaut: json
  • Valeurs optionnelles: json, text, srt, verbose_json, vtt
  • Description: Format de sortie
temperature
  • Type : Numéro
  • Obligatoire: Non
  • Par défaut : 0
  • Plage : 0 - 1
  • Description: Température d'échantillonnage, des valeurs plus élevées rendent la sortie plus aléatoire

📥 Réponse

Réponse réussie

Synthèse vocale

Renvoie le contenu du fichier audio binaire.

Synthèse vocale

Format JSON de base
{
  "text": "Transcribed text content"
}
Format JSON détaillé
{
  "task": "transcribe",
  "language": "english",
  "duration": 8.47,
  "text": "Complete transcribed text",
  "segments": [
    {
      "id": 0,
      "seek": 0,
      "start": 0.0,
      "end": 3.32,
      "text": "Segmented transcribed text",
      "tokens": [50364, 440, 7534],
      "temperature": 0.0,
      "avg_logprob": -0.286,
      "compression_ratio": 1.236,
      "no_speech_prob": 0.009
    }
  ]
}

Traduction audio

{
  "text": "Translated English text"
}

Réponse d'erreur

Lorsqu'une requête rencontre un problème, l'API renvoie un objet de réponse d'erreur, avec des codes d'état HTTP compris entre 4XX et 5XX.

Codes d'état d'erreur courants

  • 400 Bad Request: Paramètres de requête invalides
  • 401 Unauthorized: Clé API invalide ou non fournie
  • 429 Too Many Requests: limite d'appels API dépassée
  • 500 Internal Server Error: Erreur interne du serveur

Exemple de réponse d'erreur:

{
  "error": {
    "message": "Unsupported file format",
    "type": "invalid_request_error",
    "param": "file",
    "code": "invalid_file_format"
  }
}