88API88API
AI-приложенияAPIПомощь и поддержка
Аудио

Аудиоформат OpenAI

Официальная документация

📝 Введение

Аудио API OpenAI предоставляет три основные функции:

  1. Преобразование текста в речь (TTS) — преобразование текста в естественную речь.
  2. Речь в текст (STT). Транскрибируйте аудио в текст.
  3. Перевод аудио. Переведите аудио с неанглийского языка на английский текст.

💡 Пример запроса

Преобразование текста в речь ✅

curl https://88api.ai/v1/audio/speech \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1",
    "input": "Привет,мир!",
    "voice": "alloy"
  }' \
  --output speech.mp3

Речь в текст ✅

curl https://88api.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F file="@/path/to/file/audio.mp3" \
  -F model="whisper-1"

Пример ответа:

{
  "text": "Привет,мир!"
}

Аудиоперевод ✅

curl https://88api.ai/v1/audio/translations \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F file="@/path/to/file/chinese.mp3" \
  -F model="whisper-1"

Пример ответа:

{
  "text": "Hello, world!"
}

📮 Запрос

Конечная точка

Преобразование текста в речь

POST /v1/audio/speech

Преобразование текста в речь.

Преобразование речи в текст

POST /v1/audio/transcriptions

Транскрибируйте аудио в текст на языке ввода.

Аудиоперевод

POST /v1/audio/translations

Перевести аудио в английский текст.

Метод аутентификации

Включите в заголовок запроса для аутентификации ключа API следующее:

Authorization: Bearer $API_KEY

Где $API_KEY — ваш ключ API.

Параметры тела запроса

Преобразование текста в речь

$API_KEY
  • Тип: строка
  • Требуется: Да
  • Необязательные значения: tts-1, tts-1-hd.
  • Описание: модель TTS для использования.
$API_KEY
  • Тип: строка
  • Требуется: Да
  • Максимальная длина: 4096 символов.
  • Описание: текст, который нужно преобразовать в речь.
$API_KEY
  • Тип: строка
  • Требуется: Да
  • Дополнительные значения: сплав, эхо, басня, оникс, новая звезда, мерцание.
  • Описание: Звук, используемый при произнесении речи.
$API_KEY
  • Тип: строка
  • Требуется: Нет
  • По умолчанию: mp3
  • Дополнительные значения: mp3, opus, aac, flac, wav, pcm.
  • Описание: Формат вывода звука.
$API_KEY
  • Тип: Номер
  • Требуется: Нет -По умолчанию: 1.0
  • Диапазон: 0,25–4,0
  • Описание: Как быстро произносить речь.

Преобразование речи в текст

$API_KEY
  • Тип: Файл
  • Требуется: Да
  • Поддерживаемые форматы: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
  • Описание: Аудиофайл для расшифровки.
$API_KEY
  • Тип: строка
  • Требуется: Да
  • В настоящее время поддерживается только: шепот-1.
  • Описание: идентификатор модели для использования.
$API_KEY
  • Тип: строка
  • Требуется: Нет
  • Формат: ISO-639-1 (например, «en»)
  • Описание: Язык аудио, предназначенный для повышения точности.
$API_KEY
  • Тип: строка
  • Требуется: Нет
  • Описание: текст, используемый для определения стиля модели или для продолжения предыдущего аудиосегмента.
$API_KEY
  • Тип: строка
  • Требуется: Нет -Значение по умолчанию: JSON
  • Необязательные значения: json, text, srt, verbose_json, vtt.
  • Описание: Формат вывода.
$API_KEY
  • Тип: Номер
  • Требуется: Нет
  • Значение по умолчанию: 0
  • Диапазон: 0–1
  • Описание: Температура отбора проб, более высокие значения делают результат более случайным.
$API_KEY
  • Тип: массив
  • Требуется: Нет -Значение по умолчанию: сегмент
  • Необязательные значения: слово, сегмент.
  • Описание: Детализация временных меток для транскрипции.

Аудиоперевод

$API_KEY
  • Тип: Файл
  • Требуется: Да
  • Поддерживаемые форматы: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
  • Описание: Аудиофайл для перевода.
model
  • Тип: строка
  • Требуется: Да
  • В настоящее время поддерживается только: шепот-1.
  • Описание: идентификатор модели для использования.
model
  • Тип: строка
  • Требуется: Нет
  • Описание: текст на английском языке для определения стиля модели.
model
  • Тип: строка
  • Требуется: Нет -Значение по умолчанию: JSON
  • Необязательные значения: json, text, srt, verbose_json, vtt.
  • Описание: Формат вывода.
model
  • Тип: Номер
  • Требуется: Нет
  • Значение по умолчанию: 0
  • Диапазон: 0–1
  • Описание: Температура отбора проб, более высокие значения делают результат более случайным.

📥 Ответ

Успешный ответ

Преобразование текста в речь

Возвращает содержимое двоичного аудиофайла.

Преобразование речи в текст

Базовый формат JSON
{
  "text": "Транскрибированный текстовый контент"
}
Подробный формат JSON
{
  "task": "transcribe",
  "language": "english",
  "duration": 8.47,
  "text": "Полная расшифровка",
  "segments": [
    {
      "id": 0,
      "seek": 0,
      "start": 0.0,
      "end": 3.32,
      "text": "сегментированная расшифровка",
      "tokens": [50364, 440, 7534],
      "temperature": 0.0,
      "avg_logprob": -0.286,
      "compression_ratio": 1.236,
      "no_speech_prob": 0.009
    }
  ]
}

Аудиоперевод

{
  "text": "Переведенный английский текст"
}

Ошибка ответа

При возникновении проблемы с запросом API вернет объект ответа об ошибке с кодом состояния HTTP в диапазоне 4XX-5XX.

Коды состояния распространенных ошибок

  • 400 Bad Request: неверные параметры запроса.
  • 400 Bad Request: ключ API недействителен или не предоставлен.
  • 400 Bad Request: превышен лимит вызовов API.
  • 400 Bad Request: внутренняя ошибка сервера.

Пример ответа об ошибке:

{
  "error": {
    "message": "Формат файла не поддерживается",
    "type": "invalid_request_error",
    "param": "file",
    "code": "invalid_file_format"
  }
}