Аудио
Аудиоформат OpenAI
Официальная документация
📝 Введение
Аудио API OpenAI предоставляет три основные функции:
- Преобразование текста в речь (TTS) — преобразование текста в естественную речь.
- Речь в текст (STT). Транскрибируйте аудио в текст.
- Перевод аудио. Переведите аудио с неанглийского языка на английский текст.
💡 Пример запроса
Преобразование текста в речь ✅
curl https://88api.ai/v1/audio/speech \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"input": "Привет,мир!",
"voice": "alloy"
}' \
--output speech.mp3Речь в текст ✅
curl https://88api.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: multipart/form-data" \
-F file="@/path/to/file/audio.mp3" \
-F model="whisper-1"Пример ответа:
{
"text": "Привет,мир!"
}Аудиоперевод ✅
curl https://88api.ai/v1/audio/translations \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: multipart/form-data" \
-F file="@/path/to/file/chinese.mp3" \
-F model="whisper-1"Пример ответа:
{
"text": "Hello, world!"
}📮 Запрос
Конечная точка
Преобразование текста в речь
POST /v1/audio/speechПреобразование текста в речь.
Преобразование речи в текст
POST /v1/audio/transcriptionsТранскрибируйте аудио в текст на языке ввода.
Аудиоперевод
POST /v1/audio/translationsПеревести аудио в английский текст.
Метод аутентификации
Включите в заголовок запроса для аутентификации ключа API следующее:
Authorization: Bearer $API_KEYГде $API_KEY — ваш ключ API.
Параметры тела запроса
Преобразование текста в речь
$API_KEY
- Тип: строка
- Требуется: Да
- Необязательные значения: tts-1, tts-1-hd.
- Описание: модель TTS для использования.
$API_KEY
- Тип: строка
- Требуется: Да
- Максимальная длина: 4096 символов.
- Описание: текст, который нужно преобразовать в речь.
$API_KEY
- Тип: строка
- Требуется: Да
- Дополнительные значения: сплав, эхо, басня, оникс, новая звезда, мерцание.
- Описание: Звук, используемый при произнесении речи.
$API_KEY
- Тип: строка
- Требуется: Нет
- По умолчанию: mp3
- Дополнительные значения: mp3, opus, aac, flac, wav, pcm.
- Описание: Формат вывода звука.
$API_KEY
- Тип: Номер
- Требуется: Нет -По умолчанию: 1.0
- Диапазон: 0,25–4,0
- Описание: Как быстро произносить речь.
Преобразование речи в текст
$API_KEY
- Тип: Файл
- Требуется: Да
- Поддерживаемые форматы: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
- Описание: Аудиофайл для расшифровки.
$API_KEY
- Тип: строка
- Требуется: Да
- В настоящее время поддерживается только: шепот-1.
- Описание: идентификатор модели для использования.
$API_KEY
- Тип: строка
- Требуется: Нет
- Формат: ISO-639-1 (например, «en»)
- Описание: Язык аудио, предназначенный для повышения точности.
$API_KEY
- Тип: строка
- Требуется: Нет
- Описание: текст, используемый для определения стиля модели или для продолжения предыдущего аудиосегмента.
$API_KEY
- Тип: строка
- Требуется: Нет -Значение по умолчанию: JSON
- Необязательные значения: json, text, srt, verbose_json, vtt.
- Описание: Формат вывода.
$API_KEY
- Тип: Номер
- Требуется: Нет
- Значение по умолчанию: 0
- Диапазон: 0–1
- Описание: Температура отбора проб, более высокие значения делают результат более случайным.
$API_KEY
- Тип: массив
- Требуется: Нет -Значение по умолчанию: сегмент
- Необязательные значения: слово, сегмент.
- Описание: Детализация временных меток для транскрипции.
Аудиоперевод
$API_KEY
- Тип: Файл
- Требуется: Да
- Поддерживаемые форматы: flac, mp3, mp4, mpeg, mpga, m4a, ogg, wav, webm.
- Описание: Аудиофайл для перевода.
model
- Тип: строка
- Требуется: Да
- В настоящее время поддерживается только: шепот-1.
- Описание: идентификатор модели для использования.
model
- Тип: строка
- Требуется: Нет
- Описание: текст на английском языке для определения стиля модели.
model
- Тип: строка
- Требуется: Нет -Значение по умолчанию: JSON
- Необязательные значения: json, text, srt, verbose_json, vtt.
- Описание: Формат вывода.
model
- Тип: Номер
- Требуется: Нет
- Значение по умолчанию: 0
- Диапазон: 0–1
- Описание: Температура отбора проб, более высокие значения делают результат более случайным.
📥 Ответ
Успешный ответ
Преобразование текста в речь
Возвращает содержимое двоичного аудиофайла.
Преобразование речи в текст
Базовый формат JSON
{
"text": "Транскрибированный текстовый контент"
}Подробный формат JSON
{
"task": "transcribe",
"language": "english",
"duration": 8.47,
"text": "Полная расшифровка",
"segments": [
{
"id": 0,
"seek": 0,
"start": 0.0,
"end": 3.32,
"text": "сегментированная расшифровка",
"tokens": [50364, 440, 7534],
"temperature": 0.0,
"avg_logprob": -0.286,
"compression_ratio": 1.236,
"no_speech_prob": 0.009
}
]
}Аудиоперевод
{
"text": "Переведенный английский текст"
}Ошибка ответа
При возникновении проблемы с запросом API вернет объект ответа об ошибке с кодом состояния HTTP в диапазоне 4XX-5XX.
Коды состояния распространенных ошибок
400 Bad Request: неверные параметры запроса.400 Bad Request: ключ API недействителен или не предоставлен.400 Bad Request: превышен лимит вызовов API.400 Bad Request: внутренняя ошибка сервера.
Пример ответа об ошибке:
{
"error": {
"message": "Формат файла не поддерживается",
"type": "invalid_request_error",
"param": "file",
"code": "invalid_file_format"
}
}