К результатам поиска

OpenAI

GPT 4o Transcribe Diarize

Принимает текст и аудио, возвращает текст. Распознаёт речь и связывает её фрагменты с разными говорящими.

  • РассужденияРассужденияВ данных модели подтверждён режим рассуждений. Его параметры зависят от подключённой операции.
  • Вызов инструментовВызов инструментовМодель может запросить вызов функции. Приложение проверяет права и выполняет действие.
  • Структурированный ответСтруктурированный ответМодель поддерживает заданную структуру ответа. Доступный формат проверяйте в параметрах API.
  • 16 000 токенов16 000 токеновКонтекстное окно по данным каталога. Лимит ответа и допустимый объём запроса проверяйте отдельно.
  • Аудио на входеАудио на входеМодель принимает аудио. Это не подтверждает генерацию речи.
Вход
316,50 ₽
Выход
1 266,00 ₽
Вход · текст
316,50 ₽
Выход · текст
1 266,00 ₽
Вход · аудио
759,60 ₽
за 1 млн токенов
Доступность
100%
API ID
openai/gpt-4o-transcribe-diarize

Данные каталога получены .

Цена

Распознавание речи · выходные текстовые токены
1 266,00 ₽ / 1 млн токенов
Распознавание речи · входные аудиотокены
759,60 ₽ / 1 млн токенов
Распознавание речи · входные текстовые токены
316,50 ₽ / 1 млн токенов
Распознавание речи · вход
316,50 ₽ / 1 млн токенов
Распознавание речи · выход
1 266,00 ₽ / 1 млн токенов

Цена указана в рублях для выбранной операции и её параметров.

Перед оплачиваемым запросом создаётся резерв. Итоговый расход привязан к сохранённым параметрам и тарифу запроса. При неизвестном результате резерв удерживается до проверки; такой запрос не следует повторять с новым идентификатором.

О модели

GPT-4o Transcribe Diarize распознаёт речь и автоматически различает говорящих. Связывает фрагменты аудио с участниками разговора. Разработчик: openai. Вход: текст, аудио. Выход: текст. Контекст: 16000 токенов. Максимальный ответ: 2000 токенов.

Характеристики

Доступность100%
  1. 5 октября: нет данных
  2. 6 октября: нет данных
  3. 7 октября: 100%
Доля успешных запросов к модели за последние 72 часа. Обновляется каждые два часа.
Тип модели
Аудио
Вход модели
Текст, Аудио

Данные, которые модель принимает вместе с запросом.

Выход модели
Текст

Форматы результата, которые создаёт модель.

Контекстное окно
16 000 токенов

Контекстное окно по данным каталога. Лимит ответа и допустимый объём запроса проверяйте отдельно.

Максимальный ответ
2 000 токенов

Максимальный размер ответа по данным каталога. Фактический предел запроса зависит от подключённой операции.

Операции
Распознавание речи
Возможности модели
Рассуждения, Вызов инструментов, Вызов функций, Структурированный ответ, Ответ в JSON, Входное аудио

Настройки

Входных аудиоДо 1
Формат результатаdiarized_json
Входные форматыmp3 · mp4 · m4a · wav · webm
Размер входного файлаДо 26,2 МБ
Текстовое описаниеНе используется

По умолчаниюНе задано

Двухбуквенный код языка в нижнем регистре.

Контрольные показатели

Для этой версии модели оценок пока нет.

Оценки относятся к этой версии модели и методике источника. Качество и скорость конкретного запроса они не гарантируют.

API-запрос

Операция доступна через API. Ключ храните в переменной окружения на своём сервере. REQUEST_ID: уникальный идентификатор запроса. При повторе сохраняйте его и тело запроса.

Ответ содержит задание. Проверяйте его по GET /v1/jobs/{id}. Перед отправкой получите стоимость через POST /v1/quotes и укажите допустимый лимит: как задать бюджет запроса. Замените OWN_FILE_ID идентификатором своего загруженного и проверенного файла.

import json
import os
from urllib.request import Request, HTTPRedirectHandler, build_opener

class NoRedirect(HTTPRedirectHandler):
    def redirect_request(self, req, fp, code, msg, headers, newurl):
        return None

opener = build_opener(NoRedirect)

def post(url, payload):
    request = Request(url, data=json.dumps(payload).encode("utf-8"), headers={
        "Authorization": "Bearer " + os.environ["KVANTORA_API_KEY"],
        "Content-Type": "application/json",
        "Idempotency-Key": os.environ["REQUEST_ID"],
    }, method="POST")
    with opener.open(request, timeout=120) as response:
        return json.load(response)

def get(url):
    request = Request(url, headers={
        "Authorization": "Bearer " + os.environ["KVANTORA_API_KEY"],
    }, method="GET")
    with opener.open(request, timeout=120) as response:
        return json.load(response)

def format_rubles(value):
    amount = int(value)
    sign, absolute = ("-" if amount < 0 else ""), abs(amount)
    if 0 < absolute < 10_000:
        return sign + "<0,01 ₽"
    cents = (absolute + 5_000) // 10_000
    return f"{sign}{cents // 100},{cents % 100:02d} ₽"

quote = post("https://api.kvantora.ai/v1/quotes", {
  "model": "openai/gpt-4o-transcribe-diarize",
  "file_id": "OWN_FILE_ID",
  "operation": "speech_to_text"
})
print("Стоимость:", format_rubles(quote["estimated_cost_microrub"]))

# Укажите допустимый бюджет вместо max_cost_microrub: 0.
payload = {
  "model": "openai/gpt-4o-transcribe-diarize",
  "file_id": "OWN_FILE_ID",
  "max_cost_microrub": 0
}
job = post("https://api.kvantora.ai/v1/audio/transcriptions", payload)
print(get("https://api.kvantora.ai/v1/jobs" + "/" + job["id"]))
Документация APIСоздать API-ключ