Voxtral

Mistral представляет Voxtral — семейство open source моделей для распознавания и понимания речи. Давно пора. Сопоставимой открытой модели мы не видели со времён Whisper от OpenAI, а это было довольно давно.

Модели выпускаются в размерах 3B и 24B и превосходят Whisper на большинстве бенчмарков. Однако им требуется более мощное железо: самый крупный вариант Whisper — всего 1.5B. Это прямое следствие того, что Voxtral одновременно является обычной языковой моделью. Другое следствие: управлять такими моделями в режиме чистой транскрипции будет сложнее.

Модели доступны на Hugging Face, а также через API Mistral и их LeChat.

Чего им пока не хватает, так это поддержки диаризации (распознавания говорящих). Она заявлена в роадмапе, а тем временем для этой цели приходится использовать несколько неуклюжий pyannote-audio.