Транскрибация звонков выполняется на модели NOVA, обученной под языки СНГ: русский, казахский, киргизский и узбекский. Запись остаётся на наших серверах и не уходит в облачные API вроде Whisper или GPT.
🎯Whisper и GPT — универсальные модели. На русском они приемлемы, на казахском, киргизском и узбекском качество резко падает. Модель NOVA заточена под эти языки и на публичных бенчмарках обходит Whisper large v3.
Сравнение с Whisper large v3
Метрика — WER (доля ошибочных слов): чем меньше, тем лучше. Сравнение модели NOVA с Whisper large v3 на Mozilla Common Voice.
| Язык | NOVA | Whisper large v3 |
|---|---|---|
| Русский | 5.1% | 9.1% |
| Казахский | 13.8% | 57.8% |
| Киргизский | 10.2% | 95.2% |
| Узбекский | 9.2% | 109.9% |
WER на Common Voice. Чем меньше значение, тем точнее распознавание.
На живой речи разрыв ещё больше: русский 6.0% против 10.1%, казахский 15.8% против 65.2%, киргизский 9.8% против 102.2%, узбекский 12.7% против 120.6%.
А что с GPT
У OpenAI GPT-4o Transcribe нет публичных замеров по языкам СНГ. Это облачный API: запись уходит на сторону OpenAI, а специализации под казахский, киргизский и узбекский нет. В amoCRM виджет всегда транскрибирует на модели NOVA.
- На русском модель NOVA точнее Whisper на живой речи
- На казахском, киргизском и узбекском модель NOVA распознаёт речь уверенно, а у Whisper ошибка вырастает до 50–120%
- Аудио не отправляется в OpenAI и Whisper Cloud
- Результат остаётся в карточке CRM и разбирается по вашим вопросам


















