Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Whisper для бизнеса: транскрибация звонков на своём сервере

Почему транскрибация уходит на собственный контур Облачные сервисы распознавания речи удобны до первого аудита. Записи звонков содержат персональные данные, с...

Почему транскрибация уходит на собственный контур

Облачные сервисы распознавания речи удобны до первого аудита. Записи звонков содержат персональные данные, суммы сделок, медицинские и юридические детали — всё то, что по 152-ФЗ нежелательно отправлять на внешние API. Второй аргумент — экономика: при объёме от нескольких тысяч часов в год облачная тарификация за минуту становится дороже собственного GPU-сервера. Третий — предсказуемость: нет лимитов, нет зависимости от доступности чужого сервиса и смены его условий.

Поэтому всё больше российских контакт-центров, клиник и промышленных холдингов разворачивают распознавание внутри периметра. Whisper от OpenAI — самая практичная база для такой задачи: открытые веса, 99 языков, устойчивость к шуму и акцентам, активное сообщество вокруг оптимизаций.

Что реально даёт Whisper и где начинаются сложности

Базовая модель даёт приемлемое качество на русском «из коробки», но на телефонном звуке 8 кГц с потерями кодеков WER заметно растёт. Практика показывает: на чистой записи large-v3 ошибается в 8–12% слов, на сжатом телефонном канале — в 15–25% без предварительной обработки. Спасают нормализация до 16 кГц, шумоподавление и VAD-сегментация: тишина и музыкальные вставки не должны попадать в модель.

Второй нюанс — модель не знает вашей терминологии. Названия продуктов, аббревиатуры, фамилии клиентов она превращает в фонетические ребусы. Решается через initial_prompt со списком терминов, постобработку по словарю и, если нужно, дообучение LoRA на 20–50 часах размеченных звонков. Последнее даёт прирост 3–7 процентных пунктов на узкой предметной области.

Практические шаги внедрения

Начинать стоит с пилота, а не с закупки железа. Соберите 30–50 часов реальных записей, охватывающих разные каналы, микрофоны и типы разговоров, и вручную разметьте эталон. Это ваш baseline для честного замера WER и точки, где модель путается.

Дальше — стек. Для инференса берите faster-whisper на CTranslate2: он даёт ускорение в 3–4 раза относительно эталонной реализации при том же качестве. Для выравнивания слов по времени — WhisperX, для разделения по спикерам — pyannote. Всё это упаковывается в Docker и запускается как внутренний сервис с очередью задач.

Типовой сервер: одна GPU уровня RTX 4090 или L40S закрывает потребности контакт-центра на 50–100 операторов. large-v3 в пакетном режиме обрабатывает час аудио за 2–4 минуты, то есть суточный объём звонков разбирается за ночь. Для потока в реальном времени используют модель medium или large-v3-turbo с меньшим окном задержки.

Диаризация, разметка и смысловой слой

Транскрипт без разделения на «оператор» и «клиент» почти бесполезен для контроля качества. Диаризация добавляет роли, а дальше начинается ценное: автоматические чек-листы, поиск запрещённых фраз, оценка эмоций, выявление причин отказов, выгрузка в CRM карточкой сделки с кратким резюме разговора. Здесь Whisper — только первый слой, поверх которого работает LLM для суммаризации и классификации.

Интеграция с телефонией и учётными системами

Записи обычно лежат в Asterisk/FreePBX, у операторов — Bitrix24, amoCRM или 1С. Практичный путь: сервис забирает файлы из хранилища по событию, ставит задачу в очередь, после распознавания отдаёт результат вебхуком в CRM. Важно сразу продумать хранение: сырое аудио, транскрипт, разметка ролей и метаданные должны иметь срок жизни и права доступа, иначе через год вы получите неконтролируемый архив персональных данных.

Как мы можем помочь

Мы разворачиваем приватные LLM и речевые пайплайны на инфраструктуре заказчика: подбираем модель под ваш звук и терминологию, настраиваем диаризацию, дообучение и интеграцию с телефонией и CRM, замеряем WER на ваших данных и доводим решение до промышленной эксплуатации. Если хотите оценить объём и стоимость — Обсудить проект.

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.