Расшифровка звонка — это перевод записи разговора в текст, по которому можно искать, считать и сравнивать. Сам по себе текст мало кому нужен: двести диалогов за неделю никто читать не будет. Ценность появляется на следующем шаге — когда по расшифровкам ищут повторяющиеся возражения, проверяют, звучал ли обязательный вопрос, и получают выжимку встречи вместо часовой записи.
Почему записи есть, а пользы от них нет
Записи хранятся почти всегда: телефония пишет по умолчанию, встречи идут в сервисах видеосвязи с кнопкой записи. Архив растёт, а слушают из него единицы файлов и только по жалобам.
Причина арифметическая. Прослушать разговор быстрее, чем он длился, невозможно: полтора часа встречи — это полтора часа времени руководителя, сто звонков отдела за неделю — две с половиной рабочие недели. Выборочный контроль сводится к пяти-шести записям в месяц, и выводы получаются случайными. Текст меняет арифметику: по нему работает поиск и считаются повторы.
Что даёт расшифровка кроме текста
Поиск по всем разговорам сразу
Вопрос «что клиенты спрашивают про сроки поставки» перестаёт быть темой для совещания и становится запросом к архиву.
Поиск по словам здесь работает плохо: клиент говорит «а когда привезёте», менеджер отвечает «отгрузка на следующей неделе», и ни одно слово не совпадает с запросом. Помогает поиск по смыслу — расшифровки разбираются на фрагменты и укладываются в векторное хранилище. В проекте «Синтез речи» голосовой архив собран именно так: Whisper, укладка в pgvector, поиск по смыслу вместо точных совпадений.
Проверка скрипта без прослушивания
По тексту проверяется выполнение скрипта: прозвучал ли вопрос о бюджете, был ли назван срок, предложен ли следующий шаг, обещано ли то, чего обещать нельзя. Каждая проверка даёт да или нет, контроль становится сплошным, и претензия на основе впечатления заменяется фразой «вопрос прозвучал в 12 разговорах из 80».
Повторяющиеся возражения и слова клиентов
Сотня расшифровок — готовое исследование. Из неё видно, какие возражения повторяются, в какой момент возникают и какими словами клиенты описывают задачу. Тексты на сайте начинают говорить словами клиентов, а в скрипт добавляются ответы на возражения, которые раньше каждый менеджер придумывал сам.
Выжимка после встречи
После часовой встречи нужны три вещи: о чём договорились, кто что делает и к какому сроку. Это извлекается из расшифровки и рассылается участникам через несколько минут. Спор о договорённостях через две недели решается ссылкой на фрагмент, а не памятью.
Путь от записи до выводов
1. Запись. Качество звука определяет всё остальное. Телефония пишет каналы отдельно — лучший случай: реплики клиента и менеджера разделены. Запись с одного микрофона в переговорной — худший: голоса накладываются.
2. Распознавание. Открытые модели давно перестали быть узким местом: на своей машине минута речи расшифровывается примерно за 1,3 секунды — часовая встреча меньше чем за полторы минуты. Отдельная задача — разделение говорящих: без него текст превращается в сплошной поток.
3. Разметка. Текст привязывается к сделке, менеджеру и дате, разбивается на фрагменты и укладывается в хранилище с поиском по смыслу.
4. Выводы. Проверки по скрипту, сводки по встречам, подборки возражений. Список из трёх конкретных вопросов работает, «анализировать звонки» — никогда.
Провал чаще всего происходит на третьем шаге: текст получили, качеству порадовались — и остановились, потому что никто не решил, куда складывать.
Где проходит граница закона
Ниже — общее описание практики, а не юридическая консультация. Порядок действий согласуется с юристом, особенно если в разговорах звучат персональные или медицинские сведения.
Предупреждение о записи. Общепринятая практика — сообщать о записи до её начала: голосовое уведомление в телефонии, строчка в приглашении на встречу, объявление в начале звонка. Оно должно быть слышно и должно предшествовать разговору.
Согласие и основание. Запись голоса вместе с именем, номером или сделкой — это обработка персональных данных, и у неё должно быть основание, зафиксированное в политике обработки и в документах, которые компания показывает клиенту. Запись разговоров с сотрудниками регулируется трудовыми документами.
Хранение и доступ. Срок хранения называется, доступ ограничивается: архив разговоров — самый чувствительный набор данных в отделе продаж. Этот пункт и решает, где работает распознавание.
Локальная расшифровка против облачной
| Что сравнивается | Облачный сервис | Свой контур |
|---|---|---|
| Куда уходит запись | На серверы поставщика | Никуда, обработка на своей машине |
| Запуск | Часы: регистрация и загрузка | Дни: установка, разделение голосов, хранилище |
| Расходы | За минуту, растут вместе с потоком | Вложения в железо плюс поддержка |
| Персональные данные | Нужно решение по основаниям | Снимается архитектурой |
| Предсказуемость | Тариф и модель могут измениться | Версия зафиксирована |
Речь — выгодный кандидат на переезд внутрь контура: записи разговоров содержат ровно тот тип данных, который не хочется отдавать наружу, а качества открытых моделей для рабочих задач достаточно. Проект «Синтез речи» собран целиком локально — Whisper, pgvector, Qwen3-TTS, ноль обращений к облачным моделям. О границах такого контура — в статье про локальные нейросети для компании.
Из чего складывается стоимость
Публичных прайсов на такие проекты почти нет: объём определяется состоянием записей и тем, сколько выводов нужно получать автоматически. Полезнее знать состав сметы:
- Доступ к записям. Выгрузка из телефонии или сервиса встреч, обработка старого архива.
- Распознавание. Облачный тариф за минуту либо своё железо. Считается по потоку минут: десять менеджеров с двадцатью разговорами в день дают около четырёх тысяч разговоров в месяц.
- Разделение говорящих. Отдельная работа, особенно для встреч с одним микрофоном. Здесь прячется разница между «текст есть» и «текстом можно пользоваться».
- Хранилище и поиск. Укладка фрагментов, привязка к сделкам, поиск по смыслу.
- Правила и отчёты. Проверки по скрипту, форма сводки, подборки возражений.
- Сопровождение. По прайсам студий поддержка начинается примерно от 2 000 ₽/час.
На что смотреть
Вечный пилот. Распознавание запустили, текст показали, точностью впечатлились — и остановились. Признак: не назван день, когда руководитель перестаёт слушать записи выборочно и начинает работать с отчётом. Критерий выхода записывается заранее.
Расшифровка поверх бардака. Если сделки в CRM ведутся кое-как, привязать разговоры будет не к чему: архив без привязки к сделке даёт поиск по тексту и ничего больше.
Разбор стал занимать больше времени. Раньше руководитель слушал пять звонков в месяц, теперь читает восемьдесят расшифровок. Значит, шаг «выводы» пропущен: читать нужно не все разговоры, а те, где проверка не прошла.
Страх отдать записи наружу. Возражение здравое: разговоры с клиентами — не тот материал, который по умолчанию отправляют в чужой сервис. Проверка — отключить машине интернет и посмотреть, что перестало работать. И отдельно: если расшифровки нужны только для наказаний, обсуждения уезжают в личные мессенджеры.
Вопросы и ответы
Насколько точна расшифровка звонков и хватает ли этой точности? На чистой телефонии с раздельными каналами текст пригоден для поиска и проверок сразу. Ошибки собираются в предсказуемых местах: фамилии, названия компаний, артикулы. Контролю скрипта это не мешает, а цитату вычитывают.
Чем транскрибация встречи отличается от расшифровки звонка? Условиями записи. В звонке два участника и раздельные каналы. На встрече участников пятеро, микрофон один, люди перебивают друг друга. Поэтому критично разделение говорящих, а результат нужен выжимкой: решения, задачи, сроки.
Что нужно для распознавания речи для бизнеса, кроме самой модели? Доступ к записям с выгрузкой, разделение говорящих и хранилище с привязкой к сделкам. Модель — заменяемая часть, её меняют за день; всё остальное меняется неделями.
Можно ли анализировать звонки, не спрашивая согласия клиента? Это вопрос к юристу, общий ответ дать нельзя. Практика сводится к тому, что о записи предупреждают до начала разговора, основание фиксируют в документах, а срок хранения и круг доступа ограничивают. Отсутствие уведомления — самая частая ошибка в таких проектах.
С чего начать, если записи копятся, а времени на них нет? Взять один месяц архива и три вопроса: какое возражение встречается чаще всего, в каком проценте разговоров звучит обязательный вопрос, о чём спрашивают до цены. Разбор занимает неделю и показывает, стоит ли строить постоянный контур.
Расшифровка сама по себе — промежуточный результат. Работать начинает связка: текст с разделением говорящих, привязка к сделкам, поиск по смыслу и три вопроса, ответы на которые смотрят еженедельно. Разбор задачи — через контакты.
