4 шага работы голосового бота

Голосовой бот в 2026 - это конвейер из четырёх блоков, который запускается каждый раз, когда клиент произносит фразу. Весь цикл занимает 0,8-2 секунды, и собеседник этого не замечает.

  1. ASR (Automatic Speech Recognition): бот «слышит» речь клиента и превращает её в текст
  2. NLU + LLM: языковая модель понимает смысл, выбирает реакцию, формирует ответ
  3. Logic + Memory: сценарный движок проверяет ветку диалога, состояние клиента, обновляет CRM
  4. TTS (Text-to-Speech): синтезатор озвучивает ответ естественным голосом с живыми интонациями
ASRречь клиента переводится в текст
текст
NLU + LLMпонимает смысл, выбирает реакцию, формирует ответ
смысл
Logic + Memoryпроверяет ветку диалога, обновляет CRM
ответ
TTSозвучивает ответ естественным голосом с живыми интонациями
Что остаётся в CRM: ветка диалога, состояние клиента, статус записи.
4 модуля голосового бота 2026 работают в стриминге: полный цикл укладывается в 0,8-2 секунды между репликами.

Каждый блок - отдельная нейросеть или модуль. Связаны они в реальном времени: пока клиент договаривает фразу, ASR уже транскрибирует начало, LLM получает первые токены, TTS начинает синтез. Это называется streaming - именно за счёт него получается «живой» темп диалога.

Технический ключ

Главное отличие современного голосового бота от устаревшего IVR - не одна технология, а связка из 4 нейросетей, работающая в стриминге. Без LLM это не голосовой бот, а автоинформатор. Во сколько обходится такой стек, посчитано в статье про стоимость голосового робота.

Какие нейросети используются в 2026

Голосовой бот в 2026 году собирается из 3 нейросетевых блоков: распознавания речи, LLM для ответа и синтеза голоса.

БлокРоссийские моделиГлобальные модели
ASR (распознавание)Yandex SpeechKit, Tinkoff VoiceKit, GigaAMWhisper Large-v3, Deepgram Nova-3, AssemblyAI
LLM (мышление)YandexGPT 5 Pro, GigaChat MAX, T-ProGPT-5, Claude Opus 4.7, Gemini 3 Pro
TTS (синтез)Yandex SpeechKit Premium, Silero v4, SaluteshapeElevenLabs Multilingual v3, OpenAI TTS HD
VAD (детект пауз)Silero VADWebRTC VAD, pyannote

В реальных проектах PrimexAI комбинируем: для русского чаще всего связка Yandex SpeechKit (ASR) + GPT-4o / Claude (LLM) + ElevenLabs Multilingual (TTS). Для бюджетных проектов - GigaChat + Yandex TTS. Как эта техника превращается в роль в отделе продаж - в разборе что такое AI МОП.

Нужен разбор под вашу нишу? или напишите в Telegram - ответим с расчётом по вашей базе.

Как бот понимает речь - ASR

ASR (распознавание речи) - первый блок. Звуковой поток с телефонной линии (8 кГц или 16 кГц моно) разбивается на куски по 100-300 миллисекунд и отдаётся в нейросеть, которая возвращает текст.

Сложности русского ASR в телефонии:

  • Узкая полоса частот (300-3400 Гц) режет высокие тона - с женскими голосами хуже
  • Шумы линии: GSM-помехи, ветер, бубнящий человек рядом с клиентом
  • Слова-паразиты («ну», «как бы», «короче») и переключения мысли
  • Акценты и региональные говоры

Современные ASR справляются с точностью 92-97% на чистой линии и 82-88% на шумной. Этого достаточно для понимания смысла - LLM на следующем шаге восстанавливает плохо распознанные участки по контексту. Подробный обзор технологий есть в гайде «Что такое голосовой робот».

Как бот понимает смысл - NLU и LLM

Получив транскрипт, бот должен понять, что хочет клиент: ответить «да/нет», задать вопрос, выразить возражение, согласиться на встречу. До 2022 это делалось через intent classification - классификатор намерений. Точность была 75-85%, что давало много ошибок.

В 2026 классификация заменена на LLM. Языковая модель получает на вход:

  1. Системный промпт - роль бота, тон, цели звонка
  2. Базу знаний - продукты, цены, ответы на возражения
  3. Историю текущего диалога - всё, что говорили обе стороны
  4. Последнюю фразу клиента - распознанный текст

На выходе LLM выдаёт следующую реплику бота + флаги (сменить ветку сценария, эскалировать на человека, закрыть сделку). На GPT-4o / Claude Opus точность понимания смысла - 95%+ на любых сценариях, включая нестандартные возражения.

Естественный голос - TTS

TTS уровня 2026 года передаёт эмоции и паузы; при использовании ElevenLabs Multilingual v3 и Yandex SpeechKit Premium ИИ не распознают 70-80% слушателей.

Что отличает TTS уровня 2026:

  • Эмоциональная окраска - бот может произнести фразу с улыбкой, удивлением, лёгким сожалением
  • Контекстные паузы - перед сложными словами, после восклицаний, между мыслями
  • Просодия - правильное ударение, интонационная подсветка ключевых слов
  • Кастомные голоса - можно «склонировать» голос конкретного человека (легально - с согласия)

В 2026 ElevenLabs Multilingual v3 и Yandex SpeechKit Premium дают качество, при котором 70-80% слушателей не определяют, что говорит ИИ.

Связь с CRM и телефонией

Для боевого голосового бота нужны 3 связки: CRM, телефония и внешние системы; обмен с ними строится через REST API и вебхуки.

Телефония. Бот подключается к АТС через SIP-trunk: Mango Office, MTT, UIS, Beeline Cloud, MTS Exolve. Робот получает входящие, делает исходящие, видит CallerID, может перевести звонок на менеджера. Часть вызовов до разговора не доходит вообще: как отсекаются автоответчики в обзвоне.

CRM. На каждый звонок робот либо находит карточку клиента (по номеру), либо создаёт новую. По итогам диалога - обновляет статус, теги, поля «потребность», «бюджет», «сроки», ставит задачу нужному менеджеру. Поддержка: AmoCRM, Bitrix24, HubSpot, Twenty CRM, любая через REST API.

Внешние системы. МИС в стоматологии (MEDODS, Dental4Windows), TMS в логистике (1С:Транспортная логистика), ATS в HR (hh.ru, Talantix). Чтобы робот мог читать и записывать данные в реальном времени.

Реальный пример диалога

Сценарий: реактивация спящей базы стоматологии. Клиент - женщина, 38 лет, последний визит 8 месяцев назад.

Транскрипт диалога - реактивация

Бот: Алло, добрый день! Это Дина из стоматологии «Имплантум». Мария Сергеевна, верно?

Клиент: Да, я.

Бот: Мария Сергеевна, я поняла, последний раз вы у нас были на гигиене в августе. Хотела предложить - сейчас открыли запись на профилактический осмотр со скидкой 30%. Удобно посмотреть свободные дни?

Клиент: Я подумаю, занята сейчас.

Бот: Конечно, не отвлекаю. Скажите, осмотр - это в принципе интересно, просто не сейчас? Или сейчас другая клиника?

Клиент: В принципе да, давно собиралась.

Бот: Отлично. Тогда два варианта: записать вас на удобную дату прямо сейчас или прислать SMS со ссылкой - сами выберете когда?

Клиент: Давайте SMS.

Бот: Принято, отправлю в течение минуты на этот номер. Хорошего дня!

Что произошло технически: ASR перевёл речь в текст, LLM понял возражение «занята» и не сдался, а аккуратно квалифицировал - есть ли потребность в принципе. Получив утверждение, предложил два варианта закрытия. Робот не сделал продажу здесь, но получил «тёплый» лид и отправил SMS-задачу в очередь. Менеджер подхватит лид, как только клиент кликнет по ссылке. Подробнее про сценарии в нише - кейс стоматологии.

Метрики качества голосового бота

Чтобы оценить, хорошо ли работает бот, в PrimexAI смотрят на 6 метрик:

  1. Connect rate - % дозвонов до живого собеседника. Норма 30-50% (зависит от базы).
  2. Engagement rate - % диалогов длиннее 30 секунд. Норма 60-80%.
  3. Target action rate - % звонков с целевым действием (запись, согласие). Норма 8-22% на реактивации.
  4. WER (Word Error Rate) - точность распознавания. Норма ≤10%.
  5. Drop rate - % резких сбросов клиентом. Норма ≤15%.
  6. Сложность сценария - сколько диалогов прошли все ветви без сваливания на оператора. Норма 80%+.

Где голосовые боты ломаются

Голосовые боты чаще всего спотыкаются на 5 сценариях, и у каждого есть техническое решение:

  • Нестандартные имена и фамилии - ASR может перепутать. Решение: верификация по базе CRM перед диалогом.
  • Перебивание собеседника - клиент говорит поверх бота. Решение: VAD + interrupt-handling в движке.
  • Эмоциональные реакции (агрессия, плач, мат) - LLM-классификатор эмоций + автопереход на оператора.
  • Цифры и аббревиатуры - адреса, ИНН, номера договоров. Решение: spell-mode TTS и подтверждающее повторение.
  • Двусмысленные «да» (когда клиент соглашается, не понимая на что). Решение: контрольные вопросы.

Хотите увидеть, как голосовой бот будет работать в вашей нише?

На бесплатной диагностике покажу записи реальных диалогов из вашей сферы и рассчитаю окупаемость на ваших цифрах.

Написать в Telegram

FAQ

Бот реально отличается от автоинформатора 2010-х?

Принципиально. Автоинформатор - запись + DTMF. Современный бот - связка из 4 нейросетей с LLM в ядре, которая ведёт свободный диалог, отрабатывает возражения, понимает контекст.

Сколько времени занимает обработка одной фразы?

В режиме streaming - 0,8-2 секунды от окончания речи клиента до начала ответа бота. Это сравнимо с задержкой живого оператора и не воспринимается как «робот».

Можно ли использовать только бесплатные модели?

Можно - например Whisper Open Source для ASR, локальную LLM (Llama 3.1, Yandex GPT-Lite) и Silero TTS. Качество будет ниже премиум-стека, но для несложных сценариев и небольших объёмов работает.

Бот может перевести звонок на менеджера?

Да. Через SIP-redirect или REFER-метод бот переводит звонок без обрыва: клиент говорит с роботом, потом плавно соединяется с живым менеджером, который видит карточку с историей диалога.

Как обучить бота под мою специфику?

Через системный промпт + базу знаний. Прописываются продукты, цены, FAQ, типовые возражения, скрипт диалога. Дообучение модели не требуется - LLM достаточно гибкая, чтобы работать через инструкцию (in-context learning).