Речевая аналитика

Оценка качества звонков с помощью AI: как не наказывать менеджеров несправедливо

Мы разобрали 119 встреч с командами 40 компаний, которые используют Bewise. Людей волновала не строгость оценки, а её точность. AI должен анализировать все разговоры, но ставить балл только там, где хватает данных.

В одном из отчётов по оценке качества звонков почти вся команда оказалась в красной зоне. Начали разбирать строки. В одной сделке клиент перестал отвечать. В другой критерий вообще не относился к разговору. В третьей нужная договорённость осталась в переписке, которую система не увидела.

На первый взгляд отчёт объективный: у каждого сотрудника есть число, всех проверили по одной шкале. Проблема в том, что одинаковая шкала ещё не гарантирует справедливого результата. Когда AI обязан поставить балл при любых исходных данных, сомнение превращается в уверенную цифру.

Мы разрабатываем Bewise, AI-агента для анализа коммуникаций в продажах, и регулярно разбираем такие случаи с клиентами. Постепенно стало ясно: полный охват и обязательная оценка каждого разговора не одно и то же. Система может прочитать или прослушать всё, но в отдельных случаях честным результатом будет N/A или пометка о нехватке данных.

Как мы считали. Мы изучили 119 рабочих встреч по настройке, калибровке и использованию Bewise с командами 40 компаний.

Главная ошибка: требовать оценку там, где системе не хватает данных

Автоматизацию контроля качества звонков обычно продают через охват. Человек слушает выборку, AI обрабатывает все разговоры. Из этого часто делают лишний вывод: раз система анализирует 100% коммуникаций, она обязана оценить 100% коммуникаций.

Это разные задачи.

Полный охват означает, что ни один звонок или чат не выпал из анализа. Оценка означает, что системе хватило данных, критерий относился к этой ситуации, а результат действительно зависел от человека, которого оценивают.

Если хотя бы одно условие не выполнено, есть три разных ответа:

  • не выполнено: менеджер мог выполнить критерий, но не сделал этого;
  • не применимо (N/A): критерий не относился к этой коммуникации;
  • недостаточно данных: система не видит нужную часть контекста.

В отчёте все три ответа легко превратить в ноль. Для руководителя это плохая экономия: цифра есть, а причины за ней нет.

На одной встрече руководитель сформулировал требование совсем коротко:

«Дело не в строгости, а дело в точности, чтобы это было точно».

Если AI не умеет сказать «не знаю» или «не применимо», он будет регулярно выдавать догадку за результат измерения.

Все коммуникациизвонки, чаты, письма и встречи
Хватает контекста?видны данные, нужные для критерия
Критерий применим?действие требовалось в этой ситуации
Результатоценка, N/A или недостаточно данных
После результата нужны доказательство и действие. Руководитель должен увидеть, на чём основан вывод и что проверять дальше.
Как AI решает, поставить оценку, выбрать N/A или отметить недостаток данных.

Откуда берётся несправедливая оценка качества звонка

За одной красной цифрой мы чаще всего находили одну из четырёх причин.

Система видит звонок, но не видит сделку

В медицинской компании пациент несколько раз перезванивал из метро. Связь обрывалась, разговор продолжался новым звонком, часть вопросов ушла в переписку. Если смотреть каждый звонок отдельно, кажется, что менеджер пропустил представление, презентацию и обязательные вопросы. На самом деле всё это уже было в предыдущих разговорах.

Руководитель объяснила:

«По отдельному звонку они все будут плохо отработаны. А в целом, по факту, отработка будет хорошая».

Приветствие можно проверить внутри конкретного звонка. Для оценки всей работы с клиентом одного фрагмента мало. Договорённости, повторные касания и работу с возражениями приходится смотреть по цепочке звонков, чатов и встреч. Эту разницу мы подробнее разбирали в статье о том, почему анализа одного звонка недостаточно.

Критерий не относился к разговору

Возьмём 45-секундный звонок секретарю. Менеджер попросил соединить с нужным человеком, узнал время для повторного звонка и попрощался. Он не выяснял бюджет и не проводил презентацию. Собеседник всё равно не мог ответить на эти вопросы.

Если оценить такой контакт по полному сценарию продажи, менеджер получит несколько нулей за действия, которых ситуация не предполагала.

Для этих критериев нужен статус N/A. Критерий к разговору не применялся, поэтому его не стоит включать в итоговый балл.

Клиент перестал отвечать, а система снизила оценку менеджеру

Руководитель отдела продаж из недвижимости описал результат такого смешения:

«Я просто не хочу видеть всю систему CRM, в которой все брокеры будут красные… Должна быть отдельная категория: “Клиент не отвечает”».

Само по себе молчание клиента ничего не говорит о качестве работы менеджера. Нужно проверить, отправил ли он повторное сообщение, напомнил ли о договорённости и выбрал ли подходящий канал.

Если всё это сделано, статус «клиент не отвечает» должен описывать сделку. Автоматически снижать оценку сотрудника в таком случае нельзя.

Одинаковый балл скрывает разные причины

Три менеджера могут получить 40/100 по трём разным причинам:

  • первый не зафиксировал следующий шаг и пропал после встречи;
  • второй сделал три согласованных повторных касания, но клиент перестал отвечать;
  • у третьего CRM не загрузила половину переписки, и AI оценил обрывок.

В рейтинге все трое получат одинаковые 40 баллов из 100. Но руководитель должен отреагировать по-разному: первого менеджера обучить, во второй сделке изменить тактику общения с клиентом, а в третьем случае исправить загрузку данных.

Общий балл без расшифровки прячет именно ту информацию, ради которой руководитель открыл отчёт.

Пять условий справедливой AI-оценки

Мы сравнили спорные оценки в разных компаниях и свели причины ошибок к пяти требованиям. Если хотя бы одно требование не выполнено, баллам нельзя доверять: руководитель рискует обучать сотрудников не тому и искать проблему не в том месте процесса продаж.

1. Полнота: система видит контекст, нужный для критерия

Для каждого критерия нужен свой объём контекста.

  • Приветствие и чистота речи: одного звонка достаточно.
  • Выполнение договорённости: нужен предыдущий контакт.
  • Повторное касание после встречи: нужна цепочка действий.
  • Причина отказа: нужна история сделки.

Перед настройкой стоит спросить: какие источники нужны, чтобы оценить этот критерий без догадок?

Если нужны звонки, переписка и встречи, вывод по одному аудиофайлу будет неполным. Контекст в данном случае защищает менеджера от оценки по случайному фрагменту.

2. Применимость: у менеджера была возможность выполнить критерий

До расчёта балла система должна понять, требовалось ли действие в этом разговоре.

Если клиент не называл конкурента, критерий «отработал конкурента» неприменим. Если разговор состоялся с секретарём, полная квалификация может быть неуместна. Если это короткий сервисный контакт, презентация компании не нужна.

У N/A должны быть чёткие условия. Иначе им начнут прикрывать плохие результаты. Долю таких ответов стоит отслеживать отдельно: резкий рост часто указывает на ошибку настройки или пропуски в данных.

Бинарные, процентные и текстовые критерии оценки качества коммуникации в Bewise
Критерии оценки и факты из разговора разделены: не каждое извлечённое значение меняет итоговый балл.

Не вся информация из разговора должна влиять на итоговый балл. На скриншоте система отдельно оценивает, согласовал ли менеджер следующий шаг, и отдельно записывает, о чём именно договорились. Так руководитель видит и качество работы менеджера, и контекст сделки, но не смешивает их в одной оценке.

Сравните Bewise с вашей системой

За 7 дней сравним результаты на одних и тех же сделках и покажем, что Bewise нашёл дополнительно.

3. Причина связана с работой менеджера

На результат сделки одновременно влияют менеджер, качество лида, этап, канал, цена, сроки и поведение клиента. Если всё свести к одному рейтингу сотрудника, причины перемешаются.

Поэтому сигналы лучше разделять:

СигналЧто он описывает
Менеджер не сделал согласованное повторное касаниеКачество работы менеджера
Повторное касание сделано, клиент не отвечаетВовлечённость клиента и риск сделки
Половина переписки не загрузиласьПолнота данных
На одном канале конверсия заметно нижеКачество источника или особенности канала

Одна и та же оценка ещё не означает одну и ту же проблему. Руководителю важно видеть, что за ней стоит: ошибка менеджера, слабый поток лидов или пропущенные данные. Иначе рейтинг только расставляет людей по местам, но не помогает управлять командой. Подробнее об этом мы писали в статье про «святой рандом» в продажах.

4. Оценку можно проверить

Если система показывает только балл без объяснения, руководителю приходится либо довериться ей, либо самому возвращаться к записи или переписке. В первом случае легко сделать неверный вывод, во втором система не экономит время.

Поэтому рядом с баллом стоит показывать:

  • короткое объяснение логики;
  • цитату или фрагмент коммуникации;
  • переход к исходному звонку или сообщению;
  • видимые пропуски контекста;
  • способ отметить подтверждённую ошибку.
Оценка критерия, комментарий AI и цитаты из звонков, подтверждающие вывод
Рядом с оценкой видны объяснение и фрагменты коммуникации, на которых основан вывод.

Цитата не доказывает, что AI прав. Зато руководитель сразу видит, на чём основан вывод, и может быстро проверить спорное место.

5. Понятно, что делать после оценки

Сам по себе низкий балл ничего не объясняет. Руководителю нужно понимать, что делать дальше: разобрать разговор с менеджером, потренировать конкретный навык, исправить критерий оценки, вернуть сделку в работу или проверить качество лидов.

На встречах клиенты называли такой подход «контроль-помощь» и «помощь ребятам, а не контроль». Тогда низкий балл становится поводом разобрать конкретную ситуацию, а не ярлыком для сотрудника.

Хороший отчёт отвечает на три вопроса:

  1. Что произошло?
  2. Почему система сделала такой вывод?
  3. Что менеджеру или руководителю сделать теперь?

Если третьего ответа нет, компания купила дорогую раскраску для CRM.

Что означает оценка разговора от 0 до 100

Здесь речь об оценке одной коммуникации: звонка, переписки или встречи. Она показывает, насколько менеджер выполнил критерии, которые относились именно к этому контакту.

Сначала система определяет тип коммуникации и выбирает подходящие критерии. По каждому она ставит оценку, N/A или отмечает, что данных недостаточно. Общий балл считается только по тем критериям, которые удалось оценить.

82/100 по 9 критериям из 12. Два критерия не применимы, по одному не хватило данных.

Такая расшифровка полезнее одного числа: руководитель видит, из чего сложился балл и можно ли сравнивать его с другими коммуникациями.

Рейтинг менеджера строится уже по множеству таких оценок. Чтобы сравнение было честным:

  • учитывайте только применимые критерии;
  • сравнивайте одинаковые типы коммуникаций и этапы сделки;
  • показывайте, сколько коммуникаций и данных попало в расчёт;
  • позволяйте открыть критерий, коммуникацию и исходную запись.
Вовлечённость клиента отдельно от оценки качества работы менеджера
Вовлечённость клиента показывается отдельно и не смешивается с оценкой работы менеджера.

Вовлечённость клиента в этот балл включать не нужно. Статус «не реагирует» говорит о риске по сделке, но не показывает, хорошо или плохо работал менеджер.

Как внедрить оценку, которой команда будет доверять

Перед запуском критерии нужно проверить на реальных коммуникациях. Команда сравнивает выводы системы со своей оценкой, исправляет спорные формулировки и заранее определяет, какой уровень совпадения считает приемлемым.

1. Соберите 30 сделок для проверки

Возьмите 30 разных сделок. Желательно, чтобы за них отвечали разные менеджеры, а заявки приходили из разных каналов. Соберите по каждой сделке весь путь клиента: звонки, переписку, письма и встречи. Посмотрите, какие типы коммуникаций встречаются на разных этапах продажи.

2. Составьте правила для каждого типа коммуникации

Первичный звонок, повторный контакт и презентацию нельзя оценивать одинаково. Определите, чего вы ждёте от менеджера в каждом случае: что он должен выяснить, обсудить и зафиксировать. Так получится каркас оценки с отдельным набором критериев для каждого типа коммуникации. Конкретные правила будут зависеть от вашей модели продаж.

3. Опишите условия N/A

Для каждого критерия зафиксируйте три вещи: когда он должен сработать, когда неприменим и какие данные ему нужны. Это часть методологии. Откладывать её до технической настройки не стоит.

4. Разбирайте причину расхождения

Если эксперт поставил 80, а AI поставил 40, сравните причины. Возможно, система не увидела чат. Возможно, критерий описан двусмысленно. Бывает и так, что сам эксперт применяет правило непоследовательно.

5. Дайте менеджеру путь к доказательству

Менеджер должен увидеть, какая фраза привела к выводу, и иметь возможность показать пропущенный контекст. Такие споры помогают исправлять критерии.

Почему одного звонка часто недостаточно

По одному звонку можно проверить, представился ли менеджер, озвучил ли обязательную информацию и согласовал ли следующий шаг. Но учитывать нужно и задачу разговора. Подтверждение записи или короткое уточнение нельзя оценивать по тем же критериям, что и первичную консультацию.

Если клиент решил свой вопрос за один звонок, этого анализа может быть достаточно. Но в B2B и B2C со средним или высоким чеком продажа редко происходит за один контакт. Как правило, чем выше чек и сложнее выбор, тем больше звонков, переписок и встреч проходит до покупки.

Здесь важно видеть не только качество каждого разговора, но и движение сделки целиком: как менялась вовлечённость клиента, какие риски появлялись, о чём договорились и были ли выполнены эти договорённости. Отдельные звонки такой картины не дают.

Как Bewise анализирует сделку целиком

Bewise начинает с каждой отдельной коммуникации. Система определяет её тематику и применяет подходящий набор критериев. Первичный звонок, повторный контакт, презентация и сервисное обращение оцениваются по-разному.

Затем звонки, переписки, письма, встречи и действия менеджера в CRM собираются в общую историю сделки. Bewise анализирует:

  • как менялась вовлечённость клиента;
  • какие риски появлялись по ходу продажи;
  • о чём договорились менеджер и клиент;
  • выполнил ли менеджер эти договорённости и следующие шаги;
  • какие действия помогали двигать сделку вперёд, а какие мешали.

На уровне всей сделки Bewise также оценивает выполнение методологии продаж. Система проверяет не каждый звонок на наличие всех блоков сразу, а весь сценарий продажи по совокупности коммуникаций. Например, потребность могли выяснить в первом звонке, решение презентовать на встрече, возражение отработать в переписке, а следующий шаг согласовать во время повторного контакта.

После этого Bewise формирует оценку сделки целиком: какие блоки методологии выполнены, какие пропущены, как менялась вовлечённость клиента и где появились риски. Это не балл за один разговор, а общая картина продажи. Каждый вывод можно проверить: открыть нужную коммуникацию и увидеть, на каких фактах он основан.

Что в итоге считать хорошей оценкой

Если почти вся команда оказалась в красной зоне, сначала разберите причины. Проблема может быть в работе менеджеров, в критериях, в неполных данных или в формуле итогового балла.

Хорошая система умеет остановиться, когда данных недостаточно. Она показывает источник вывода и даёт руководителю понять, что делать дальше.

На небольшой выборке всё это можно делать вручную: собирать контекст, проверять применимость критериев и возвращаться к исходным разговорам. Bewise проделывает ту же работу по всем доступным коммуникациям, чтобы руководитель разбирал только важные и спорные случаи.

Сравните Bewise с вашей текущей системой

Если у вас уже есть сервис аналитики или отдел контроля качества, запустим Bewise параллельно на 7 дней. Сравним результаты на одних и тех же сделках и покажем, что Bewise нашёл дополнительно.