Материал серии rechevaya-analitika-dlya-otdela-prodazh по теме: Оценка звонков менеджеров: критерии, калибровка и единый стандарт

Оценка звонков менеджеров - это проверка конкретных действий сотрудника в разговоре с клиентом по заранее определённым критериям.

Рабочая оценка должна показывать не абстрактное качество менеджера, а проверяемый факт:

  • задал ли он нужный вопрос;
  • согласовал ли следующий шаг;
  • раскрыл ли возражение;
  • предложил ли дополнительный продукт;
  • зафиксировал ли срок;
  • выполнил ли выбранный стандарт компании.

Но за время работы над “Дожми Продажи” я понял: главный источник субъективности находится не только в AI.

Часто собственник, РОП, менеджер и сама система по-разному понимают, что именно считается выполнением критерия.

Если это различие не разобрать, автоматическая оценка звонков просто ускоряет старый спор.

Я хотел получить объективную цифру

Идея автоматической оценки сначала кажется очень простой.

Есть звонок.

Есть правило.

AI проверяет разговор.

Руководитель получает процент выполнения.

Например:

Менеджер зафиксировал следующий шаг.

Дальше можно посмотреть показатель по отделу, сравнить сотрудников, увидеть динамику и понять, где нужно вмешаться.

Именно к такой логике я постепенно пришёл в “Дожми Продажи”:

один управленческий фокус -> один проверяемый показатель -> тренд -> решение руководителя.

Она намного полезнее общего дашборда с десятками метрик.

Но в пилотах выяснилось, что между критерием и показателем есть ещё один обязательный слой.

Нужно сначала ответить:

Одинаково ли все участники понимают, что значит “критерий выполнен”?

Без этого цифра выглядит точной, но управленчески остаётся спорной.

Один звонок, четыре разные оценки

Возьмём простой критерий:

Менеджер назначил следующий контакт.

В разговоре сотрудник говорит:

Хорошо, я отправлю материалы, потом свяжемся.

Менеджер считает, что критерий выполнен. Он обозначил продолжение общения.

РОП может согласиться: сотрудник не закончил разговор окончательным отказом.

Собственник может поставить отрицательную оценку: нет конкретного действия, срока и ответственного.

AI тоже может выбрать любой из вариантов в зависимости от формулировки инструкции.

На уровне слов все обсуждают один критерий.

На уровне смысла у каждого свой стандарт.

Если сразу прогнать тысячу звонков, мы получим не объективность, а тысячу быстрых применений неопределённого правила.

И чем красивее будет отчёт, тем сложнее заметить, что проблема находится внутри самого критерия.

Почему готовый чек-лист не решает проблему

Когда руководитель ищет критерии оценки звонков, он часто находит готовый чек-лист:

  • приветствие;
  • представление;
  • выявление потребности;
  • презентация;
  • работа с возражениями;
  • завершение разговора;
  • следующий шаг.

Такой список полезен как источник идей.

Но его нельзя механически перенести в любой отдел продаж.

В одном бизнесе цель первого звонка - назначить замер.

В другом - провести квалификацию.

В третьем - перевести клиента на демонстрацию.

В четвёртом - получить документы для расчёта.

В пятом - понять, подходит ли обращение компании вообще.

Даже внутри одного отдела разные звонки выполняют разные функции.

Нельзя одинаково требовать презентацию продукта:

  • от первичного звонка;
  • от повторного уточнения;
  • от разговора после коммерческого предложения;
  • от звонка по документам;
  • от сервисного обращения.

Готовый чек-лист создаёт иллюзию порядка.

Но если критерий не связан с целью конкретной коммуникации, высокий балл может ничего не говорить о движении сделки.

Почему я сначала формулирую работу, а потом автоматизирую

В прошлых проектах я уже видел, как легко сначала построить сложную систему, а потом уточнять, какую работу она должна выполнять.

С критериями звонков риск тот же.

Если компания сама не определила, что означает “качественно выявил потребность” или “зафиксировал следующий шаг”, AI не убирает неопределённость. Он только применяет её быстрее и на большем массиве.

Поэтому сначала нужен наблюдаемый стандарт, затем примеры и калибровка, и только после этого - массовая оценка.

Что такое критерий оценки звонка

Критерий - это проверяемое описание факта, который должен быть обнаружен в коммуникации.

Хороший критерий отвечает на четыре вопроса:

  1. Что именно должен сделать менеджер?
  2. В каких разговорах это действие применимо?
  3. По какому фрагменту можно проверить выполнение?
  4. Где проходит граница между “выполнено” и “не выполнено”?

Плохой критерий:

Менеджер хорошо выявил потребность.

Он содержит оценочный ярлык, но не объясняет наблюдаемое действие.

Более рабочий вариант:

Менеджер задал вопросы о текущей ситуации клиента, желаемом результате и ограничениях, которые влияют на выбор решения.

Ещё уже:

До презентации менеджер выяснил, какую задачу клиент хочет решить и по какому признаку будет оценивать результат.

Такую формулировку можно проверить по цитате.

Она не доказывает, что менеджер провёл идеальную квалификацию.

Но она позволяет одинаково проверить конкретное действие.

Почему критерий должен описывать факт, а не впечатление

Слова “уверенно”, “качественно”, “профессионально”, “эмпатично” и “убедительно” звучат естественно.

Но для автоматической оценки они опасны.

Допустим, критерий звучит так:

Менеджер уверенно презентовал продукт.

Что считается уверенностью?

Отсутствие слов-паразитов?

Громкий голос?

Быстрая речь?

Отсутствие пауз?

Чёткое знание характеристик?

Менеджер может говорить медленно и спокойно, но точно отвечать на вопросы клиента.

Другой может звучать энергично и при этом не связать предложение с задачей покупателя.

Поэтому я стараюсь переводить впечатление в наблюдаемое действие.

Не:

Менеджер был убедителен.

А:

Менеджер связал свойства предложения с задачей, которую клиент сформулировал ранее.

Не:

Менеджер хорошо отработал возражение.

А:

После возражения менеджер задал уточняющий вопрос, определил основание сомнения и только затем дал ответ.

Не:

Менеджер проявил инициативу.

А:

Менеджер предложил конкретное следующее действие и согласовал срок.

Чем меньше в критерии психологической интерпретации, тем легче его проверить и откалибровать.

Сначала применимость, потом оценка

Одна из частых методических ошибок - оценивать каждый критерий в каждом звонке.

Например, мы проверяем работу с возражением.

Но клиент не выдвигал возражение.

Что ставить менеджеру?

Ноль?

Полный балл?

Среднюю оценку?

Любой из этих вариантов искажает показатель.

Поэтому перед оценкой должен быть отдельный вопрос:

Был ли критерий применим к этой коммуникации?

Если нет, нужен статус “не применимо”.

Он не является ни успехом, ни ошибкой.

Примеры:

  • нельзя оценивать отработку цены, если цена не обсуждалась;
  • нельзя оценивать назначение замера в звонке, целью которого было уточнение документов;
  • нельзя оценивать допродажу, если клиент обращался по сервисному вопросу;
  • нельзя оценивать презентацию в коротком повторном контакте после уже проведённой демонстрации.

Статус N/A кажется технической мелочью.

На практике он защищает отчёт от ложной точности.

Какую шкалу использовать

Я не считаю, что каждому критерию нужна сложная десятибалльная шкала.

Чем больше уровней, тем больше пространства для спорной интерпретации.

Для большинства управленческих критериев достаточно трёх состояний:

  • выполнено;
  • не выполнено;
  • не применимо.

Иногда полезна промежуточная оценка:

  • 1 - выполнено полностью;
  • 0,5 - действие начато, но не доведено до стандарта;
  • 0 - не выполнено;
  • N/A - критерий неприменим.

Например, следующий шаг:

  • 1 - согласованы действие и срок;
  • 0,5 - следующее действие обозначено, но срок не зафиксирован;
  • 0 - договорённости нет;
  • N/A - следующий шаг не требовался по типу коммуникации.

Но промежуточный балл нужно вводить только тогда, когда компания действительно понимает его границу.

Иначе 0,5 превращается в удобное место, куда проверяющий складывает все сомнения.

Цитата важнее общего балла

Оценка без основания быстро превращается в веру в систему.

Поэтому рядом с каждым результатом должна быть цитата или опорный фрагмент разговора.

Если система поставила “выполнено”, руководитель должен видеть, на каких словах основан вывод.

Если поставила “не выполнено”, должно быть понятно, что именно отсутствовало или где разговор завершился.

Цитата нужна не для того, чтобы каждый раз вручную перепроверять весь массив.

Она нужна для трёх задач:

  • быстро разобрать спорный случай;
  • откалибровать критерий;
  • объяснить стандарт сотруднику без абстрактной лекции.

Я всё меньше доверяю цифре, которую нельзя развернуть до конкретной коммуникации.

Не потому, что AI обязательно ошибается.

А потому, что управленческая цифра должна быть объяснимой.

Что я увидел в первых калибровках

В ранних пилотах мы иногда начинали с формулировки, которая казалась понятной всем.

AI оценивал выборку.

Клиент открывал карточки.

И выяснялось, что часть разговоров, которые система отметила как успешные, руководитель успешными не считает.

Мы уточняли правило.

После повторного анализа показатель мог стать ниже.

На первый взгляд результат ухудшился.

Но на самом деле произошло важное изменение: цифра стала ближе к реальному стандарту клиента.

Иногда клиент сам менял свою трактовку после просмотра примеров.

Сначала он считал, что фраза “потом свяжемся” подходит.

Потом увидел несколько разговоров, где после такой договорённости сделка зависала, и решил требовать конкретный срок.

Это не означает, что мы доказали причинную связь между формулировкой и потерей сделки.

Но реальные карточки помогли руководителю точнее определить стандарт, который он хочет внедрять.

Именно в этот момент я понял:

Калибровка - это не только настройка AI. Это процесс прояснения управленческого ожидания.

Кто утверждает критерий

Здесь важно не уйти в бесконечное коллективное согласование.

Критерий утверждает владелец управленческого фокуса.

Обычно это:

  • собственник;
  • коммерческий директор;
  • директор по продажам;
  • РОП в пределах своей зоны ответственности;
  • руководитель контроля качества.

Команда не голосует, нужен ли стандарт.

Но сотрудники должны проверить его понимание и применимость на реальных карточках.

Это разные действия.

Руководитель определяет:

Что компания считает правильным действием.

Команда помогает увидеть:

  • где формулировка непонятна;
  • где критерий неприменим;
  • где не хватает контекста;
  • где сотрудник и руководитель по-разному читают одну реплику;
  • где эталон противоречит реальному процессу.

Так расхождение становится не борьбой за правоту, а материалом для уточнения стандарта.

Как проходит калибровка критерия

Я использую такой цикл.

Шаг 1. Выбрать управленческий фокус

Не “повысить качество звонков вообще”.

А конкретный фокус:

  • фиксировать следующий шаг;
  • назначать замер;
  • предлагать дополнительный продукт;
  • раскрывать возражение по цене;
  • выяснять критерии выбора;
  • не отпускать инициативу после интереса клиента.

Шаг 2. Описать наблюдаемое действие

Нужно перевести ожидание руководителя в факт, который можно проверить по коммуникации.

Например:

Менеджер и клиент согласовали конкретное следующее действие и срок.

Шаг 3. Определить применимость

Для каких типов звонков критерий обязателен?

Когда он не применяется?

Какие исключения допустимы?

Шаг 4. Собрать реальные карточки

Нужны не выдуманные учебные диалоги, а настоящие примеры:

  • явно выполненные;
  • явно невыполненные;
  • спорные;
  • неприменимые.

Шаг 5. Провести ручную оценку

Сначала карточки оценивает руководитель.

Желательно сохранить не только ответ, но и логику:

  • какая цитата стала основанием;
  • почему критерий выполнен;
  • чего не хватило;
  • почему случай неприменим.

Шаг 6. Сравнить оценки

AI оценивает те же карточки.

Затем калибровку проходят РОП и сотрудники.

Важно смотреть не только итоговую сходимость, но и типы расхождений.

Шаг 7. Уточнить критерий

Если разные люди системно расходятся в одном месте, нужно не обвинять проверяющего, а проверить правило.

Возможно:

  • формулировка слишком широкая;
  • не определена применимость;
  • отсутствует промежуточный уровень;
  • разные типы звонков смешаны;
  • в карточке недостаточно контекста;
  • руководитель сам использует два разных стандарта.

Шаг 8. Запустить новый цикл

После уточнения критерий снова проверяется на карточках.

Только после этого его имеет смысл использовать в регулярном контроле и динамике.

Два режима синхронизации команды

Не каждый критерий требует длинного обучения.

Я разделяю два режима.

Длинный режим

Он нужен для нового или спорного стандарта.

Сотрудники получают реальные карточки без готовой оценки.

Каждый определяет:

  • выполнен ли критерий;
  • какая цитата подтверждает решение;
  • применим ли критерий;
  • что вызывает сомнение.

Затем оценки сравниваются с логикой руководителя.

Так строится понимание, а не просто передаётся инструкция.

Короткий режим

Он подходит для понятного критерия, который нужно быстро внедрить.

Руководитель показывает:

  • несколько эталонных карточек;
  • несколько ошибок;
  • границы применимости;
  • логику оценки.

После этого понимание проверяется на новых примерах.

Короткий режим быстрее.

Но его нельзя использовать, если сама формулировка вызывает системные споры.

Что означает сходимость

Сходимость - это не магическая цифра точности AI.

Она показывает, насколько одинаково участники применяют утверждённый критерий к одним и тем же карточкам.

Можно смотреть:

  • сходимость AI и собственника;
  • сходимость РОПа и собственника;
  • сходимость сотрудников и руководителя;
  • долю спорных карточек;
  • долю случаев N/A;
  • типичные причины расхождения.

Низкая сходимость не всегда означает, что AI или сотрудник ошибается.

Она может показывать:

  • плохую формулировку;
  • неоднозначный стандарт;
  • смешение разных сценариев;
  • недостаток контекста;
  • реальное расхождение управленческих ожиданий.

Поэтому я не использую слово “объективная оценка” как автоматическое свойство системы.

Точнее сказать:

Показатель становится управленчески легитимным после калибровки критерия, проверки сходимости и разбора спорных карточек.

Почему общий балл менеджера опасен

Соблазнительно собрать все критерии в одну цифру:

Иванов - 82 балла.

Но эта цифра скрывает слишком много.

Менеджер может:

  • хорошо квалифицировать, но не фиксировать следующий шаг;
  • правильно работать с возражениями, но не делать допродажу;
  • получать низкий балл из-за критериев, неприменимых к его типу звонков;
  • формально проходить чек-лист, не двигая сделку;
  • работать с более сложным сегментом клиентов.

Общий балл может быть удобен для навигации.

Но управленческое действие должно опираться на конкретный фокус.

Не:

У сотрудника низкое качество звонков.

А:

В подходящих коммуникациях сотрудник редко согласовывает срок следующего контакта.

Второй вывод можно проверить, обсудить и изменить.

Первый звучит как характеристика человека и вызывает защиту.

Как использовать оценку без карательного контроля

Я не считаю, что речевая аналитика должна начинаться с поиска виноватых.

Во многих случаях проблема находится не в менеджере.

Например:

  • критерий не объяснён;
  • РОП сам понимает его иначе;
  • скрипт противоречит реальному процессу;
  • лид не подходит компании;
  • следующий шаг невозможно назначить на этом этапе;
  • оффер не отвечает задаче клиента;
  • CRM объединяет разные типы обращений;
  • сотруднику не дали полномочий выполнить нужное действие.

Оценка должна помогать увидеть, где рвётся система.

Наказывать человека по некалиброванному показателю - значит превращать методическую ошибку в кадровое решение.

Поэтому рядом с цифрой должны оставаться:

  • критерий;
  • цитата;
  • применимость;
  • спорные карточки;
  • история уточнений;
  • решение руководителя.

Пример рабочего критерия

Возьмём фокус:

После отправки коммерческого предложения менеджер должен сохранить инициативу.

Плохой критерий:

Менеджер проявил инициативу после КП.

Рабочая версия:

В коммуникации, где менеджер обещает или отправляет коммерческое предложение, он согласовывает с клиентом конкретное действие после ознакомления и срок следующего контакта.

Применимость:

  • применяется к разговорам и перепискам, где обсуждается отправка КП;
  • не применяется к сервисным обращениям;
  • не применяется, если клиент сам назначил конкретный следующий контакт;
  • требует доступа к фрагменту, где завершалось обсуждение предложения.

Оценка:

  • 1 - действие и срок согласованы;
  • 0,5 - действие согласовано, срок не указан;
  • 0 - КП отправляется без следующей договорённости;
  • N/A - критерий неприменим.

Основание:

“Я отправлю расчёт сегодня. Давайте завтра после 15:00 созвонимся и обсудим вопросы”.

Такой критерий можно объяснить менеджеру, проверить через AI и смотреть в динамике.

Он не доказывает, что сделка обязательно состоится.

Он показывает выполнение выбранного управленческого стандарта.

С чего я бы начинал

Я бы не загружал в систему чек-лист из двадцати критериев.

Начал бы с одного действия, которое:

  • связано с текущей задачей бизнеса;
  • физически может происходить в подходящих коммуникациях;
  • понятно руководителю;
  • проверяется по цитате;
  • приводит к конкретной реакции;
  • встречается достаточно часто для анализа динамики.

Например:

Менеджер согласовал следующий шаг с конкретным сроком.

Дальше:

  1. Взять 20-30 реальных карточек.
  2. Разделить их на выполненные, невыполненные, спорные и неприменимые.
  3. Зафиксировать логику руководителя.
  4. Проверить AI на тех же примерах.
  5. Найти типовые расхождения.
  6. Уточнить критерий.
  7. Синхронизировать РОПа и команду.
  8. Только потом смотреть регулярный показатель.

Это медленнее, чем сразу включить автоматический скоринг всех звонков.

Но быстрее, чем месяцами спорить с отчётом, которому никто не доверяет.

Мой главный вывод

Когда я начинал автоматизировать оценку звонков, мне хотелось получить объективную цифру.

Пилоты показали, что объективность нельзя включить одной настройкой.

Сначала руководитель должен превратить своё ожидание в наблюдаемый критерий.

Потом определить применимость.

Показать эталонные и спорные карточки.

Проверить оценки AI.

Синхронизировать РОПа и сотрудников.

И только после этого использовать показатель в управлении.

Поэтому сегодня я смотрю на оценку звонков так:

Оценка звонков менеджеров - это не автоматический приговор сотруднику, а способ проверить выполнение конкретного стандарта на реальных коммуникациях.

AI здесь не главный судья.

Он масштабирует правило, которое компания смогла сформулировать, откалибровать и объяснить.

Если правило размыто, система масштабирует размытость.

Если стандарт понятен, проверяем и подтверждён реальными карточками, оценка начинает помогать управлению.

Подробнее о месте критериев в общем цикле я написал в статье что такое речевая аналитика для отдела продаж. Практический разбор автоматической проверки разговоров находится в материале анализ звонков менеджеров без ручной прослушки.

Что читать после настройки критерия

Критерий и калибровка - только методологическая основа.

Дальше есть две разные задачи:

Частые вопросы

Какие критерии использовать для оценки звонков менеджеров?

Критерии должны быть связаны с конкретной задачей продажи и описывать наблюдаемые действия: выявление задачи клиента, согласование следующего шага, раскрытие возражения, назначение встречи или предложение дополнительного продукта. Универсальный чек-лист нужно адаптировать под этап, сегмент и тип коммуникации.

Как сделать оценку звонков объективной?

Полностью устранить интерпретацию нельзя. Но оценку можно сделать управленчески легитимной: сформулировать проверяемый критерий, определить применимость, добавить цитаты, собрать эталонные карточки и провести калибровку между руководителем, AI, РОПом и сотрудниками.

Что такое калибровка оценки звонков?

Калибровка - это сравнение оценок одних и тех же коммуникаций. Участники разбирают расхождения, уточняют границы критерия и формируют единый стандарт, по которому затем оцениваются новые звонки.

Нужен ли общий балл звонка?

Общий балл может использоваться для навигации, но не должен заменять анализ конкретных критериев. Для управленческого действия важнее понимать, какое именно действие выполняется или не выполняется.

Что означает статус N/A?

N/A означает, что критерий неприменим к конкретной коммуникации. Например, нельзя оценивать отработку возражения, если клиент не высказал возражение. Такие случаи нельзя считать ни успехом, ни ошибкой.

Можно ли сразу оценивать все звонки с помощью AI?

Технически можно, но без предварительной калибровки система будет масштабировать неопределённость критерия. Надёжнее сначала проверить правило на небольшой выборке реальных карточек, разобрать расхождения и только потом запускать регулярную автоматическую оценку.

Серия

Речевая аналитика для отдела продаж

  1. 10 AI-анализ звонков: чем он отличается от расшифровки
  2. 30 Речевая аналитика для отдела продаж: что это, как работает и что показывает
  3. 40 Анализ звонков в Битрикс24: встроенные функции, приложения и внешние сервисы
  4. 50 Оценка звонков менеджеров: критерии, калибровка и единый стандарт
  5. 60 Контроль качества звонков менеджеров: как построить регулярный процесс
  6. 70 Контроль звонков без ручного прослушивания: что можно автоматизировать
  7. 80 Анализ возражений клиентов в звонках и переписках
  8. 90 Где теряются продажи: как искать потери в коммуникациях
  9. 100 Как искать успешные паттерны продаж в звонках и переписках
  10. 110 Сколько стоит речевая аналитика: модели тарифов и скрытые расходы
  11. 120 Речевая аналитика для amoCRM: звонки, переписки и история сделки