Калибровка звонков начинается не с настройки ИИ. Сначала руководитель должен на реальных разговорах определить, что для компании считается выполнением критерия, где проходит граница 0/1 и к каким звонкам правило применимо.

В первой статье серии исходный чек-лист таксопарка превратился в 26 критериев 0/1. Во второй я прогнал первую выборку звонков и посмотрел, где появляется сигнал для дальнейшей работы.

Один из критериев оказался особенно интересным:

“Менеджер подвёл итог достигнутых договорённостей”.

В первом отчёте по нему стоял 0. Самая простая реакция на такую цифру - решить, что менеджеры не подводят итоги и это нужно исправлять. Но сначала нужно понять, что именно исправлять. Что конкретно в этом таксопарке должно считаться подведением итогов? Пока на этот вопрос нет ответа на уровне реальных разговоров, ноль остаётся сигналом, а не готовым управленческим выводом.

Здесь начинается калибровка.

Что я называю калибровкой звонков

Под калибровкой звонков в этом проекте я понимаю проверку одного выбранного критерия на наборе реальных разговоров: руководитель определяет, что для компании является 1 и 0, после чего то же правило проверяется на новых звонках.

Не всего чек-листа сразу и не общего балла менеджера. Руководитель смотрит конкретные звонки и определяет:

  • где точно 1;
  • где точно 0;
  • где случай спорный;
  • к каким разговорам критерий применим;
  • какая реплика подтверждает оценку.

После этого то же правило можно передать системе и проверить, одинаково ли оно применяется. Если оценки расходятся, я сначала проверяю не сотрудника и не ИИ, а сам критерий. Общую методику калибровки критериев оценки звонков я разбирал отдельно. Здесь задача уже: пройти этот путь на одном критерии из реального проекта таксопарка.

Почему одного нуля недостаточно

В первом отчёте система не просто показала 0. Она объяснила причину: в разговоре не было найдено явного действия менеджера, которое суммирует или подтверждает ранее согласованные условия, шаги или решения.

Это полезнее общей оценки, но ещё не даёт готового стандарта. Допустим, звонок заканчивается фразой:

“Хорошо, приезжайте”.

Следующий шаг вроде бы есть. Является ли это подведением итогов? В исходном разборе я приводил более явный пример:

“Давайте я тогда подведу итоги нашего разговора. Мы проговорили с вами про это, про это, договорились о том, всё верно?”

Такое действие уже заметно ближе к суммаризации договорённостей. Между этими двумя примерами остаётся серая зона, которую и нужно разобрать на реальных звонках.

Формулировка кажется понятной, пока не открываешь звонки

Критерий:

“Менеджер подвёл итог достигнутых договорённостей”.

на первый взгляд звучит однозначно. Проблемы начинаются, когда нужно одинаково оценить десять разных разговоров. Что именно должен повторить менеджер?

  • следующий шаг;
  • дату и время;
  • основные условия;
  • документы;
  • место встречи;
  • все существенные договорённости разговора?

Достаточно ли сказать:

“Ждём вас завтра”.

Нужно ли получить подтверждение клиента? Считается ли итогом:

“Хорошо, тогда до завтра”?

Абстрактное обсуждение быстро упирается в разные трактовки. Реальные звонки показывают, где формулировка перестаёт работать однозначно.

Для калибровки нужны разные звонки

Я бы начал не с большого массива, а с небольшой подборки четырёх типов разговоров:

  1. очевидная единица;
  2. очевидный ноль;
  3. спорный случай;
  4. разговор, к которому критерий неприменим.

Особенно полезен третий тип. Например:

“Хорошо, тогда ждём вас завтра”.

Один человек поставит 1: следующий шаг зафиксирован, итог есть.
Другой поставит 0: менеджер не суммировал достигнутые договорённости.

Такое расхождение показывает, что правило ещё недостаточно точное.

Сначала стандарт формулирует руководитель

Я не хочу отдавать этот этап искусственному интеллекту. ИИ не должен самостоятельно решать, что компания считает правильным завершением разговора. Сначала это определяет владелец управленческого требования.

Для каждого калибровочного звонка нужно зафиксировать:

  • оценку 1 или 0;
  • цитату;
  • причину оценки;
  • применимость критерия;
  • чего конкретно не хватило при нуле.

После этого появляется эталон, который можно передать системе. ИИ масштабирует сформулированное правило, а не создаёт его вместо руководителя.

Первая версия правила не обязана быть идеальной

Начать можно с рабочей формулировки:

Менеджер перед завершением разговора явно суммирует ранее согласованные условия, шаги или решения.

Ниже - условные примеры для проверки этого правила, а не цитаты из клиентской выборки.

Звонок 1

“Мы договорились, что завтра в 11 вы подъезжаете в парк с документами. Всё верно?”

Похоже на 1: есть договорённость, конкретика и подтверждение.

Звонок 2

“Хорошо, приезжайте”.

Здесь уже нужно решить, достаточно ли обозначенного действия или критерий требует именно суммаризации.

Звонок 3

“Тогда на связи”.

Вероятно, конкретной зафиксированной договорённости здесь недостаточно.

Звонок 4

Короткое техническое уточнение на 30-40 секунд. Возможно, критерий к такому разговору вообще неприменим. Это не готовая финальная разметка. Это материал, на котором руководитель должен провести границу и объяснить её так, чтобы правило можно было повторить.

При 0/1 нельзя прятать сомнения в промежуточный балл

В этом проекте используется бинарная шкала. Для применимого разговора:

  • 1 - критерий выполнен;
  • 0 - критерий не выполнен.

Я не хочу добавлять 0,5 только потому, что появился неудобный пример. Спорный звонок должен помогать уточнять правило. Но до самой оценки остаётся ещё один вопрос:

Этот критерий вообще применим к разговору?

В первой выборке были очень короткие звонки, в том числе около 35 секунд. Не в каждом таком контакте менеджер должен пройти полноценный сценарий продажи и завершить его суммаризацией договорённостей.

Поэтому определить нужно не только границу между 0 и 1, но и область применимости.

Длительность может быть фильтром, но не правилом сама по себе

При обсуждении первого отчёта возник вариант оценивать некоторые критерии только после определённой длительности разговора. Например, после трёх минут.

Три минуты здесь были примером возможной настройки, а не универсальным стандартом.
Пятиминутный разговор может остаться техническим, а содержательная договорённость иногда появляется быстрее.

Длительность может быть первым фильтром, но окончательное условие должно следовать из бизнес-сценария.

Расхождение оценок - материал для калибровки

Представим, что руководитель разметил десять звонков, а затем система оценила те же разговоры. В семи случаях оценки совпали, в трёх - нет. Именно эти три звонка стоит разобрать в первую очередь. Причины могут отличаться.

Формулировка слишком широкая

Система считает подведением итогов любое обозначение следующего шага, а руководитель ждёт повторения нескольких договорённостей. Значит, правило нужно уточнить.

Руководитель сам применяет разные стандарты

В одном звонке фраза:

“Ждём вас завтра”.

получает 1, а в другом почти такая же реплика - 0. Здесь калибровка выявляет проблему в самом управленческом стандарте.

Не определена применимость

Система оценивает короткие технические контакты, которые руководитель считает неподходящими. Значит, в критерии не хватает условия применения.

Не хватает бизнес-контекста

В разговоре появляется внутренний термин, действие или условие, понятное сотрудникам компании, но не описанное в критерии. Такой контекст нужно зафиксировать явно, а не ожидать, что модель восстановит внутреннюю логику бизнеса самостоятельно.

Спорные звонки нельзя выбрасывать

Можно собрать пять очевидных единиц и пять очевидных нулей. На таком наборе легко проверить крайние случаи. Настоящие проблемы обычно находятся между ними.

Именно спорные звонки показывают:

  • где размыта формулировка;
  • где люди по-разному понимают одно требование;
  • где смешались разные сценарии;
  • где отсутствует контекст;
  • где граница 0/1 существует только в голове руководителя.

Поэтому для калибровки пограничный пример часто полезнее очевидного.

То же самое относится к субъективным критериям

В исходном чек-листе были формулировки вроде:

  • “ответил аргументированно”;
  • “не перегрузил клиента”;
  • “адаптировал стиль”.

С такими критериями особенно легко получить видимость точности. Например:

“Менеджер ответил аргументированно”.

Что считается аргументом?
Факт?
Объяснение выгоды?
Связь ответа с ситуацией клиента?
Несколько причин?
Ссылка на конкретное условие?

Если руководитель не может показать на реальных звонках, почему один ответ считается аргументированным, а другой нет, автоматизировать пока нечего. Сначала нужно сделать явным сам стандарт.

Минимальная карточка калибровки одного звонка

Чтобы разбор не оставался на уровне впечатлений, по каждому выбранному звонку я бы фиксировал одинаковый набор данных:

  • применим ли критерий;
  • оценка 0 или 1;
  • конкретная реплика, на которой основана оценка;
  • почему реплика соответствует или не соответствует критерию;
  • чего не хватило для 1;
  • есть ли пограничный случай;
  • нужно ли после этого примера уточнить формулировку.

Например:

Критерий: менеджер подвёл итог достигнутых договорённостей.

Применимость: да.

Оценка: 0.

Реплика: “Хорошо, приезжайте”.

Причина: следующий шаг обозначен, но ранее согласованные условия не суммированы и не подтверждены с клиентом.

Это рабочая разметка, а не окончательная истина. Если руководитель посмотрит тот же разговор и решит, что для его процесса такой фразы достаточно, нужно изменить критерий так, чтобы это решение стало явным и воспроизводимым.

После нескольких таких карточек появляется материал для настройки конкретной границы между 0 и 1.

Что должно остаться после калибровки

Результат калибровки - не только новый текст критерия. В рабочем виде я хочу получить:

  • формулировку;
  • область применимости;
  • признаки 1;
  • признаки 0;
  • реальные положительные примеры;
  • реальные отрицательные примеры;
  • спорные случаи;
  • объяснение решений по спорным случаям.

После этого критерий можно снова применить к новым разговорам. Если расхождения повторяются в одном и том же месте, правило уточняется ещё раз. Так постепенно формируется рабочий стандарт.

Когда имеет смысл смотреть динамику

Первый отчёт по 26 критериям был разведкой. Следующий этап нужен для проверки самого инструмента измерения. Поэтому я бы пока не сравнивал сотрудников и периоды по выбранному критерию.

Сначала нужно добиться устойчивого понимания того, что считается 1 и 0. Иначе изменение показателя может означать две разные вещи:

  • сотрудники начали работать иначе;
  • изменился способ оценки.

Пока эти причины нельзя разделить, цифру рано использовать для выводов о команде.

Калибровка - прежде всего управленческая работа

Чем дальше я работаю с речевой аналитикой, тем меньше воспринимаю калибровку как техническую настройку ИИ.

Вопрос не только в том, как заставить модель оценивать правильно.
Сначала компания должна определить, что именно она считает правильным.

Когда на этот вопрос появляется проверяемый ответ, ИИ может применять одно правило к большому массиву разговоров.
Если правило размыто, автоматизация масштабирует размытость.
Если правило определено, можно масштабировать измерение.

Три статьи - три вопроса

В первой части этого проекта вопрос был:

Что измерять?

Исходный чек-лист я перевёл в первую карту из 26 критериев 0/1.

Во второй:

Куда смотреть?

Первый массовый анализ помог перейти от сводного отчёта к конкретному кластеру, критерию и звонку.

Третья часть отвечает на следующий вопрос:

Что именно должно считаться 1 и 0 по выбранному критерию?

Весь путь складывается в последовательность:

сначала достаточно широко измерить и найти сигнал;

затем сузить внимание до одного критерия;

потом на реальных звонках определить его границы.

Только после этого выбранный показатель можно превращать в регулярный управленческий стандарт.
Так речевая аналитика переходит от отчёта к инструменту управления.

FAQ

Что такое калибровка звонков?

В этом проекте это проверка одного выбранного критерия на наборе реальных разговоров. Руководитель определяет, что для компании считается выполнением и невыполнением, после чего то же правило можно проверить на новых звонках.

Как определить границу между 0 и 1?

Нужно разобрать реальные звонки и по каждому зафиксировать оценку, цитату и причину решения. Спорные случаи используются для уточнения формулировки критерия и границы между выполнением и невыполнением.

Какие звонки брать для калибровки?

Нужны не только очевидные хорошие и плохие примеры. Полезно включать пограничные случаи и разговоры, к которым критерий может быть неприменим.

Что делать со спорным звонком?

Не прятать его в промежуточный балл. Нужно определить причину расхождения и при необходимости уточнить формулировку критерия, область применимости или бизнес-контекст.

Что делать, если руководитель и ИИ оценили звонок по-разному?

Сначала проверить сам критерий: достаточно ли он точен, одинаково ли применяется и передан ли системе необходимый контекст. Расхождение само по себе ещё не доказывает ошибку одной из сторон.

Можно ли использовать длительность звонка как условие оценки?

Можно использовать длительность как один из технических фильтров, но конкретный порог нельзя считать универсальным. Его нужно определять по реальным разговорам и бизнес-процессу компании.

Когда критерий можно использовать для регулярного контроля?

После того как определены его границы 0/1, область применимости и логика спорных случаев, а повторная проверка на новых разговорах не показывает системных расхождений по одной и той же причине.

Серия

Речевая аналитика для таксопарков

  1. 10 Чек-лист оценки звонка для таксопарка: как перевести критерии клиента в 0/1
  2. 20 Анализ звонков таксопарка: почему 0 ещё не означает проблему менеджера
  3. 30 Калибровка звонков в таксопарке: как определить границы критерия 0/1
  4. 4 Скоро выйдет, приходите завтра