Как превратить ожидания руководителя в проверяемую рубрику AI-оценки звонков: три критерия, шкала 0, 0.5 и 1, цитаты, N/A и ручная калибровка.
После анализа возражений мы уже хорошо понимали содержание звонков.
Но чем глубже пытались объяснить весь разговор, тем сложнее было одинаково передать вывод:
- руководителю;
- менеджеру;
- разработчику промта;
- проверяющему;
- AI-модели.
Нам понадобилась более строгая система.
Не вопрос:
Насколько хорошо менеджер провёл звонок?
А несколько отдельных вопросов, на которые можно ответить по наблюдаемым действиям.
Так появилась рубрика из трёх критериев:
- Заход с правом на разговор.
- Вскрытие причины для диагностики.
- Фиксация следующего шага.
Полезной её сделали не названия, а правила:
- что именно проверяется;
- что не относится к критерию;
- когда ставится 0, 0.5 или 1;
- на какую цитату опирается вывод;
- когда оценка неприменима.
Критерий 1. Заход с правом на разговор
Первый вопрос:
Понимает ли клиент, почему этот разговор имеет смысл?
Слабое вступление:
- “Как у вас дела?”;
- “Давно не обращались”;
- “Вопросы по 1С есть?”;
- “Хотим предложить бесплатный аудит”.
Менеджер начал звонок, но клиент не понимает:
- почему обращаются именно к нему;
- что компания знает о его ситуации;
- какая возможная польза есть в разговоре.
Более сильная конструкция опирается на:
- историю взаимодействия;
- конкретный повод;
- гипотезу риска или пользы.
Например:
“Мы раньше настраивали вам обмен между системами. После обновлений иногда появляются ручные операции или ошибки. Хочу уточнить, как сейчас всё работает и есть ли смысл быстро это проверить”.
Шкала выглядела так:
- 0 - понятного основания нет;
- 0.5 - история упомянута, но повод размытый;
- 1 - есть конкретный контекст и релевантная причина разговора.
Критерий оценивал не красоту вступления, а легитимность контакта.
Критерий 2. Вскрытие причины для диагностики
Второй вопрос:
Выяснил ли менеджер реальную причину для следующего шага?
Слабая версия:
“Всё работает?”
Клиент отвечает:
“Да”.
Разговор заканчивается.
Другой слабый вариант:
“Предлагаем бесплатный аудит. Записать вас?”
Следующий шаг предлагается раньше, чем появилась причина для него.
Более рабочий разговор помогает понять:
- что изменилось после прошлых работ;
- где остались ручные операции;
- какие ошибки повторяются;
- кто отвечает за процесс;
- есть ли смысл подключать специалиста.
Шкала:
- 0 - задача, риск или основание не выявлены;
- 0.5 - вопросы задавались, но причина осталась общей;
- 1 - выявлена конкретная ситуация, к которой логично привязать диагностику.
Здесь возникло важное правило:
Критерии нельзя смешивать.
Если менеджер выявил задачу, но плохо завершил звонок, это не должно снижать оценку второго критерия.
Ошибка завершения относится к третьему блоку.
Иначе один слабый фрагмент начинает снижать весь звонок, а отдельные оценки превращаются в общее впечатление.
Критерий 3. Фиксация следующего шага
Третий вопрос:
Закончился ли разговор конкретной договорённостью?
Нулевой результат:
- “Если что - пишите”;
- “Будем на связи”;
- “Я передам информацию”;
- “Посмотрите и дайте знать”.
Продолжение возможно, но не определено:
- кто действует;
- что делает;
- когда;
- в каком формате.
Оценка 0.5 применялась, когда движение было, но оставалось размытым:
“Я перезвоню после обеда”.
Оценка 1 требовала конкретного действия:
- назначена диагностика;
- согласованы дата и время;
- определён формат;
- понятны участники.
Например:
“Завтра в 11:00 подключаем специалиста на короткий звонок. Я сейчас отправлю ссылку”.
Шкала:
- 0 - продолжение не определено;
- 0.5 - следующий шаг обсуждён, но зафиксирован не полностью;
- 1 - есть конкретная договорённость.
Почему шкала была 0, 0.5 и 1
Можно было использовать десять баллов или проценты.
Но чем больше градаций, тем сложнее объяснить разницу между соседними значениями.
Наша шкала разделяла три состояния:
- действие отсутствует;
- выполнено частично;
- выполнено полностью.
0 не означает, что менеджер плохой.
1 не означает, что звонок идеальный.
Балл относится только к одному критерию.
Менеджер мог получить:
- 0 за заход;
- 1 за выявление задачи;
- 1 за следующий шаг.
Это означает, что разговор начался слабо, но затем сотрудник разобрался в ситуации и договорился о продолжении.
Такой разбор полезнее общей оценки “хороший звонок”.
Почему мы убрали эмоциональные ярлыки
В первых версиях встречались формулировки:
- “менеджер сдался”;
- “провалил квалификацию”;
- “не дожал”;
- “потратил звонок впустую”.
Проблема не только в резкости.
Такие фразы объединяют:
- факт;
- интерпретацию;
- оценку человека;
- предполагаемое намерение.
Вместо “менеджер сдался” нужна наблюдаемая формулировка:
“После ответа клиента менеджер завершил разговор и не предложил конкретный следующий шаг”.
Это можно проверить по транскрибации.
Формат стал таким:
- Цитата.
- Сопоставление с правилом.
- Оценка.
- Рекомендация, если критерий выполнен не полностью.
Почему цитата стала обязательной
Вывод:
“Клиент не видит ценности диагностики”
может звучать убедительно.
Но нужно понимать, на чём он основан.
Клиент прямо сказал, что аудит не нужен?
Попросил прислать информацию?
Или менеджер вообще не объяснил предложение?
Обязательная цитата позволяет руководителю увидеть:
- исходный фрагмент;
- интерпретацию;
- правило;
- оценку.
Если вывод спорный, не нужно переслушивать все звонки подряд.
Можно сразу проверить основание.
Почему понадобилось правило N/A
Даже хороший критерий нельзя применять к каждому разговору.
Что ставить, если:
- звонок прервался;
- разговор был техническим;
- клиент ошибся номером;
- транскрипция неполная;
- клиент сам инициировал встречу;
- нужная ситуация не возникла?
Если всегда выбирать 0 или 1, система начнёт наказывать за отсутствие действия там, где оно не должно было происходить.
Поэтому появился статус:
N/A - критерий неприменим.
Это не ноль и не нейтральная оценка.
Это признание, что по этому разговору нельзя честно оценить выполнение условия.
Почему одного текста правила было недостаточно
Фраза “есть причина для диагностики” может пониматься по-разному.
Для одного человека достаточно упоминания технической проблемы.
Другой требует выяснить последствия.
Третий считает обязательной проверку полномочий собеседника.
Поэтому понадобились примеры:
- полное выполнение;
- частичное выполнение;
- отсутствие действия;
- неприменимость;
- пограничные ситуации.
Не просто:
Здесь 1 балл.
А:
Здесь 1 балл, потому что менеджер выявил конкретную задачу, уточнил последствия и связал их с диагностикой.
Примеры превращают абстрактное правило в рабочий стандарт.
Как проходила калибровка
Несколько специалистов:
- создавали версии инструкции;
- проверяли их на реальных транскрибациях;
- сравнивали результаты;
- получали обратную связь;
- дорабатывали определения.
Так мы разделили два уровня работы.
Архитектура рубрики
- что проверяем;
- как устроена шкала;
- когда критерий применим;
- какие доказательства нужны.
Калибровка применения
- насколько строго ставится балл;
- одинаково ли трактуются пограничные случаи;
- не домысливает ли модель;
- не смешивает ли критерии;
- правильно ли определяет автора действия.
Иногда не нужно переписывать весь промт.
Нужно разобрать несколько расхождений и синхронизировать применение уже существующего правила.
Главный урок этапа
До проекта я мог бы сказать:
Для хорошего анализа звонков нужен хороший промт.
После нескольких итераций формулировка стала другой:
Для хорошего анализа звонков люди должны договориться о правилах оценки, проверить их на реальных примерах и только затем упаковать в промт.
Промт важен.
Но он не заменяет:
- владельца критерия;
- определение результата;
- правила применимости;
- эталонные примеры;
- ручную проверку;
- разбор спорных случаев.
Доверие к AI-показателю строится на цепочке:
критерий -> цитата -> оценка -> калибровка -> обратная связь.
К этому моменту мы получили достаточно устойчивую систему оценки.
Но затем появился следующий вопрос:
Что именно команда должна изменить после получения такого отчёта?
Точность выросла. Управленческий фокус по-прежнему оставался широким.