Меловая таблица с процентами 46, 20, 10, 13 и 12 и фразой «Цифры прочитали. Смысл додумали.»

7 нейросетей вместо РОПа: таблицу дали текстом, но выводы всё равно пришлось проверять

Денис Логинов
11 мин чтения
Если, в двух словах ...

После эксперимента со скриншотом я убрал распознавание изображения и дал 7 нейросетям новую таблицу текстом. Цифры стали читаться точнее, но модели начали достраивать воронку, конверсию, причины и управленческие решения, которых в исходных данных не было.

В прошлой проверке со скриншотом таблицы я дал 9 нейросетям большой табличный отчёт и попросил подготовить краткие выводы перед планёркой.

Тогда часть проблем начиналась ещё до анализа. Модели могли неправильно прочитать строку, процент, сотрудника или сам смысл столбца. Поэтому после того эксперимента оставался очевидный вопрос:

А что изменится, если вообще убрать распознавание картинки?

Я взял другой реальный отчёт, передал его семи нейросетям уже обычной текстовой таблицей и снова задал простой человеческий вопрос:

О чём мне говорить на совещании с менеджерами?

Это не повтор первого эксперимента на тех же данных. Таблица другая. Я поменял именно формат входа, чтобы убрать одну известную проблему и посмотреть, что останется после неё.

И одна вещь действительно изменилась. Цифры стали читаться заметно лучше. Но именно после этого стало гораздо проще увидеть другую границу: модель может правильно прочитать данные и всё равно продолжить их там, где сами данные уже закончились.

Что изменилось, когда я убрал картинку

В новом отчёте было 541 звонок.
По каждому менеджеру показывались пять критериев:

  • спросил, занимался ли человек волейболом;
  • спросил, сколько и где занимался;
  • спросил, сколько раз планирует заниматься;
  • спросил, подходит ли расписание;
  • спросил, когда готов посетить пробное занятие.

По отделу итоговые значения были 46%, 20%, 10%, 13% и 12%. Кроме этого, было количество звонков по каждому сотруднику.

Для публичной версии я убрал фамилии сотрудников и другие признаки, которые не нужны для понимания эксперимента. Названия AI-сервисов оставлены, потому что они являются участниками проверки.

Никакого дополнительного контекста нейросетям я не дал. Они не знали:

  • за какой период собраны данные;
  • как именно настроены критерии;
  • обязательны ли все пять вопросов в каждом звонке;
  • одинаково ли они применимы;
  • какое расписание было доступно менеджерам;
  • кто из клиентов обращался впервые, а кто повторно;
  • сколько людей реально записалось на пробное;
  • сколько пришло;
  • сколько купило.

То есть задача была ровно такой, какой она часто бывает у обычного пользователя: вот таблица, что мне с ней делать на совещании?

Передача текстом действительно помогла. Большинство моделей нормально увидели основные цифры, количество звонков и различия между сотрудниками. Некоторые правильно заметили и важную статистическую вещь: сотрудников с одним, двумя или тремя звонками нельзя всерьёз сравнивать с теми, у кого 95, 167 или 270 звонков.

ChatGPT, например, отдельно отметил, что 100% на одном звонке ничего не доказывает.
То есть изменение формата реально сработало. Нейросети больше не нужно было сначала разбирать большой скриншот. Цифры лежали перед ней уже в готовом виде.

Правильно прочитать цифры и правильно понять, что они означают, - две разные задачи.

Пять критериев превратились в воронку

DeepSeek начинает разбор с общей картины по воронке. Дальше берёт пять итоговых процентов:

46% -> 20% -> 10% -> 13% -> 12%

и пишет, что дальше конверсия резко падает.

ChatGPT называет ту же конструкцию воронкой квалификации лида.
Gemma 26B пишет, что перед ней классическая воронка продаж.
Gemini говорит о провале на этапе закрытия.
Алиса предлагает искать, где клиенты отваливаются.

На первый взгляд всё выглядит логично.
Первое значение большое, следующие меньше.
Значит, клиенты проходят несколько этапов и постепенно теряются.

Но сама таблица этого не показывает.

Из неё неизвестно:

  • должны ли эти вопросы идти именно в таком порядке;
  • должен ли второй вопрос обязательно следовать после первого;
  • является ли 20% подмножеством тех самых 46%;
  • должен ли каждый клиент пройти все пять критериев;
  • можно ли вообще складывать их в одну последовательную воронку.

В таблице есть пять отдельных показателей выполнения критериев. Последовательную воронку модели построили сами. А после этого начали вполне логично анализировать уже созданную ими конструкцию.

12% вопроса превратились в 12% конверсии

Ещё нагляднее это видно на последнем показателе.
В исходной таблице есть критерий:

Когда готовы посетить пробное?

По отделу он выполнен в 12% звонков.
Что отсюда можно утверждать? Только то, что используемый анализ зафиксировал этот вопрос примерно в 12% звонков.

Но DeepSeek пишет про низкую конверсию в пробное занятие - 12%.
Алиса называет 12% финальной конверсией в готовность посетить пробное занятие.
Gemma 26B уже говорит про 9% переходов на пробное у одного из менеджеров и предлагает считать конверсию из звонка в пробное.

Получается маленькая, но принципиальная подмена.
Было:

менеджер задал определённый вопрос.

Стало:

клиент сконвертировался в пробное занятие.

Чтобы посчитать настоящую конверсию, нужны совсем другие данные:

  • сколько клиентов согласилось;
  • сколько записалось;
  • сколько реально пришло;
  • что считается базой расчёта;
  • в каких звонках вообще было уместно предлагать пробное.

Ничего этого в таблице нет.

Выполнение критерия превратилось в качество продавца

Следующий переход происходит на уровне сотрудников.

У менеджера А действительно выше многие показатели среди сотрудников с большой выборкой: 63%, 29%, 12%, 26% и 20% при 167 звонках.
Это факт. Но дальше начинается интерпретация.

DeepSeek пишет, что этот сотрудник работает качественно.
ChatGPT предлагает превратить его подход в эталонный сценарий для остальных.
Gemini прямо называет сотрудника эталоном.
BitrixGPT пишет, что это эталон эффективности.

Но в таблице нет результатов продаж.
Мы не знаем:

  • сколько клиентов записалось;
  • сколько пришло;
  • сколько купило;
  • какая реальная конверсия;
  • какие лиды получал сотрудник;
  • одинаковые ли обращения обрабатывали менеджеры.

Поэтому из таблицы можно сказать:

Среди сотрудников с существенным количеством звонков менеджер А чаще выполняет ряд анализируемых критериев.

Но из неё нельзя автоматически получить:

Менеджер А лучше продаёт.

Это уже новая гипотеза, которую нужно проверять отдельно.

Потом появились причины, которых в данных не было

После оценки показателей многие модели начинают объяснять, почему они такие.

DeepSeek предлагает целый список причин: менеджеры не следуют скрипту, не умеют вести диалог, нет контроля качества, недостаточная мотивация, неправильно распределена нагрузка.

ChatGPT предполагает, что менеджер забывает, боится показаться навязчивым, не понимает, зачем нужен вопрос, или слишком быстро переходит к цене и расписанию.

Gemini предлагает выяснять, забывают ли сотрудники вопросы, спешат ли или получают ранний отказ.

BitrixGPT предположил, что большой объём звонков у менеджера Б может приводить к потоковости.

Алиса допускает, что клиенты не видят ценности предложения или не уверены в своём графике.

Все эти версии теоретически возможны. Какая-то из них даже может оказаться правильной.
Но таблица не позволяет выбрать ни одну.
Она показывает отклонение. Она не показывает его причину.

Есть большая разница между:

Здесь показатель заметно ниже. Нужно понять почему.

и:

Менеджер плохо закрывает, потому что боится возражений.

Первое - направление исследования.
Второе - уже диагноз человеку.

Самое опасное начинается, когда гипотеза превращается в решение

Если бы всё заканчивалось набором возможных объяснений, риск был бы относительно небольшим.
Но модели идут дальше.

DeepSeek предлагает обучить конкретного менеджера, перераспределить нагрузку, дать больше звонков сотруднику с высокими процентами, внедрить KPI, довести первый показатель до 70-80% и увеличить якобы конверсию в пробное до 20-25%.

Gemini предлагает сделать закрывающие вопросы обязательными, установить целевой показатель не менее 50% и проверить распределение лидов.

BitrixGPT предлагает внедрить обязательный вопрос, провести тренинг и установить KPI на процент перехода к обсуждению расписания и пробного.

Gemma 26B предлагает поднять якобы конверсию одного менеджера с 9% до 15% и считать звонок некачественным, если сотрудник не спросил про расписание.

Gemma e4B идёт ещё дальше: объявляет сотрудников с единичными звонками золотым стандартом, предлагает обязательные пять вопросов даже при сопротивлении клиента и рекомендует привязать часть бонусов к проценту выполнения критериев.

Здесь для меня начинается уже не просто вопрос качества ответа нейросети.

Представим, что руководитель принимает такой ответ как готовую аналитику. Тогда цепочка может выглядеть так:

12% в таблице -> низкая конверсия -> менеджеры плохо закрывают -> надо изменить скрипт -> сделать вопрос обязательным -> изменить KPI -> привязать к нему деньги сотрудника.

Каждый отдельный переход звучит достаточно правдоподобно. Но начало цепочки и её конец разделены несколькими предположениями, которые никто не проверял.

Что меняется, если немного знать контекст отчёта

Здесь важно уточнить мою позицию.
Я не РОП этого отдела и не собираюсь изображать человека, который знает этот бизнес лучше всех. Но я участвовал в настройке анализа, понимаю, что именно мы пытались измерять, и немного знаю контекст.

И мой разбор начался вообще не с вопроса, кто из менеджеров хуже работает.
Первое, что я заметил: в названии говорится о четырёх вопросах квалификации, а в таблице показано пять критериев.
Почему?

Первые четыре я воспринимаю как вопросы, которые помогают квалифицировать обращение: есть ли опыт, какой именно опыт, как часто человек хочет заниматься, подходит ли ему расписание.

А вопрос:

Когда готовы посетить пробное?

уже ближе к следующему этапу разговора.

Причём в текущей настройке все 5 показателей участвуют в общем среднем балле.
И до разговора о сотрудниках у меня возникает более базовый вопрос:

Правильно ли вообще считать общий показатель именно так?

Это принципиально другой порядок анализа.
Сначала проверить метрику.
Потом оценивать людей по этой метрике.

Один и тот же процент в разные периоды означает разное

Дальше есть информация, которой не было в таблице, переданной нейросетям.
Актуальное расписание на август-сентябрь появилось только с 15 августа.
Это значит, что вопрос:

Подойдёт ли вам расписание?

до появления актуального расписания и после него нельзя интерпретировать совершенно одинаково. То же самое касается перехода к конкретному пробному занятию.

А вот вопросы про прошлый опыт, сколько и где человек занимался и сколько раз хочет заниматься можно задавать независимо от появления нового расписания.
Получается, что даже внутри одной таблицы разные показатели имеют разные ограничения.

Нейросеть не могла знать дату появления расписания. И я не считаю это её ошибкой.
Ошибка начинается там, где модель не знает контекст, но всё равно делает вывод так, будто контекст ей известен.

Даже мой первый взгляд на динамику оказался слишком грубым

Когда я открыл полный отчёт, сначала было очень легко сказать: в прошлом сопоставимом периоде было около 30%, сейчас около 15%, значит стало в два раза хуже.
Но дальше я начал чистить сравнение.

Период с двумя звонками вообще не имеет смысла анализировать.
Июль нельзя одинаково сравнивать по всем критериям, потому что актуального расписания ещё не было.
Незаконченный кусок недели тоже может сильно исказить картинку.

Поэтому я переключился на законченные недели и сопоставимые интервалы.
И увидел уже другую картину.

Да, текущие показатели пока ниже прошлого сопоставимого периода.
Но внутри текущего периода есть рост: примерно с 12% до 18%. Причём тенденция вверх видна по сотрудникам достаточно равномерно.

Это уже совсем другой разговор на совещании.
Не:

Всё стало в два раза хуже.

А:

Мы пока ниже прежнего уровня, но команда уже движется вверх. Нужно понять, какой фокус сейчас усилить.

Таблица показывает, куда смотреть. Звонок помогает понять почему

После этого можно смотреть сотрудников.

В отчёте есть люди, у которых отдельные показатели равны 100%.
Но у одного человека один звонок, у другого два, у третьего три.
Поэтому сначала такие выборки нужно просто убрать из серьёзного сравнительного анализа.

А дальше становится интереснее.
Допустим, у одного сотрудника какой-то критерий встречается в несколько раз чаще, чем у другого.

Почему? Вот теперь это хороший вопрос.
Но ответ на него я не знаю из таблицы. Поэтому начинаю открывать звонки.

При просмотре конкретных коммуникаций появляются детали, которых агрегированная таблица не показывает.

В одном случае человек, возможно, уже общался раньше, поэтому часть информации могла быть известна.
В другом менеджер довольно быстро переходит к пробному.
В третьем расписания ещё нет, и закончить разговор конкретным предложением занятия сложно.
Где-то действительно видно, что часть вопросов не прозвучала.
Где-то причина неочевидна и её ещё нужно разбирать.

То есть один и тот же ноль может иметь несколько разных объяснений.

Таблица хорошо показывает, куда посмотреть. Но сама по себе намного хуже отвечает на вопрос, почему там получился именно такой результат.

И вот на вопросе “почему?” нейросети в этом эксперименте особенно часто начинали заполнять пробелы сами.

Что я бы реально вынес на совещание

После всех этих проверок мой план оказался значительно уже большинства рекомендаций моделей.
Я бы сейчас не стал:

  • менять систему мотивации;
  • вводить пять новых KPI;
  • перераспределять лиды;
  • объявлять лучшего продавца;
  • заставлять всех механически задавать пять вопросов в каждом разговоре.

Я бы начал с одного-двух критериев. В частности:

  • всегда уточнять текущий опыт;
  • спрашивать, сколько и где человек занимался.

Эти вопросы можно использовать независимо от актуального расписания.
Дальше я бы смотрел недельную динамику. Если конкретный сотрудник заметно отличается от остальных - открывал бы его звонки и пытался понять причину.

И отдельно принял бы решение по самой настройке отчёта:

Должен ли вопрос о готовности посетить пробное участвовать в общем балле наравне с четырьмя вопросами квалификации?

И это тоже не правильный ответ РОПа.
Это мой текущий управленческий вывод на основании того контекста, который у меня есть.
Другой человек, глубже знающий продажи этого бизнеса, может скорректировать его после просмотра тех же звонков.

Что в итоге изменил текстовый формат

После первого эксперимента было легко сделать слишком простой вывод: нейросеть плохо анализирует таблицу, потому что плохо видит картинку.

Новый тест показал, что это только один слой проблемы.
Передача структурированного текста действительно помогла. Модели в основном стали лучше получать исходные цифры.

Но после этого появилась более сложная граница.
Нейросеть может правильно прочитать 46%, 20%, 10%, 13% и 12%. А затем сама построить воронку. Потом назвать 12% конверсией. Потом решить, что менеджеры плохо закрывают. И закончить предложением поменять KPI, скрипт или мотивацию.

Самое неприятное в таком ответе - он не выглядит сломанным.
Цифры правильные. Количество звонков правильное. Текст структурирован. Причинно-следственная цепочка звучит разумно.

Именно поэтому руководителю намного сложнее заметить момент, где закончились данные и начались предположения модели.
В этом пользовательском сценарии я бы не делал вывод, что нейросети не умеют анализировать таблицы или не способны помогать руководителю.

Наоборот, часть работы они сделали полезно: быстро увидели различия, заметили слишком маленькие выборки, подсветили показатели, куда стоит посмотреть.

Но между “увидеть сигнал” и “принять управленческое решение” остаётся большой кусок работы.

Нужно понять смысл метрики.
Проверить период.
Проверить применимость критерия.
Посмотреть знаменатель.
Открыть реальные звонки.
Проверить гипотезу.
И только потом решать, что менять.

Поэтому мой главный вывод после второго эксперимента такой:

Проблема оказалась не только в том, может ли нейросеть правильно прочитать таблицу. Гораздо важнее, понимает ли она, где таблица заканчивается.

Потому что чем точнее прочитаны цифры, тем убедительнее может выглядеть вывод, которого в этих цифрах никогда не было.

Серия

AI: Х...О?

  1. 10 Я устал объяснять, почему AI - не магическая кнопка. Поэтому буду проверять это публично
  2. 20 Правда ли, что 95% AI-проектов проваливаются
  3. 30 Я изучил 150 видео про AI и понял, как буду проверять нейросети на бизнес-задачах
  4. 40 8 нейросетей вместо верстальщика: только две дали готовый результат
  5. 50 Может ли AI готовить рекомендации к планёрке: проверил 9 моделей
  6. 60 7 нейросетей вместо РОПа: таблицу дали текстом, но выводы всё равно пришлось проверять
  7. 7 Скоро выйдет, приходите завтра