Проверил, могут ли 9 AI-моделей по одной таблице подготовить рекомендации руководителю. Все начали достраивать бизнес-контекст, которого не было в данных.
В нашем продукте уже есть таблица с процентами, сортировкой и светофором. Красные ячейки показывают потенциальные узкие места. Зелёные - сильные сигналы. Руководитель может быстро увидеть отклонение, открыть нужные звонки и разобраться, что за ним стоит.
На встрече возник логичный продуктовый вопрос:
Может ли система не только показывать показатели, но и сразу готовить базовые рекомендации, чтобы руководитель пришёл на совещание уже с предварительными выводами и гипотезами?
Идея выглядит естественно. Если продукт уже анализирует разговоры, считает критерии и собирает сводную таблицу, почему бы не добавить ещё один слой:
- на кого обратить внимание;
- что обсудить на планёрке;
- где возможна системная проблема;
- какие действия стоит рассмотреть.
Чтобы проверить эту гипотезу, я взял одну реальную таблицу и один обычный запрос руководителя. Затем передал одинаковые данные девяти доступным AI-моделям.
Результат оказался важнее простого сравнения нейросетей.
Две модели фактически не поняли таблицу. Пять ответов я отнёс к критическому уровню управленческого риска. Ни один результат нельзя было без проверки использовать для решений по сотрудникам.
Но главный вывод не в том, какая модель лучше распознала цифры.
Главный вопрос другой:
Зачем вообще просить AI оценивать людей по таблице, если светофор, проценты и сортировки уже показывают потенциальные узкие места, а бизнес-контекста у модели нет?
Откуда взялся эксперимент
На встрече по речевой аналитике обсуждалось развитие продукта.
Руководитель видит большую таблицу: сотрудники, проценты, красные и зелёные ячейки, десятки критериев. Перед совещанием ему всё равно нужно понять, что именно вынести на обсуждение.
Возник вопрос:
Может ли продукт сразу подготовить краткие рекомендации по каждому сотруднику, чтобы руководитель пришёл на планёрку уже с базовой аналитикой?
Формулировка запроса была обычной, без сложной инструкции:
По этой таблице сделай какие-то краткие тезисные выводы и выкладки по каждому сотруднику, чтобы я мог быстро посмотреть их перед планёркой.
Это не был специально подготовленный тест на галлюцинации. Такой запрос вполне может появиться внутри продукта в виде кнопки “Подготовить рекомендации к планёрке”.
Я взял его почти дословно. Каждая модель получила:
- один и тот же скриншот;
- один и тот же запрос;
- новый чистый чат;
- никаких дополнительных пояснений.
В таблице было 15 сотрудников, 17 критериев разговора и 1 678 звонков.
Для публикации фамилии сотрудников, название компании, продуктовые названия и другие идентификаторы удалены. В примерах оставлены только имена.
Это результат одного изображения, одного запроса и конкретных запусков. Он не является универсальным рейтингом моделей.
Что таблица уже делает без генеративного AI
В ней уже есть:
- проценты;
- светофор;
- сортировка;
- общий объём звонков;
- сравнение сотрудников между собой.
Если задача руководителя - быстро увидеть потенциальное отклонение, таблица уже её решает.
Красная ячейка говорит:
Здесь есть сигнал, который стоит проверить.
Зелёная ячейка говорит:
Здесь показатель выше выбранного ориентира.
Когда нейросеть просто пересказывает цвет словами, нового факта не появляется.
Она может добавить ценность только на следующем шаге: помочь понять, почему показатель получился таким и что с этим делать.
Но именно для этого в исходном скриншоте не хватало главного.
Модели не знали:
- цель отдела на текущий период;
- задачу конкретной планёрки;
- приоритет руководителя;
- роли сотрудников;
- типы звонков;
- применимость каждого критерия;
- число реальных случаев под каждой процентной ячейкой;
- качество автоматической разметки;
- историю изменений;
- содержание исходных разговоров;
- результаты продаж;
- выручку;
- конверсию.
Последний столбец показывал общий объём звонков сотрудника. Но он не раскрывал знаменатель каждой отдельной оценки.
Например, у сотрудника могло быть 276 звонков, а возражение “дорого” возникнуть только в пяти. Тогда показатель 40% означает два случая из пяти, а не примерно 110 звонков из 276.
На скриншоте этого не видно.
Тем не менее модели начали оценивать качество, эффективность, дисциплину, мотивацию и потенциал сотрудников.
Когда ошибка заметна сразу
Часть ответов была настолько далека от исходника, что их легко было отбросить.
DeepSeek превратил таблицу отдела в один звонок
Модель начала так:
Исходная таблица - это «каша» из ключевых слов, которые, судя по всему, описывают этапы работы менеджера.
Затем решила, что перед ней последовательность действий одного сотрудника, а не сводка по 15 людям.
Из 1 678 звонков она увидела один и написала:
Сделал 1 звонок - критически мало для активных продаж.
После этого появилась норма, которой в исходных данных не было:
Норма: 20+.
А затем психологическая причина:
Проверить занятость или страх обзвона.
В конце модель предложила изменить скрипт и внедрить вопрос:
Кто подписывает бюджет?
В таблице не было расшифровки одного разговора, нормы звонков, признаков страха или информации о процессе согласования бюджета.
DeepSeek не выполнил исходную задачу, но выдал готовый чек-лист для руководителя.
Gemma e4B признала, что не понимает таблицу, и построила другую
Модель прямо написала:
Я не знаю точного значения каждой колонки.
Это был правильный сигнал остановиться и запросить более качественный источник или пояснения.
Но дальше появились несуществующие сотрудники, выдуманные столбцы и роли:
Запускщик, финализатор, генератор лидов.
Вместо анализа исходной таблицы модель создала новую воронку и новую организационную логику.
GigaChat придумал KPI и перевернул сотрудников местами
Один из критериев модель прочитала как:
Попытки выкупа.
Такого показателя в таблице не было.
После этого появился вывод:
Глеб - лучший сотрудник.
А сотрудник с одними из наиболее высоких значений получил противоположную оценку:
Никита - на особом контроле, почти всё ниже среднего.
На неверно прочитанных данных модель не просто ошиблась в описании. Она предложила использовать одного человека как пример, а другого усиленно контролировать.
BitrixGPT ошибся в данных, но перешёл к кадровым выводам
Модель перепутала имена, название компании, количество звонков и несколько ячеек. У одного сотрудника 276 звонков превратились в 168.
При этом в ответе появились формулировки:
Много шума, мало результата.
И для сотрудника с выборкой из трёх звонков:
Пересмотр позиции.
В таблице не было результата продаж. По трём звонкам нельзя было оценить даже устойчивость показателей, не говоря уже о должности человека.
Когда ошибка выглядит как нормальная управленческая аналитика
Гораздо опаснее оказались ответы, которые в основном правильно читали таблицу.
Они использовали реальные цифры, аккуратно раскладывали сотрудников по пунктам и звучали так, будто их уже можно открыть на планёрке.
Gemini назначил эталон и увидел характер сотрудника
В ответе появились формулировки:
Эталон по качеству разговора.
Максимальный напор.
Масштабировать интенсивность.
Таблица показывала проценты отдельных критериев. Она не показывала качество разговора как единый показатель, напор человека, его загрузку или норму активности.
Яндекс Алиса придумала проблему с CRM
Нулевые значения по отдельным критериям были превращены в вывод про:
Дисциплина ведения карточки клиента.
Информации о CRM-карточке в таблице не было.
Для сотрудников с одним и тремя звонками модель предложила:
Срочно отработать базовые навыки.
Маленькая и потенциально случайная выборка стала основанием для обучения.
Gemma 24B превратила проценты в рейтинг людей
Ответ сразу разделил команду на:
Лидеры, рабочие лошадки, зона риска, критическая зона.
Про Никиту было сказано:
Топ-перформер.
Максимально эффективен.
Про Данила:
Количество вместо качества.
Работает много, но неэффективно.
А для сотрудников с одним и тремя звонками среди возможных причин появились:
Здесь нужно понять причину: это новички, болезни или саботаж.
В таблице не было показателя эффективности, коммерческого результата или причин малого объёма. Но ответ выглядел как готовая карта команды.
ChatGPT увидел рост конверсии там, где конверсии не было
Модель неплохо прочитала изображение и корректно указала, что по одному и трём звонкам делать выводы рано.
Но дальше появился вывод:
Один из самых качественных сотрудников по соблюдению скрипта.
А в общем резюме:
Именно здесь сосредоточен наибольший потенциал для роста конверсии без увеличения количества звонков.
В таблице не было конверсии и связи между критериями разговора и продажами.
Qwen построил зависимость и предложил перераспределить работу
Модель почти без ошибок прочитала цифры и сформулировала:
Обратная зависимость «объём-качество».
Затем назначила людей для разбора:
как эталон
как антипример
И предложила:
Обсудить перераспределение объёма в пользу качественных менеджеров.
Для такого решения нужны данные о ролях, лидах, загрузке, типах звонков, результатах продаж и качестве конкретных разговоров. Ничего этого в скриншоте не было.
Почему ответы получились разными и при этом убедительными
Представим, что ту же таблицу показали группе людей и спросили:
Кто здесь лучший сотрудник и что нужно менять в отделе?
Один человек выберет лидера по количеству звонков. Другой - по следующему шагу. Третий - по приветствию. Четвёртый решит, что важнее всего выход на ЛПР. Пятый возьмёт среднее по всем столбцам.
Каждый сможет объяснить свой выбор. И каждый будет по-своему логичен, потому что сначала сам решит, что считать главным.
Именно это произошло с моделями.
Gemma выбрала общую высоту процентов и получила топ-перформеров. Qwen сопоставил объём и проценты и получил обратную зависимость. ChatGPT собрал низкие показатели квалификации и увидел резерв роста конверсии. Алиса решила, что нули связаны с дисциплиной фиксации данных. DeepSeek восстановил из заголовков один вымышленный разговор.
Ответы разные не потому, что одна модель знает правду, а остальные ошибаются в одном и том же месте.
Они разные, потому что правды, которую у них попросили, в таблице не было.
Каждая модель сама выбрала критерий важности, сама достроила контекст и затем последовательно продолжила его убедительным текстом.
Это похоже на вопрос к толпе: “Кто здесь лучший?”
Люди дадут разные ответы. Каждый выберет собственную систему координат и сможет логично её защитить. Но убедительность ответа не сделает выбранную систему координат правильной для конкретного бизнеса.
Правда находится не в светофоре и не в нейросети
Светофор показывает сигнал. Он не объясняет причину.
Нейросеть может красиво пересказать сигнал и добавить к нему правдоподобную историю. Но она не знает:
- зачем отдел сейчас звонит;
- какой тип клиента находится в конкретной выборке;
- какое действие обязательно именно в этом сценарии;
- какой критерий связан с текущим результатом;
- кто работает с более сложной базой;
- что руководитель уже менял в процессе;
- какой фокус стоит у команды на этой неделе.
Эта информация есть у руководителя отдела, который знает людей, текущую задачу и историю показателей.
Например, низкое упоминание продукта может означать слабое знание продукта. А может означать, что в этих разговорах продукт не нужно было упоминать.
Низкий процент выхода на ЛПР может быть проблемой менеджера. А может быть особенностью базы.
Высокий процент следующего шага может быть сильной практикой. А может быть формальным обещанием без реального продолжения.
Одно и то же число получает управленческий смысл только внутри бизнес-контекста.
Поэтому правда о том, что происходит в отделе, находится не в отдельной красной ячейке и не в автоматически сгенерированном резюме.
Она появляется, когда руководитель соединяет:
- цель;
- текущий фокус;
- знания о команде;
- применимость критерия;
- конкретные разговоры;
- фактический результат.
Что делает генеративная модель, когда контекста нет
Генеративная модель не открывает внутри себя скрытую правду о компании.
Она продолжает входные данные наиболее правдоподобным текстом.
Если ей дали таблицу и попросили управленческие выводы, она строит текст, похожий на управленческий отчёт.
В таком отчёте обычно должны быть:
- лидеры;
- отстающие;
- причины;
- точки роста;
- рекомендации;
- план действий.
Поэтому модель заполняет отсутствующие звенья тем, что выглядит логичным продолжением.
Высокий процент становится сильной стороной. Низкий - зоной развития. Большое число звонков - активностью. Ноль - игнорированием этапа. Несколько совпадений - закономерностью. Красные ячейки - причиной низкой конверсии.
Текст получается связным, красивым и убедительным.
Но связность текста не является доказательством причинности. Уверенный тон не означает, что модель знает контекст. Правильное чтение части цифр не подтверждает управленческий вывод целиком.
Самый опасный ответ в такой задаче - не обязательно самый нелепый.
Грубую ошибку легко заметить. Гораздо опаснее частично правильный текст, который незаметно продолжает данные там, где они закончились.
Может ли продукт всё-таки готовить рекомендации к планёрке
Потенциально - да. Но не в формате автоматического вердикта:
Этот сотрудник слабый, этого нужно обучать, а этому следует передать больше лидов.
Простая передача агрегированной таблицы в генеративную модель не даёт ей бизнес-контекст. Она лишь делает интерпретацию более гладкой и удобной для чтения.
Более полезная роль продукта может быть другой:
- выделить необычные значения;
- показать, на каких объёмах они рассчитаны;
- проверить применимость критерия;
- подобрать конкретные звонки для разбора;
- отделить наблюдение от гипотезы;
- указать, каких данных не хватает;
- задать руководителю уточняющие вопросы;
- не предлагать действие до подтверждения причины.
То есть не оценивать людей вместо руководителя, а помогать ему быстрее пройти путь:
от сигнала - к гипотезе;
от гипотезы - к конкретным звонкам;
от звонков - к проверенному решению.
Но это уже другая продуктовая гипотеза и другой эксперимент.
В следующей статье я проверю, сможет ли AI вместо рейтинга сотрудников подготовить набор проверяемых гипотез для совещания.
Посмотрим:
- сможет ли модель отделять факт от предположения;
- будет ли она указывать, каких данных ей не хватает;
- сможет ли предлагать не готовый диагноз, а вопросы для проверки;
- сможет ли выбирать звонки для разбора;
- перестанет ли она назначать сильных, слабых и виноватых без контекста.
Материалы эксперимента
Чтобы вывод можно было проверить, отдельно сохранены:
- исходный запрос и условия запуска;
- сводная матрица результатов;
- доказательная матрица и ограничения;
- ответы моделей с цветовой подсветкой проблемных фрагментов;
- ответы моделей в Markdown с текстовыми метками ошибок.
В публичных материалах фамилии сотрудников, названия компании и продуктов удалены. Оставлены только имена и названия AI-сервисов.
Частые вопросы
Значит ли эксперимент, что AI нельзя использовать для рекомендаций руководителю
Нет. Эксперимент показывает более узкое ограничение: агрегированная таблица без бизнес-контекста недостаточна для персональных управленческих выводов. AI можно использовать для поиска сигналов, подготовки гипотез и выбора звонков для проверки.
Почему светофора недостаточно для решения
Светофор показывает отклонение, но не объясняет причину. Одинаковая красная ячейка может означать ошибку сотрудника, неприменимость критерия, особенность базы, неправильную настройку оценки или маленькую выборку.
Почему ответы моделей настолько разные
В таблице не было задано, какой критерий считать главным. Поэтому каждая модель самостоятельно выбрала систему оценки и достроила недостающий контекст. Ответы получились логичными внутри разных, придуманных ими предпосылок.
Что будет проверяться дальше
В следующем эксперименте задача будет сформулирована иначе. AI должен будет не оценивать сотрудников, а отделять наблюдение от гипотезы, указывать недостающие данные и предлагать конкретные звонки и вопросы для проверки перед совещанием.
Главный вывод эксперимента
Изначальная продуктовая гипотеза была понятной:
Система уже анализирует звонки и показывает светофор. Возможно, она сможет сразу подготовить руководителю рекомендации перед планёркой.
Эксперимент показал ограничение этой идеи.
Светофор уже показывает потенциальное узкое место. Генеративная модель может быстро превратить его в красивый управленческий текст. Но если у неё нет цели отдела, фокуса руководителя и контекста команды, она сама решает, что считать проблемой, качеством и эффективностью.
Одна модель выбирает объём звонков. Другая - выход на ЛПР. Третья - выполнение скрипта. Четвёртая - среднее значение по всем критериям.
Все ответы выглядят логично, потому что каждая модель сначала сама придумывает контекст, а потом последовательно продолжает его текстом.
У руководителя отдела контекст не придуманный. Он знает:
- чего сейчас должна добиться команда;
- какие критерии действительно важны;
- у кого какая роль;
- какие звонки сложнее;
- что уже обсуждалось;
- где реальная проблема, а где особенность данных.
Поэтому продукт не должен автоматически превращать светофор в окончательный диагноз.
Его более полезная роль - помочь руководителю быстрее перейти от сигнала к проверенной гипотезе, а затем к конкретным звонкам и обоснованному решению.
Главный риск в такой работе - не очевидно глупый ответ. Его легко заметить.
Главный риск - красивый, связный и частично правильный текст, который продолжает данные ровно там, где они закончились.
AI: Х...О?
- 10 Я устал объяснять, почему AI - не магическая кнопка. Поэтому буду проверять это публично
- 20 Правда ли, что 95% AI-проектов проваливаются
- 30 Я изучил 150 видео про AI и понял, как буду проверять нейросети на бизнес-задачах
- 40 8 нейросетей вместо верстальщика: только две дали готовый результат
- 50 Может ли AI готовить рекомендации к планёрке: проверил 9 моделей
- 6 Скоро выйдет, приходите завтра