Меловая лестница с несколькими финишами на разных этапах

Правда ли, что 95% AI-проектов проваливаются

Денис
12 мин чтения
Если, в двух словах ...

Разбор популярных цифр о провале AI-проектов и различий между ответом модели, пилотом, внедрением, использованием и финансовым результатом.

В обсуждениях искусственного интеллекта регулярно появляется убедительная цифра:

95% AI-проектов проваливаются.

Иногда вместо неё называют 74%, 80% или 96%.

Такая формулировка хорошо работает в заголовке. Она создаёт понятный конфликт между обещаниями рынка и реальностью внедрения.

Но у неё есть проблема.

Единого глобального исследования, которое доказало бы, что 95% всех AI-проектов проваливаются, я не нашёл.

Разные цифры относятся к разным объектам, выборкам и определениям результата.

Сначала нужно определить, что именно считается успехом

AI-проект может пройти несколько уровней.

Первый - модель дала содержательный ответ на отдельный запрос.

Второй - команда собрала работающий прототип.

Третий - прототип встроили в рабочий процесс.

Четвёртый - сотрудники начали регулярно им пользоваться.

Пятый - решение масштабировали на компанию.

Шестой - появился измеримый операционный результат.

Седьмой - результат стал заметен в выручке, расходах или прибыли.

Проект может успешно пройти первые три уровня и не дойти до седьмого.

Это не означает, что модель не работала.

Но и не означает, что компания получила экономический эффект.

Поэтому вопрос “сколько AI-проектов проваливается” без определения уровня почти не имеет смысла.

Откуда берётся цифра 95%

Чаще всего её связывают с предварительным отчётом MIT Project NANDA 2025 года.

В нём около 5% изученных интегрированных корпоративных GenAI-пилотов показали устойчивый измеримый эффект на P&L по критериям отчёта.

Из этого легко сделать обратный заголовок:

95% AI-пилотов не дают результата.

Но исходное утверждение уже значительно уже.

Речь идёт:

  • не обо всех видах AI;
  • не обо всех проектах мира;
  • не о технической работоспособности;
  • не о любой пользовательской пользе;
  • а об изученных интегрированных корпоративных GenAI-пилотах и устойчивом измеримом финансовом эффекте.

Сам отчёт предварительный, а его выборка и знаменатель требуют осторожной интерпретации.

Поэтому корректная формулировка звучит так:

В предварительном исследовании MIT Project NANDA около 5% изученных интегрированных корпоративных GenAI-пилотов показали устойчивый измеримый эффект на P&L.

Это сильный сигнал о разрыве между пилотом и финансовым результатом.

Но не доказательство того, что 95% всех AI-проектов технически провалились.

Предварительный отчёт MIT Project NANDA

Почему из BCG получается миф о 96% провалов

В исследовании BCG компании были разделены по зрелости создания ценности от AI.

4% относились к лидерам, создающим существенную ценность.

Ещё 22% уже масштабировали некоторую ценность.

49% находились в основном на стадии доказательства концепции.

Если просто инвертировать 4%, получится эффектная фраза:

96% компаний не получают результата.

Но она выбрасывает из картины 22% компаний, которые уже масштабировали ценность, пусть и не относились к самой сильной группе.

Это подмена классификации зрелости показателем провала.

Исследование BCG Where’s the Value in AI?

Более 80% без заметного EBIT - тоже не 80% провалов

В одном из глобальных опросов McKinsey более 80% респондентов не видели ощутимого влияния GenAI на EBIT всей компании.

При этом 17% связывали с GenAI не менее 5% EBIT.

В следующем опросе McKinsey 88% организаций сообщили о регулярном использовании AI хотя бы в одной функции, но почти две трети ещё не перешли к масштабированию.

Эти данные показывают важный разрыв.

Использование AI может распространяться быстрее, чем появляется измеримый эффект на уровне всей компании.

Но отсутствие заметного enterprise EBIT не означает, что каждый отдельный проект бесполезен.

Решение может экономить время одной команды, повышать качество одной операции или ещё не иметь достаточного масштаба, чтобы изменить общий финансовый результат.

McKinsey: The State of AI - how organizations are rewiring to capture value

McKinsey: The State of AI 2025

Ожидаемый ROI и отрицательный ROI - не одно и то же

В исследовании IBM только 25% AI-инициатив, по оценкам CEO, достигли ожидаемого ROI.

Эту цифру можно пересказать как:

75% AI-проектов не окупаются.

Но “не достигли ожидаемого ROI” не означает “дали отрицательный ROI”.

Ожидание могло быть завышено.

Проект мог дать положительный, но меньший эффект.

Мог находиться на ранней стадии.

Мог быть полезным операционно, но ещё не масштабированным.

IBM Institute for Business Value: CEO Study

Почему исследования не противоречат друг другу

В одном эксперименте AI ускоряет отдельную работу.

В другом опросе компания не видит влияния на прибыль.

На первый взгляд это выглядит противоречием.

Но измеряются разные уровни.

В исследовании customer support средний прирост производительности составлял около 15%, а менее опытные сотрудники получали особенно заметную пользу.

В эксперименте с консультантами AI повышал скорость и качество на задачах внутри границы своих возможностей, но ухудшал результат на внешне похожей задаче за её пределами.

В исследовании METR опытные разработчики на знакомых репозиториях работали с AI на 19% медленнее, хотя субъективно считали, что ускорились.

Эти результаты не складываются в одну среднюю цифру успеха.

Они показывают зависимость эффекта от задачи, сотрудника, способа использования и стоимости проверки.

Generative AI at Work, Quarterly Journal of Economics

Navigating the Jagged Technological Frontier, MIT Sloan

METR: влияние AI на опытных open-source разработчиков

Где чаще всего теряется результат

По совокупности исследований и моего практического опыта проблема редко сводится только к качеству модели.

Результат теряется в переходах между уровнями.

Между ответом и принятым результатом

Модель что-то сгенерировала, но никто заранее не определил критерий качества.

Ответ выглядит убедительно, но непонятно, можно ли его использовать.

Между прототипом и процессом

Демонстрация работает на подготовленных данных.

В рабочем процессе появляются пропуски, нестандартные случаи, права доступа и интеграции.

Между доступом и использованием

Сотрудникам выдали лицензии, но инструмент не стал частью ежедневной работы.

В шестимесячном полевом эксперименте более 90% пользователей попробовали корпоративный GenAI-инструмент, но еженедельное использование затем стабилизировалось ниже 40%.

Shifting Work Patterns with Generative AI, NBER

Между локальной экономией и экономикой компании

Если сотрудник сделал документ на двадцать минут быстрее, это ещё не означает, что компания получила дополнительные деньги.

Освободившееся время должно превратиться в больший объём работы, снижение расходов, рост конверсии или другой измеримый эффект.

При этом нужно вычесть стоимость лицензий, интеграций, проверки, ошибок и поддержки.

Как я буду использовать цифры об AI-проектах

Я не буду говорить, что 95% всех AI-проектов проваливаются.

Корректнее говорить о большом разрыве между несколькими уровнями:

  • модель умеет выполнить операцию;
  • прототип работает;
  • процесс встроен;
  • сотрудники пользуются;
  • результат масштабирован;
  • появился операционный эффект;
  • появился финансовый эффект.

У каждого исследования свой уровень и свой критерий.

Поэтому в практических экспериментах серии я буду начинать с самого первого вопроса:

Выполнила ли модель конкретную работу в том виде, в котором её ожидал пользователь?

А затем отдельно проверять:

  • сколько понадобилось ручных действий;
  • сколько заняла проверка;
  • появились ли новые ошибки;
  • можно ли повторить результат;
  • что потребуется для регулярного использования;
  • где начинается необходимость системы вокруг модели.

Итог

Универсальной доли провала AI-проектов нет.

Цифры 74%, 80%, 95% и 96% описывают разные выборки, уровни зрелости и критерии результата.

Но за ними действительно стоит общая проблема.

Между способностью модели выполнить отдельную операцию и устойчивым бизнес-результатом находится длинная цепочка.

Именно эту цепочку обычно скрывает фраза “AI уже всё умеет”.

В следующем материале я разбираю, как превратить этот вывод в публичный формат, который будет не только доказательным, но и способным собирать внимание:

Я изучил 150 видео про AI и понял, как буду проверять нейросети на бизнес-задачах.

Серия

AI: Х...О?

  1. 10 Я устал объяснять, почему AI - не магическая кнопка. Поэтому буду проверять это публично
  2. 20 Правда ли, что 95% AI-проектов проваливаются
  3. 3 Скоро выйдет, приходите завтра