Меловая кнопка, после ремонта которой трескается соседняя фотография

8 нейросетей вместо верстальщика: только две дали готовый результат

Денис
13 мин чтения
Если, в двух словах ...

Практический тест восьми AI-сервисов на одной доработке HTML-лендинга: кто вернул готовый файл, кто дал только код и кто сломал остальную страницу.

В предыдущей статье я зафиксировал правила новой серии.

Одна реальная задача. Один исходный файл. Один обычный запрос. Несколько доступных AI. Проверка не ответа, а готовой работы.

Теперь появился первый практический результат.

Мне нужно было исправить небольшую проблему в готовом HTML-лендинге.

На десктопе блок программы работал нормально.

На мобильном пользователь нажимал на вторую, третью или четвёртую вкладку. Содержимое переключалось, но сама активная кнопка оставалась за пределами видимой части горизонтальной ленты.

Раньше я бы передал такую задачу верстальщику или программисту.

В этот раз я отправил один и тот же файл восьми AI-сервисам и попросил вернуть готовую страницу.

Что именно я хотел получить

Я не хотел получать объяснение, пример кода или инструкцию, куда что вставить.

Я выступал как обычный конечный пользователь.

Мне нужен был результат в том же формате, в котором я ожидал бы его от специалиста:

  • полный HTML-файл;
  • исправленная мобильная прокрутка вкладок;
  • сохранённый дизайн страницы;
  • работающая фотография;
  • отсутствие новых поломок;
  • возможность открыть файл и сразу проверить результат.

Это важное ограничение.

Модель может правильно назвать функцию JavaScript. Может предложить рабочую строку кода. Может уверенно объяснить причину ошибки.

Но если пользователь должен сам искать место в файле, вставлять код, собирать страницу и проверять последствия, работа ещё не выполнена.

Один запрос для всех

Я передал сервисам готовый HTML-файл и написал обычным языком:

На мобильной версии, в блоке за 60 минут, когда кликаешь на вторую кнопку, она должна полностью пролистываться и быть активной на экране.

Сейчас, когда я на неё нажимаю, она просто активируется, но сама кнопка не пролистывается, чтобы я видел следующую кнопку. Доработай и пришли мне итоговую страничку на скачивание.

Профессионального промта не было.

Я не указывал название функции, селекторы, архитектуру скрипта или конкретное место правки.

Смысл теста был именно в этом:

Может ли человек описать локальную задачу обычными словами и получить готовый файл без участия разработчика?

Что я считал успехом

До проверки результатов я зафиксировал три основных критерия.

Первый - сервис вернул полный файл, а не отдельный фрагмент кода.

Второй - мобильные вкладки действительно начали прокручиваться в видимую область.

Третий - всё остальное осталось прежним.

Последний критерий оказался главным.

Исправить одну функцию недостаточно, если вместе с ней исчезла фотография, поменялись шрифты или весь лендинг превратился в другой сайт.

Кто участвовал

В итоговую восьмёрку вошли:

  • Яндекс Алиса с подпиской Плюс;
  • локальная Gemma 4B;
  • локальная Gemma 26B;
  • GigaChat на бесплатном тарифе;
  • DeepSeek на бесплатном тарифе;
  • ChatGPT на бесплатном тарифе;
  • Qwen 3.8-Max на бесплатном тарифе;
  • BitrixGPT внутри Bitrix24.

Отдельно я пытался открыть Kimi, но в момент теста веб-интерфейс зависал. Проверяемого запуска не получилось, поэтому в итоговую восьмёрку этот сервис не вошёл.

Результаты относятся только к этому файлу, этому запросу, этим тарифам и этому моменту проверки.

Это не универсальный рейтинг моделей для программирования.

Результат в одной таблице

СервисЧто вернулЦелевая функцияЧто произошло с остальной страницейСтатус
Яндекс АлисаHTML, CSS и JavaScript отдельными фрагментамиНе проверялась в готовом файлеПользователю нужно самостоятельно внедрять измененияЧастично
Gemma 4B локальноОписание проблемы и обещание передать разработчикуНе реализованаФайл отсутствуетНе выполнено
Gemma 26B локальноФрагмент функции со scrollIntoViewКод выглядит релевантным, но готового файла нетПользователю нужно самостоятельно внедрять и проверятьЧастично
GigaChatОшибка в режиме рассуждения, затем незавершённая печать HTMLПолный результат проверить нельзяИтоговый файл не полученНе подтверждено
DeepSeekГотовый HTML-файлРаботаетПовредилась фотографияОпасный результат
ChatGPTГотовый HTML-файлРаботаетФотография и дизайн сохранилисьГотово к использованию
QwenПолная HTML-страницаРаботаетСервис переписал дизайн и шрифтыОпасный результат
BitrixGPTГотовый HTML-файл через чат задачи Bitrix24РаботаетФотография и дизайн сохранилисьГотово к использованию

Четыре сервиса реализовали целевую механику.

Но только два результата прошли все критерии.

Правильный код ещё не является готовой работой

Яндекс Алиса поняла проблему и предложила HTML, CSS и JavaScript.

В ответе была логика горизонтальной прокрутки и обработчик клика.

Вероятно, разработчик смог бы быстро использовать эти рекомендации.

Но я ставил другую задачу.

Мне нужен был готовый файл.

Как конечный пользователь я не обязан понимать, куда вставлять разметку, какой скрипт заменять и не конфликтует ли новый код с существующей логикой.

Поэтому такой результат полезен, но не завершён.

Локальная Gemma 26B тоже предложила релевантную правку через scrollIntoView.

Это снова показывает, что модель может понять локальную операцию.

Но без полного файла и браузерной проверки я не могу утверждать, что работа выполнена.

Когда уверенный ответ ничего не решает

Локальная Gemma 4B подробно пересказала проблему.

Затем сообщила, что передаст её разработчику и вернётся после исправления.

Для живого сотрудника такой ответ мог бы означать начало процесса.

Для AI-чата он означает отсутствие результата.

Никакой разработчик не подключился. Файл не появился. Проверять было нечего.

GigaChat в режиме рассуждения несколько раз завершал работу ошибкой.

В другом режиме сервис начал печатать итоговую HTML-страницу, но вывод оборвался до завершения.

Отдельного готового файла, который можно открыть и проверить, я не получил.

Поэтому этот результат нельзя ни засчитать, ни уверенно назвать технически неправильным.

Его статус - не подтверждён.

Первый ложный успех: кнопка работает, фотография сломана

DeepSeek вернул файл примерно через пять минут. Во время генерации потребовалось один раз нажать кнопку продолжения.

На мобильной версии вкладки начали прокручиваться правильно.

Если бы я проверил только поставленную функцию, сервис прошёл бы тест.

Но на десктопе я увидел, что пропала или повредилась фотография автора.

Причина для конечного пользователя неочевидна.

Факт важнее причины:

  • локальная задача выполнена;
  • существующий продукт повреждён;
  • результат нельзя публиковать без дополнительного разбора.

Это не частичный успех.

Это опасный результат, потому что он выглядит готовым и может пройти поверхностную проверку.

Второй ложный успех: задача решена, но сайт уже другой

Qwen обрабатывал файл дольше остальных протестированных облачных сервисов. По моему ощущению, работа заняла около семи-десяти минут.

Мобильные вкладки заработали.

Но вместе с локальной доработкой сервис полностью поменял дизайн, шрифты и часть визуальной логики страницы.

Некоторые решения могли выглядеть интереснее исходных.

Но я не просил разработать новый лендинг.

Такой результат создаёт новую работу:

  • обсуждать новый дизайн;
  • согласовывать изменения;
  • переносить стиль на другие страницы;
  • проверять все блоки заново;
  • решать, что оставить, а что вернуть.

Модель выполнила больше действий, чем требовалось.

Но ценность для пользователя стала ниже.

В существующем продукте самовольное улучшение может быть такой же регрессией, как явная поломка.

ChatGPT вернул то, что я просил

В момент теста я использовал бесплатный ChatGPT через доступный мне способ подключения.

Сервис вернул полный HTML-файл.

Я открыл страницу и проверил её в браузере.

На мобильной версии активная вкладка прокручивалась в видимую область.

На десктопе фотография оставалась на месте.

Дизайн и остальные блоки не изменились.

В рамках поставленной атомарной задачи этот результат можно было использовать.

Важно не то, что ChatGPT написал правильный код.

Важно, что он сохранил формат входа и выхода:

получил готовую страницу - вернул готовую страницу.

BitrixGPT удивил меня сильнее всего

Я являюсь интегратором Bitrix24 и регулярно работаю с этой платформой.

Поэтому я решил проверить не только отдельные AI-чаты, но и AI, встроенный в рабочую систему.

Тест проходил в Bitrix24 на платной связке: тариф “Профессиональный”, Маркет и чат внутри задачи.

Чтобы передать файл, мне потребовалось создать задачу, открыть её чат, приложить HTML и отправить тот же запрос.

BitrixGPT прочитал файл, нашёл блок .program-tabs и описал причину проблемы.

В обработчик активации он добавил автоматическую прокрутку через scrollIntoView.

Затем сервис вернул итоговый файл.

После браузерной проверки мобильные вкладки работали, фотография не повредилась, дизайн сохранился.

Для меня это был неожиданно положительный результат.

Я ожидал, что встроенный AI скорее поможет сформулировать задачу, подготовит текст или даст рекомендацию.

В этом запуске он прошёл полный путь до проверяемого файла.

Это не доказывает, что BitrixGPT лучше других моделей для программирования.

Но показывает другую важную вещь:

На результат влияет не только модель, но и способ, которым AI встроен в рабочий процесс.

В Bitrix24 файл, задача, обсуждение и результат находились в одном контуре.

Пользователю не пришлось отдельно переносить код между чатами и редактором.

При этом сама проверка результата всё равно осталась на мне.

Почему я не называю победителя

Два сервиса дали готовый результат: ChatGPT и BitrixGPT.

Но условия доступа и работы были разными.

ChatGPT использовался как отдельный бесплатный чат.

BitrixGPT работал внутри платной платформы, где файл передавался через чат задачи.

По одному запуску нельзя сделать общий вывод о качестве моделей, стоимости или стабильности.

Можно сделать более узкий вывод:

В этом пользовательском сценарии оба сервиса вернули полный файл, исправили целевую функцию и не повредили проверенные части страницы.

Этого достаточно для результата эксперимента.

Но недостаточно для универсального рейтинга.

Что показал эксперимент

Все участники в той или иной степени поняли задачу.

Главный разрыв появился не на уровне понимания.

Он появился между правильной операцией и безопасным изменением существующего продукта.

Для пользователя важны сразу несколько слоёв:

  1. Принять исходный файл.
  2. Понять запрос обычным языком.
  3. Внести локальное изменение.
  4. Вернуть полный результат в исходном формате.
  5. Не изменить то, чего не просили.
  6. Дать возможность быстро проверить работу.

Отдельная модель может хорошо выполнить третий пункт.

Но пользователь покупает весь путь.

Может ли AI заменить верстальщика

В рамках этой конкретной задачи - да, это оказалось возможно.

У меня был один HTML-файл, локальная визуально проверяемая проблема и понятные критерии.

Два сервиса вернули результат, который не потребовал участия верстальщика.

Но из этого не следует, что специалист больше не нужен.

Задача была небольшой. Ошибки можно было быстро увидеть глазами. Регрессии были заметны на нескольких экранах.

В большом продукте проверка становится сложнее:

  • больше страниц;
  • внешние зависимости;
  • сборка;
  • формы и аналитика;
  • интеграции;
  • доступность;
  • безопасность;
  • разные браузеры;
  • скрытые сценарии пользователей.

Чем сложнее продукт, тем дороже становится проверка уверенного ответа модели.

Главный вывод

Я начинал тест с вопроса, могут ли нейросети исправить одну кнопку.

Оказалось, что почти все понимают, что нужно сделать.

Настоящий критерий находится дальше:

Может ли AI безопасно изменить существующий продукт, сохранить всё остальное и вернуть результат в формате, который пользователь может сразу проверить?

Четыре сервиса реализовали целевую механику.

Два создали новые проблемы.

Только два дали готовый результат.

На простой странице побочную ошибку можно увидеть глазами.

В тысячах звонков, документов или управленческих рекомендаций ручная проверка каждого результата становится значительно сложнее.

Поэтому бизнесу нужен не только ответ модели.

Нужны критерии, проверка, калибровка и система контроля вокруг AI.

Я не проверяю, умеет ли искусственный интеллект убедительно отвечать.

Я проверяю, можно ли использовать его результат в реальной работе и отвечать за последствия.

Какую небольшую задачу вы сейчас отдали бы специалисту, но хотели бы сначала проверить на нескольких нейросетях?

Серия

AI: Х...О?

  1. 10 Я устал объяснять, почему AI - не магическая кнопка. Поэтому буду проверять это публично
  2. 20 Правда ли, что 95% AI-проектов проваливаются
  3. 30 Я изучил 150 видео про AI и понял, как буду проверять нейросети на бизнес-задачах
  4. 40 8 нейросетей вместо верстальщика: только две дали готовый результат
  5. 5 Скоро выйдет, приходите завтра