2САЙТ

Почему ИИ-агент падает: harness, а не модель

Когда сложная задача разваливается на середине, первая реакция — обвинить нейросеть, сменить модель на более дорогую или переписать системный промпт. На практике узкое место почти всегда кроется в обвязке (harness) — наборе инструментов, файлов состояния, тестов и инструкций, через которые модель взаимодействует с кодом. Этот бесплатный интерактивный курс объясняет, как спроектировать надежное окружение, чтобы агент стабильно доводил задачи до конца, а не сбивался на полпути.

Почему ИИ-агент падает: harness, а не модель

🎓 AI-ОБРАЗОВАНИЕ

Кому подойдет этот курс, а кому пока рано

Курс рассчитан на разработчиков, тимлидов и технических специалистов, которые уже дают ИИ-агентам реальные многошаговые задачи в кодовой базе, скриптах или пайплайнах. Если вы регулярно сталкиваетесь с тем, что агент уверенно рапортует об успехе, но оставляет сломанные тесты или забывает договоренности через пять шагов — здесь вы найдете инженерные ответы.

Если вы хотите запустить простого чат-бота для сайта, автоматизировать ответы на типовые вопросы клиентов или только знакомитесь с нейросетями, курс пока покажется слишком сложным. Для старта лучше прочитать наш разбор терминов: что такое ИИ, агент и автономный агент.

Не путайте тему курса с дрейфом. В статье о том, почему ИИ-агент работает нестабильно, мы разбирали ситуацию, когда инструкция агента не меняется, но внешний мир вокруг нее уезжает (обновляются API, верстка сайтов или бизнес-правила). В курсе по harness engineering речь идет о другой проблеме: внешние условия неизменны, задача ясна, модель достаточно умна, но агент всё равно падает, потому что сама рабочая среда не дает ему опереться на факты и проверить результат.

Способность рассуждать не равна надежности: что такое harness

Флагманские языковые модели отлично справляются с короткими задачами в один шаг: написать функцию, разобрать ошибку в логе или подготовить шаблон. Но когда цепочка действий растягивается на десятки шагов, вероятность накопления ошибок резко возрастает. Модель теряет начальные ограничения, выдумывает несуществующие файлы или зацикливается на правках одного и того же бага.

Дело не в том, что модели не хватает интеллекта. Ей не хватает инженерного каркаса. Harness (обвязка) — это инфраструктурный слой между рассуждениями модели и реальной системой.

Здесь работает аналогия с кухней и шеф-поваром. Даже гениальный кулинар не приготовит ужин, если на кухне перепутаны банки со специями, плита не греет, ножи затупились, а заказ записан неразборчиво. Модель — это повар, а harness — обустроенное рабочее пространство, понятные рецептурные карты и контроль качества готовых блюд перед подачей.

В курсе вся обвязка агента раскладывается на пять подсистем:

  • Instructions (инструкции): правила поведения, архитектурные ограничения и маршрутизация по проекту.
  • Tools (инструменты): скрипты сборки, консольные утилиты, доступ к базам данных и файловой системе.
  • Environment (окружение): изолированная среда исполнения, зависимости, тестовые стенды и корректные переменные.
  • State (состояние): история сессий, память о принятых решениях и текущий прогресс выполнения.
  • Feedback (обратная связь): линтеры, вывод компилятора, автотесты и валидаторы.

Каждый сбой агента можно отнести к одному из пяти слоев провала — от непонимания задачи до разрыва верификации (verification gap), когда агент искренне считает задачу выполненной просто потому, что у него нет инструмента для проверки.

Править систему чаще всего начинают с подсистемы Feedback. Добавить быстрый линтер или строгую проверку типов в цикл работы агента обходится дешево, но сразу отсекает массу элементарных ошибок компиляции.

Репозиторий как единственная правда и вред гигантских инструкций

Разработчик-человек держит в голове контекст из созвонов, чатов в мессенджерах и тикетов в трекере. У агента этого контекста нет. Если информации нет в репозитории, для агента её буквально не существует.

В курсе мы разбираем тест холодного старта: новый агент с чистым контекстом открывает репозиторий и должен без подсказок понять структуру проекта, запустить тесты и осознать свою текущую задачу. Если агент спотыкается на старте, проблему нужно решать в архитектуре репозитория.

При этом многие пытаются записать абсолютно все требования компании в один гигантский файл вроде AGENTS.md или CLAUDE.md. Раздутый файл инструкций только вредит:

  1. Вытеснение задачи: длинный текст забивает контекстное окно, не оставляя модели места для чтения кода и анализа логов.
  2. Провал внимания: инструкции, оказавшиеся в середине длинного контекста, модель неизбежно теряет и начинает игнорировать.

В курсе мы учим делать файл инструкций коротким маршрутизатором. Он задает лишь верхнеуровневые правила и ссылки на компактные тематические документы, которые агент читает только тогда, когда работает с соответствующей областью кода.

Дисциплина сессий, правило WIP=1 и объективные доказательства

Надежная работа агента опирается на строгие правила выполнения:

  • Жизненный цикл сессии: до написания кода агент проходит этап инициализации — проверяет окружение, запускает базовые тесты и подтверждает готовность инструментов.
  • Передача контекста (Handoff): при смене или перезапуске сессии агент передает чистое состояние без накопленного промежуточного мусора.
  • Правило WIP=1 (Work In Progress = 1): агент берет ровно одну атомарную задачу, доводит ее до конца и только потом переходит к следующей.
  • Доказательства вместо самоотчетов: фраза агента «я всё исправил» не имеет ценности. Завершением работы считается только объективное подтверждение: чистый прогон тестов, успешная сборка или логи валидатора.

В качестве практического упражнения в курсе разбирается разработка 2D-игры с нуля двумя путями: когда языковую модель пускают писать код «вслепую» через одиночные промпты и когда вокруг нее выстроен дисциплинированный harness.

Программа курса

Курс состоит из 8 последовательных модулей:

  1. Почему способные агенты проваливаются. Пять слоев сбоев, накопление ошибок в длинных цепочках и устранение разрыва верификации.
  2. Из чего состоит harness. Разбор пяти подсистем (инструкции, инструменты, среда, состояние, обратная связь) и очередность их настройки.
  3. Репозиторий как система записи. Организация кодовой базы без слепых зон и прохождение теста холодного старта.
  4. Архитектура инструкций без раздувания. Почему гигантские файлы вредят контексту и как организовать маршрутизацию по узким документам.
  5. Жизненный цикл сессии и передача состояния. Запуск от тестов к коду, фиксация результатов и передача эстафеты между сессиями.
  6. Борьба с overreach и правило WIP=1. Фокус на одной задаче, предотвращение лишних правок в чужом коде и замена самоотчетов строгими проверками.
  7. Фичи как данные и уровни проверки. Переход от слабой поверхностной проверки к строгой верификации контрактов.
  8. E2E, наблюдаемость и чистое состояние. Сквозное тестирование поведения, отслеживание шагов агента и порядок очистки среды после работы.

Как устроен курс

Курс представляет собой интерактивный тренажер прямо на сайте. Мы в веб-студии 2САЙТ создаем сайты, развиваем проекты и внедряем ИИ-агентов в рабочие процессы, поэтому курс построен на практике и реальных кейсах.

Здесь нет обещаний «получить идеального автономного программиста за вечер». Мы разбираем прикладную инженерную дисциплину: как находить узкие места в окружении, локализовать сбои и выстраивать надежную обвязку вокруг моделей.

Если помимо технической обвязки вам интересна управленческая сторона — постановка задач, декомпозиция и контроль работы агентов, — обратите внимание на наш смежный курс по методикам управления агентами.

Переходите к первому модулю в плеере ниже и приступайте к разбору архитектуры harness.