Исследование / Агентная инженерия / Проверяемые AI-системы

Агент строит агента: методология проверяемой автоматизации

Исследовательский кейс о том, как наблюдения за работой специалиста становятся семантическими контрактами, тестами и ограниченным правом AI-системы действовать. Это не заявка на автономное управление автомобилем или сертификацию безопасности.

Метод разделяет запись работы, доказательные артефакты и runtime-контур, чтобы агент учился сначала в воспроизведении и наблюдении, а право на действие получал только в явно ограниченной области.

Статус
Исследование
Моя роль
Исследовательская постановка · Архитектура доказательного контура · Проектирование ограничений и проверки · Редакционная публикация методологии
Кейс опубликован
Обновлено
Комикс: улыбающийся автомобиль на подъёмнике, механик с диагностическим планшетом и дружелюбный AI-помощник
Обложка из предоставленной автором публикационной версии материала.

Полная публикационная версия

Ниже — полный материал в исходной постраничной вёрстке утверждённого PDF. Сохранены все 20 страниц, схемы, таблицы, вставки и типографика; текст не проходил через автоматическое извлечение или машинное переформатирование.

Обложка канонической публикационной версии статьи «Агент строит агента».
Страница 1 из 20 — обложка.
Титульная страница, аннотация и карта статьи канонической публикационной версии.
Страница 2 из 20 — аннотация и карта статьи.
Введение канонической публикационной версии статьи.
Страница 3 из 20.
Раздел «Профессия как скрытый язык» канонической публикационной версии.
Страница 4 из 20.
Продолжение раздела о наблюдении профессионального процесса и его доказательной трассе.
Страница 5 из 20.
Схема и текст о переходе от записи работы к семантической структуре.
Страница 6 из 20.
Раздел об агентной фабрике и распределении ролей между агентами.
Страница 7 из 20.
Продолжение описания агентной фабрики и её ролей.
Страница 8 из 20.
Раздел о том, как несколько примеров заменяют тысячи кликов.
Страница 9 из 20.
Продолжение раздела о переносе правил работы вместо маршрута кликов.
Страница 10 из 20.
Раздел «Модель предсказывает. Система разрешает».
Страница 11 из 20.
Раздел о проверке агента другим агентом.
Страница 12 из 20.
Продолжение раздела о воспроизводимой проверке агентной системы.
Страница 13 из 20.
Раздел о границах замещения и усиления работы специалиста.
Страница 14 из 20.
Раздел о применении методологии за пределами автосервиса.
Страница 15 из 20.
Раздел о праве как части архитектуры агентной системы.
Страница 16 из 20.
Раздел «Новая единица производства».
Страница 17 из 20.
Примечание автора и ограничения материала.
Страница 18 из 20.
Список источников канонической публикационной версии.
Страница 19 из 20 — источники.
Продолжение списка источников канонической публикационной версии.
Страница 20 из 20 — источники.

Краткая веб-версия

Профессия как скрытый язык

На экране автомобильного диагностического планшета рядом могут находиться две похожие команды. Одна считывает сведения о неисправности. Другая удаляет их, запускает сервисную процедуру или меняет состояние электронного блока. Для опытного автоэлектрика это не похожие кнопки: он понимает, на каком этапе диагностики находится, что уже проверено и к чему приведёт следующий шаг.

Для наивной AI-системы перед глазами остаются надписи и прямоугольники. Ей можно показать несколько видеозаписей и попросить предсказать следующее нажатие. Получится убедительная демонстрация, но не производственная агентная система. Она не доказывает, что модель различает безопасное и опасное, замечает смену состояния, знает границы доказательств или умеет остановиться.

Этот кейс исследует другой путь: как агентные системы помогают построить другую агентную систему. Сначала создаётся наблюдение и телеметрия. Затем отдельный контур превращает наблюдения в структурированные данные. Следующие роли извлекают повторяющиеся решения, проектируют контракты и пытаются конструкцию сломать. Runtime-агент получает право действовать только после проверки — сначала в симуляции, затем в режиме наблюдения и только затем в ограниченном исполнительном контуре.

Комикс: механик показывает диагностический планшет дружелюбному AI-помощнику рядом с автомобилем на подъёмнике
Иллюстрация к исследовательскому сценарию: AI помогает с наблюдением и подготовкой процесса, а специалист сохраняет контроль над действиями с последствиями.

От записи к смыслу

Большая часть профессионального знания не записана в инструкции. Регламент может потребовать подключить прибор, выполнить общий опрос, открыть проблемный блок и подготовить отчёт. Но он редко фиксирует десятки микрорешений: экран ещё не стабилизировался, список продолжается ниже видимой области, одинаковые надписи относятся к разным блокам, а общий отчёт не доказывает полноту проверки.

Одна видеозапись оставляет изображение процесса, но не его проверяемую структуру. Одни координаты касаний дают сценарий, который сломается после прокрутки, новой версии приложения или иного состояния экрана. Поэтому для каждого шага требуется доказательная трасса:

  • что видел специалист до действия;
  • какое физическое действие он совершил;
  • какие промежуточные состояния возникли;
  • какой экран стабилизировался после действия;
  • изменился ли процесс ожидаемым образом;
  • что уже проверено, что осталось и где наблюдение неоднозначно.

Особенно важно не смешивать четыре сущности: написанное на экране, фактическое касание, профессиональный смысл действия и причину, по которой специалист выбрал его именно сейчас. Причину фиксируют отдельно; её нельзя достоверно вывести только из положения пальца.

наблюдение → физическое действие → подтверждённый результат → профессиональный смысл
полный кадр → tap / swipe / back → устойчивое состояние → цель, правило, исключение
От записи к смыслу: каждое звено фиксируется отдельно, а не подменяет другое.

Агентная фабрика, а не одна самосовершенствующаяся модель

Фраза «агент строит агента» не означает, что одна модель переписывает собственный код, сама себя экзаменует и объявляет готовой к работе. Здесь речь о разделении труда и полномочий. Роли могут использовать одну или разные модели, но у каждой свой вход, разрешения и критерий результата.

1. Агент-разработчик создаёт наблюдателя

Coding-агенты помогают исследовать устройство, писать безопасные probes, recorder, схемы данных, валидаторы, тесты и инструкции воспроизводимого запуска. Первая граница принципиальна: этот контур наблюдает за работой оператора, но не управляет диагностическим приложением.

2. Агент-наблюдатель переводит пиксели в структуру

Мультимодальная модель получает отдельный экран или последовательность экранов и создаёт семантическое описание: тип экрана, активный слой, видимые тексты, элементы управления, модальные окна и неопределённости. Она отвечает не на вопрос «что нажать», а на вопрос «что сейчас наблюдается».

3. Агент-куратор собирает корпус

Следующий контур проверяет целостность архивов, связывает события по времени, нормализует названия действий, выявляет пропуски и формирует технические отчёты. Первичные трассы остаются записью реальной работы. Синтетическими могут быть только дополнительные вариации, обезличенные примеры и специально созданные пограничные случаи; происхождение нельзя смешивать.

4. Агент-аналитик извлекает грамматику процесса

Его интересуют не координаты, а повторяющаяся логика: какие состояния предшествуют действию, какие признаки достаточны для перехода, что подтверждает завершение, когда нужно задать вопрос человеку и когда необходимо отказаться от продолжения. Из нескольких операторских трасс формируется не макрос, а граф состояний и решений.

5. Агент-архитектор проектирует исполнителя

На основании корпуса он помогает подготовить системную инструкцию, типизированные входы и выходы, ограниченный словарь намерений, память прогресса и правила завершения. Но инструкция не является единственным защитным слоем. Всё, что связано с реальным действием, остаётся в детерминированном host-контуре: разрешено ли действие сейчас, соответствует ли ему состояние и действительно ли оно выполнено.

6. Агент-проверяющий пытается конструкцию сломать

Отдельная роль ищет пропущенные ветви, недоказанные переходы, неустойчивые экраны, слишком широкие полномочия и случаи, где уверенность модели не равна доказательству. Негативный результат не прячется: он становится частью корпуса и критерием для следующей версии.

Не запомнить маршрут, а перенести правило

Несколько качественных сессий могут оказаться полезнее тысяч однотипных кликов, если они покрывают разные состояния, исключения и причины решений. Это не отменяет необходимость в данных; меняется их единица. Ценной становится не «строка с действием», а проверяемая траектория: состояние, допустимая цель, шаг, результат, подтверждение и граница применимости.

Вместо правила «нажать на элемент в координате X» появляется правило вида: «если выбран этот блок, в нём есть такая ошибка, экран устойчив, а предыдущая ветвь закрыта, можно предложить действие из ограниченного набора». Если один из признаков не доказан, система спрашивает человека или безопасно останавливается.

Такой подход близок к идее заземления: модель может предлагать высокоуровневое намерение, но оно не становится действием, пока не сопоставлено с доступным состоянием и разрешённым навыком.saycan Исследования vision-language-action систем тоже не заменяют это требование для конкретного процесса: общий перенос знания не равен доказанному праву действовать в конкретной среде.rt2

Модель предсказывает. Система разрешает

Модель полезна, когда она видит альтернативы, распознаёт ситуацию, формулирует намерение или отмечает неопределённость. Однако действие с последствиями должно разрешаться кодом и текущим состоянием. Это аналог принципа наименьших привилегий: исполнитель может понимать задачу широко, но получает доступ только к одной операции, которая нужна и доказана сейчас.

agent: предлагает намерение
host policy: проверяет наблюдение, правило и право
action executor: выполняет ровно одно подтверждённое действие
deny / ask human / safe stop: допустимые безопасные исходы
Интеллект не равен полномочию.

Контур разрешения проверяет свежесть наблюдения, ровно одно соответствие между намерением и действием, разрешённую операцию, отсутствие конкурирующих условий и постфактум-подтверждение результата. Если доказательств недостаточно, корректный исход — не угадывание, а ask human или safe stop.

Когда агент проверяет агента

Обычное тестирование программного продукта спрашивает, выполняет ли код заранее определённые требования. Для LLM-систем этого недостаточно: модель способна дать правильный ответ по неправильной причине, использовать информацию из будущего экрана, спутать контекст или объявить работу завершённой, оставив ветвь ниже видимой области.

Поэтому историческая сессия воспроизводится причинно. На каждом шаге агент видит только то, что существовало в тот момент. Будущий экран, следующее действие механика и финальный результат ему недоступны. Предложение сравнивается не только с фактическим касанием человека, но и с целью процесса, правилами безопасности и доказательством завершённости.

Проверка должна включать пограничные случаи: задержку экрана, неожиданное модальное окно, похожие надписи, неудачную повторную попытку, отсутствие физического подтверждения и противоречивые данные. Система учится не избегать всех ошибок, а делать ошибку видимой до действия с последствиями.

Кого именно заменяет такая система

Корректный вопрос не «заменяет ли она автоэлектрика». Автоматизация почти всегда заменяет или усиливает часть работы: повторяемый опрос, подготовку рабочей последовательности, контроль полноты, сбор отчёта, сопоставление следов или выявление отклонений. Она не получает автоматически право на физическое подтверждение, спорную диагностику, изменение состояния блока или решение об ответственности.

Человек не исчезает. Он определяет цель, утверждает границы, разбирает исключения, проверяет спорную разметку и решает, когда область автономности можно расширить. По мере появления новых трасс стандартные случаи могут уходить в автоматизацию, а специалист будет работать с длинным хвостом исключений — именно там обычно высока цена ошибки.

Методология за пределами автосервиса

Автомобильная диагностика удобна как наглядный пример: здесь есть физическое оборудование, закрытое приложение, много состояний, повторяемые workflow и очевидная цена неправильного действия. Но сам метод не ограничен автомобилями.

Он применим к лабораторным приборам, промышленным интерфейсам, медицинским административным процедурам, юридическим исследованиям, документообороту и служебным процессам. Условие одно: нужно различать наблюдение, решение, действие, результат и право на действие. Иногда первым ценным продуктом будет не исполнитель, а recorder, агент контроля качества или shadow-агент, который месяцами учится на реальной работе, не вмешиваясь в неё.

Право становится частью архитектуры

Фотографирование опыта — это также обработка данных. В публичном и производственном контуре необходимо заранее определить цель, объём, хранение, доступ, обезличивание и разделение первичных доказательств с исследовательскими ссылками. Принципы GDPR, включая минимизацию данных и privacy by design, влияют на запись процесса с самого начала.gdpr

AI Act добавляет слой прозрачности и риск-ориентированной оценки. С 2 августа 2026 года статья 50 применяется к отдельным обязанностям прозрачности; Европейская комиссия отдельно указывает на случаи интерактивных систем, synthetic content и публичных текстов без человеческой проверки или редакционного контроля.ai-transparency Это не позволяет автоматически объявить любой диагностический AI high-risk или, наоборот, гарантировать обратное: квалификация зависит от intended purpose, реальной функции и контекста применения.ai-act

Для автомобильной отрасли важен также Data Act. Разъяснения Европейской комиссии касаются данных транспортных средств, режима доступа к ним и отношений между OEM, поставщиками и aftermarket-сервисами; эти разъяснения относятся именно к автомобильному сектору и не переносятся автоматически на другие отрасли.data-act

Право здесь не внешний тормоз для готовой технологии. Оно определяет, какие данные можно записать, кто вправе дать разрешение, где хранится evidence, как описывается роль AI и что останется после каждого решения.

Новая единица производства

Главный вывод не в том, что AI научился нажимать кнопки на диагностическом планшете. Новая единица инженерной работы — связка наблюдения, данных, контракта, теста и ограниченного действия. Языковые и мультимодальные модели могут участвовать почти в каждом звене: предлагать схемы и инструкции, строить пограничные случаи, воспроизводить исторические сессии, искать ошибки другого агента и сопровождать runtime-систему.

Но агентность не отменяет инженерную дисциплину. Чем больше этапов доверено моделям, тем важнее происхождение артефактов, разделение ролей, замороженные тесты, детерминированные границы и человеческое решение о готовности. Будущее производственного AI, вероятно, будет похоже не на одного универсального цифрового сотрудника, а на фабрику, в которой одни системы наблюдают, другие структурируют, третьи проектируют, четвёртые проверяют, а пятые получают строго ограниченное право действовать.

Агент строит агента. Доказательства строят доверие. А право действовать по-прежнему создаёт человек — через архитектуру, правила и ответственность.

Ограничения и статус

Описанный проект находится в исследовательской и поэтапно валидируемой стадии. Эта страница не заявляет сертификацию безопасности, соответствие определённому классу AI Act, доступ к данным производителей, готовность к автономному управлению функциями автомобиля или подтверждённые производственные показатели.

Инструменты AI использовались при подготовке структуры и редакционной версии текста. Автор проверяет факты, выводы и публикационную редакцию и несёт за неё редакционную ответственность.

Источники

  1. Brown, T. B. et al. Language Models are Few-Shot Learners, 2020.few-shot
  2. Ahn, M. et al. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances, 2022.saycan
  3. Brohan, A. et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, 2023.rt2
  4. Regulation (EU) 2016/679 (GDPR), Articles 5 and 25.gdpr
  5. Regulation (EU) 2024/1689 (AI Act), Articles 4 and 50.ai-act
  6. European Commission, Guidelines on transparency obligations under Article 50 of the AI Act, 2026.ai-transparency
  7. European Commission, Guidance on vehicle data, accompanying the Data Act, 2025.data-act
  1. Контекст о few-shot learning; не является доказательством работоспособности описанного метода.
  2. Контекст о заземлении намерений модели в доступных действиях.
  3. Контекст о vision-language-action моделях; не является подтверждением конкретной реализации проекта.
  4. Официальный текст регулирования; применимость к конкретной реализации требует отдельной оценки.
  5. Официальный текст AI Act; классификация зависит от intended purpose и фактической функции системы.
  6. Официальные разъяснения Европейской комиссии, обновлённые 29 июля 2026 года.
  7. Отраслевые разъяснения Европейской комиссии, опубликованные 12 сентября 2025 года.

08 / Доказательства

Публичные артефакты и связанные материалы

СТАТЬЯ-01

Language Models are Few-Shot Learners

Исследовательская работа о few-shot обучении; используется как контекст, а не как доказательство работоспособности описанного кейса.

Доступ
публичный
Издатель
arXiv
Дата
СТАТЬЯ-02

Do As I Can, Not As I Say

Работа о заземлении предложений языковой модели в доступных действиях; служит контекстом для ограничения полномочий.

Доступ
публичный
Издатель
arXiv
Дата
ДОКУМЕНТАЦИЯ-04

Regulation (EU) 2016/679 (GDPR)

Официальный текст GDPR; в кейсе рассматриваются принципы обработки данных и privacy by design.

Доступ
публичный
Издатель
EUR-Lex
Дата
ДОКУМЕНТАЦИЯ-05

Regulation (EU) 2024/1689 (AI Act)

Официальный текст AI Act; классификация конкретной системы зависит от её intended purpose и реальной функции.

Доступ
публичный
Издатель
EUR-Lex
Дата
ДОКУМЕНТАЦИЯ-06

Guidelines on transparency obligations under Article 50 of the AI Act

Разъяснения Европейской комиссии о прозрачности AI-систем и AI-контента по статье 50 AI Act.

Доступ
публичный
Издатель
European Commission
Дата
ДОКУМЕНТАЦИЯ-07

Guidance on vehicle data, accompanying the Data Act

Разъяснения о применении главы II Data Act к данным транспортных средств; применимы именно к автомобильному сектору.

Доступ
публичный
Издатель
European Commission
Дата