Вчера мой AI написал восемнадцать сценариев. В них были крючки, структура, факты и даже сарказм по расписанию. Сегодня я отправила всё в мусор. Агент выполнил задание. Задание оказалось недостаточным.

Коротко: За 30 минут можно собрать прототип агента и получить первую выдачу. Рабочий агент появляется позже: когда вокруг модели есть карта бизнеса, контекст, инструменты, критерии качества, тестовые задачи, журнал ошибок и человек с правом остановить процесс.
Вчера мой AI написал восемнадцать сценариев для роликов.
Сегодня я отправила их в мусор.
Не потому, что там были ошибки уровня «добрый день, дорогие друзья». Всё выглядело вполне пристойно:
Можно было поставить восемнадцать зелёных галочек и объявить контент-завод запущенным.
Только смотреть не хотелось ни один ролик.
Из сценариев исчезла моя позиция как эксперта. Не было личной истории. Не было нормального конфликта с тем, что сейчас происходит в бизнесе. Тексты не цеплялись за живую боль собственника. Они были правильными, аккуратными и абсолютно заменяемыми.
AI честно выполнил задачу.
Проблема была в том, что мы недостаточно хорошо описали, какой результат считаем хорошим.
Это и есть момент, о котором почти не рассказывают в роликах про «соберите идеального AI-агента за 30 минут».
За 30 минут можно создать персонажа с красивым именем, написать системный промпт и получить эффектную демонстрацию.
Нельзя за 30 минут узнать все способы, которыми этот агент сломается на реальной работе.
За полчаса вполне реально:
Это хороший старт.
Но старт не равен готовой системе.
Рабочий агент должен пережить не одну красивую демонстрацию, а десятки обычных, неудобных и неполных задач. Ему придётся столкнуться с противоречивыми данными, отсутствующей фактурой, новой темой, неудачным примером, изменившимся продуктом и человеком, который сегодня объяснил задачу совсем не так, как вчера.
Официальное руководство OpenAI описывает основу агента как связку модели, инструментов и инструкций. Там же рекомендуют сначала установить базовый уровень качества через evals, учитывать пограничные случаи и добавлять человеческий контроль для рискованных действий. Это уже сильно больше одного промпта.
Anthropic формулирует похожий принцип: начинать с простой конструкции, измерять результат и добавлять сложность только тогда, когда она доказанно улучшает работу.
Иными словами, первая версия агента нужна не для того, чтобы успокоиться.
Она нужна, чтобы начать собирать ошибки.
У текста были формальные признаки сценария. Но агент оптимизировал не то.
Ему сказали:
Он это сделал.
Но крючок можно написать вокруг пустой мысли. Провокацию можно поставить по расписанию. Сарказм можно имитировать. Факт можно вставить так, что он ничего не меняет. Личную манеру речи можно превратить в набор словечек.
Агент не обязан сам догадаться:
Это не «тупость нейросети».
Это нехватка контекста, критериев и обратной связи.
Промпт описывает одно поручение или набор инструкций.
Агент ведёт задачу через несколько шагов, использует контекст и инструменты, проверяет состояние и понимает, когда остановиться.
Harness, или обмотка вокруг модели, удерживает весь этот процесс в рабочих границах.
В эту обмотку входят:
Сама модель может стать умнее после обновления. Но она не получит телепатически карту вашей компании и не узнает, что три недели назад вы отказались от определённого оффера.
Эти знания живут в harness.
OpenAI отдельно отмечает, что выбор harness, инструментов, сохранение состояния и повторные попытки способны заметно менять результат длинных многошаговых задач. То есть оценивать нужно не голую модель, а всю систему, в которой она работает.
Реальный бизнес меняется.
Появляются новые продукты. Меняются цены. Один сегмент перестаёт покупать, другой начинает задавать новые вопросы. Вы находите более точную формулировку своей позиции. Площадка вводит новый лимит. Юрист запрещает обещание, которое вчера казалось нормальным. Команда меняет порядок согласования.
Если агент об этом не знает, он продолжает исправно работать в прошлом.
Есть и вторая причина. Все пограничные случаи невозможно придумать заранее.
Пока контентный агент не написал восемнадцать внешне правильных и мёртвых сценариев, можно было считать, что требования к крючкам, структуре и тону уже достаточны.
Теперь у нас появился новый класс ошибки:
Формально правильный сценарий без авторской позиции, личной истории и связи с реальной проблемой бизнеса.
Эту ошибку мало обсудить в чате. Её нужно превратить в изменение системы:
Вот это и называется развитием агента.
Не «давай напишем промпт подлиннее».
А нормальная инженерная работа с качеством.
Обычно плохую выдачу молча выбрасывают, сердятся и начинают новый чат.
В результате бизнес платит за одну и ту же ошибку много раз.
Полезнее вести журнал провалов. Для каждого провала достаточно зафиксировать пять вещей:
| Что фиксируем | Пример с восемнадцатью сценариями |
|---|---|
| Задача | написать серию коротких роликов |
| Что агент сделал | выполнил структуру, хронометраж и формальные требования |
| Почему результат не годится | нет позиции, истории и связи с проблемой бизнеса |
| Что меняем | входные данные, критерии, проверку и эталоны |
| Как проверяем | повторный прогон на старых и новых темах |
Через несколько недель такой журнал становится ценнее очередной подборки «100 секретных промптов».
В нём лежит реальное знание компании:
Плохой результат перестаёт быть просто мусором. Он становится тестом, который следующая версия должна пройти.
Рабочий цикл выглядит так.
Если переписать восемнадцать сценариев руками и ничего не изменить в системе, завтра агент принесёт ещё восемнадцать таких же.
Сначала нужно найти место поломки:
Не всё нужно запихивать в один гигантский промпт.
Отдельно хранят:
Тогда изменение цены не требует переписывать характер агента, а новая редакционная находка не смешивается с юридическими запретами.
Фраза «напиши интересно» не проверяется.
Для сценарного агента можно задать конкретные вопросы:
Это не математическая гарантия хорошего контента. Но такой чек-лист гораздо полезнее команды «добавь человечности».
Один удачный ответ ничего не доказывает.
Для начала можно взять от 10 до 20 типичных задач:
После каждого изменения прогоняют хотя бы ключевую часть набора.
Иначе можно починить сарказм и случайно потерять факты.
Нужно знать:
Без версий улучшение превращается в гадание. Сегодня стало лучше. Завтра хуже. Почему, никто не помнит.
Особенно там, где результат выходит наружу и влияет на репутацию, деньги, персональные данные или обязательства компании.
Человек не обязан вручную делать всю работу. Но он должен понимать предмет и уметь отличить результат от его убедительной имитации.
В моей истории восемнадцать сценариев спасло именно это.
Система сработала не потому, что AI написал идеальный текст.
Система сработала потому, что мусор не дошёл до съёмки.
После провала стало понятно: агенту мало знать формулу ролика.
Ему нужна связь с системой бизнеса.
Кто мы, что продаём, на чём зарабатываем, какие продукты сейчас приоритетны, чего не обещаем.
Не «предприниматели 25-55», а конкретные люди с разной ситуацией, риском и причиной купить.
Какие идеи мы защищаем. С какими рыночными мифами спорим. Что хотим изменить в голове читателя. Как эта мысль связана с продуктом.
Не набор характерных слов, а способ смотреть на проблему.
Моя позиция в этой истории не «нейросети плохо пишут сценарии». Они написали ровно то, что им позволила система.
Позиция другая:
AI не отменяет мышление специалиста. Он быстро и безжалостно показывает, какую часть своей экспертизы специалист не сумел превратить в правила.
Конкретный эпизод: восемнадцать сценариев, один день между генерацией и решением, формально правильные элементы, отказ публиковать результат.
Если личной фактуры нет, агент не должен её сочинять. Он должен остановиться и запросить материал.
Плохой сценарий означает не только слабые просмотры.
Это время на согласование, съёмку и монтаж. Это расход внимания аудитории. Это ещё один материал, после которого человек не понял, чем эксперт отличается от сотни других. Это работа команды, которая не приблизила продажу.
Когда агент видит только текст, он оптимизирует текст.
Когда он видит процесс, он начинает беречь ресурсы бизнеса.
Имя помогает различать роли. Характер помогает держать тон.
Ни то ни другое не заменяет задачу, контекст, инструменты и критерии результата.
Длинная инструкция может быть точной. А может быть свалкой противоречий.
Если правило нельзя проверить, оно часто остаётся пожеланием.
Более сильная модель способна улучшить рассуждение и работу с инструментами.
Но она не придумает за собственника сегменты, позиционирование и границы полномочий. Если вход кривой, более быстрая модель быстрее добежит не туда.
Каждая новая роль добавляет передачу контекста, инструменты, стоимость, задержку и ещё одно место для ошибки.
Сначала нужно выжать максимум из одной понятной роли. Делить систему стоит тогда, когда у частей есть разные задачи и отдельные критерии качества.
Он может работать всё самостоятельнее внутри стабильного процесса.
Но меняются бизнес, рынок, данные, правила площадок и сами модели. Поэтому наблюдение, тесты и обновление harness никуда не исчезают.
Не когда он один раз впечатлил владельца.
И не когда его ответ приятно показать в ролике.
Агент готов к рабочему использованию, если:
Последний пункт особенно важен.
Если собственник тратит два часа на исправление каждой «автоматически созданной» страницы, возможно, у него не агент. Возможно, у него очень дорогой генератор черновиков с хорошей легендой.
Идеального агента за 30 минут не существует.
За 30 минут существует первая версия. Иногда очень полезная.
Дальше начинается настоящая работа:
Мои восемнадцать сценариев отправились в мусор не потому, что AI бесполезен.
Наоборот.
Он за несколько минут показал, какие части моей экспертизы ещё не были нормально описаны для системы.
Хороший специалист после такого не увольняет нейросеть и не просит её «постараться ещё раз».
Он идёт усиливать обмотку.
Модель, инструменты, инструкции, evals, пограничные случаи, guardrails и человеческий контроль.
Влияние harness, инструментов, состояния и бюджета на наблюдаемую способность агентной системы.
Простая архитектура, измерение результата, итерации и усложнение только при доказанной пользе.
Задачи, прогоны, оценщики, траектории, результаты, regression suites и сочетание автоматических и человеческих проверок.
За 30 минут можно собрать прототип под одну узкую задачу, описать роль, подключить базовый контекст и получить первую выдачу. Рабочая система требует испытаний на реальных задачах, критериев качества, обработки ошибок, ограничений и контроля.
Первая демонстрация обычно проходит на удобном примере. В работе появляются неполные данные, исключения, новые продукты и противоречия. Без набора тестов, версий и журнала ошибок трудно понять, что именно ухудшилось.
Промпт входит в harness. Кроме него нужны контекст, инструменты, состояние, ограничения, проверки, правила остановки и маршрут согласования. Надёжность создаёт вся система, а не одна формулировка.
Не всегда. Часто сначала достаточно привести в порядок базу знаний, инструкции, поиск по контексту, инструменты и тесты. Решение о дополнительном обучении принимают после того, как понятна задача и измерено качество базовой системы.
Проверять его на одном и том же наборе типичных и проблемных задач. Сравнивать не только финальный текст, но и факты, вызовы инструментов, соблюдение ограничений, стоимость, скорость и количество вмешательств человека.
Уровень контроля зависит от риска. Черновик внутренней заметки можно проверять выборочно. Публикации, платежи, цены, персональные данные, юридические формулировки и изменения production требуют отдельного шлюза и ответственного человека.
После новых классов ошибок, изменений продукта, процесса, данных, правил площадки или модели. Полезно также регулярно прогонять контрольный набор задач, чтобы видеть регрессии до того, как их заметит клиент.
Три часа практики для собственников. Покажем, что можно собрать быстро, где заканчивается прототип и как не превратить автоматизацию в новый слой хаоса.
Посмотреть программу СХОДа →