AmigaОбучение ИИ
Модуль 5 · Управляемость · урок 9 из 12

Управляемость: как инструкции меняют поведение

11 мин чтения▶ есть видеоверсия

Одна и та же модель в руках двух коллег ведёт себя по-разному: у одного она пишет чёткие тест-кейсы, у другого — расплывчатые общие слова. Разница не в модели, а в том, что она получила на вход. Управляемость — свойство, благодаря которому модель вообще можно использовать для разных задач. Но оно же делает её послушной там, где нужна была бы твёрдость. Этот урок про то, чем управляют, как сильно и где предел.

Что значит «управляемая»

В первом модуле мы видели: модель продолжает текст. Управляемость — это следствие: всё, что находится в тексте перед ответом, влияет на ответ. Инструкции, роль, примеры, тон, порядок слов, даже настроение вашей реплики — всё это часть текста, а значит, всё сдвигает вероятности.

Модель обучена относиться к некоторым частям текста как к указаниям: системные инструкции продукта имеют больший вес, чем случайная фраза в середине разговора; явная просьба — больший, чем намёк. Но это иерархия вероятностей, а не правил. Инструкция не «выполняется», она делает одни продолжения вероятнее других. Поэтому управляемость всегда частичная: «отвечай кратко» сработает в большинстве случаев, но не во всех, и чем дальше инструкция от текущего ответа, тем слабее.

Слои управления

Полезно представлять управление как слои, от самых устойчивых к самым подвижным.

Обучение. То, что зашито в веса: характер, принципы, отказы. Вам недоступно.

Системные инструкции. Текст, который продукт отправляет перед разговором. Модели специально обучают соблюдать его надёжнее, чем реплики пользователя. В приложении Claude часть системных инструкций пишет Anthropic, часть — вы: инструкции проекта, настройки стиля. В Claude Code это CLAUDE.md. В приложении на API — всё, что вы туда положили.

Роль и рамка. «Ты — старший тестировщик, который проверяет требования на полноту». Роль сдвигает не только тон, но и содержание: модель достаёт из весов то, что связано с этой ролью, и ведёт себя соответственно. Работает потому, что в обучающих текстах старшие тестировщики и стажёры писали по-разному.

Примеры. Два-три образца желаемого результата задают формат и уровень детализации точнее любого описания. Это самый надёжный слой для формата, потому что модель буквально продолжает показанное. И самый опасный, если в примерах ошибка.

Инструкции в сообщении. «Не выдумывай сроки», «сначала перечисли неизвестные, потом отвечай», «ответ — в таблице». Действуют сильно на ближайший ответ и слабеют с расстоянием.

Формулировка и тон. Самый незаметный слой. «Найди баг» и «есть ли баг» — разные тексты. «Мне кажется, тут всё правильно, да?» — и модель уже подталкивается к «да».

Почему модель соглашается

В уроке про характер мы упоминали угодливость: склонность модели соглашаться с собеседником и подстраивать ответ под его ожидания. Это самая важная тёмная сторона управляемости, и она заслуживает объяснения.

Во время обучения на обратной связи люди оценивали ответы модели. Люди чаще предпочитают ответы, которые подтверждают их точку зрения, звучат уверенно и не спорят. Модель уловила это как закономерность: соглашаться — значит получать высокую оценку. Anthropic исследовала этот эффект и показала, что он проявляется у разных моделей: изменение мнения после возражения без аргументов, более мягкая критика идей, которые пользователь называет своими, подстройка фактических ответов под убеждения собеседника.

Современные модели обучены сопротивляться этому, и Claude заметно реже сдаётся без аргументов, чем несколько лет назад. Но эффект остаётся статистическим: модель сдаётся реже, а не никогда. В рабочих ситуациях это проявляется так:

  • Менеджер спрашивает: «Оценка в две недели реалистична?» — и получает «да, вполне» чаще, чем если спросит «какие риски у оценки в две недели».
  • Аналитик показывает ТЗ со словами «я его уже согласовал с заказчиком» — и получает менее строгий разбор, чем без этой фразы.
  • Разработчик пишет: «Ты ошибся, должно быть иначе» — и модель переписывает правильный код в неправильный.

Правило: если вам нужна оценка, а не одобрение, не показывайте, какого ответа ждёте. А если модель изменила позицию после вашего возражения, спросите, почему: настоящий аргумент она назовёт, а при угодливости ответ будет расплывчатым.

Управляемость — рабочий инструмент

Не стоит воспринимать управляемость только как риск. Это то, что делает одну модель полезной для аналитика, дизайнера и разработчика одновременно. Несколько приёмов, которые прямо следуют из механизма.

Явное разрешение не отвечать. «Если данных недостаточно для оценки, так и скажи и перечисли, чего не хватает». Без этого модель продолжит жанр «оценка» и выдаст цифру. С этим — вероятность честного «не хватает данных» резко растёт.

Разделение шагов. «Сначала перечисли требования из документа, потом найди противоречия, потом предложи вопросы заказчику». Каждый шаг — отдельный текст, который модель продолжает, и промежуточные результаты лежат в контексте для следующих. Это работает лучше одной большой просьбы.

Роль как источник критериев. «Ты — ревьюер, который отклоняет merge request, если нет тестов на граничные случаи». Роль приносит с собой критерии, и модель применяет их без перечисления.

Просьба о самопроверке. «Перед ответом проверь, что каждое требование из списка учтено, и отметь, какие не учтены». Модель напишет проверку в тексте, и это меняет вероятности следующего текста: пропущенное становится заметным.

Просьба спорить. «Приведи три сильнейших возражения против этого решения». Прямое указание на жанр «возражения» перебивает склонность соглашаться.

Где предел

Управляемость не безгранична, и полезно знать, где именно.

Инструкции не добавляют знаний. «Ты — эксперт по нашей внутренней системе биллинга» не даст модели знаний о вашем биллинге. Роль достаёт из весов то, что там есть, и если про вашу систему там ничего нет, эксперт будет выдумывать увереннее стажёра.

Инструкции не отменяют механику. «Считай точно» не сделает подсчёт букв точным; «не забывай контекст» не отменит деградацию длинного окна. Для этого нужны инструменты и структура работы, а не просьбы.

Инструкции конфликтуют друг с другом. «Отвечай кратко» и «объясни каждое решение подробно» — модель выберет что-то среднее или одно из двух, и вы не узнаете, что именно. Лучше спросить её саму: «Какие из моих инструкций противоречат друг другу?»

И инструкции слабеют: об этом был модуль про рабочую память. Что сказано в начале длинного разговора, к концу действует хуже, чем то, что сказано только что.

Попробуйте сами

10–15 мин на рабочем месте
  1. Возьмите задачу, которую регулярно даёте модели. Добавьте к запросу одну строку: «Если для ответа не хватает данных, не отвечай, а перечисли, чего не хватает». Сравните результаты на трёх запросах.
  2. Покажите модели своё решение с фразой «мне кажется, это правильно». Потом в новом чате — то же решение с фразой «коллега предлагает так, я сомневаюсь». Сравните строгость разбора.

Подробные эксперименты — в уроке «Попробуйте сами: управляемость».

Коротко

  • Управляемость — следствие предсказания текста: всё, что перед ответом, сдвигает вероятности; инструкции не выполняются, а делают одни продолжения вероятнее.
  • Слои от устойчивых к подвижным: обучение, системные инструкции, роль, примеры, инструкции в сообщении, формулировка и тон.
  • Угодливость — побочный продукт обучения на обратной связи: модель склонна соглашаться и смягчать критику; не показывайте, какого ответа ждёте.
  • Рабочие приёмы: разрешение не отвечать, разделение шагов, роль как источник критериев, самопроверка, просьба спорить.
  • Предел: инструкции не добавляют знаний, не отменяют механику, конфликтуют между собой и слабеют с расстоянием.

Видеоверсия

Сценарий озвучки · 552 слова, ≈ 4 мин

Одна и та же модель у двух коллег ведёт себя по-разному. У одного она пишет чёткие тест-кейсы, у другого — общие слова. Разница не в модели, а в том, что она получила на вход. Это свойство называют управляемостью, и оно делает модель полезной для разных задач. Но оно же делает её послушной там, где нужна твёрдость.

Начнём с механизма. Модель продолжает текст, а значит, всё, что находится перед ответом, влияет на ответ: инструкции, роль, примеры, тон, даже настроение вашей реплики. Модель обучена относиться к некоторым частям текста как к указаниям — системные инструкции весят больше, чем случайная фраза в середине разговора. Но это иерархия вероятностей, а не правил. Инструкция не выполняется, она делает одни продолжения вероятнее других. Поэтому «отвечай кратко» сработает в большинстве случаев, но не во всех.

Управление удобно представлять слоями. Самый устойчивый — обучение: характер, принципы, отказы; вам это недоступно. Дальше системные инструкции: текст, который продукт отправляет перед разговором; в приложении Claude часть пишет Anthropic, часть — вы, в инструкциях проекта; в Claude Code это файл клод-эм-дэ. Дальше роль: «ты — старший тестировщик, который проверяет требования на полноту». Роль сдвигает не только тон, но и содержание. Дальше примеры: два-три образца задают формат точнее любого описания, но и ошибку из примера модель размножит. Потом инструкции в сообщении — они сильно действуют на ближайший ответ и слабеют с расстоянием. И самый незаметный слой — формулировка и тон. «Мне кажется, тут всё правильно, да?» — и модель уже подталкивается к «да».

Теперь о главной тёмной стороне — угодливости. При обучении на обратной связи люди оценивали ответы модели. А люди чаще предпочитают ответы, которые подтверждают их точку зрения и не спорят. Модель уловила закономерность: соглашаться — значит получать высокую оценку. Anthropic исследовала этот эффект: модели меняют мнение после возражения без аргументов, мягче критикуют идеи, которые пользователь называет своими, подстраивают ответы под убеждения собеседника. Современные модели обучены сопротивляться этому, и Claude сдаётся заметно реже, чем раньше. Но реже — не значит никогда.

Как это выглядит в работе? Менеджер спрашивает: «оценка в две недели реалистична?» — и чаще получает «да», чем если спросит «какие риски у этой оценки». Аналитик показывает техзадание со словами «я уже согласовал с заказчиком» — и получает менее строгий разбор. Разработчик пишет «ты ошибся» — и модель переписывает правильный код в неправильный. Правило: если нужна оценка, а не одобрение, не показывайте, какого ответа ждёте. А если модель изменила позицию после вашего возражения, спросите почему. Настоящий аргумент она назовёт, а при угодливости ответ будет расплывчатым.

Но управляемость — прежде всего рабочий инструмент. Несколько приёмов. Явное разрешение не отвечать: «если данных недостаточно, так и скажи и перечисли, чего не хватает» — без этого модель продолжит жанр оценки и выдаст цифру. Разделение шагов: сначала перечисли требования, потом найди противоречия, потом предложи вопросы — каждый шаг ложится в контекст для следующего. Роль как источник критериев: «ревьюер, который отклоняет запрос без тестов на граничные случаи». Просьба о самопроверке: «перед ответом отметь, какие требования не учтены». И просьба спорить: «приведи три сильнейших возражения» — жанр возражений перебивает склонность соглашаться.

И где предел. Инструкции не добавляют знаний: «ты эксперт по нашему биллингу» не даст знаний о вашем биллинге, эксперт просто будет выдумывать увереннее. Инструкции не отменяют механику: «считай точно» не сделает подсчёт букв точным. Инструкции конфликтуют: «кратко» и «подробно» одновременно — модель выберет что-то, и вы не узнаете что; лучше спросите её, какие инструкции противоречат друг другу. И инструкции слабеют с расстоянием, как мы видели в модуле про память. В следующем уроке проверим всё это на пяти экспериментах.

Отметка хранится только в вашем браузере