Откуда у модели характер
Claude отвечает на «вы», отказывается от некоторых просьб, любит структурировать текст списками и извиняется за ошибки. Откуда всё это берётся, если внутри — только предсказание следующего слова? Этот урок про этапы обучения, на каждом из которых модель получает часть своего поведения. Понимание этой кухни объясняет, почему модель не всегда слушается, почему у неё нет «настоящего мнения» и почему её нельзя починить как программу.
Этап первый: предобучение
Всё начинается с предобучения (pretraining). Модель получает очень большой массив текстов — книги, статьи, код, форумы, документацию — и учится одной задаче: по началу текста предсказывать его продолжение. Ни диалогов, ни правил вежливости, ни понятия «пользователь» на этом этапе нет. Есть только текст и его вероятное продолжение.
Результат этого этапа называют базовой моделью. Она уже знает язык, факты и стили, но ведёт себя не как собеседник, а как «автозаполнение». Спросите базовую модель «Как оценить сроки проекта?» — и она с равной вероятностью может ответить, продолжить список похожих вопросов или дописать «Ответов: 3» как на форуме. Она продолжает текст в том жанре, в котором он начат.
Именно предобучение даёт модели знания: всё, что она «знает» о Python, о методологиях разработки, о русской грамматике, пришло отсюда. Отсюда же — дата среза знаний, о которой пойдёт речь в модуле про знания.
Этап второй: дообучение на инструкциях
Чтобы базовая модель стала помощником, её дообучают на примерах диалогов: вот запрос, вот хороший ответ. Этот этап называют дообучением на инструкциях (instruction tuning) или обучением с учителем. Примеры пишут люди или отбирают из существующих текстов, и модель усваивает сам формат: на вопрос следует ответ, на просьбу — выполнение, на непонятную задачу — уточнение.
На этом этапе у модели появляется «роль ассистента»: она перестаёт дописывать форумные треды и начинает отвечать. Здесь же закладываются привычки к структуре — заголовки, списки, шаги, — потому что такие ответы были в обучающих примерах.
Этап третий: обратная связь от людей
Дальше поведение шлифуют обратной связью. Модель генерирует несколько вариантов ответа, люди оценивают, какой лучше, и модель учат чаще выдавать варианты, похожие на предпочтённые. Общее название этого подхода — обучение с подкреплением на основе обратной связи от людей (RLHF, reinforcement learning from human feedback).
Именно здесь появляются вежливость, готовность помочь, аккуратные формулировки. И здесь же появляется побочный эффект, который будет важен в модуле про управляемость: люди чаще предпочитают ответы, которые с ними соглашаются и звучат уверенно. Если этого не контролировать, модель учится угождать. Anthropic отдельно исследует этот эффект — его называют угодливостью (sycophancy) — и борется с ним при обучении, но полностью он не исчезает.
Этап четвёртый: принципы вместо примеров
Оценивать каждый ответ руками — дорого и непоследовательно: разные люди по-разному понимают «хороший ответ». Anthropic использует подход, который называет конституционным ИИ (Constitutional AI): вместо того чтобы люди оценивали каждый ответ, формулируется набор письменных принципов, и модель учится сама сверять свои ответы с этими принципами, критиковать их и переписывать. Люди при этом остаются: они пишут принципы и проверяют результат.
Anthropic публикует документ с принципами, которыми руководствуется Claude, — его называют конституцией. Оттуда идут такие свойства, как честность о границах своих знаний, отказ от вредных действий и стремление быть полезным без лести. Актуальную версию и объяснения стоит читать на сайте anthropic.com, а не пересказывать по памяти: документ меняется.
Важно понимать, что принципы — это не правила в коде. Модель не проверяет каждый ответ по списку «если запрос содержит X, то отказать». Она обучена так, что ответы, согласующиеся с принципами, стали более вероятными. Поэтому одинаковые запросы в разной формулировке могут вести к разным результатам, и поэтому «джейлбрейки» вообще возможны: они не ломают правило, а находят контекст, в котором вероятности сдвигаются.
Последний слой: системные инструкции продукта
Всё перечисленное зашито в веса модели и одинаково для всех, кто ей пользуется. Но поверх есть ещё один слой, который меняется без переобучения: системные инструкции. Продукт — чат, Claude Code, ваше приложение на API — отправляет модели текст с указаниями: кто она, как отвечать, какие инструменты доступны, какое сегодня число. Anthropic публикует системные инструкции своих приложений в документации, и их полезно хоть раз прочитать: многое из того, что кажется «характером Claude», на самом деле написано там.
В вашей работе это самый доступный уровень влияния. Когда аналитик создаёт в Claude проект с инструкцией «отвечай кратко, ссылайся на разделы ТЗ, не выдумывай сроки», он добавляет слой поверх обучения. Инструкция не переписывает характер, а сдвигает вероятности, и модуль про управляемость покажет, где у этого сдвига пределы.
Что из этого следует
Поведение статистическое. Модель не «решила» быть вежливой — вежливые ответы стали более вероятными. Значит, любое её свойство проявляется чаще или реже, а не всегда или никогда. Тестировщик, который получил от модели десять хороших тест-кейсов, не может быть уверен, что одиннадцатый будет таким же. Проверка нужна всегда.
У модели нет «настоящего мнения». Когда вы просите её оценить идею, она выдаёт текст, который в обучении считался хорошей оценкой идеи. Спросите иначе — получите другую оценку. Это не лицемерие, а отсутствие субъекта, который мог бы лицемерить.
Ошибки исправляют не патчем, а обучением или контекстом. Если модель систематически делает что-то не так, у вас два рычага: изменить то, что она получает на вход (инструкции, примеры, данные), или ждать следующей версии модели. Третьего нет.
Разные модели — разный характер. Модели разных компаний проходят похожие этапы, но с разными данными, людьми и принципами. Поэтому один и тот же промпт в разных продуктах даёт разные результаты, и опыт с одной моделью переносится на другую лишь частично.
Попробуйте сами
10–15 мин на рабочем месте- Найдите в документации Anthropic опубликованные системные инструкции для приложения Claude и прочитайте их. Отметьте три правила, которые вы раньше считали «характером модели».
- Спросите Claude: «Какие принципы ты стараешься соблюдать в ответах и откуда они у тебя?» Сравните ответ с тем, что вы узнали из урока. Обратите внимание, где модель говорит уверенно, а где оговаривается, что не знает деталей своего обучения.
- Задайте один и тот же вопрос («Стоит ли переписывать legacy-модуль перед релизом?») дважды в новых чатах: один раз нейтрально, другой — со словами «я уверен, что стоит». Сравните, насколько изменилась позиция модели.
Коротко
- Предобучение даёт знания и язык, но не поведение собеседника: базовая модель просто продолжает текст.
- Дообучение на примерах диалогов превращает её в ассистента и задаёт формат ответов.
- Обратная связь от людей добавляет вежливость и полезность, а побочно — склонность угождать.
- Конституционный ИИ заменяет часть ручной оценки письменными принципами; Anthropic публикует их.
- Системные инструкции продукта — последний слой, и он доступен вам для изменения.
- Поведение модели статистическое: свойства проявляются чаще или реже, а не всегда или никогда.
Видеоверсия
Сценарий озвучки · 518 слов, ≈ 4 мин
Claude обращается на «вы», отказывается от некоторых просьб, любит списки и извиняется за ошибки. Откуда это берётся, если внутри — только предсказание следующего слова? Никто не писал ей правил вежливости. Её этому обучили, в несколько этапов, и на каждом этапе она получила часть своего поведения.
Первый этап — предобучение. Модели дают огромный массив текстов: книги, статьи, код, форумы. И учат одной задаче: по началу текста угадывать продолжение. Никаких диалогов, никакого понятия «пользователь». Получается базовая модель. Она уже знает язык и факты, но ведёт себя как автозаполнение. Спросите её, как оценить сроки проекта, — и она может ответить, а может продолжить список похожих вопросов, как на форуме. Она просто продолжает текст в том жанре, в котором он начат. Зато все знания модели — о языках программирования, о методологиях, о грамматике — приходят именно отсюда.
Второй этап — дообучение на инструкциях. Модели показывают примеры: вот запрос, вот хороший ответ. Она усваивает формат: на вопрос отвечают, просьбу выполняют, непонятную задачу уточняют. Здесь появляется роль ассистента. Здесь же — привычка к заголовкам и спискам, потому что так выглядели примеры.
Третий этап — обратная связь от людей. Модель выдаёт несколько вариантов ответа, люди выбирают лучший, и модель учат чаще выдавать похожие. Отсюда вежливость и готовность помочь. Но отсюда же побочный эффект: люди чаще выбирают ответы, которые с ними соглашаются и звучат уверенно. Если это не контролировать, модель учится угождать. Anthropic называет это угодливостью и специально борется с ней, но полностью эффект не исчезает. Мы вернёмся к нему в модуле про управляемость.
Четвёртый этап — принципы. Оценивать каждый ответ руками дорого, и разные люди понимают «хороший ответ» по-разному. Поэтому Anthropic формулирует письменные принципы, и модель учится сама сверять с ними свои ответы, критиковать их и переписывать. Этот подход называют конституционным ИИ, а документ с принципами — конституцией Claude. Он опубликован на сайте Anthropic, и он меняется, так что читать стоит оригинал. Главное, что нужно понять: принципы — это не правила в коде. Модель не проверяет запрос по списку. Она обучена так, что ответы в духе принципов стали более вероятными. Поэтому один и тот же вопрос в разной формулировке может дать разный результат.
И последний слой — системные инструкции продукта. Всё предыдущее зашито в модель и одинаково для всех. А системные инструкции — это текст, который приложение отправляет модели перед разговором: кто она, как отвечать, какие инструменты доступны, какое сегодня число. Anthropic публикует инструкции своих приложений, и многое из того, что кажется характером Claude, на самом деле написано там. Для вас это самый доступный рычаг: инструкция в проекте — это ещё один слой поверх обучения.
Что из всего этого следует? Во-первых, поведение модели статистическое. Она не решила быть вежливой — вежливые ответы стали вероятнее. Значит, любое свойство проявляется чаще или реже, а не всегда. Десять хороших тест-кейсов не гарантируют одиннадцатый. Во-вторых, у модели нет настоящего мнения. Спросите иначе — получите другую оценку, и это не лицемерие, а отсутствие того, кто мог бы лицемерить. В-третьих, ошибки исправляются не патчем. У вас два рычага: изменить то, что модель получает на вход, или дождаться новой версии. И в-четвёртых, у разных моделей разный характер, потому что данные, люди и принципы у всех свои.
В следующем модуле разберём самый первый этап подробнее: как именно модель предсказывает следующий токен и что из этого следует для вашей работы.
