AmigaОбучение ИИ
Модуль 2 · Что такое генеративный ИИ · урок 4 из 13

Как устроен генеративный ИИ

10 мин чтения▶ есть видеоверсия

Не нужно знать математику нейросетей, чтобы хорошо работать с ИИ. Но несколько фактов об устройстве языковых моделей объясняют почти все их странности — а значит, помогают предсказать, где модель подведёт. Этот урок про эти факты, без формул.

Модель предсказывает продолжение текста

Большая языковая модель (LLM, large language model) — это программа, которая по началу текста предсказывает, каким будет следующий фрагмент. Фрагменты называют токенами: это примерно слова или части слов. Модель предсказывает один токен, добавляет его к тексту, предсказывает следующий — и так, пока не решит, что ответ закончен.

Из этого следует важная вещь: у модели нет отдельного «знания» и отдельного «текста». Всё, что она умеет, — продолжать текст правдоподобно. Когда вы спрашиваете «какой срок у гарантии на этот товар», а данных о товаре у неё нет, она не ищет ответ в базе — она продолжает текст так, как обычно продолжаются такие фразы. Получается «два года», потому что так часто пишут. Это и есть галлюцинация: не сбой, а нормальная работа механизма в ситуации, где правильного ответа в тексте не было.

Отсюда первое практическое правило: если ответ должен опираться на факты, факты должны быть в запросе или доступны модели через инструменты. Модель не «знает» ваш проект — она видит только то, что вы ей показали.

Откуда берутся способности

Модель обучают в два этапа.

Предобучение. Модели показывают огромный объём текста — книги, статьи, код, форумы — и учат предсказывать следующий токен. На этом этапе она усваивает язык, факты, которые часто встречались в текстах, стили, структуры документов. Внутри это выражается в параметрах — миллиардах чисел, которые определяют, как модель связывает слова между собой. Ничего похожего на базу данных внутри нет: факт из предобучения — это статистическая привычка, а не запись.

Дообучение. После предобучения модель учат быть ассистентом: следовать инструкциям, отвечать полезно, отказываться от вредных запросов. На этом же этапе появляется привычка отвечать уверенно и вежливо — та самая, из-за которой галлюцинация выглядит убедительно, а замечание пользователя часто вызывает мгновенное «вы правы» даже там, где пользователь неправ.

У предобучения есть дата отсечения: модель ничего не знает о событиях после неё, если не получила информацию в запросе или через поиск. Уточнять дату для конкретной модели лучше в документации, чем в чате — модель может ошибаться и на этот счёт.

Контекстное окно: всё, что модель видит

Контекстное окно — это объём текста, который модель может учитывать одновременно: ваш запрос, вся история разговора, прикреплённые документы и её собственные предыдущие ответы. Оно ограничено, и лимит зависит от модели. Точные цифры — в документации, они меняются.

Две вещи, которые из этого следуют.

Во-первых, модель ничего не помнит между разговорами, если только у продукта нет отдельной функции памяти. Новый чат — чистый лист. Если в прошлый раз вы полчаса объясняли контекст проекта, в новом разговоре его нет. Поэтому контекст стоит хранить в файле и вставлять, а не рассказывать заново.

Во-вторых, в длинном разговоре модель может хуже удерживать детали из его начала: окно большое, но внимание модели распределяется неравномерно. Если вы на сороковом сообщении замечаете, что модель «забыла» правило из первого, — это не каприз, а свойство. Лучше начать новый разговор с коротким резюме того, что важно.

Почему ответы разные

Задайте модели один и тот же вопрос дважды — ответы будут отличаться. При выборе следующего токена модель не всегда берёт самый вероятный: в неё встроена управляемая случайность, которую в API называют температурой. Высокая температура даёт разнообразие, низкая — предсказуемость.

Для работы это значит: если результат вас не устроил, иногда достаточно попросить ещё раз. А если результат критичен — например, модель классифицирует обращения клиентов, — нельзя рассчитывать, что на одинаковый вход она всегда даст одинаковый ответ. Нужна проверка или настройка через API.

Инструменты: модель с руками

Сама по себе модель только читает и пишет текст. Всё остальное — поиск в интернете, выполнение кода, чтение файлов, доступ к трекеру — это инструменты, которые ей подключают. Когда ассистент «сходил в интернет», это значит, что модель попросила систему выполнить поиск, получила текст результатов в контекст и продолжила отвечать с их учётом.

Для вас это важно по двум причинам. Понимание того, какие инструменты подключены, — это и есть осознание платформы из модели 4D. Модель без поиска не знает вчерашних новостей; модель без доступа к репозиторию рассуждает о вашем коде вслепую. И наоборот: с инструментами модель становится агентом, который совершает действия, а действия нужно контролировать. Как именно инструменты подключаются, разбирается в курсе про MCP; в уроке «Что такое MCP и зачем он нужен» есть понятная картинка.

Рассуждающие модели

Отдельный класс — модели, которые перед ответом «думают»: генерируют промежуточные рассуждения и только потом итоговый текст. Для задач с логикой, многошаговыми вычислениями и планированием они заметно точнее. Для простых задач — переписать абзац, перевести — разница невелика, а времени уходит больше.

Практический вывод: сложные задачи стоит отдавать моделям с режимом рассуждения или явно просить модель сначала разобрать задачу по шагам. Об этом — в уроке про приёмы промптов.

Что из этого следует для работы

Соберём выводы в одном месте.

  • Модель продолжает текст, а не ищет истину. Факты — в запрос.
  • Уверенный тон ничего не говорит о точности.
  • Каждый разговор начинается с нуля; контекст стоит хранить в файле.
  • Длинный разговор размывает детали; начинайте заново с резюме.
  • Одинаковый вопрос — разные ответы; критичные вещи проверяйте.
  • Возможности зависят от подключённых инструментов, а не только от модели.

Попробуйте сами

10–15 мин на рабочем месте
  1. Спросите ассистента о чём-то, что он знать не может: о внутреннем процессе в вашей команде, о деталях вашего проекта, о событии на прошлой неделе. Посмотрите, как он отвечает: честно скажет, что не знает, или сгенерирует правдоподобный ответ? Затем задайте тот же вопрос, добавив «если у тебя нет этой информации, так и скажи», и сравните.
  2. Задайте один и тот же содержательный вопрос дважды в двух новых чатах — например, «предложи структуру ТЗ для мобильного приложения доставки». Отметьте, чем отличаются ответы. Это тренировка на то, чтобы не считать первый ответ единственно возможным.
  3. Заведите файл с контекстом одного своего проекта (5–10 строк: кто клиент, что делаем, на каком этапе, какие ограничения). В следующий раз начните разговор с этого файла и посмотрите, насколько лучше стал первый ответ.

Коротко

  • Языковая модель предсказывает следующий фрагмент текста; галлюцинация — нормальная работа этого механизма без нужных данных.
  • Предобучение даёт язык и «привычные» факты, дообучение — манеру ассистента, включая уверенный тон.
  • Контекстное окно ограничено; между разговорами модель ничего не помнит.
  • Ответы недетерминированы: один вопрос — разные ответы.
  • Поиск, код, файлы, трекер — это инструменты, а не свойство модели; от них зависит, что она может.
  • Рассуждающие модели точнее на сложных задачах и избыточны на простых.

Видеоверсия

Сценарий озвучки · 469 слов, ≈ 4 мин

Чтобы хорошо работать с ИИ, не нужно понимать математику нейросетей. Но несколько фактов об устройстве языковых моделей объясняют почти все их странности. Зная их, вы будете предсказывать, где модель подведёт, ещё до того, как она подвела.

Факт первый. Языковая модель — это программа, которая по началу текста предсказывает следующий фрагмент. Фрагменты называют токенами, это примерно слова или части слов. Модель предсказывает токен, добавляет его к тексту, предсказывает следующий — и так до конца ответа. У модели нет отдельного знания и отдельного текста. Всё, что она умеет, — продолжать текст правдоподобно. Спросите её про срок гарантии на товар, о котором она ничего не знает, и она напишет «два года», потому что так часто пишут. Это и есть галлюцинация. Не сбой, а нормальная работа механизма там, где правильного ответа не было. Отсюда правило: если ответ должен опираться на факты, факты должны быть в запросе.

Факт второй. Модель обучают в два этапа. Сначала ей показывают огромный объём текста и учат предсказывать продолжение. Так она усваивает язык, стили и факты, которые часто встречались. Потом её дообучают быть ассистентом: следовать инструкциям, отвечать полезно и вежливо. На этом этапе появляется привычка отвечать уверенно, из-за которой галлюцинация выглядит убедительно. И привычка соглашаться: скажите модели «ты неправа», и она нередко ответит «вы правы», даже если права была она.

Факт третий. У модели есть контекстное окно — объём текста, который она видит одновременно: ваш запрос, история разговора, прикреплённые документы. Оно большое, но ограничено. Из этого следуют две вещи. Между разговорами модель ничего не помнит, новый чат — чистый лист. Поэтому контекст проекта лучше хранить в файле и вставлять, а не объяснять заново. И второе: в очень длинном разговоре модель хуже удерживает детали из его начала. Если на сороковом сообщении она забыла правило из первого — это свойство, а не каприз. Начните новый разговор с коротким резюме.

Факт четвёртый. Задайте один вопрос дважды — получите два разных ответа. В модель встроена управляемая случайность. Для работы это значит: если результат не устроил, иногда достаточно попросить ещё раз. А если результат критичен, нельзя рассчитывать, что одинаковый вход всегда даст одинаковый выход.

Факт пятый. Сама модель только читает и пишет текст. Поиск в интернете, запуск кода, чтение файлов, доступ к трекеру — это инструменты, которые ей подключают. Модель без поиска не знает вчерашних новостей. Модель без репозитория рассуждает о вашем коде вслепую. Понимать, что подключено, — это и есть осознание платформы, о котором мы говорили в прошлом уроке.

И последнее. Есть модели, которые перед ответом рассуждают: сначала разбирают задачу по шагам, потом отвечают. На сложных задачах они заметно точнее. На простых — переписать абзац, перевести — разница невелика, а времени уходит больше.

Соберём вместе. Модель продолжает текст, а не ищет истину. Уверенный тон ничего не говорит о точности. Каждый разговор начинается с нуля. Одинаковый вопрос даёт разные ответы. А возможности зависят от инструментов, а не только от модели. В следующем уроке разберём, что из этого следует: что модели удаётся хорошо, а что — плохо.

Отметка хранится только в вашем браузере