Большой разбор
Что такое LLM и как она работает: простое объяснение без магии
LLM не хранит готовый ответ и не думает как человек. Она получает текст, разбивает его на токены и шаг за шагом продолжает последовательность. Разберём, откуда при таком простом принципе берутся диалог, код и пересказ документов, зачем модели контекст и инструменты и почему уверенный ответ всё равно может оказаться неверным.
Ответ появляется по кусочкам
Представим обычную задачу: есть расшифровка встречи, а из неё нужен короткий список решений. В окне чата всё выглядит просто — вставили текст, написали просьбу, получили аккуратные пункты.
Внутри не лежит готовый конспект и не запускается поиск по тайной энциклопедии. Модель получает вашу инструкцию вместе с расшифровкой и начинает продолжать эту последовательность: выбирает следующий небольшой фрагмент текста, затем ещё один и ещё. Каждый выбор зависит от того, что уже находится в доступном контексте.
Так работает LLM — Large Language Model, или большая языковая модель. Базовый механизм похож на очень развитое автодополнение, но обучающие данные, масштаб вычислений и устройство нейросети позволяют ему поддерживать диалог, менять стиль, разбирать код и собирать связный ответ из большого документа.
Что означает название LLM
В аббревиатуре важны все три слова.
- Large — большая. Речь не только о числе параметров. Масштаб складывается из архитектуры, обучающих данных, вычислений и последующей настройки. Большее число параметров само по себе не гарантирует лучший результат на конкретной задаче.
- Language — языковая. Основной материал для такой модели — последовательности текста: обычный язык, программный код, формулы и разметка. В мультимодальной системе к ним могут добавляться изображения, звук и видео, но способ их обработки зависит от архитектуры продукта.
- Model — модель. Это математическая функция с обученными весами. Она преобразует входную последовательность в распределение вероятностей для возможного продолжения.
Слово «языковая» не означает, что модель умеет только писать статьи. Таблица в текстовом виде, программный код и структура JSON тоже состоят из последовательностей. Поэтому один базовый механизм подходит для перевода, классификации, извлечения полей, редактуры и генерации кода.
ChatGPT, Claude и Gemini — не названия одного файла
ChatGPT, Claude и Gemini чаще всего встречаются как готовые продукты. Внутри продукта могут меняться модели и режимы, а вокруг них работают дополнительные компоненты:
- системные инструкции;
- поиск и подключённые источники;
- загрузка и разбор файлов;
- выполнение кода;
- память и проекты;
- фильтры безопасности;
- голосовой или графический интерфейс.
Поэтому фраза «эта LLM умеет искать в интернете» обычно неточна. Искать может отдельный инструмент, а модель получает найденные фрагменты и формирует ответ. То же относится к календарю, почте, базе данных и запуску программы.
Такое разделение помогает сравнивать системы честнее. Модель отвечает за языковое продолжение, а продукт — за то, какой контекст ей передали, какие действия разрешили и как показали результат.
Как LLM собирает ответ
У разных моделей различаются детали, но общий маршрут можно разобрать на четыре части.
1. Текст превращается в токены
Сначала токенизатор делит вход на элементы своего словаря. Токеном может быть целое короткое слово, часть слова, знак препинания или несколько символов. Граница зависит от конкретного токенизатора: нельзя заранее считать, что одно слово всегда равно одному токену или что русский текст обязательно дороже английского в фиксированное число раз.
Каждому токену соответствует числовой идентификатор. Фраза для человека превращается в последовательность чисел, с которой уже может работать нейросеть.
2. Токены получают числовые представления
Идентификатор переводится в эмбеддинг — вектор чисел. К нему добавляется информация о позиции в последовательности. Дальше представление меняется на каждом слое: один и тот же токен в разных предложениях получает разный контекстный смысл.
Например, слово «ключ» в инструкции к замку и в описании базы данных начинается с одного словарного элемента, но соседние слова направляют модель к разным значениям.
3. Attention связывает части контекста
Механизм attention помогает каждой позиции определить, какие предыдущие части последовательности сейчас важнее. В генеративной модели действует причинное ограничение: при выборе следующего токена она опирается на уже доступный контекст, а не заглядывает в ещё не написанное продолжение.
Связи вычисляются многократно и в нескольких представлениях. На одних шагах важнее синтаксис, на других — тема, формат ответа, дальняя ссылка на имя или условие из начала документа. Это не готовая карта правил: полезные шаблоны возникают в весах во время обучения.
Архитектура Transformer появилась в работе Attention Is All You Need. Современные модели сильно отличаются от первой схемы: меняются типы attention, позиционные представления, маршрутизация параметров и способы экономить память. Базовая идея при этом узнаваема — контекст обрабатывается как система взаимосвязанных элементов.
4. Модель выбирает продолжение
После слоёв нейросети получается распределение вероятностей по словарю. Система выбирает следующий токен, добавляет его к последовательности и повторяет расчёт. Так постепенно появляются предложение, абзац и весь ответ.
Temperature, top-p и другие параметры меняют способ выбора из распределения. Их шкалы и допустимые значения различаются между API, а результат зависит ещё и от системных настроек. Низкая вариативность полезна для стабильного формата, более широкая выборка — для поиска разных формулировок. Универсального числа для «кода» или «творчества» нет.
Откуда у модели появляются навыки
Обучение обычно состоит из нескольких больших фаз, но одинакового рецепта для всех лабораторий нет.
Базовое обучение
Во время pre-training модель видит большие массивы последовательностей и учится предсказывать скрытый или следующий токен. Ошибка возвращается через сеть и понемногу меняет параметры. После множества повторов веса начинают отражать языковые закономерности, фактические связи, стили и шаблоны решения задач, встречавшиеся в данных.
Это не копирование интернета в виде страниц. Веса не устроены как поисковый индекс, хотя крупная модель способна воспроизводить отдельные фрагменты, особенно если они часто повторялись. Состав данных, фильтрация, дедупликация и права на материалы остаются важной частью качества и рисков.
Post-training
Базовое продолжение текста ещё не обязано быть удобным собеседником. Затем модель настраивают следовать инструкциям, соблюдать формат и отказываться от нежелательных действий. Для этого используют демонстрации хороших ответов, данные о предпочтениях, синтетические примеры, обучение с подкреплением и другие методы.
Известная работа InstructGPT показала один из вариантов: supervised fine-tuning на демонстрациях, затем модель предпочтений и RLHF. Это важный пример, но не обязательная трёхступенчатая схема для любой современной LLM. Post-training постоянно меняется и может отдельно включать рассуждение, вызов инструментов, работу с кодом и требования безопасности.
Проверка и выпуск
Перед выпуском модель прогоняют через наборы задач, проверки безопасности и нагрузочные тесты. После этого продукт всё равно продолжает меняться: разработчики могут заменить модель, обновить системный prompt, поиск или обработчик файлов. Поэтому название чата не является точной технической спецификацией.
Параметры — не библиотечные полки
Параметры — числа, которые управляют преобразованиями внутри сети. В них распределённо закрепляются закономерности, найденные при обучении. Нельзя открыть один параметр и прочитать там дату основания города или правило пунктуации.
Отсюда следуют две особенности.
Первая: модель способна связно объяснить тему без доступа к исходной странице, потому что многие связи отражены в весах. Вторая: она может смешать похожие шаблоны и получить убедительную, но неверную деталь. Весам трудно сообщить: «этот факт изменился вчера» или «в источниках нет ответа».
Число параметров полезно для оценки требований к памяти у открытой модели, но плохо подходит для рейтинга качества. Архитектура, данные, post-training, квантизация, инструменты и конкретная задача могут влиять сильнее.
Контекст, память и свежие данные
LLM отвечает не только из весов. Во время запроса она получает контекст: системные правила, историю разговора, текст пользователя, фрагменты файлов и результаты инструментов. Всё вместе должно поместиться в доступное окно.
Большое окно означает, что система может принять больше токенов. Оно не гарантирует, что нужная строка будет найдена и правильно использована. Исследование Lost in the Middle показало, что положение факта в длинном контексте способно заметно влиять на результат. Новые архитектуры и способы поиска улучшаются, но длину окна всё равно полезно отделять от качества работы с ним.
Память между чатами обычно является внешней функцией продукта. Сервис сохраняет заметку или краткое резюме и добавляет его в будущий контекст. Сама инференс-модель не переписывает свои веса после каждого разговора. Использование переписок для последующего обучения регулируется отдельными настройками и политикой провайдера.
Для свежих или частных данных применяют дополнительные механизмы:
- веб-поиск приносит страницы из внешнего индекса;
- RAG находит подходящие фрагменты в выбранном корпусе;
- tool calling запрашивает программу, базу данных или сервис;
- выполнение кода считает результат, который неудобно надёжно получать простым продолжением текста.
Эти инструменты снижают часть рисков, но не дают автоматической гарантии истины. Поиск может выбрать слабый источник, RAG — пропустить нужный фрагмент, а модель — неверно пересказать полученные данные.
Почему возникают галлюцинации
Галлюцинацией называют правдоподобный ответ, который не подтверждается данными. Для модели гладкая формулировка и фактическая точность — разные цели. Предсказание следующего токена поощряет связное продолжение, даже когда в контексте не хватает надёжного факта.
Чаще проблема заметна в трёх ситуациях:
- запрос требует свежей информации, которой нет в контексте;
- пользователь просит точную цитату, ссылку, число или название;
- задача неоднозначна, а формат ответа не оставляет места для честного «данных недостаточно».
Надёжнее выглядит ответ, который можно проверить: с первичным источником, цитатой из переданного документа, воспроизводимым расчётом или тестом кода. Уверенный тон сам по себе ничего не измеряет.
Текст, изображения и действия
Базовая LLM работает с текстовыми токенами. Мультимодальная система добавляет компоненты, которые представляют изображение, звук или видео в форме, доступной модели. У разных продуктов это может быть единая модель, связка энкодеров и декодеров или несколько специализированных моделей.
Похожая оговорка нужна для действий. LLM может написать JSON с именем функции и аргументами, но реальный запрос к погодному сервису или изменение файла выполняет приложение. AI-агент добавляет цикл: получить цель, выбрать действие, увидеть результат, проверить состояние и решить, что делать дальше.
С чем легко перепутать LLM
- LLM и чат. Чат — интерфейс. Та же модель может работать через API, редактор кода или внутренний процесс без диалога.
- LLM и поисковик. Поисковик возвращает документы из индекса, модель генерирует продолжение. В одном продукте они могут работать вместе.
- LLM и база знаний. Веса содержат выученные закономерности, но не заменяют обновляемую базу с точными записями и источниками.
- LLM и агент. Агент использует модель для выбора шагов, а действия выполняют инструменты и управляющая программа.
- LLM и весь AI. Языковые модели — один класс среди систем распознавания, рекомендаций, прогнозирования, генерации изображений и других подходов.
Открытая модель, API или готовый сервис
Работать с LLM можно по-разному.
Готовый сервис быстрее всего начать использовать: интерфейс, хранение истории и инструменты уже собраны. При этом модель, лимиты и обработка данных зависят от поставщика.
API даёт больше контроля над интерфейсом и процессом. Разработчик сам хранит контекст, вызывает инструменты, проверяет структуру ответа и считает стоимость.
Модель с доступными весами может запускаться локально или на своей инфраструктуре. Здесь появляются вопросы лицензии, квантизации, памяти, скорости и поддержки. Слова «открытые веса» не означают автоматически свободную лицензию, бесплатную эксплуатацию или полную приватность: важны условия модели и весь путь данных.
Размер файла приблизительно зависит от числа параметров и точности хранения. Квантизация уменьшает требования к памяти, но её влияние на качество и скорость зависит от модели, формата и оборудования. Поэтому универсальная таблица «такой размер точно запустится на таком ноутбуке» быстро становится неверной.
Как оценить ответ в рабочей задаче
У LLM хорошо получается преобразовывать уже предоставленный материал: сократить текст, изменить тон, извлечь поля, предложить варианты структуры. Риск выше там, где нужен неизвестный модели факт или безошибочное многошаговое действие.
Для практической проверки обычно достаточно пяти вопросов:
- Получила ли система нужные исходные данные?
- Можно ли проверить факты по источнику или фрагменту документа?
- Был ли расчёт или код действительно выполнен?
- Сохранились ли ограничения и формат задачи?
- Повторяется ли качество на нескольких примерах?
Такой тест переживает смену бренда и номера модели. Он оценивает не обещание «понимать всё», а конкретный результат в конкретном процессе.
Частые вопросы
Чем LLM отличается от нейросети вообще?
Нейросеть — общее семейство моделей. LLM — его языковая ветвь, обученная работать с последовательностями текста. Не каждая система распознавания изображений, прогнозирования или рекомендаций является LLM.
Что означает B в названии модели?
Обычно B обозначает миллиарды параметров: например, 7B — около семи миллиардов. Для MoE-моделей отдельно различают общее и активное число параметров. У закрытых моделей размер может не публиковаться.
Можно ли обучить собственную LLM?
Базовое обучение крупной модели требует серьёзных данных, вычислений и команды. Для прикладной задачи чаще используют готовую модель, RAG, настройку prompt или fine-tuning. Что выбрать, зависит от причины ошибки: отсутствие фактов не всегда лечится дообучением.
Что такое reasoning-модель?
Reasoning-модели тратят дополнительные вычисления на промежуточную работу перед финальным ответом. Реализация может включать специальное обучение, внутренние рассуждения, проверку вариантов и инструменты. Это режим или класс системы, а не отдельный от LLM принцип.
Что такое RAG?
Retrieval-Augmented Generation сначала ищет релевантные фрагменты в выбранных источниках, затем передаёт их модели вместе с вопросом. Так можно работать со свежими или внутренними документами и прикладывать проверяемые ссылки. Качество зависит и от поиска, и от генерации.
Есть ли у модели дата знаний?
У обученных весов есть граница данных, но в готовом продукте она не всегда описывает весь ответ. Поиск, RAG и подключённые сервисы могут добавить более свежий контекст. Для актуального факта важнее увидеть источник и дату самого события.
Куда двигаться дальше
Механику удобно разбирать по отдельным деталям: Transformer, токены, эмбеддинги, контекстное окно, параметры и inference. Для прикладной стороны пригодятся prompt, RAG, tool calling и AI-агенты.
Если нужен обзор всей темы нейросетей, рядом есть разбор «Что такое нейросеть» и каталог словаря.
Короткий итог
LLM строит текст токен за токеном, опираясь на обученные параметры и текущий контекст. Pre-training даёт языковые закономерности, post-training превращает базовое продолжение в более удобное поведение, а продукт добавляет файлы, поиск, память и действия.
Эта схема объясняет и сильные стороны, и ограничения. Модель хорошо преобразует предоставленный материал и умеет собирать новые формулировки. Но её ответ не становится фактом только потому, что звучит гладко. Там, где важна точность, системе нужен проверяемый контекст, подходящий инструмент и понятный способ контроля результата.
Карта дальше — термины из словаря
Если хотите идти глубже — вот все термины, упомянутые в этом гиде. Можно открыть в новой вкладке и читать параллельно.
Подписка Neurosaver
Получать новые разборы Neurosaver
Большие материалы выходят не каждый день, зато их стоит читать спокойно. Подпишитесь, и мы пришлём новые разборы и важные обновления словаря.