GPT
generative pre-trained transformer — семейство моделей OpenAI
GPT расшифровывается как Generative Pre-trained Transformer. Это семейство моделей OpenAI, которые предварительно обучаются на больших наборах данных, а затем настраиваются для диалога, инструментов и других задач. GPT — модель, ChatGPT — продукт вокруг моделей.
Коротко
GPT — Generative Pre-trained Transformer: генеративный предварительно обученный трансформер. Это название семейства моделей OpenAI. Базовая задача обучения — предсказывать следующий токен по предыдущему контексту. После дополнительной настройки модель лучше следует инструкциям, ведёт диалог и вызывает инструменты.
Generative
Модель генерирует продолжение, а не выбирает готовый ответ из базы. На каждом шаге она оценивает распределение вероятностей следующего токена.
Контекст: «На улице пошёл сильный...»
Кандидаты: дождь, ветер, снег, ливень...
Выбранный токен добавляется к контексту, после чего процесс повторяется. Так возникает предложение, код или структурированный ответ.
Генеративность даёт гибкость и одновременно создаёт риск галлюцинаций: правдоподобное продолжение не обязано быть фактом.
Pre-trained
До работы в чате модель проходит предварительное обучение на большом корпусе. Она усваивает языковые закономерности, форматы, связи между понятиями и множество статистических шаблонов.
Pre-training не превращает модель в поисковую базу с точными записями. Усвоенные закономерности распределены по весам. Это не записи с датой и ссылкой на источник: модель может воспроизвести их неверно или не знать о последующих событиях.
После этого возможны дополнительные этапы:
- обучение на примерах выполнения инструкций;
- обучение на предпочтениях;
- настройка безопасного поведения;
- дообучение под отдельную задачу;
- обучение инструментальному поведению;
- мультимодальная настройка.
Точная схема зависит от поколения и не всегда публикуется полностью.
Transformer
Трансформер обрабатывает последовательность с помощью механизма внимания — attention — и слоёв преобразования. В классической GPT-схеме используются декодерные блоки с причинной маской. При обучении очередная позиция не может подсмотреть следующий токен, который ей предстоит предсказать.
Основные части:
- токенизатор разбивает текст на элементы — токены;
- слой эмбеддингов переводит токены в числовые векторы;
- внимание связывает информацию разных позиций;
- полносвязные слои преобразуют полученные представления;
- выходной слой рассчитывает оценки возможных следующих токенов — логиты.
Название GPT не означает одну неизменную архитектуру. Между поколениями могут меняться механизм внимания, распределение вычислений, обработка разных типов данных и способ обучения.
GPT и ChatGPT
GPT — модель или семейство. ChatGPT — пользовательский продукт, который добавляет интерфейс, историю, файлы, поиск, инструменты, память и политику доступа.
Ответ в ChatGPT зависит не только от модели, но и от:
- системные инструкции и настройки приложения;
- доступных инструментов;
- истории и памяти;
- выбранного режима;
- продуктовых фильтров;
- текущего плана и региона.
Поэтому поведение чата нельзя полностью воспроизвести одним API-вызовом с тем же текстом.
Мультимодальность
Современные GPT-продукты могут работать не только с текстом. Изображение, аудио или другой вход кодируется в представление, которое модель и окружающие инструменты используют вместе с текстом.
Умение понять изображение не гарантирует генерацию изображения той же моделью. Продукт может вызывать отдельный инструмент генерации изображений или модель речи.
Наглядный пример
Допустим, пользователь загружает чек и просит вернуть позиции в JSON.
Система должна:
- прочитать изображение;
- распознать строки и числа;
- связать цену с товаром;
- вернуть структуру по схеме;
- отметить неразборчивые места;
- проверить арифметическую сумму кодом.
Модель помогает сопоставить строки и числа на изображении. Затем программа пересчитывает сумму. Если на чеке есть скидки или округление, их тоже нужно учесть: несовпадение итога не всегда означает ошибку распознавания.
Температура и выбор токена
Параметр temperature, если выбранная модель и режим его поддерживают, меняет распределение вероятностей перед выбором токена. Низкое значение обычно делает ответы устойчивее, высокое — разнообразнее.
Это не ползунок истинности. Нулевая или низкая температура не исправляет неверные знания, а одинаковый запрос всё равно может отличаться из-за особенностей вычислений, результатов инструментов и обновления модели.
Контекстное окно
В контекст входят инструкции, история, файлы, результаты инструментов и ответ. Большое окно позволяет передать больше данных, но не гарантирует одинаковое внимание к каждому фрагменту.
Для длинного материала полезны структура, поиск нужных фрагментов, ссылки на разделы и проверка цитат. Просто вставить всё целиком иногда хуже, чем выбрать релевантные части.
Подключение через API
В запросе к API указывают идентификатор модели. Он определяет поддерживаемые входы, параметры и инструменты; одного слова GPT для настройки приложения недостаточно.
Для рабочего приложения обычно сохраняют:
- выбранную модель и параметры запроса;
- проверочные задачи с ожидаемыми результатами;
- расход токенов и причину завершения ответа;
- обработку отказов, обрывов и вызовов функций;
- способ перехода на другую поддерживаемую модель.
Постоянный API-ключ хранится на сервере, а не в коде веб-страницы или мобильного приложения, откуда его можно извлечь.
Что GPT не делает автоматически
- Не проверяет факт по свежему источнику без поиска или данных.
- Не выполняет предложенную функцию без приложения или подключённого инструмента.
- Не гарантирует JSON только просьбой в тексте.
- Не знает внутреннюю базу компании без контекста.
- Не является калькулятором или системой прав доступа.
- Не выдаёт надёжный журнал внутренних вычислений по просьбе «объясни ход мыслей».
Инструменты, схемы ответов, поиск и обычный код помогают с этими задачами, но сами тоже нуждаются в проверке. Наличие поиска, например, не гарантирует верного пересказа найденной страницы.
С чем часто путают
- GPT и LLM. GPT — одно семейство LLM; не каждая LLM относится к OpenAI.
- GPT и Transformer. Transformer — архитектурное семейство, GPT — конкретная линия моделей.
- GPT и ChatGPT. Модель и продукт вокруг неё.
- Pre-training и свежий поиск. Обученные веса не обновляются от каждого веб-запроса.
- Следующий токен и случайный текст. Модель учитывает сложные закономерности контекста, но остаётся вероятностной.
Частые вопросы
Как расшифровывается GPT?
Generative Pre-trained Transformer: генеративный предварительно обученный трансформер.
GPT просто угадывает слово?
Технически она предсказывает следующий токен, но делает это через многослойное представление всего доступного контекста. Простое правило обучения приводит к сложному поведению.
Как выбрать модель GPT для приложения?
Сначала определить задачу: какие данные она получает, сколько времени можно ждать и как проверяется ответ. Затем сравнить подходящие варианты из каталога OpenAI на одинаковых примерах. Стоимость одного запроса мало говорит о выгоде, если ответы приходится часто переделывать.
Можно ли запустить GPT локально?
Облачную модель нельзя перенести на свой компьютер без опубликованных весов и подходящей программы. У OpenAI есть отдельные модели с открытыми весами, например gpt-oss. Это не локальная копия ChatGPT: инструменты, интерфейс и хранение контекста придётся организовать отдельно.
Главное
GPT — семейство генеративных предварительно обученных трансформеров OpenAI. Модель создаёт ответ токен за токеном, опираясь на контекст и дополнительную настройку. Её практические возможности определяет не только поколение, но и продукт, инструменты, данные и проверки вокруг модели.