Transformer
transformer — архитектура нейросети, которая создала всех современных LLM
Transformer — архитектура нейросети, представленная Google в статье «Attention Is All You Need» (2017). На ней построены все современные LLM: GPT, Claude, Gemini, Llama. Главная идея — self-attention: каждое слово смотрит на все остальные одновременно и решает, что важно. Это дало две вещи: возможность параллельного обучения (раньше было последовательное) и способность ловить длинные связи в тексте. Революция AI началась здесь.
Коротко
Коротко. Transformer — архитектура нейронной сети, представленная Google в статье «Attention Is All You Need» (июнь 2017). Главная идея — self-attention: каждое слово в предложении смотрит на все остальные параллельно и взвешивает их важность. Это дало две вещи: параллельное обучение (раньше RNN были последовательные) и способность улавливать длинные связи в тексте. На transformer-архитектуре построены все современные LLM — GPT, Claude, Gemini, Llama, DeepSeek. Без transformer не было бы ChatGPT.
Что это такое
12 июня 2017-го. Команда из Google Brain (Vaswani, Shazeer и ещё шесть авторов) выкладывает на arXiv статью «Attention Is All You Need». Заголовок-каламбур: до этого все нейросети для языка использовали attention как дополнение к рекуррентным сетям (RNN, LSTM). Авторы утверждали: attention сам по себе достаточно, RNN не нужны.
Через 5 лет — ChatGPT. Все современные большие модели — на transformer:
- GPT-1/2/3/4/5 (OpenAI) — decoder-only transformer.
- BERT (Google, 2018) — encoder-only transformer (для классификации, поиска).
- T5 (Google) — encoder-decoder transformer.
- Claude (Anthropic) — decoder-only.
- Gemini (Google) — decoder-only с мультимодальностью.
- Llama (Meta) — decoder-only.
- Vision Transformer (ViT) — для картинок.
- Stable Diffusion 3, FLUX — Diffusion Transformer для генерации картинок.
- Sora — Diffusion Transformer для видео.
Transformer заменил собой:
- RNN/LSTM в обработке текста (последовательные сети 1990-х-2010-х).
- CNN в обработке картинок (постепенно — Vision Transformer).
- GAN в генерации (вместе с диффузионными моделями).
К 2026 — это главная архитектура AI, на которой строится всё.
Как это работает
Главные элементы transformer:
1. Embeddings
Каждое слово (токен) превращается в вектор размером, например, 768 или 4096 чисел. Этот вектор — «значение слова» в высокоразмерном пространстве. К embedding добавляются позиционные кодировки (позиция слова в предложении).
2. Self-Attention
Сердце трансформера. Для каждого слова в предложении:
1. Создаётся 3 вектора: Query (Q), Key (K), Value (V).
2. Q сравнивается с K каждого другого слова — получается «релевантность».
3. Релевантности softmax-ом превращаются в веса (сумма = 1).
4. V каждого слова умножается на свой вес и суммируется.
5. Получается «контекстное» представление слова — учитывает все остальные.
Метафора: каждое слово на занятии «смотрит» на все другие, оценивает «насколько вы важны для меня?» (через Q×K), и берёт у них «знания» (V) с правильным весом.
3. Multi-Head Attention
Self-attention делается параллельно несколько раз («head»), каждая голова учится смотреть на свой аспект (синтаксис, семантику, ссылки). Результаты конкатенируются.
4. Feed-Forward Network
После attention — обычный MLP-блок (несколько слоёв нейронов), независимо для каждой позиции.
5. Residual + LayerNorm
Между блоками — skip-connections (residual) и нормализация.
Всё это собирается в слой. Большая модель — десятки-сотни таких слоёв.
Input tokens
↓
[Embeddings + Position]
↓
[Self-Attention] → [Add & Norm]
↓
[Feed-Forward] → [Add & Norm]
↓
... (×N слоёв)
↓
[Output projection]
↓
Predicted next token
Decoder vs Encoder
- Decoder-only (GPT, Claude, Llama): генерирует текст слева направо. Self-attention с маской — каждое слово видит только предыдущие. Самая популярная архитектура для LLM.
- Encoder-only (BERT): принимает весь текст сразу, выдаёт embeddings. Для классификации, поиска.
- Encoder-decoder (T5, BART): для перевода. Encoder читает вход, decoder генерирует выход.
Пример на практике
Покажем, что делает self-attention на простой фразе.
Предложение: «Кошка которая жила у соседей убежала».
Когда модель доходит до слова «убежала», у неё стоит вопрос: кто убежала? Self-attention весит:
- «Кошка» → высокий вес (она субъект).
- «которая жила у соседей» → низкий вес (это придаточное).
- «соседей» → низкий вес (не субъект).
Без attention RNN после длинного придаточного забывал бы про «кошку». Transformer — нет, он смотрит напрямую.
В коде (упрощённо):
import torch
from transformers import GPT2LMHeadModel, GPT2Tokenizer
tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
model = GPT2LMHeadModel.from_pretrained("gpt2")
text = "The Eiffel Tower is located in"
inputs = tokenizer(text, return_tensors="pt")
# Forward pass через transformer
outputs = model(**inputs)
# Вытаскиваем attention веса (один из слоёв, одна head)
# В реальности модель имеет 12 слоёв × 12 heads
В подкапотном коде каждое слово прошло через 12 трансформер-слоёв, в каждом — 12 параллельных attention-голов. Финал — предсказание следующего токена («Paris»).
В ComfyUI каждая текстовая модель (Stable Diffusion text-encoder, ControlNet text-encoder, FLUX) — это transformer. Картиночные latent-блоки тоже всё чаще transformer (DiT — Diffusion Transformer).
С чем часто путают
- Transformer и Transformer-модель в Hasbro — нет, это разные вещи. AI Transformer — нейросеть, Transformers — игрушки/мультфильмы.
- Transformer и LLM — Transformer это архитектура. LLM это большая модель на этой архитектуре. LLM = Transformer + миллиарды параметров.
- Self-attention и Cross-attention — Self: смотрит сама на себя (внутри одной последовательности). Cross: одна последовательность смотрит на другую (для перевода).
- Attention и Memory — attention это механизм внутри одного запроса. Memory — это хранение информации между запросами.
- Encoder-only и Decoder-only — разные стили: Encoder для понимания (BERT), Decoder для генерации (GPT).
Частые ошибки и заблуждения
- «Transformer это про текст». Изначально да, но сейчас на transformer работает почти всё: картинки (ViT), видео (Sora DiT), аудио (Whisper), белки (AlphaFold), мультимодальность (Gemini).
- «Это очень сложно». Концептуально — нет. Multi-head attention + FFN + repeat. Сложна реализация в продакшне (оптимизации, distributed training).
- «Transformer — самая эффективная архитектура». Не самая. Она O(N²) по длине последовательности — медленно на длинном контексте. Альтернативы: Mamba, RWKV, LinearAttention. Но качество transformer пока лучше.
- «Авторы получили миллиарды». Из 8 авторов оригинальной статьи большинство ушло из Google и основали свои AI-стартапы (Cohere, Character.ai, Inceptive). Никто из них не получил «миллиарды» от исходной статьи, но карьеры взлетели.
- «Transformer создал AGI». Не создал. Сделал возможным современные LLM. AGI — далеко не достигнут.
Связанные термины
- LLM — большие модели на transformer.
- GPT — главное семейство decoder-only transformer.
- Embedding — вход transformer.
- Mixture of Experts (MoE) — модификация transformer для frontier-моделей.
- Diffusion Model — комплементарная архитектура; современные diffusion-модели тоже используют transformer внутри (DiT).
Частые вопросы
Кто изобрёл transformer? Команда Google Brain в составе: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Łukasz Kaiser, Illia Polosukhin. Статья «Attention Is All You Need», NeurIPS 2017.
Зачем нужно multi-head? Каждая «голова» учится своему аспекту языка: синтаксису, семантике, кореференции, длинным связям. Параллельный пул разных «взглядов» сильнее одного.
Сколько слоёв в современных моделях? GPT-3 — 96. GPT-4 — публично неизвестно (~120). Llama 3 70B — 80. Gemini Ultra — оценочно 100+.
Можно ли обучить transformer дома? Маленький — да. nanoGPT (Karpathy) обучается на одной 4090 за день. Большие — нет, нужны кластеры.
Что заменит transformer? Пока ничего не победило. Mamba и State Space Models показывают себя на длинных последовательностях. RetNet, RWKV, xLSTM — альтернативы. К 2026 — transformer всё ещё доминирует.
Главное
Transformer — архитектура нейросети, представленная Google в 2017-м в статье «Attention Is All You Need». Главная идея — self-attention: каждое слово параллельно смотрит на все остальные и взвешивает их важность. Это дало две революции: параллельное обучение (раньше RNN были последовательные) и способность улавливать длинные связи. На transformer-архитектуре построены все современные LLM, картиночные модели (ViT, FLUX), видео (Sora), мультимодальные системы (Gemini), и даже AlphaFold для биологии. Стандартный блок: Multi-Head Attention + Feed-Forward + Residual + LayerNorm, повторённый десятки раз. Главное ограничение — квадратичная сложность по длине, что породило поиски альтернатив (Mamba, RWKV), но к 2026 transformer остаётся главной архитектурой AI. Без transformer не было бы ChatGPT, Sora, Claude, Gemini.