Transformer

transformer — архитектура нейросети, которая создала всех современных LLM

Раздел
Основы AI
Обновлено
18.05.26

Transformer — архитектура нейросети, представленная Google в статье «Attention Is All You Need» (2017). На ней построены все современные LLM: GPT, Claude, Gemini, Llama. Главная идея — self-attention: каждое слово смотрит на все остальные одновременно и решает, что важно. Это дало две вещи: возможность параллельного обучения (раньше было последовательное) и способность ловить длинные связи в тексте. Революция AI началась здесь.

Коротко

Коротко. Transformer — архитектура нейронной сети, представленная Google в статье «Attention Is All You Need» (июнь 2017). Главная идея — self-attention: каждое слово в предложении смотрит на все остальные параллельно и взвешивает их важность. Это дало две вещи: параллельное обучение (раньше RNN были последовательные) и способность улавливать длинные связи в тексте. На transformer-архитектуре построены все современные LLM — GPT, Claude, Gemini, Llama, DeepSeek. Без transformer не было бы ChatGPT.

Что это такое

12 июня 2017-го. Команда из Google Brain (Vaswani, Shazeer и ещё шесть авторов) выкладывает на arXiv статью «Attention Is All You Need». Заголовок-каламбур: до этого все нейросети для языка использовали attention как дополнение к рекуррентным сетям (RNN, LSTM). Авторы утверждали: attention сам по себе достаточно, RNN не нужны.

Через 5 лет — ChatGPT. Все современные большие модели — на transformer:

  • GPT-1/2/3/4/5 (OpenAI) — decoder-only transformer.
  • BERT (Google, 2018) — encoder-only transformer (для классификации, поиска).
  • T5 (Google) — encoder-decoder transformer.
  • Claude (Anthropic) — decoder-only.
  • Gemini (Google) — decoder-only с мультимодальностью.
  • Llama (Meta) — decoder-only.
  • Vision Transformer (ViT) — для картинок.
  • Stable Diffusion 3, FLUX — Diffusion Transformer для генерации картинок.
  • Sora — Diffusion Transformer для видео.

Transformer заменил собой:

  • RNN/LSTM в обработке текста (последовательные сети 1990-х-2010-х).
  • CNN в обработке картинок (постепенно — Vision Transformer).
  • GAN в генерации (вместе с диффузионными моделями).

К 2026 — это главная архитектура AI, на которой строится всё.

Как это работает

Главные элементы transformer:

1. Embeddings

Каждое слово (токен) превращается в вектор размером, например, 768 или 4096 чисел. Этот вектор — «значение слова» в высокоразмерном пространстве. К embedding добавляются позиционные кодировки (позиция слова в предложении).

2. Self-Attention

Сердце трансформера. Для каждого слова в предложении:

1. Создаётся 3 вектора: Query (Q), Key (K), Value (V).
2. Q сравнивается с K каждого другого слова — получается «релевантность».
3. Релевантности softmax-ом превращаются в веса (сумма = 1).
4. V каждого слова умножается на свой вес и суммируется.
5. Получается «контекстное» представление слова — учитывает все остальные.

Метафора: каждое слово на занятии «смотрит» на все другие, оценивает «насколько вы важны для меня?» (через Q×K), и берёт у них «знания» (V) с правильным весом.

3. Multi-Head Attention

Self-attention делается параллельно несколько раз («head»), каждая голова учится смотреть на свой аспект (синтаксис, семантику, ссылки). Результаты конкатенируются.

4. Feed-Forward Network

После attention — обычный MLP-блок (несколько слоёв нейронов), независимо для каждой позиции.

5. Residual + LayerNorm

Между блоками — skip-connections (residual) и нормализация.

Всё это собирается в слой. Большая модель — десятки-сотни таких слоёв.

Input tokens
    ↓
[Embeddings + Position]
    ↓
[Self-Attention] → [Add & Norm]
    ↓
[Feed-Forward]   → [Add & Norm]
    ↓
   ... (×N слоёв)
    ↓
[Output projection]
    ↓
Predicted next token

Decoder vs Encoder

  • Decoder-only (GPT, Claude, Llama): генерирует текст слева направо. Self-attention с маской — каждое слово видит только предыдущие. Самая популярная архитектура для LLM.
  • Encoder-only (BERT): принимает весь текст сразу, выдаёт embeddings. Для классификации, поиска.
  • Encoder-decoder (T5, BART): для перевода. Encoder читает вход, decoder генерирует выход.

Пример на практике

Покажем, что делает self-attention на простой фразе.

Предложение: «Кошка которая жила у соседей убежала».

Когда модель доходит до слова «убежала», у неё стоит вопрос: кто убежала? Self-attention весит:

  • «Кошка» → высокий вес (она субъект).
  • «которая жила у соседей» → низкий вес (это придаточное).
  • «соседей» → низкий вес (не субъект).

Без attention RNN после длинного придаточного забывал бы про «кошку». Transformer — нет, он смотрит напрямую.

В коде (упрощённо):

import torch
from transformers import GPT2LMHeadModel, GPT2Tokenizer

tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
model = GPT2LMHeadModel.from_pretrained("gpt2")

text = "The Eiffel Tower is located in"
inputs = tokenizer(text, return_tensors="pt")

# Forward pass через transformer
outputs = model(**inputs)

# Вытаскиваем attention веса (один из слоёв, одна head)
# В реальности модель имеет 12 слоёв × 12 heads

В подкапотном коде каждое слово прошло через 12 трансформер-слоёв, в каждом — 12 параллельных attention-голов. Финал — предсказание следующего токена («Paris»).

В ComfyUI каждая текстовая модель (Stable Diffusion text-encoder, ControlNet text-encoder, FLUX) — это transformer. Картиночные latent-блоки тоже всё чаще transformer (DiT — Diffusion Transformer).

С чем часто путают

  • Transformer и Transformer-модель в Hasbro — нет, это разные вещи. AI Transformer — нейросеть, Transformers — игрушки/мультфильмы.
  • Transformer и LLM — Transformer это архитектура. LLM это большая модель на этой архитектуре. LLM = Transformer + миллиарды параметров.
  • Self-attention и Cross-attention — Self: смотрит сама на себя (внутри одной последовательности). Cross: одна последовательность смотрит на другую (для перевода).
  • Attention и Memory — attention это механизм внутри одного запроса. Memory — это хранение информации между запросами.
  • Encoder-only и Decoder-only — разные стили: Encoder для понимания (BERT), Decoder для генерации (GPT).

Частые ошибки и заблуждения

  • «Transformer это про текст». Изначально да, но сейчас на transformer работает почти всё: картинки (ViT), видео (Sora DiT), аудио (Whisper), белки (AlphaFold), мультимодальность (Gemini).
  • «Это очень сложно». Концептуально — нет. Multi-head attention + FFN + repeat. Сложна реализация в продакшне (оптимизации, distributed training).
  • «Transformer — самая эффективная архитектура». Не самая. Она O(N²) по длине последовательности — медленно на длинном контексте. Альтернативы: Mamba, RWKV, LinearAttention. Но качество transformer пока лучше.
  • «Авторы получили миллиарды». Из 8 авторов оригинальной статьи большинство ушло из Google и основали свои AI-стартапы (Cohere, Character.ai, Inceptive). Никто из них не получил «миллиарды» от исходной статьи, но карьеры взлетели.
  • «Transformer создал AGI». Не создал. Сделал возможным современные LLM. AGI — далеко не достигнут.

Связанные термины

  • LLM — большие модели на transformer.
  • GPT — главное семейство decoder-only transformer.
  • Embedding — вход transformer.
  • Mixture of Experts (MoE) — модификация transformer для frontier-моделей.
  • Diffusion Model — комплементарная архитектура; современные diffusion-модели тоже используют transformer внутри (DiT).

Частые вопросы

Кто изобрёл transformer? Команда Google Brain в составе: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Łukasz Kaiser, Illia Polosukhin. Статья «Attention Is All You Need», NeurIPS 2017.

Зачем нужно multi-head? Каждая «голова» учится своему аспекту языка: синтаксису, семантике, кореференции, длинным связям. Параллельный пул разных «взглядов» сильнее одного.

Сколько слоёв в современных моделях? GPT-3 — 96. GPT-4 — публично неизвестно (~120). Llama 3 70B — 80. Gemini Ultra — оценочно 100+.

Можно ли обучить transformer дома? Маленький — да. nanoGPT (Karpathy) обучается на одной 4090 за день. Большие — нет, нужны кластеры.

Что заменит transformer? Пока ничего не победило. Mamba и State Space Models показывают себя на длинных последовательностях. RetNet, RWKV, xLSTM — альтернативы. К 2026 — transformer всё ещё доминирует.

Главное

Transformer — архитектура нейросети, представленная Google в 2017-м в статье «Attention Is All You Need». Главная идея — self-attention: каждое слово параллельно смотрит на все остальные и взвешивает их важность. Это дало две революции: параллельное обучение (раньше RNN были последовательные) и способность улавливать длинные связи. На transformer-архитектуре построены все современные LLM, картиночные модели (ViT, FLUX), видео (Sora), мультимодальные системы (Gemini), и даже AlphaFold для биологии. Стандартный блок: Multi-Head Attention + Feed-Forward + Residual + LayerNorm, повторённый десятки раз. Главное ограничение — квадратичная сложность по длине, что породило поиски альтернатив (Mamba, RWKV), но к 2026 transformer остаётся главной архитектурой AI. Без transformer не было бы ChatGPT, Sora, Claude, Gemini.