Parameters
parameters — числа внутри модели, подбираемые на данных
Параметры (parameters, веса модели) — это числа внутри нейросети, которые подбираются во время обучения. У одного нейрона есть веса входов и смещение (bias); у всей модели — сумма таких чисел по всем слоям. Когда говорят «модель на 7 миллиардов параметров» или «175B», имеют в виду количество этих чисел. Параметры — это и есть «знание» модели: всё, чему она научилась на данных, закодировано в их значениях.
Коротко
Коротко. Параметры — это числа внутри модели, которые подбираются во время обучения. У одного искусственного нейрона их единицы; у крупной LLM — сотни миллиардов. Размер модели в названии («Llama 3 8B», «GPT-3 175B») — это именно количество параметров. Они и есть «знание» модели: всё, что она выучила, спрятано в их значениях.
Что это такое
Если открыть файл модели в hex-редакторе, окажется, что внутри нет ни кода, ни картинок, ни текста — только длинная последовательность чисел. Эти числа и есть параметры. Каждое число — настройка одного «регулятора» нейросети. У SD 1.5 их 900 миллионов, у GPT-3 — 175 миллиардов, у GPT-4, по оценкам, около триллиона.
Параметр в нейросети — это вес связи или смещение нейрона. В формуле одного нейрона:
выход = activation(w₁·x₁ + w₂·x₂ + … + wₙ·xₙ + b)
w (weights) и b (bias) — это и есть параметры. x — это входы, которые модель получает в реальном времени. Параметры остаются неизменными после обучения; входы меняются каждый запрос.
Когда модель «учится распознавать кошку», она не запоминает фотографии — она подкручивает значения этих w и b так, чтобы при картинке с кошкой на выходе появлялась высокая активация в нужном нейроне. Через миллионы примеров параметры сходятся к такому состоянию, что модель уверенно классифицирует и те кадры, которых раньше не видела.
Сами цифры мало о чём говорят человеку. Параметр w₁₄₃₂₇₆₅ = 0.0342 не означает «края» или «глаза». Смысл рождается из миллионов параметров вместе. Каждый по отдельности — пустой шум.
Как это работает
Считать параметры в реальной сети просто, если знать архитектуру.
Один полносвязный (dense) слой размером in × out содержит:
in × outвесов в матрице.outсмещений.
Например, dense-слой 512 → 256 = 512·256 + 256 = 131 328 параметров.
Свёрточный слой с фильтрами размером k × k × c_in × c_out (k — ширина ядра, c — каналы):
k·k·c_in·c_outвесов +c_outсмещений.
Фильтр 3×3 с 64 входными каналами и 128 выходными — 3·3·64·128 + 128 = 73 856 параметров.
Трансформер-блок в LLM состоит из:
- Q, K, V матрицы (attention):
d_model² · 3. - Output-проекция:
d_model². - MLP: обычно
4 · d_model² · 2(два линейных слоя). - Layer-norm и bias: пренебрежимо.
Для GPT-3 с d_model = 12 288 и 96 слоями получается около 175 миллиардов параметров.
Размер модели на диске считается так: параметры × точность в байтах.
| Точность | Байт на параметр | Llama 3 8B (8.03 млрд) |
|---|---|---|
| FP32 | 4 | 32 ГБ |
| FP16 / BF16 | 2 | 16 ГБ |
| INT8 | 1 | 8 ГБ |
| INT4 (4-bit) | 0.5 | 4 ГБ |
| INT2 (2-bit) | 0.25 | 2 ГБ (с потерей качества) |
Это объясняет, почему квантизация — главный приём для запуска больших моделей дома: уменьшая точность с FP16 до INT4, размер падает в 4 раза без катастрофической потери качества.
Пример на практике
Видеомонтажёр выбирает локальную LLM для написания подписей к видео. На Hugging Face три варианта одного семейства:
- Llama 3.2 1B — 1.23 млрд параметров. FP16 = 2.5 ГБ, INT4 = 0.7 ГБ. Запускается даже на смартфоне. Подойдёт для быстрых ответов, но путается в сложных задачах.
- Llama 3.1 8B — 8.03 млрд. FP16 = 16 ГБ (нужна RTX 4060 16 GB), INT4 = 4.5 ГБ (запустится на RTX 3060 12 GB). Хороший компромисс для домашней работы.
- Llama 3.1 70B — 70 млрд. FP16 = 140 ГБ (нужны 2× A100 или облако), INT4 = 40 ГБ (нужна RTX 4090 24 GB + RAM-offload). Качество близко к GPT-3.5.
Для подписей к роликам монтажёр останавливается на 8B INT4. Файл llama-3.1-8b-instruct-q4_k_m.gguf весит 4.6 ГБ, запускается через llama.cpp или LM Studio за пару секунд. Подобный workflow можно собрать визуально в ComfyUI через ноды LLM Chat — параметры модели остаются те же, меняется только обвязка.
Что произошло с параметрами при квантизации:
- Изначально каждый из 8 миллиардов параметров — это число в формате FP16 (16 бит).
- Квантизация преобразовала их в 4-битные целые с шагом, рассчитанным по группам параметров (обычно по 32–128 за раз).
- При инференсе параметры восстанавливаются «на лету» обратно в float — с небольшой потерей точности.
Качество ответов чуть страдает (особенно на длинном контексте), но скорость и память выигрывают в 4 раза. Это и есть инженерный компромисс, на котором держится локальный AI.
С чем часто путают
- Параметры и гиперпараметры — это разные вещи. Параметры подбирает алгоритм во время обучения (веса, смещения). Гиперпараметры выбирает человек перед обучением: learning rate, batch size, количество слоёв, размер скрытого слоя. Гиперпараметры влияют на то, как пройдёт обучение, параметры — это его результат.
- Параметры и токены — параметры это «ёмкость» модели, токены это единицы текста на входе и выходе. Llama 3 8B имеет 8 млрд параметров и контекстное окно ~128 тысяч токенов. Это разные шкалы.
- Параметры и FLOPS — FLOPS (операций с плавающей точкой в секунду) — это скорость вычислений. Параметры — это объём знаний. У одной и той же модели FLOPS зависит от длины запроса, параметры — нет.
- Параметры и активации — параметры остаются постоянными между запросами; активации — это промежуточные значения внутри сети для конкретного входа. На каждый запрос активации пересчитываются заново.
- Размер модели и качество — больше параметров не всегда лучше. Llama 3 8B часто обыгрывает старые модели на 30B параметров за счёт лучших данных и архитектуры.
Частые ошибки и заблуждения
- «7B» значит модель размером 7 ГБ. Нет. 7B — это 7 миллиардов параметров. Размер файла зависит от точности: FP16 → 14 ГБ, INT4 → 4 ГБ. Те же 7B параметров могут весить от 2 ГБ (INT2) до 28 ГБ (FP32).
- Параметры — это «знания» в человеческом смысле. Не совсем. Параметры — это статистическая упаковка закономерностей из данных. Они не хранят факты как база данных, поэтому модель может ошибаться даже в том, что много раз «видела» в обучающем корпусе.
- Можно понять, что закодировано в конкретном параметре. Почти никогда. Один параметр изолированно бессмысленен. Интерпретируемые признаки рождаются из взаимодействия миллионов параметров. Целая дисциплина (mechanistic interpretability) пытается распутать это, но пока с переменным успехом.
- Удвоить параметры — удвоить качество. Зависимость не линейная. Эмпирические законы (scaling laws, Chinchilla, 2022) показывают: для удвоения качества обычно нужен 5–10-кратный рост и параметров, и обучающих данных одновременно. Просто увеличить модель без новых данных — пустая трата ресурсов.
Связанные термины
- Model — файл, в котором лежат параметры вместе с архитектурой.
- Weights — синоним параметров; чаще употребляется в контексте сохранения и обмена моделями.
- Neural Network — структура, в которой параметры расставлены по слоям и связям.
- Training — процесс, который подбирает значения параметров.
- Quantization — сокращение размера параметра ради экономии памяти.
- Hyperparameters — настройки обучения, влияющие на то, как подбираются параметры.
- Fine-tuning — донастройка готовых параметров под узкую задачу.
- Scaling laws — эмпирические зависимости качества от количества параметров и данных.
Частые вопросы
Что такое параметры в нейросети простыми словами? Это числа — веса и смещения — внутри модели, которые подбираются на данных во время обучения. Именно в них закодировано всё «знание» сети. Когда пишут «7B» или «175B», имеют в виду количество таких параметров.
Где посмотреть, сколько параметров в модели?
В описании на Hugging Face (поле «Model size»), в названии файла (llama-3-8b, mistral-7b) или через библиотеку — например, model.num_parameters() в Transformers.
Сколько GPU нужно, чтобы обучить модель с нуля? Для GPT-3 (175B) использовали кластер из 10 000+ NVIDIA V100. Для дообучения готовой модели на узкой задаче (Llama 8B + LoRA) хватит одной RTX 3090. Базовое обучение с нуля сейчас доступно только крупным лабораториям.
Что такое «active parameters» в Mixtral и других MoE? В Mixture-of-Experts моделях параметры разбиты на «экспертов» — несколько подсетей. На каждый запрос модель выбирает 1–2 эксперта из 8 и считает только их. У Mixtral 8×7B total = 47B параметров, active = 13B. Это компромисс между ёмкостью и скоростью.
Почему 0.5 байта на параметр — это INT4, а не INT8? INT8 (8-битное целое) занимает 1 байт = 8 бит. INT4 = 4 бита = 0.5 байта. Два параметра в INT4 упаковываются в один байт. Это самый агрессивный из «безопасных» режимов квантизации; INT2 и битовая упаковка уже сильно бьют по качеству.
Что такое frozen vs trainable parameters? При fine-tuning часть параметров «замораживают» (frozen) — они не меняются во время дообучения. Остальные (trainable) обновляются. LoRA — крайний случай: основная модель полностью frozen, обучаемых параметров всего 1–2% от общего числа, но эффект сравним с полным fine-tuning.
Главное
Параметры — это числа, в которых модель хранит выученные закономерности. Их количество — главная характеристика модели после архитектуры: оно определяет размер файла, требования к памяти и потенциальную ёмкость. Но количество — не равно качеству: значения параметров зависят от того, на чём и как модель обучали. Хорошо обученные 8 миллиардов параметров уверенно обходят кое-как обученные 30 миллиардов. Поэтому в современном AI всё чаще говорят не о размере, а о том, что в этом размере удалось упаковать.