Model
model — архитектура нейросети плюс обученные веса в одном файле
Модель в AI — это файл с обученной нейросетью. Внутри лежат архитектура (как соединены слои) и веса (миллионы или миллиарды чисел, подобранных на данных). Архитектура одна и та же может породить разные модели, если обучить её на разных данных или с разной целью. GPT-4, Claude, Llama, Stable Diffusion, Whisper — это всё модели, каждая со своим размером (от мегабайт до сотен гигабайт) и специализацией.
Коротко
Коротко. Модель — это обученная нейросеть, упакованная в файл. Внутри два слоя: архитектура (схема связей между нейронами) и веса (миллионы или миллиарды чисел, найденные во время обучения). Файл подгружается в программу, и та начинает отвечать на запросы — генерировать текст, распознавать речь, рисовать картинку. Чем больше параметров и чем чище были данные, тем точнее модель решает свою задачу.
Что это такое
Папка models/ в ComfyUI. Внутри — sd_xl_base_1.0.safetensors на 6.9 гигабайт. Это и есть модель: один файл, в котором лежит способность Stable Diffusion рисовать почти что угодно по текстовому запросу.
Никаких хитрых программ внутри нет. Только числа. Веса нейронов и параметры слоёв — несколько миллиардов значений, упакованных в бинарный формат. Когда программа загружает этот файл в память видеокарты, нейросеть оживает. Когда выгружает — становится просто числами на диске.
Это и есть главное свойство модели. Модель — это снимок знания, который можно передать, сохранить, скопировать. Точно так же, как программа сохраняется в .exe-файл, а музыкальный трек — в .mp3, обученная нейросеть сохраняется в .safetensors, .gguf, .bin или .onnx.
Архитектура и модель — две разные вещи. Архитектура (например, «transformer 12 слоёв, 768 каналов внимания») — это рецепт. Модель — это рецепт, по которому уже приготовили блюдо. По одному рецепту можно сделать разные блюда: ту же архитектуру обучают на разных данных и получают разные модели. GPT-3, GPT-4, Claude и Gemini имеют похожую базовую архитектуру transformer, но это разные модели с разными весами.
Как это работает
В жизни модели три стадии: обучение, сохранение, использование.
- Обучение. Архитектуре с пустыми весами показывают миллионы примеров. Алгоритм обратного распространения постепенно подкручивает веса в сторону, уменьшающую ошибку. Через дни или недели на GPU-кластерах веса приходят в состояние, при котором модель угадывает правильные ответы на проверочных данных.
- Сохранение. Веса замораживаются. Архитектура и веса записываются на диск в одном из форматов:
.safetensors(для diffusion),.gguf(для квантизованных LLM),.binили.pt(PyTorch),.onnx(универсальный),.gguf(CPU-friendly). - Использование (inference). Программа загружает файл в память (VRAM или RAM), подаёт на вход данные — модель считает выход. Веса не меняются, обучение не идёт. На этом этапе модель — это просто детерминированная функция: одинаковые входы → один и тот же выход.
Размер модели = размер файла. Каждый параметр занимает байты: 4 байта для FP32, 2 байта для FP16, 1 байт для INT8, 0.5 байта для квантизации в 4 бита.
| Модель | Параметры | FP16 (.safetensors) | INT4 (.gguf) |
|---|---|---|---|
| Stable Diffusion 1.5 | 0.9 млрд | ~2 ГБ | ~1 ГБ |
| Stable Diffusion XL | 3.5 млрд | ~6.9 ГБ | ~3 ГБ |
| Llama 3 8B | 8 млрд | ~16 ГБ | ~4.5 ГБ |
| Whisper Large v3 | 1.55 млрд | ~3 ГБ | ~1 ГБ |
| GPT-3 | 175 млрд | ~350 ГБ | ~90 ГБ |
| FLUX.1 dev | 12 млрд | ~24 ГБ | ~7 ГБ |
Пример на практике
Видеомонтажёр настраивает workflow для апскейлинга кадров в ComfyUI. Нужно увеличить разрешение с 1280×720 до 4K с восстановлением деталей.
Выбор модели — главное решение. В папке models/upscale_models/ несколько вариантов:
RealESRGAN_x4.pth(66 МБ) — универсальный апскейлер, обучен на синтетике, средняя детализация.4xUltraSharp.pth(66 МБ) — заточен под фотореалистичный апскейл, лучше держит резкость.4x_NMKD-Siax_200k.pth(66 МБ) — специализация: лица и кожа.Remacri_4x.pth(67 МБ) — мягкий стиль, хорош для рисованного контента.
Все они имеют одну архитектуру ESRGAN. Но обучены на разных датасетах с разными целями — поэтому работают по-разному. Выбор зависит от типа кадров: для лиц подойдёт 4x_NMKD-Siax_200k, для городских пейзажей — 4xUltraSharp, для анимации — Remacri_4x.
Это и есть смысл слова «модель» на практике: одна и та же архитектура порождает десятки специализированных версий, каждая со своей областью применения. Сообщество Hugging Face и Civitai хранят больше миллиона публичных моделей — для каждой задачи можно найти готовое.
С чем часто путают
- Модель и алгоритм — алгоритм описывает шаги работы (например, transformer-блок: сначала attention, потом MLP). Модель — это конкретный экземпляр алгоритма с обученными весами. Алгоритм пишется один раз; моделей на этом алгоритме могут быть тысячи.
- Модель и архитектура — архитектура определяет, сколько слоёв, какой размер, как они соединены. Модель = архитектура + конкретные значения весов. Без весов архитектура — пустой скелет.
- Модель и Checkpoint — Checkpoint часто используется как синоним модели в мире Stable Diffusion. Изначально checkpoint — это «снимок» весов на определённой эпохе обучения. На практике в ComfyUI и Automatic1111 «checkpoint» означает основную модель.
- Модель и веса (weights) — веса это содержимое модели, миллионы чисел. Иногда говорят «обновить веса», «выложить веса» — это в практике означает «выпустить модель» или «обновить модель».
- Модель и продукт — ChatGPT, Claude, Midjourney — это продукты со своими интерфейсами. Внутри них модели (GPT-4, Claude 3.5 Sonnet, проприетарный Midjourney v6). Один и тот же продукт может использовать разные модели на бэкенде.
Частые ошибки и заблуждения
- Большая модель всегда лучше маленькой. Не всегда. Для узкой задачи специализированная маленькая модель (например, BERT-base на 110 млн параметров для классификации) обыгрывает GPT-4 по скорости и стоимости, давая сопоставимую точность. Большая модель оправдана для широких или плохо определённых задач.
- Модель «знает» текущие новости. Нет. Модель знает только то, что было в её обучающих данных. Cutoff date — момент, после которого данные не использовались. Для актуальной информации нужен RAG (модель ищет в свежих документах) или специальные обновления через инструменты.
- Можно дообучить любую модель за пару часов. Полное дообучение большой модели требует кластера и недель времени. Лёгкое дообучение (LoRA, fine-tuning последних слоёв) — действительно вопрос часов и доступно на одной GPU.
- Все модели одного семейства одинаковы. Нет. SD 1.5, SDXL и SD 3 имеют разную архитектуру (количество и тип слоёв), разные размеры, разные требования к промпту. Промпт, работающий в SD 1.5, может дать что-то совершенно иное в SDXL.
- Открытая модель = бесплатная для коммерции. Не всегда. Модель может быть «open weights», но с лицензией, ограничивающей коммерческое использование (Llama 2 community license, FLUX dev для non-commercial). Лицензию каждой модели нужно читать отдельно.
Связанные термины
- Neural Network — архитектура, на которой строится модель.
- Checkpoint — синоним модели в мире Stable Diffusion и других diffusion-систем.
- Parameters / Weights — то, из чего состоит обученная модель.
- Fine-tuning — дообучение готовой модели на узкой задаче.
- LoRA — лёгкий способ добавить к модели специализацию без перезаписи весов.
- Inference — процесс использования модели для предсказаний.
- Safetensors / GGUF / ONNX — форматы хранения модели на диске.
- Hugging Face — крупнейший каталог открытых моделей.
Частые вопросы
Где хранятся скачанные модели?
Зависит от программы. ComfyUI: models/checkpoints/ для основных, models/loras/ для LoRA, models/vae/ для VAE. Llama.cpp: рядом с бинарником или по пути в конфиге. Hugging Face Transformers: ~/.cache/huggingface/hub/ по умолчанию.
Сколько GPU-памяти нужно для модели? Минимум — размер весов в FP16 плюс память для активаций. Для SDXL FP16 (6.9 ГБ) нужна карта от 8 ГБ VRAM. Для Llama 8B в FP16 — от 16 ГБ. Квантизация в 4 бита снижает требования вчетверо: SDXL → ~2 ГБ, Llama 8B → ~5 ГБ.
Можно ли запустить модель без интернета? Любую открытую модель — да. Скачали файл, запустили локально. Закрытые модели (GPT-4, Claude, Gemini) доступны только через API провайдера.
Что такое «base model» и «fine-tuned model»? Base — модель, обученная с нуля на массиве разнородных данных. Fine-tuned — модель, дополнительно обученная на узком датасете для специализации. Civitai и Hugging Face полны fine-tune'ов: «реалистичный портрет», «аниме-стиль», «архитектурная визуализация».
Чем .safetensors лучше .ckpt и .pt?
.ckpt и .pt могут содержать произвольный Python-код через pickle. Это вектор атаки: вредоносный файл может выполнить команды при загрузке. .safetensors — простой бинарный формат, только числа, безопасен по дизайну. Сейчас это де-факто стандарт для публикации моделей.
Главное
Модель — это материальное воплощение того, чему научилась нейросеть. Архитектура отвечает за форму, веса — за содержание; вместе они дают файл, который можно скачать, загрузить и использовать. Размер модели говорит не о её «уме», а о ёмкости — сколько закономерностей она способна запомнить. Большая часть прогресса в современном AI — это не новые архитектуры, а новые модели на старых архитектурах, обученные на лучших данных. И главное, что отличает модель от просто файла: внутри неё спрятан опыт, добытый из миллионов примеров.