Model

model — архитектура нейросети плюс обученные веса в одном файле

Раздел
Основы AI
Обновлено
18.05.26

Модель в AI — это файл с обученной нейросетью. Внутри лежат архитектура (как соединены слои) и веса (миллионы или миллиарды чисел, подобранных на данных). Архитектура одна и та же может породить разные модели, если обучить её на разных данных или с разной целью. GPT-4, Claude, Llama, Stable Diffusion, Whisper — это всё модели, каждая со своим размером (от мегабайт до сотен гигабайт) и специализацией.

Коротко

Коротко. Модель — это обученная нейросеть, упакованная в файл. Внутри два слоя: архитектура (схема связей между нейронами) и веса (миллионы или миллиарды чисел, найденные во время обучения). Файл подгружается в программу, и та начинает отвечать на запросы — генерировать текст, распознавать речь, рисовать картинку. Чем больше параметров и чем чище были данные, тем точнее модель решает свою задачу.

Что это такое

Папка models/ в ComfyUI. Внутри — sd_xl_base_1.0.safetensors на 6.9 гигабайт. Это и есть модель: один файл, в котором лежит способность Stable Diffusion рисовать почти что угодно по текстовому запросу.

Никаких хитрых программ внутри нет. Только числа. Веса нейронов и параметры слоёв — несколько миллиардов значений, упакованных в бинарный формат. Когда программа загружает этот файл в память видеокарты, нейросеть оживает. Когда выгружает — становится просто числами на диске.

Это и есть главное свойство модели. Модель — это снимок знания, который можно передать, сохранить, скопировать. Точно так же, как программа сохраняется в .exe-файл, а музыкальный трек — в .mp3, обученная нейросеть сохраняется в .safetensors, .gguf, .bin или .onnx.

Архитектура и модель — две разные вещи. Архитектура (например, «transformer 12 слоёв, 768 каналов внимания») — это рецепт. Модель — это рецепт, по которому уже приготовили блюдо. По одному рецепту можно сделать разные блюда: ту же архитектуру обучают на разных данных и получают разные модели. GPT-3, GPT-4, Claude и Gemini имеют похожую базовую архитектуру transformer, но это разные модели с разными весами.

Как это работает

В жизни модели три стадии: обучение, сохранение, использование.

  1. Обучение. Архитектуре с пустыми весами показывают миллионы примеров. Алгоритм обратного распространения постепенно подкручивает веса в сторону, уменьшающую ошибку. Через дни или недели на GPU-кластерах веса приходят в состояние, при котором модель угадывает правильные ответы на проверочных данных.
  2. Сохранение. Веса замораживаются. Архитектура и веса записываются на диск в одном из форматов: .safetensors (для diffusion), .gguf (для квантизованных LLM), .bin или .pt (PyTorch), .onnx (универсальный), .gguf (CPU-friendly).
  3. Использование (inference). Программа загружает файл в память (VRAM или RAM), подаёт на вход данные — модель считает выход. Веса не меняются, обучение не идёт. На этом этапе модель — это просто детерминированная функция: одинаковые входы → один и тот же выход.

Размер модели = размер файла. Каждый параметр занимает байты: 4 байта для FP32, 2 байта для FP16, 1 байт для INT8, 0.5 байта для квантизации в 4 бита.

Модель Параметры FP16 (.safetensors) INT4 (.gguf)
Stable Diffusion 1.5 0.9 млрд ~2 ГБ ~1 ГБ
Stable Diffusion XL 3.5 млрд ~6.9 ГБ ~3 ГБ
Llama 3 8B 8 млрд ~16 ГБ ~4.5 ГБ
Whisper Large v3 1.55 млрд ~3 ГБ ~1 ГБ
GPT-3 175 млрд ~350 ГБ ~90 ГБ
FLUX.1 dev 12 млрд ~24 ГБ ~7 ГБ

Пример на практике

Видеомонтажёр настраивает workflow для апскейлинга кадров в ComfyUI. Нужно увеличить разрешение с 1280×720 до 4K с восстановлением деталей.

Выбор модели — главное решение. В папке models/upscale_models/ несколько вариантов:

  • RealESRGAN_x4.pth (66 МБ) — универсальный апскейлер, обучен на синтетике, средняя детализация.
  • 4xUltraSharp.pth (66 МБ) — заточен под фотореалистичный апскейл, лучше держит резкость.
  • 4x_NMKD-Siax_200k.pth (66 МБ) — специализация: лица и кожа.
  • Remacri_4x.pth (67 МБ) — мягкий стиль, хорош для рисованного контента.

Все они имеют одну архитектуру ESRGAN. Но обучены на разных датасетах с разными целями — поэтому работают по-разному. Выбор зависит от типа кадров: для лиц подойдёт 4x_NMKD-Siax_200k, для городских пейзажей — 4xUltraSharp, для анимации — Remacri_4x.

Это и есть смысл слова «модель» на практике: одна и та же архитектура порождает десятки специализированных версий, каждая со своей областью применения. Сообщество Hugging Face и Civitai хранят больше миллиона публичных моделей — для каждой задачи можно найти готовое.

С чем часто путают

  • Модель и алгоритм — алгоритм описывает шаги работы (например, transformer-блок: сначала attention, потом MLP). Модель — это конкретный экземпляр алгоритма с обученными весами. Алгоритм пишется один раз; моделей на этом алгоритме могут быть тысячи.
  • Модель и архитектура — архитектура определяет, сколько слоёв, какой размер, как они соединены. Модель = архитектура + конкретные значения весов. Без весов архитектура — пустой скелет.
  • Модель и Checkpoint — Checkpoint часто используется как синоним модели в мире Stable Diffusion. Изначально checkpoint — это «снимок» весов на определённой эпохе обучения. На практике в ComfyUI и Automatic1111 «checkpoint» означает основную модель.
  • Модель и веса (weights) — веса это содержимое модели, миллионы чисел. Иногда говорят «обновить веса», «выложить веса» — это в практике означает «выпустить модель» или «обновить модель».
  • Модель и продуктChatGPT, Claude, Midjourney — это продукты со своими интерфейсами. Внутри них модели (GPT-4, Claude 3.5 Sonnet, проприетарный Midjourney v6). Один и тот же продукт может использовать разные модели на бэкенде.

Частые ошибки и заблуждения

  • Большая модель всегда лучше маленькой. Не всегда. Для узкой задачи специализированная маленькая модель (например, BERT-base на 110 млн параметров для классификации) обыгрывает GPT-4 по скорости и стоимости, давая сопоставимую точность. Большая модель оправдана для широких или плохо определённых задач.
  • Модель «знает» текущие новости. Нет. Модель знает только то, что было в её обучающих данных. Cutoff date — момент, после которого данные не использовались. Для актуальной информации нужен RAG (модель ищет в свежих документах) или специальные обновления через инструменты.
  • Можно дообучить любую модель за пару часов. Полное дообучение большой модели требует кластера и недель времени. Лёгкое дообучение (LoRA, fine-tuning последних слоёв) — действительно вопрос часов и доступно на одной GPU.
  • Все модели одного семейства одинаковы. Нет. SD 1.5, SDXL и SD 3 имеют разную архитектуру (количество и тип слоёв), разные размеры, разные требования к промпту. Промпт, работающий в SD 1.5, может дать что-то совершенно иное в SDXL.
  • Открытая модель = бесплатная для коммерции. Не всегда. Модель может быть «open weights», но с лицензией, ограничивающей коммерческое использование (Llama 2 community license, FLUX dev для non-commercial). Лицензию каждой модели нужно читать отдельно.

Связанные термины

  • Neural Network — архитектура, на которой строится модель.
  • Checkpoint — синоним модели в мире Stable Diffusion и других diffusion-систем.
  • Parameters / Weights — то, из чего состоит обученная модель.
  • Fine-tuning — дообучение готовой модели на узкой задаче.
  • LoRA — лёгкий способ добавить к модели специализацию без перезаписи весов.
  • Inference — процесс использования модели для предсказаний.
  • Safetensors / GGUF / ONNX — форматы хранения модели на диске.
  • Hugging Face — крупнейший каталог открытых моделей.

Частые вопросы

Где хранятся скачанные модели? Зависит от программы. ComfyUI: models/checkpoints/ для основных, models/loras/ для LoRA, models/vae/ для VAE. Llama.cpp: рядом с бинарником или по пути в конфиге. Hugging Face Transformers: ~/.cache/huggingface/hub/ по умолчанию.

Сколько GPU-памяти нужно для модели? Минимум — размер весов в FP16 плюс память для активаций. Для SDXL FP16 (6.9 ГБ) нужна карта от 8 ГБ VRAM. Для Llama 8B в FP16 — от 16 ГБ. Квантизация в 4 бита снижает требования вчетверо: SDXL → ~2 ГБ, Llama 8B → ~5 ГБ.

Можно ли запустить модель без интернета? Любую открытую модель — да. Скачали файл, запустили локально. Закрытые модели (GPT-4, Claude, Gemini) доступны только через API провайдера.

Что такое «base model» и «fine-tuned model»? Base — модель, обученная с нуля на массиве разнородных данных. Fine-tuned — модель, дополнительно обученная на узком датасете для специализации. Civitai и Hugging Face полны fine-tune'ов: «реалистичный портрет», «аниме-стиль», «архитектурная визуализация».

Чем .safetensors лучше .ckpt и .pt? .ckpt и .pt могут содержать произвольный Python-код через pickle. Это вектор атаки: вредоносный файл может выполнить команды при загрузке. .safetensors — простой бинарный формат, только числа, безопасен по дизайну. Сейчас это де-факто стандарт для публикации моделей.

Главное

Модель — это материальное воплощение того, чему научилась нейросеть. Архитектура отвечает за форму, веса — за содержание; вместе они дают файл, который можно скачать, загрузить и использовать. Размер модели говорит не о её «уме», а о ёмкости — сколько закономерностей она способна запомнить. Большая часть прогресса в современном AI — это не новые архитектуры, а новые модели на старых архитектурах, обученные на лучших данных. И главное, что отличает модель от просто файла: внутри неё спрятан опыт, добытый из миллионов примеров.