Generative AI
generative AI — модели, которые создают новые объекты, а не классифицируют
Генеративный AI (Generative AI) — класс нейросетей, которые создают новый контент: тексты, изображения, видео, музыку, код. В отличие от классических моделей классификации (распознать кота на фото), генеративные модели рисуют кота с нуля по описанию. К ним относятся ChatGPT, Stable Diffusion, Sora, Midjourney, Flux и десятки других. Это сдвиг 2022–2025 годов, который превратил AI из исследовательского инструмента в массовый.
Коротко
Коротко. Generative AI — это модели, главная задача которых создавать новые объекты, а не оценивать существующие. ChatGPT генерирует текст, Stable Diffusion в ComfyUI — изображение, Sora — видеоролик. Все они учились на огромных коллекциях данных и теперь умеют выдавать новые примеры в том же стиле.
Что это такое
Десять лет назад фразу «сгенерируй кота на подоконнике в стиле акварели» компьютер не понимал. Сегодня — выдаёт картинку за двадцать секунд. И это не поиск по архиву. Этой картинки до запроса не существовало.
Здесь и проходит граница между двумя поколениями AI.
Классический AI почти всегда занимался задачами различения. Это спам или нет? На фотографии кот или собака? Какая эмоция в голосе? Такие модели сравнивают вход с тем, что они уже видели, и относят его к одной из категорий.
Генеративные модели меняют постановку. Им показывают примеры — миллионы текстов, изображений, аудиозаписей — и просят научиться производить новые примеры в том же распределении. Не «отличить кота от собаки», а «нарисуй мне кота», «напиши абзац про осеннюю прогулку», «озвучь эту реплику».
Из этого вытекают две практические особенности генеративных моделей. Во-первых, результат принципиально вероятностный — один и тот же запрос даст разные ответы. Во-вторых, модель отвечает за форму и стиль, но не за фактическую точность.
Как это работает
Внутри большинства современных генеративных моделей лежит одна из трёх архитектур.
- Авторегрессионные модели (GPT, LLaMA, Claude) предсказывают следующий токен — кусочек текста — по предыдущим. Текст пишется слева направо, по одному фрагменту.
- Диффузионные модели (Stable Diffusion, FLUX, Sora) начинают со случайного шума и шаг за шагом превращают его в осмысленную картинку или видео, опираясь на описание.
- Гибриды объединяют подходы: одна модель кодирует контекст, другая генерирует результат. Так работают мультимодальные системы, которые отвечают одновременно текстом и картинкой.
Общая идея у всех — научиться имитировать распределение исходных данных. Если модель видела миллионы фотографий городов, она хорошо умеет дорисовывать новые. Если она видела миллионы строчек кода, она научилась продолжать программу.
Пример на практике
Видеомонтажёр готовит превью к серии из тридцати роликов. Каждое — со своей сценой, своим настроением, своим заголовком. Раньше пришлось бы рисовать или собирать каждую обложку вручную: подобрать кадр, выровнять, наложить шрифт. Тридцать роликов — три рабочих дня минимум.
С генеративным AI задача меняет масштаб. В ComfyUI собирается workflow: Stable Diffusion получает короткое описание сцены, ControlNet задаёт позу или композицию, IP-Adapter подмешивает фирменный стиль студии. Промпт меняется, остальное стоит на месте.
За двадцать минут выходит сотня вариантов в одном настроении. Из них монтажёр отбирает тридцать удачных, ещё час уходит на подгонку шрифтов. Три рабочих дня превратились в полдня.
Сила здесь не в магии, а в скорости перебора. Генеративная модель выдаёт варианты быстрее, чем человек успевает их продумать.
С чем часто путают
- Generative AI и поиск похожих картинок — поиск возвращает то, что уже есть в базе. Генерация создаёт новое. Картинка, которую вы получите из Stable Diffusion, не лежит ни в одном архиве: модель собирает её из статистических закономерностей.
- Generative AI и копирование стиля — модель не копирует конкретное произведение. Она училась на миллионах работ, и в результате может имитировать общий стиль (импрессионизм, нуар, акварель). Юридическая граница между «обучением» и «копированием» пока размытая, и в разных странах решается по-разному.
- Generative AI и LLM — LLM это подвид генеративного AI, специализированный на тексте. Диффузионные модели для картинок — тоже генеративные, но другая архитектура. Все LLM генеративные, но не все генеративные — LLM.
- Generation и Inference — генерация это конкретный результат (одна картинка, один абзац). Inference — общий процесс работы любой обученной модели, включая классификацию. Терминологически inference шире.
Частые ошибки и заблуждения
- Generative AI всегда лучше классического. Нет. Для задач классификации (это спам или нет?) или поиска (найди похожие документы) генеративные модели обычно избыточны и хуже специализированных.
- Модель «придумывает» новое. Скорее переставляет известное. Результат всегда лежит внутри распределения обучающих данных. То, чего модель не видела ни в каком виде, она и не породит.
- Если результат красивый, значит он точный. Генеративная модель отвечает за форму, а не за факты. Текст может звучать уверенно и оказаться неверным. Картинка может быть стильной и при этом с шестью пальцами на руке.
- Чем дороже модель, тем лучше. На практике результат сильно зависит от формулировки промпта и параметров (CFG Scale, Seed, Sampler). Маленькая модель с грамотной настройкой часто бьёт большую модель «в лоб».
Связанные термины
- AI — общее семейство методов, в которое входит Generative AI.
- LLM — большие языковые модели, генеративные по своей природе.
- Stable Diffusion — наиболее известная локальная диффузионная модель для изображений.
- FLUX — современная диффузионная модель с другим принципом генерации.
- Prompt — текст-запрос, которым управляют генеративной моделью.
- Hallucination — оборотная сторона генерации: уверенный, но неверный ответ.
Частые вопросы
Чем Generative AI отличается от обычного AI? Обычный AI чаще решает задачи распознавания и предсказания: «это что?», «это произойдёт?». Generative AI отвечает на другой вопрос: «как это могло бы выглядеть?». Это разные цели и часто разные архитектуры.
Где Generative AI работает плохо? Там, где нужна гарантия точности: юридические тексты, медицинские заключения, расчёты. Модель выдаёт правдоподобный результат, но без проверки человеком его нельзя использовать в ответственных сферах.
Можно ли запустить генеративную модель локально? Изображения — да, Stable Diffusion и FLUX отлично работают на видеокартах с 8–16 ГБ памяти. Текстовые модели побольше — труднее: для качественной LLM нужны 24+ ГБ VRAM или квантованные версии. Видео-генерация на потребительском железе пока тяжёлая.
Все ли Generative AI используют диффузию? Нет. Диффузия — это в основном про изображения и видео. Текстовые модели работают авторегрессионно. Музыкальные и голосовые модели — отдельная категория со своими подходами.
Кому принадлежит результат генерации? Юридическая ситуация неустоявшаяся и зависит от страны. В большинстве юрисдикций пока считается, что объекту, созданному только машиной, не положена авторская защита. Если человек существенно участвовал в работе (промпт, выбор, доработка) — права в большинстве случаев у него.
Главное
Generative AI — это не одна технология, а целый класс моделей, которые создают новые объекты на основе того, что видели. Они дают огромный прирост скорости в производстве визуала, текста и звука, но требуют человека на двух местах: на входе (поставить задачу) и на выходе (проверить результат). Чем точнее формулировка и чем разумнее проверка, тем полезнее эти модели в реальной работе.