AI Library · Каталог

Каталог156/ 156

Все термины библиотеки с поиском, фильтром по разделу и семью способами сортировки.

Раздел
Мужчина-оператор ведёт цель Agentic AI по циклу планирования, инструментов, действий, наблюдений и проверки, останавливая рискованный шаг у подтверждения. Языковые модели Agentic AI Agentic AI — системы, которые планируют несколько шагов, используют инструменты и проверяют промежуточный результат. Они особенно полезны там, где есть… 5 мин Мужчина управляет тремя AI-станциями, которые распознают звук, предсказывают результат и создают изображение на основе данных. Основы AI AI ИИ Искусственный интеллект, AI или ИИ, — широкое название систем, которые распознают данные, строят прогнозы, создают контент, планируют шаги или помогают… 6 мин Девушка за рабочим столом проходит цикл цели, выбора, действия и проверки — наглядная схема работы AI-агента. Языковые модели AI Agent AI Agent (AI-агент) — это LLM, которая не просто отвечает на вопрос, а решает задачу через несколько шагов и использует… 7 мин Аналитик проверяет выводы AI: слева система выделяет аномалии и помогает расследованию, справа показаны фишинг, подделка медиа, поиск уязвимостей и вредоносный код. Применения AI in Cybersecurity AI в кибербезопасности помогает разбирать поток событий, искать аномалии, группировать оповещения и готовить черновики расследований. Те же технологии упрощают фишинг,… 6 мин Студентка решает задачу сама, а учебная AI-система последовательно даёт подсказку, обратную связь и новую задачу для практики. Применения AI in Education AI в образовании помогает объяснять материал разными способами, давать подсказки, создавать тренировочные задания и разбирать черновики. Учителю он может снять… 6 мин Молодая врач проверяет три узких результата медицинского AI — черновик записи, отмеченный участок снимка и закономерность в данных — прежде чем обсудить клиническое решение с пациенткой. Применения AI in Healthcare Нейросети в медицине помогают готовить черновики клинических записей, анализировать снимки и искать закономерности в данных. Это не единый «AI-врач», а… 6 мин Инженер и руководитель проводят AI-систему через оценку риска, проверку, запуск, наблюдение за инцидентами и исправление, сохраняя ответственность на всём цикле. Этика и регулирование AI Safety AI Safety изучает, как снизить вероятность вреда от модели и продукта вокруг неё. Сюда входят тесты, защита данных и инструментов,… 7 мин Журналистка и золотистый ретривер находят документы для AI-поиска; выбранные фрагменты поступают в синтез ответа, а цветные нити связывают его со ссылками и проверяемыми источниками. Языковые модели AI Search AI Search — это новый формат поиска, в котором система не показывает список ссылок, а формирует прямой ответ через LLM… 6 мин Инженерка калибрует поведение модели: примеры ответов, пары предпочтений и принципы проходят через SFT, RLHF или DPO, а проверки возвращают ошибки на следующий цикл настройки. Языковые модели Alignment Alignment — процесс настройки LLM на поведение, согласованное с человеческими ценностями: быть полезной, честной, безопасной (helpful, honest, harmless). Без alignment… 5 мин Аниматор подключает модуль движения к базовой диффузионной модели, которая сохраняет стиль кадра; временная связь превращает фазы прыжка белого кота в короткую анимацию. Видео AnimateDiff AnimateDiff — способ заставить обычную модель Stable Diffusion рисовать не один кадр, а короткое видео. К модели подключается отдельный «модуль… 5 мин Бэкенд-разработчик принимает данные приложения, добавляет ключ из защищённого хранилища, отправляет запрос через API к сервису и раздельно обрабатывает ответ, ошибку и журнал вызова. Основы AI API Application Programming Interface API (Application Programming Interface) в контексте AI — это способ программно отправлять запросы к языковой модели и получать ответы. Вместо… 6 мин Арт-директорка сравнивает один танцевальный сюжет в квадратном, горизонтальном и вертикальном кадрах: меняются пропорции ширины и высоты и композиция, но фигура не растягивается. Параметры Aspect Ratio AR Aspect Ratio описывает форму кадра как отношение ширины к высоте. Оно влияет на композицию и на то, насколько размер близок… 5 мин Иллюстраторка и кот показывают AUTOMATIC1111: модель, промпт и параметры собираются в браузерной форме, локальный компьютер создаёт изображение и сохраняет данные генерации в PNG Info. Инструменты AUTOMATIC1111 AUTOMATIC1111 (или Stable Diffusion WebUI) — классический веб-интерфейс для запуска моделей Stable Diffusion, появился в августе 2022 года. Долгое время… 5 мин Операторка показывает Batch Size: четыре портрета животных идут через модель вместе, следующие кассеты — по очереди, память ограничивает пачку, а градиенты накапливаются до обновления весов. Параметры Batch Size Batch Size — количество примеров в одном вычислительном пакете. При генерации он влияет на память, задержку и пропускную способность; при… 5 мин Аналитик сравнивает модели на одном бенчмарке: общий тестовый набор, промпт, настройки и метрика дают сопоставимые результаты, которые затем проверяют на закрытых и собственных задачах. Языковые модели Benchmark Benchmark — общий набор задач, правил запуска и метрик для сравнения моделей. Результат имеет смысл только вместе с версией датасета,… 6 мин Промышленный дизайнер показывает Canny Edge: снимок мотоцикла проходит сглаживание, градиенты, истончение и двойной порог, а контурная карта сохраняет геометрию в новом стиле. Адаптеры Canny Edge Canny Edge — алгоритм извлечения контуров изображения, изобретённый Джоном Канни в 1986-м. В Stable Diffusion через ControlNet Canny используется как… 5 мин Операторка показывает CFG Scale: безусловное и условное предсказания задают направление к промпту, усиление повышает соответствие, а чрезмерная сила приводит к насыщению и артефактам. Параметры CFG Scale Classifier-Free Guidance CFG Scale управляет тем, насколько сильно диффузионная модель отталкивается от безусловного предсказания в сторону промпта. Слишком слабое влияние может дать… 5 мин Девушка работает со станцией ChatGPT, где модель GPT соединена с поиском, файлами, изображениями, голосом и кодом. Языковые модели ChatGPT ChatGPT — AI-ассистент OpenAI с чатом, поиском, памятью и инструментами для файлов, изображений, голоса и кода. Это продукт вокруг семейства… 5 мин Библиотекарка и рыжий кот показывают Chunking: документ делится по структуре, перекрытие сохраняет контекст на границе, а метаданные помогают индексу находить релевантные фрагменты. Языковые модели Chunking Chunking — разбиение длинных документов на маленькие фрагменты (chunks) для индексации в RAG. От выбора размера и стратегии разбиения зависит… 5 мин Исследовательница подаёт документы и вопрос в модель Claude, которая работает через приложение или API с контекстом и инструментами. Языковые модели Claude Claude — семейство языковых моделей и AI-ассистент от компании Anthropic, основанной бывшими сотрудниками OpenAI. Модели семейства рассчитаны на разные сочетания… 6 мин Две героини и рыжий кот показывают CLIP: текстовый и визуальный энкодеры создают векторы, подходящая пара сближается в общем пространстве, а неподходящая остаётся далеко. Генеративные модели CLIP Contrastive Language-Image Pretraining CLIP состоит из текстового и визуального энкодеров, обученных сближать подходящие пары «изображение — подпись» и отдалять неподходящие. Благодаря этому текст… 6 мин Художница соединяет узлы ComfyUI: модель, промпт и фотография русской борзой проходят через обработку к готовому изображению, а workflow сохраняется в JSON и метаданных. Инструменты ComfyUI ComfyUI — это визуальный интерфейс для запуска моделей генерации изображений на основе графа узлов. Каждый шаг пайплайна (загрузка модели, кодирование… 6 мин Специалистка и бигль показывают ComfyUI Manager: недостающий пакет находят в Registry, проверяют, устанавливают и тестируют, а снимок окружения помогает вернуть рабочую сборку. Инструменты ComfyUI Manager ComfyUI Manager помогает искать, устанавливать, обновлять и отключать custom nodes, находить недостающие пакеты из чужого workflow, управлять моделями и сохранять… 4 мин Механический компьютерный агент повторяет цикл из снимка экрана, решения, движения курсора, клика или ввода и нового снимка, останавливая важное действие у подтверждения. Языковые модели Computer Use Computer-Using Agent (CUA) Computer Use (CUA, компьютерный агент) — ИИ-агент, который управляет компьютером как человек: делает скриншот экрана, «видит» интерфейс, двигает курсор, кликает… 7 мин Редактор отбирает инструкции, память, документы и инструменты, упорядочивает и сжимает их в окно контекста, из которого модель формирует ответ; кошка играет с отброшенной запиской. Промпты Context Engineering Context Engineering — практика системно снабжать AI-модель нужным контекстом до того, как она ответит. Память о пользователе, документы через RAG,… 5 мин Девушка раскладывает инструкции, документы, диалог и вопрос на ограниченном столе, показывая границы контекстного окна модели. Языковые модели Context Window Контекстное окно — объём токенов, доступный модели во время одного вызова. Туда попадают инструкции, история диалога, документы, результаты инструментов и… 6 мин Танцовщица задаёт карту позы для ControlNet: обучаемая ветка передаёт пространственное условие замороженной модели, а промпт меняет образ в итоговой генерации без копирования исходника. Адаптеры ControlNet ControlNet — техника управления композицией в диффузионных моделях через зрительную подсказку: скелет позы (OpenPose), контур (Canny), карту глубины (Depth), набросок… 6 мин Аналитик и чёрно-белый кот показывают расчёт стоимости LLM API: input, output, кэш, инструменты и повторы сверяются с usage-логом и текущими ставками провайдера. Языковые модели Cost per Token Cost per Token описывает тарификацию LLM API по объёму входа и выхода. К итоговой сумме могут добавляться кэш, инструменты, хранение… 5 мин Инженерка показывает CUDA: код на CPU проходит через драйвер и runtime, данные попадают в VRAM, а kernel запускает параллельные потоки GPU для матричных операций. Инструменты CUDA Compute Unified Device Architecture CUDA связывает программы с видеокартами NVIDIA. Через её runtime, драйвер и библиотеки фреймворки запускают матричные операции, свёртки и attention на… 5 мин Девушка в Cursor связывает запрос с файлами проекта, получает diff изменений и запускает проверку кода. Инструменты Cursor Cursor — редактор на базе VS Code с AI-функциями для автодополнения, поиска по проекту и многофайловых изменений. Он соединяет контекст… 5 мин Инженер и бордер-колли показывают Custom Nodes: node pack содержит код, интерфейс и зависимости, принимает входы, выполняет операцию и добавляет выходы в workflow ComfyUI. Инструменты Custom Nodes Custom Nodes — сторонние расширения ComfyUI. Они добавляют новые загрузчики, модели, способы управления, обработку видео, звука и изображений. В обычной… 7 мин Иллюстратор отправляет текстовое описание в закрытое облачное ателье DALL-E, сравнивает варианты оранжереи, вносит правку и выбирает готовое изображение. Генеративные модели DALL-E DALL-E — семейство закрытых моделей генерации изображений OpenAI, начатое в 2021 году. Оно прошло путь от отдельного генератора до связки… 6 мин Кураторка показывает путь датасета: собирает и размечает примеры, удаляет дубли, проверяет происхождение, покрытие и баланс, затем разделяет набор на train, validation и закрытый test. Обучение Dataset Dataset, или датасет, — организованный набор примеров для обучения, настройки или проверки модели. В нём важны не только объём и… 6 мин Фотографка подписывает снимок сиба-ину: фотография получает точное описание, затем снимок и подпись скрепляются в одну пару для обучения модели. Обучение Dataset Captioning Dataset Captioning — подготовка текстовых подписей к изображениям в обучающем датасете. Подпись связывает конкретный снимок с его содержанием и помогает… 4 мин Пять прозрачных слоёв Deep Learning превращают пиксели изображения кота в края, текстуры, части и целый объект, пока рядом сидит настоящий кот. Основы AI Deep Learning DL Deep Learning, или глубокое обучение, — область machine learning, где модель строится из нескольких обучаемых преобразований. Вместо заранее написанного списка… 7 мин Исследователь направляет одну задачу DeepSeek в облачный API или в локально запущенные доступные веса модели. Языковые модели DeepSeek DeepSeek — компания и семейство языковых моделей, включающее облачные API, модели рассуждения, кодовые варианты и опубликованные веса. Линейки, лицензии и… 6 мин Четыре снимка мейн-куна показывают Denoising Strength: чем выше сила и больше начального шума, тем заметнее результат отходит от исходника. Параметры Denoising Strength Denoising Strength задаёт, насколько сильно генерация может отойти от входного изображения. Чем выше сила, тем больше шума получает исходник перед… 5 мин Комната с таксой превращается в Depth Map: светлый передний план и тёмный фон сохраняют расстановку и перспективу при смене отделки интерьера. Адаптеры Depth Map Depth Map кодирует глубину сцены: какие поверхности находятся ближе, а какие дальше. Такая карта помогает генеративной модели сохранить расстановку и… 5 мин Типограф сравнивает генерацию текста: печатная машинка выдаёт токены слева направо, а диффузионная модель параллельно проявляет весь блок через маску, черновик и готовый текст. Языковые модели Diffusion LLM Diffusion Language Model Diffusion LLM, или dLLM, генерирует текст через несколько раундов уточнения. Модель начинает с замаскированной последовательности, восстанавливает часть токенов и снова… 7 мин Четыре снимка показывают, как диффузионная модель шаг за шагом превращает визуальный шум в фотографию девушки с котёнком. Генеративные модели Diffusion Model Diffusion Model — семейство генеративных моделей, которые учатся восстанавливать данные из зашумлённого состояния. При генерации процесс идёт от случайного шума… 6 мин Фотограф обучает DreamBooth по снимкам одного корги; отдельная ветвь сохраняет класс собак, а выходы показывают новые сцены, полные веса и LoRA. Адаптеры DreamBooth DreamBooth — рецепт персонализации text-to-image модели по нескольким изображениям конкретного объекта. Во время обучения редкий идентификатор связывается с его внешностью,… 9 мин Промышленный инженер показывает Edge AI: датчик передаёт сырые данные устройству рядом с мотором, локальный инференс даёт результат на месте, а в облако уходят только нужные данные. Инструменты Edge AI Edge AI запускает модель на телефоне, компьютере, камере, автомобиле или локальном сервере рядом с устройством. Такой подход уменьшает зависимость от… 6 мин Диктор записывает голос у микрофона, а звукоинженер ведёт четыре ветви ElevenLabs — синтез речи, клон с согласием, дубляж и голосового агента, затем прослушивает результат. Видео ElevenLabs ElevenLabs — облачная платформа для работы с AI-аудио. Она превращает текст в речь, создаёт и клонирует голоса, переводит аудио и… 6 мин Руки размещают карточки с кошкой, котёнком, щенком и автомобилем на карте смысловой близости эмбеддингов. Языковые модели Embedding Embedding (эмбеддинг) — это длинный вектор чисел, который представляет смысл слова, фразы, документа или изображения. Близкие по смыслу объекты получают… 6 мин Шесть фотографий серого кота сгруппированы в три batch по две и лежат вокруг кругового сканера: полный круг по всем примерам обозначает одну эпоху. Обучение Epoch Epoch, или эпоха, — один проход через весь обучающий набор. Она показывает, сколько раз данные были охвачены тренировкой, но сама… 7 мин Юристка оценивает назначение, контекст и роль компании, после чего AI-система попадает в одну из веток EU AI Act: запрет, высокий риск, прозрачность или минимальный риск. Этика и регулирование EU AI Act EU AI Act регулирует AI в Евросоюзе с учётом назначения системы, уровня риска и роли компании. Для запрещённых практик, высокорисковых… 7 мин Аудитор прослеживает через линзу путь от входных данных через модель к решению; объяснение показывает причины, верность процессу, понятность человеку и границы знания. Этика и регулирование Explainable AI XAI Explainable AI объединяет методы, которые помогают исследовать вклад признаков, сравнивать возможные решения и объяснять работу системы разным людям. Одно объяснение… 6 мин На рабочем столе показано сравнение размытого лица и восстановленного портрета, где обработка исправляет только проблемную область. Инструменты Face Restoration Face Restoration — отдельный пост-обработочный шаг, который улучшает лица на сгенерированной или старой фотографии. Решает классическую проблему AI-генерации: лица «уплывают»,… 4 мин Три синтетических портрета показывают, как Faceswap переносит лицо-источник в позу, мимику и свет целевого кадра, сохраняя отметку согласия и изменения. Инструменты Faceswap Faceswap переносит черты лица из изображения-источника в фотографию или видео. Система находит лицо, сопоставляет его с позой и мимикой человека… 5 мин Портниха меняет детали готового костюма на манекене: метафора fine-tuning, который адаптирует основу на примерах. Обучение Fine-tuning Fine-tuning продолжает обучение готовой модели на данных конкретной задачи. Так можно закрепить формат, стиль, терминологию или способ принимать решения. Полное… 7 мин Дизайнер ведёт FLUX по двум ветвям: создаёт новую сцену из текстового промпта и редактирует фотографию русской борзой с помощью исходника и референсов, затем проверяет варианты. Генеративные модели FLUX FLUX — семейство генеративных моделей Black Forest Labs для создания и редактирования изображений. В нём есть облачные и self-hosted варианты,… 6 мин Мастер сравнивает шкалы FP16, BF16 и двух вариантов FP8; отдельный коллектор показывает scaling и накопление в более высокой точности. Параметры FP16, BF16, FP8 FP16, BF16 и FP8 по-разному делят биты между экспонентой и дробной частью. FP16 оставляет больше значащих битов, BF16 сохраняет диапазон… 10 мин Модель выбирает инструмент и формирует имя с аргументами, приложение проверяет схему и права, выполняет функцию, возвращает результат модели и получает итоговый ответ. Языковые модели Function Calling Function Calling позволяет модели выбрать описанную функцию и вернуть её имя с JSON-аргументами. Функцию выполняет приложение, а не сама LLM.… 5 мин Журналист подаёт текст, изображение, аудио и видео в модель Gemini, затем получает доступ к ней через приложение или API и подключает инструменты. Языковые модели Gemini Gemini — семейство моделей Google для текста, изображений, аудио, видео и работы с инструментами. Доступ к нему встроен в пользовательские… 6 мин Три девушки получают от генеративного AI новые варианты текста, изображения с котом, звука и видео из одного промпта и выбирают подходящий результат. Основы AI Generative AI Генеративный AI Генеративный AI создаёт текст, изображения, звук, видео, код и другие данные по примерам и условиям. Модель не достаёт готовый файл… 6 мин Инженер собирает GGUF из метаданных, тензоров и параметров токенизатора, показывает необязательную квантизацию, один файл и части модели; рядом лежит рыжий мейн-кун. Инструменты GGUF GPT-Generated Unified Format GGUF — переносимый формат тензоров и метаданных, тесно связанный с llama.cpp и совместимыми приложениями. Файл может содержать квантизированные веса, сведения… 5 мин Разработчица показывает устойчивый путь Google AI Studio: промпт и мультимодальные данные проходят через браузерный эксперимент, проверку ответа, Get code, Gemini API и прототип приложения. Инструменты Google AI Studio Google AI Studio помогает испытать модели Gemini в браузере, настроить промпт и мультимодальный вход, получить пример вызова API и собрать… 6 мин Типографский механизм GPT связывает входные токены контекстом и печатает следующий токен, показывая смысл частей названия. Языковые модели GPT Generative Pre-trained Transformer GPT расшифровывается как Generative Pre-trained Transformer. Это семейство моделей OpenAI, которые предварительно обучаются на больших наборах данных, а затем настраиваются… 6 мин Химик наблюдает за молекулярным графом: соседние узлы передают сообщения по рёбрам, центральный узел агрегирует их, обновляет своё представление и расширяет видимую окрестность. Основы AI Graph Neural Networks GNN Graph Neural Networks (GNN) — класс нейросетей, который работает не с таблицами, картинками или текстами, а с графами: узлами и… 6 мин Редактор направляет диалог, файлы, изображения и поиск в Grok, различая ассистента, модели, приложение, API и инструменты, а найденные сведения проверяет по источникам. Языковые модели Grok Grok — семейство языковых моделей и AI-ассистент компании xAI. Он умеет отвечать на вопросы, работать с текстом и кодом, а… 5 мин Картограф показывает на одной латунной направляющей предсказания U, C и GUIDED; рядом схема отделяет CFG от model-native guidance и весов адаптеров. Параметры Guidance Guidance — семейство способов направлять генерацию к условию. Классический CFG усиливает разницу между условным и опорным предсказаниями, некоторые модели получают… 9 мин Девушка и кот проверяют уверенный ответ по книгам и источникам: метафора правдоподобной галлюцинации модели. Языковые модели Hallucination Hallucination (галлюцинация) — ошибка LLM, когда модель уверенно выдумывает факт, который выглядит правдоподобно, но не существует. Это не баг, а… 6 мин Слева агентский harness ведёт задачу через модель, инструмент и проверку по кругу, справа оценочный harness проводит одинаковые задания через модель к метрике и отчёту. Инструменты Harness Harness — это программный слой, который организует работу модели: собирает вход, ведёт состояние, вызывает разрешённые инструменты, проверяет результат и сохраняет… 8 мин Маленький портрет девушки с котом увеличивается, а затем проходит повторную прорисовку: композиция сохраняется, волосы, ткань и шерсть становятся детальнее. Параметры Hires.fix Hires.fix строит изображение в два прохода. Сначала модель создаёт базовый кадр и его композицию. Затем кадр увеличивается и частично зашумляется,… 6 мин Запрос о тихом вентиляторе AX-17 делится на поиск по точным словам и по смыслу, после чего обе ветки объединяются в общий список результатов. Языковые модели Hybrid Search Hybrid Search объединяет несколько способов найти документы. Лексическая ветка удерживает точные слова и коды, семантическая замечает близкий смысл и перефразировки,… 5 мин Малая сеть Hypernetwork получает ключи K и значения V, добавляет к ним регулируемую поправку и возвращает изменённый сигнал внимания в базовую модель с закрытыми весами. Адаптеры Hypernetwork Hypernetwork в генерации изображений — отдельный обучаемый модуль, который преобразует ключи и значения attention и добавляет к ним свою поправку.… 7 мин Режиссёр превращает исходный снимок корги в последовательность согласованных фаз движения: изображение задаёт внешний вид, модель достраивает движение объекта, камеры и ход времени. Видео Image-to-Video Image-to-Video (I2V) — модель берёт статичную картинку и достраивает движение объектов, камеры и света во времени. Исходник задаёт внешний вид… 4 мин Иллюстраторка превращает фотографию полосатого кота через кодирование, шум и денойзинг в две новые версии: более похожую на исходник и более свободно переосмысленную. Инструменты img2img image-to-image img2img (image-to-image) — режим генерации, в котором на вход модели подаётся картинка, а не случайный шум. Модель частично её «стирает»… 5 мин Новые данные проходят через готовую модель с неизменными весами; отдельная лента показывает prefill всего запроса и decode по одному токену. Основы AI Inference Inference, или инференс, начинается, когда готовая модель получает новые данные и строит результат: класс, прогноз, текст, изображение или эмбеддинг. В… 8 мин Фоторетушёрка выделяет маской красную бандану на снимке корги, заменяет её по текстовой инструкции на синий вязаный шарф и сохраняет позу, шерсть и фон вне выбранной области. Инструменты Inpainting Inpainting меняет часть изображения внутри маски и старается связать новую область с окружением. Так удаляют предметы, меняют одежду, исправляют детали… 6 мин Диспетчерка пропускает запрос о билете через смысловой сортировщик, который отделяет намерение купить билет от параметров Казань и пятница и отправляет неясные фразы на уточнение. Промпты Intent Recognition Intent Recognition (Intent Detection) — задача NLP: понять, какую цель преследует пользователь в своём сообщении, даже если он сформулировал её… 5 мин Текстовая карточка и фотография витража входят в IP-Adapter раздельными каналами, создавая новый портрет девушки с рыжим котом в цвете референса. Адаптеры IP-Adapter Image Prompt Adapter IP-Adapter добавляет к текстовому промпту визуальное условие. Image encoder превращает референс в признаки, а отдельная ветка внимания передаёт их диффузионной… 6 мин Специалист по безопасности со служебной собакой наблюдает попытку обойти правила модели; данные и действия защищают разделение инструкций, минимальные права, проверка и наблюдение. Языковые модели Jailbreak Jailbreak — техника обхода встроенных ограничений LLM (alignment-фильтров), чтобы заставить модель выполнить запрещённое: написать вредоносный код, обойти политики, выдать опасные… 5 мин Разработчица пропускает ответ модели через ворота JSON-грамматики: контейнер всегда синтаксически валиден, но поля и типы внутри могут меняться и требуют проверки в коде. Языковые модели JSON Mode JSON Mode ограничивает ответ языковой модели синтаксисом JSON. Это удобнее обычной просьбы «верни JSON», но режим не задаёт обязательные поля,… 4 мин Девушка раскладывает один граф из четырёх нод в два JSON-листа: формат редактора сохраняет расположение, а API-формат — исполняемую структуру и параметры. Инструменты JSON Workflow JSON Workflow хранит структуру графа, типы нод, их параметры и связи в машиночитаемом тексте. В ComfyUI есть формат для визуального… 8 мин Исследовательница проводит документы, код и изображения через длинный контекст Kimi; модель отмечает нужные фрагменты, вызывает инструмент и связывает ответ с исходными местами. Языковые модели Kimi Kimi — продукт Moonshot AI: чат, модели, API и агентные инструменты для поиска, кода и работы с файлами. Сервис стал… 6 мин Архивист связывает сущности «человек», «проект» и «технология» подписанными отношениями; запрос подсвечивает путь и источник каждого факта. Языковые модели Knowledge Graph Knowledge Graph, или граф знаний, хранит сущности и утверждения о связях между ними. В нём можно явно показать, что человек… 8 мин Мастер ведёт стеклянный latent по латунной шкале от высокого к низкому шуму; подписи разделяют seed, scheduler, sampler, CFG и denoise. Сэмплеры KSampler KSampler объединяет модель, conditioning, исходный latent и настройки sampling в один узел ComfyUI. Scheduler строит последовательность уровней шума, sampler задаёт… 9 мин Бумажный запрос проходит сеть, очередь и prefill до первого токена, затем телетайп выдаёт поток токенов и полный ответ с разметкой TTFT, ITL и E2E. Языковые модели Latency Latency описывает, сколько времени проходит от отправки запроса до результата. У потоковой языковой модели отдельно измеряют ожидание первого токена, интервалы… 6 мин Фотолаборант проводит изображение через VAE в компактный пространственный latent; отдельные линии показывают добавление шума, работу denoiser и текстовый conditioning. Генеративные модели Latent Space Latent space — внутреннее пространство представлений, с которым работает модель. В latent diffusion изображение обычно кодируется в компактный пространственный тензор,… 9 мин На рельефной карте три маршрута показывают маленький, чрезмерный и подходящий learning rate: шаги не доходят, перескакивают долину или устойчиво сходятся к минимуму. Обучение Learning Rate LR Learning rate задаёт масштаб обновлений, которые делает оптимизатор. Слишком маленький шаг может не успеть за бюджет обучения, слишком большой —… 8 мин Исполнительница в студии соединяет исходные видеокадры с новой аудиодорожкой; монтажный механизм синхронизирует область губ, а последовательность кадров помогает проверить звук и мимику. Видео Lip Sync Lip Sync меняет движение губ в видео так, чтобы оно совпадало с новой речью. Техника помогает при дубляже, замене реплик… 5 мин Рыжий кот и библиотечный механизм показывают, как LLM учитывает контекст и выбирает следующий токен для продолжения текста. Языковые модели LLM Large Language Model LLM (Large Language Model) — большая языковая модель, нейросеть, обученная на триллионах слов и умеющая осмысленно продолжать любой текст. Принципиально… 6 мин Мастер подключает к замороженной базовой модели небольшой LoRA-адаптер из матриц A и B, чтобы получить обновление под задачу или стиль; рядом сидит длинношёрстная такса. Адаптеры LoRA Low-Rank Adaptation LoRA (Low-Rank Adaptation) — техника тонкой настройки больших диффузионных моделей. Вместо переобучения целой модели (6+ ГБ) рядом с базой подключается… 6 мин Девушка загружает в модель фотографии собак; цикл предсказания, проверки ошибки и настройки параметров ведёт к распознаванию новой собаки. Основы AI Machine Learning ML Machine Learning (машинное обучение, ML) — раздел AI, в котором программа не получает готовые правила, а выводит их сама из… 6 мин Руководитель и бордер-колли ведут задачу Manus от цели и плана через браузер, код и файлы; неудачный шаг возвращается на перепланирование, а результат выходит отчётом, таблицей и сайтом. Языковые модели Manus Manus — облачный AI-агент, который получает цель, использует браузер, код и файлы, а затем возвращает готовый артефакт: таблицу, отчёт или… 5 мин Оранжевая лейка рядом с девушкой и чёрным котом выделяется белой маской с серым краем, после чего на её месте появляется корзина цветов. Параметры Mask Mask — одноканальная карта, которая задаёт, где операция действует полностью, частично или совсем не действует. В inpainting маска ограничивает область… 6 мин Системная архитекторка управляет MCP-хостом: отдельные клиенты ведут к локальному и удалённому серверу и дают инструменты, ресурсы и промпты с учётом прав доступа. Языковые модели MCP Model Context Protocol MCP (Model Context Protocol) задаёт общий способ, которым AI-приложение обнаруживает инструменты, читает доступные данные и вызывает внешние действия. Протокол разделяет… 6 мин Пользователь и такса показывают память ассистента: факты из прошлых чатов сохраняются во внешней картотеке и по релевантности попадают в контекст нового запроса, не меняя веса модели. Языковые модели Memory Memory — способность AI-ассистента помнить факты о пользователе между сессиями. В отличие от Context Window (один разговор) Memory сохраняет информацию… 5 мин Девушка сравнивает варианты Midjourney, созданные по промпту и референсу, выбирает кадр и отмечает область для редактирования. Генеративные модели Midjourney Midjourney создаёт изображения по тексту и визуальным референсам, предлагает варианты и позволяет продолжать выбранный кадр в редакторе. Это облачный сервис… 6 мин Звукорежиссёр наблюдает, как маршрутизатор направляет токен к части экспертных модулей, объединяет их выходы и оставляет невыбранные модули в общем пуле; рядом сидит чёрный кот. Обучение Mixture of Experts MoE Mixture of Experts (MoE) — архитектура нейросетей, где модель состоит не из одной плотной сети, а из набора «экспертов». Маршрутизатор… 5 мин Слева MMLU проверяет выбор ответа среди A–D по разным предметам, справа HumanEval превращает описание функции в код и запускает его через тестовый стенд. Языковые модели MMLU и HumanEval MMLU проверяет выбор ответа по разным предметам, а HumanEval — способность написать небольшую функцию, которая проходит тесты. Обе цифры полезны,… 7 мин Инженерка соединяет архитектуру с весами, настроенными обучением на данных; собранная модель преобразует вход в выход, а другие данные и цели могут дать другую модель. Основы AI Model AI-модель — обученная математическая функция. Для запуска нужны архитектура, веса, конфигурация и обработчики входа и выхода. Они могут лежать в… 6 мин Архивистка изучает лицензию точной версии модели; рядом отдельные папки весов, кода, данных, API и результатов показывают, что условия могут различаться. Основы AI Model License Лицензия модели описывает, что разрешено делать с конкретными весами: использовать, изменять и распространять их, в том числе в коммерческих сценариях.… 8 мин Молодая мастер совмещает две стеклянные матрицы весов A и B в латунном прессе; схема показывает пропорцию 70/30, совместимость тензоров и отдельные MODEL, CLIP и VAE. Обучение Model Merge Model Merge создаёт новую модель из весов нескольких совместимых моделей. Простое смешивание интерполирует одинаковые тензоры, delta merge переносит разницу между… 8 мин Три исследовательницы подают текст, изображение с котом, звук и видео через энкодеры в общую модель; выходы показывают текстовый ответ, новое изображение и синтез речи. Основы AI Multimodal AI Multimodal AI принимает или создаёт данные нескольких типов: текст, изображения, аудио, видео и сигналы датчиков. Возможности не обязаны быть симметричными:… 6 мин Певица-продюсер соединяет описание и мелодию с ритмом, гармонией, тембром, структурой и вокалом, собирает трек и отдельно проверяет права; у микрофона сидит корелла. Видео Music Generation Музыкальные модели создают аудио по описанию, напеву, референсу или заданной структуре. Одни генерируют готовую песню с вокалом, другие — инструментал,… 6 мин Художница направляет генерацию портрета чёрного кота двумя карточками: positive prompt тянет к желаемой сцене, а negative prompt ослабляет размытие, надписи и пластиковую шерсть. Промпты Negative Prompt Negative Prompt описывает признаки, от которых генерацию нужно оттолкнуть. В классическом classifier-free guidance его embedding участвует в сравнении с положительным… 5 мин Кот и четыре прозрачных слоя показывают, как нейросеть превращает фотографию в пиксели, контуры, части формы и предсказание «кот». Основы AI Neural Network NN, ANN Нейросеть (neural network, искусственная нейронная сеть) — математическая модель, в которой простые элементы-«нейроны» собраны в слои и обмениваются числами. На… 6 мин Пять стеклянных фотопластин постепенно проявляют смотрителя маяка с собакой: бордовая кривая задаёт уровни шума, а точки обозначают шаги процесса. Сэмплеры Noise Schedule Noise schedule задаёт, какой уровень сигнала и шума соответствует каждому моменту диффузионного процесса. При генерации sampler идёт по выбранным точкам… 8 мин Исследовательница задаёт вопрос по выбранным источникам; NotebookLM находит фрагменты, собирает ответ с цитатами и связывает его с оригиналом, конспектом и аудиообзором. Инструменты NotebookLM NotebookLM собирает отдельное рабочее пространство из документов, ссылок, аудио и других источников. Чат отвечает с переходами к использованным фрагментам, а… 6 мин Куратор раскрывает AI-релиз как архив из весов, кода, сведений о данных и лицензий; пакет open-weight ведёт только к секции с весами. Основы AI Open-source AI Open-source AI даёт свободу использовать, изучать, изменять и распространять систему, а также материалы, без которых её нельзя осмысленно доработать. Доступные… 8 мин Две девушки повторяют одну позу по схеме ключевых точек, показывая перенос движения через OpenPose. Адаптеры OpenPose OpenPose — препроцессор и модель ControlNet для управления позой человека в Stable Diffusion. Превращает любое фото в палочную фигуру (skeleton),… 5 мин Квадратный снимок девушки с таксой помещается на расширенный холст с маской, после чего по бокам появляются продолжение луга, пледа и летнего света. Инструменты Outpainting Outpainting расширяет холст и генерирует сцену в новых областях за пределами исходного кадра. Модель опирается на пиксели возле старой границы,… 6 мин Три похожих студийных портрета девушки сходятся в связку «героиня плюс фон», поэтому на проверочном снимке пляж перекрывает знакомая синяя штора. Обучение Overfitting Overfitting, или переобучение, возникает, когда модель всё точнее подстраивается под обучающие примеры, но хуже работает на новых данных. В генерации… 8 мин Обучение по ошибке настраивает в модели веса, смещения и масштабы; checkpoint сохраняет положения регуляторов, а inference применяет их к новому снимку собаки. Основы AI Parameters Параметры модели — обучаемые числа внутри матриц и других тензоров нейросети. Обучение меняет их по градиентам, checkpoint сохраняет найденные значения,… 8 мин Рыжий кот прослеживает путь вопроса Perplexity через найденные страницы к ответу со ссылками и проверяет исходный фрагмент через лупу. Языковые модели Perplexity Perplexity соединяет веб-поиск с языковой моделью: находит страницы, собирает связный ответ и показывает ссылки. Такой формат удобен для обзора темы,… 6 мин Девушка собирает промпт из контекста, задачи и формата; стрелки ведут через модель к ожидаемому результату. Промпты Prompt Промпт (prompt) — текстовый запрос, который пользователь передаёт языковой модели, чтобы получить ответ. От формулировки промпта зависит результат: одна и… 6 мин Редактор собирает промпт из задачи, контекста, примера, ограничений и формата ответа, проверяет его на тестовых входах, сравнивает результаты и возвращает на правку. Промпты Prompt Engineering Prompt Engineering (промпт-инженерия) — навык формулировать запросы к языковой модели так, чтобы получать предсказуемый, точный и полезный ответ. Это не… 6 мин Мужчина сортирует правила, данные и опасную записку, показывая, как prompt injection подменяет маршрут действий модели. Промпты Prompt Injection Prompt Injection — атака, при которой пользователь или внешние данные заставляют LLM нарушить исходные инструкции (system prompt). Direct injection: пользователь… 5 мин Бумажные фразы проходят через parser с тремя регуляторами веса; красный шарф становится заметнее в итоговом портрете, а сетка композиции остаётся отдельным инструментом. Промпты Prompt Weighting Prompt Weighting усиливает или ослабляет отдельные фрагменты текстового условия до генерации. Запись вроде `(красный шарф:1.2)` работает только там, где интерфейс… 8 мин Инженер проводит тензоры через модель PyTorch: прямой проход строит граф и вычисляет ошибку, autograd идёт назад за градиентами, а оптимизатор обновляет веса. Инструменты PyTorch PyTorch — open-source библиотека для работы с тензорами, нейросетями и автоматическим дифференцированием. Модель описывается обычным Python-кодом, autograd вычисляет градиенты, а… 6 мин Стеклянная волна точных значений округляется к ближайшим уровням и помещается в компактную кассету, показывая экономию памяти и потерю части точности. Параметры Quantization Quantization переводит веса или активации модели в более компактное числовое представление. Памяти и передач становится меньше, но значения округляются, а… 5 мин Исследовательница раскрывает семейство Qwen: текст, код, математику, изображения и аудио; модели доступны как открытые веса, через API и приложение, а кот касается карточки изображения. Языковые модели Qwen Qwen — семейство моделей Alibaba для текста, кода, рассуждения и мультимодальных задач. Часть весов публикуется для локального запуска, а облачные… 6 мин Девушка ищет карточки документов в архиве и собирает ответ: схема работы RAG от вопроса к найденному контексту. Языковые модели RAG Retrieval-Augmented Generation RAG (Retrieval-Augmented Generation) — техника, в которой LLM перед ответом достаёт из внешней базы релевантные документы и использует их как… 7 мин Исследовательница наблюдает, как reasoning-модель перебирает подходы, проверяет и исправляет путь перед финальным ответом; рядом сидит русский голубой кот. Языковые модели Reasoning Models Reasoning-модели тратят дополнительные вычисления перед финальным ответом: разбивают задачу, пробуют варианты, используют инструменты и проверяют промежуточный результат. Это особенно полезно… 6 мин Две одинаковые фотопластины с самоедом показывают работу base и refiner: первая задаёт композицию, вторая при меньшем шуме уточняет шерсть, снег и отражения. Генеративные модели Refiner Refiner — отдельная модель или стадия, которая принимает промежуточный результат base и дорабатывает его в позднем диапазоне denoising. Такой этап… 7 мин Три бумажные подсказки направляют области общей сцены: слева девушка читает, справа корги лежит на подушке, а фон занимает дождливый зимний сад. Промпты Regional Prompting Regional Prompting — семейство способов связать отдельные описания с нужными участками изображения. Маски, прямоугольники или другие пространственные условия помогают развести… 8 мин Запрос о ночном шуме вентилятора проходит через быстрый поиск кандидатов и повторную оценку, после которой карточка о тихом режиме оказывается первой в новом порядке. Языковые модели Reranking Reranking — второй этап поиска, на котором уже найденные документы получают новые оценки и меняются местами. Быстрый retriever собирает кандидатов,… 6 мин Человек выбирает один из двух ответов, после чего RLHF передаёт предпочтение через модель награды и цикл подкрепления, а DPO напрямую сравнивает выбранный и отклонённый варианты. Обучение RLHF и DPO RLHF и DPO используют сравнения ответов, чтобы скорректировать поведение модели. В классическом RLHF отдельная модель награды оценивает новые ответы, а… 7 мин Три видеохудожницы проверяют Runway, Kling и Pika на одном снимке собаки и движении, сравнивая сохранение героя, движение, камеру, монтаж и условия использования без постоянного победителя. Видео Runway, Kling, Pika Runway, Kling и Pika — закрытые платформы генерации и редактирования видео. Их модели и тарифы меняются, поэтому устойчивое сравнение строится… 5 мин Инженерка показывает Safetensors: JSON-заголовок описывает имя, dtype, shape и offsets, затем идут байты тензоров, которые загрузчик переносит в память без исполнения кода. Инструменты Safetensors Safetensors — открытый формат файлов для хранения весов нейросетевых моделей. Разработан Hugging Face как безопасная альтернатива формату .ckpt (Python pickle),… 4 мин Художница и серый кот показывают sampler: предсказание модели и правило шага вычисляют следующее состояние, а по выбранной траектории из шума возникает изображение. Сэмплеры Sampler sampling method Sampler задаёт правило, по которому диффузионная модель обновляет noisy latent на каждом шаге. Он работает вместе с scheduler, checkpoint и… 6 мин Три дорожки ведут от шумной пластины к чёткой фотографии бордер-колли, но контрольные точки равномерны, сгущены в середине или ближе к концу. Сэмплеры Scheduler Karras schedule Scheduler задаёт, на каких уровнях шума или временных точках sampler делает шаги генерации. При одинаковом числе шагов расписание может распределить… 7 мин Промпт проходит через два текстовых кодировщика; базовая модель SDXL превращает латентный шум в композицию, а необязательное уточнение деталей готовит итоговое изображение. Генеративные модели SDXL Stable Diffusion XL SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное… 6 мин Фотограф показывает, как seed задаёт стартовый шум: при тех же модели и настройках два запуска повторяют портрет рыжего кота, а другой seed меняет шум и композицию. Параметры Seed Seed (сид) — число, которое задаёт начальный шум для диффузионной модели. При одинаковой вычислительной среде он помогает повторить стартовую точку… 5 мин Цветная карта классов и фотография показывают одну композицию: девушка ведёт велосипед, рыжий кот сидит в корзине, рядом дерево, дом, небо и мостовая. Адаптеры Segmentation Map Segmentation Map делит изображение на области и хранит для каждого пикселя метку класса или экземпляра объекта. В генеративном конвейере такая… 8 мин Архивист и русская борзая показывают семантический поиск: запрос и документы проходят через одну embedding-модель, становятся векторами, а индекс возвращает ближайшие по смыслу материалы. Языковые модели Semantic Search Semantic Search — поиск документов по **смыслу запроса**, а не по ключевым словам. Запрос превращается в эмбеддинг, документы заранее тоже,… 5 мин Полевая инженерка запускает SLM на устройстве для узкой задачи, проверяет качество и ресурсы и направляет сложный случай к более крупной модели; рядом ждёт поисковая собака. Языковые модели Small Language Models SLM Small Language Model — относительное название компактной LLM. Такая модель требует меньше памяти и вычислений, поэтому подходит для устройства, edge-сервера… 6 мин Девушка управляет локальной установкой Stable Diffusion, превращающей промпт и латентный шум в изображение через последовательное уточнение. Генеративные модели Stable Diffusion Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми… 6 мин Фотограф и золотистый ретривер показывают Steps: ранние, средние и поздние итерации уточняют изображение, а после точки насыщения время растёт быстрее заметного прироста. Параметры Steps Steps — число итераций, за которые sampler переводит шум в изображение. Больше шагов обычно означает больше вычислений, но улучшение быстро… 5 мин Архитектор данных показывает Structured Output: JSON Schema задаёт обязательные поля, типы и enum, ограничение генерации сохраняет форму, а содержание отдельно проверяется. Языковые модели Structured Output Structured Output ограничивает форму ответа схемой: обязательными полями, типами, enum и вложенными объектами. Это снимает многие ошибки парсинга, но не… 5 мин Инженер дата-центра показывает цикл устойчивого AI: измерить электроэнергию, воду и оборудование, применить меньшую модель, кэш, квантизацию и гибкий запуск, затем снова сверить качество. Этика и регулирование Sustainable AI Sustainable AI рассматривает энергию, воду и оборудование на всём жизненном цикле модели: обучение, инференс, хранение и замену серверов. Одна цифра… 6 мин Кураторка данных и корги показывают synthetic data: реальные примеры поступают в генератор, варианты проходят фильтр, смешиваются с реальными и проверяются на отдельном наборе. Обучение Synthetic Data Синтетические данные создаются программой, симулятором или другой моделью, а не собираются напрямую из наблюдений за реальным миром. Они помогают покрыть… 6 мин Режиссёрка задаёт system prompt из роли, тона, формата и границ; модель соединяет эту рамку с запросом пользователя и формирует ответ без гарантии абсолютного соблюдения. Промпты System Prompt System Prompt задаёт модели роль, правила, формат и границы конкретного приложения. Он влияет на ответы сильнее обычного запроса, но не… 6 мин Аналитик подаёт одну задачу в неизменную модель и сравнивает быстрый одиночный проход с дополнительным поиском, несколькими попытками, проверкой и выбором ответа; рядом лежит бордер-колли. Языковые модели Test-Time Compute Inference-Time Scaling Test-Time Compute — способы потратить больше вычислений на конкретный ответ: сделать несколько попыток, провести поиск, проверить решение или увеличить внутренний… 7 мин Золотистый ретривер с красным шарфом проходит через последовательность согласованных кадров от текстового промпта к готовому видеоклипу. Видео Text-to-Video Text-to-Video — генерация видео по текстовому описанию. Есть облачные сервисы и открытые модели для локального запуска, в том числе через… 5 мин Четыре фотографии одной рыжеволосой девушки обучают латунную литеру MIRA, остальные веса заперты, а новый промпт переносит героиню к борзой в зимний сад. Адаптеры Textual Inversion TI Textual Inversion учит новое текстовое представление концепта по примерам, сохраняя остальные веса генеративной модели замороженными. Полученный embedding загружается в совместимый… 7 мин Дизайнер раскладывает большой постер на перекрывающиеся плитки; рядом с котом повторяется бесшовная ткань, а tiled VAE обрабатывает изображение окнами ради меньшей нагрузки на память. Адаптеры Tile / Tiling Tile называют сразу несколько разных приёмов: обработку большого изображения перекрывающимися фрагментами, tiled diffusion во время sampling, tiled VAE для снижения… 9 мин Типографка пропускает русский текст через токенизатор: он делит фразу на кусочки разной длины, сопоставляет им идентификаторы, собирает контекст и передаёт его модели для ответа. Языковые модели Token Токен — элемент словаря модели: целое слово, часть слова, знак, пробел или последовательность байтов. Токенизатор превращает текст в идентификаторы, а… 6 мин Операторка подаёт модели запрос и описания инструментов; модель выбирает встроенный или собственный вариант, внешний контур проверяет и выполняет вызов, а результат возвращается для ответа. Языковые модели Tool Calling Tool Calling позволяет модели предложить вызов поиска, калькулятора, базы или другой функции в структурированном виде. Само действие выполняет приложение или… 6 мин Исследовательница с бордер-колли показывает цикл обучения модели: данные дают предсказание, loss измеряет ошибку, backpropagation вычисляет градиенты, а оптимизатор обновляет веса. Основы AI Training Training, или обучение модели, — процесс настройки её параметров на примерах. Модель делает предсказание, функция потерь измеряет ошибку, а оптимизатор… 6 мин Карточки слов и цветные связи показывают self-attention: слово «убежала» сильнее связано с «кошка», чем с соседними словами. Основы AI Transformer Transformer — архитектура нейросети, представленная в статье Attention Is All You Need в 2017 году. Она обрабатывает последовательность через attention:… 6 мин Три фотографии одной девушки подписаны меткой TOK, нити связывают их с адаптером, а новый промпт переносит ту же героиню и серого кота в дождливый город. Промпты Trigger Word Trigger word — слово или короткая фраза, которую во время обучения связывают с персонажем, предметом или стилем. Повтор той же… 7 мин Аудиторка и лабрадор показывают доверие к AI: назначение, границы, данные и тесты проходят проверку, человек сохраняет контроль, а обратная связь и пересмотр замыкают цикл. Этика и регулирование Trust in AI Доверие к AI полезно, когда оно соответствует реальной надёжности системы. Пользователю нужны понятное назначение, проверенные ограничения, источники, возможность отменить действие… 6 мин Радиоведущая показывает два направления голосового AI: STT превращает речь из микрофона в текст, а TTS преобразует текст в озвучку с ритмом, паузами и интонацией. Видео TTS и STT STT превращает запись речи в текст, а TTS — текст в звучащую речь. Вместе они лежат в основе транскрипции, дубляжа… 6 мин Маленький пиксельный снимок самоеда проходит через увеличитель и становится большим детальным отпечатком с напоминанием, что новые детали могут быть достроены. Инструменты Upscaler Upscaler делает изображение крупнее. Обычная интерполяция вычисляет новые пиксели по соседним, а обученная модель ещё и оценивает, какие контуры и… 6 мин Фотография рыжего кота проходит через VAE Encoder в маленький латент, а Decoder восстанавливает второй отпечаток с немного изменившимися деталями шерсти. Генеративные модели VAE Variational Autoencoder VAE переводит изображение в компактный латентный тензор и декодирует его обратно в пиксели. В txt2img обычно работает decoder, а в… 8 мин Запрос об уютном уголке для чтения превращается в вектор, индекс подсвечивает ближайшие карточки, а база возвращает связанные изображения и метаданные. Языковые модели Vector Database Vector DB Vector Database хранит embedding-вектора вместе со ссылками на исходные объекты и метаданными. Для нового запроса она находит ближайшие записи по… 8 мин Создательница прототипа описывает цель AI-агенту, который печатает код и запускает результат; ошибка возвращается в новое описание, а отдельная ветка добавляет ревью и тесты. Промпты Vibe Coding Vibe Coding — название для подхода, в котором человек описывает желаемое поведение, принимает сгенерированный код и ориентируется на результат, почти… 6 мин Девушка даёт VLA-модели команду положить мяч в корзину: робот видит сцену с собакой, понимает цель, переносит мяч и получает обратную связь. Мультимодальные модели VLA Vision-Language-Action Vision-Language-Action-модель получает изображение или видео, понимает текстовую задачу и превращает её в действия робота. Вместо жёсткого сценария «увидел метку —… 7 мин Владелица голоса подтверждает согласие, затем образец и новый текст проходят через представление голоса и синтез речи к маркированной новой фразе; рядом сидит серый попугай. Видео Voice Cloning Voice Cloning переносит тембр, акцент и манеру речи из образцов на новый текст. Быстрый клон строится по короткой записи, профессиональный… 6 мин Открытая видеокарта показывает VRAM: веса модели, активации и рабочие буферы помещаются рядом с GPU, а лишние данные переносятся в системную RAM. Параметры VRAM Video RAM VRAM хранит данные, с которыми графический процессор работает прямо сейчас: веса модели, активации, кадры и временные буферы. Чем больше данных… 5 мин Аудиоредакторка превращает речь в спектрограмму; кодировщик Whisper строит представление сигнала, декодер выдаёт текстовые токены, а транскрипция проходит проверку по записи. Видео Whisper Whisper — семейство моделей OpenAI для многоязычного распознавания речи и перевода аудио в английский. Веса опубликованы для локального запуска, а… 6 мин Разработчица меняет действие в диораме, а World Model обновляет состояние мира, сохраняет скрытый объект в памяти и сравнивает несколько будущих состояний. Мультимодальные модели World Models World Model Мировая модель хранит внутреннее представление среды и предсказывает её следующее состояние. Она помогает агенту представить последствия действия до того, как… 7 мин Две редакционные доски сравнивают zero-shot с одной инструкцией и few-shot с размеченными снимками питомцев, показывая, как примеры задают образец ответа. Промпты Zero-shot и Few-shot Zero-shot означает, что модель получает инструкцию и новую задачу без готовых примеров. При few-shot в тот же контекст добавляют несколько… 6 мин