AI Library · Каталог

Каталог156/ 156

Все термины библиотеки с поиском, фильтром по разделу и семью способами сортировки.

Раздел
Мужчина-оператор ведёт цель Agentic AI по циклу планирования, инструментов, действий, наблюдений и проверки, останавливая рискованный шаг у подтверждения. Языковые модели Agentic AI Agentic AI — системы, которые планируют несколько шагов, используют инструменты и проверяют промежуточный результат. Они особенно полезны там, где есть… 6 мин Мужчина управляет тремя AI-станциями, которые распознают звук, предсказывают результат и создают изображение на основе данных. Основы AI AI ИИ Искусственный интеллект, AI или ИИ, — широкое название систем, которые распознают данные, строят прогнозы, создают контент, планируют шаги или помогают… 6 мин Девушка за рабочим столом проходит цикл цели, выбора, действия и проверки — наглядная схема работы AI-агента. Языковые модели AI Agent AI-агент — система, которая выбирает действия для решения задачи и получает обратную связь от среды. Агент на базе языковой модели… 8 мин Аналитик проверяет выводы AI: слева система выделяет аномалии и помогает расследованию, справа показаны фишинг, подделка медиа, поиск уязвимостей и вредоносный код. Применения AI in Cybersecurity AI в кибербезопасности помогает разбирать поток событий, искать аномалии, группировать оповещения и готовить черновики расследований. Те же технологии упрощают фишинг,… 7 мин Студентка решает задачу сама, а учебная AI-система последовательно даёт подсказку, обратную связь и новую задачу для практики. Применения AI in Education AI в образовании помогает объяснять материал разными способами, давать подсказки, создавать тренировочные задания и разбирать черновики. Учителю он может снять… 6 мин Молодая врач проверяет три узких результата медицинского AI — черновик записи, отмеченный участок снимка и закономерность в данных — прежде чем обсудить клиническое решение с пациенткой. Применения AI in Healthcare Нейросети в медицине помогают готовить черновики клинических записей, анализировать снимки и искать закономерности в данных. Это не единый «AI-врач», а… 8 мин Инженер и руководитель проводят AI-систему через оценку риска, проверку, запуск, наблюдение за инцидентами и исправление, сохраняя ответственность на всём цикле. Этика и регулирование AI Safety AI Safety изучает, как снизить вероятность вреда от модели и продукта вокруг неё. Сюда входят тесты, защита данных и инструментов,… 8 мин Журналистка и золотистый ретривер находят документы для AI-поиска; выбранные фрагменты поступают в синтез ответа, а цветные нити связывают его со ссылками и проверяемыми источниками. Языковые модели AI Search AI-поиск использует модели, чтобы находить и сопоставлять сведения. В генеративном поиске система собирает ответ по найденным материалам и показывает ссылки.… 7 мин Инженерка калибрует поведение модели: примеры ответов, пары предпочтений и принципы проходят через SFT, RLHF или DPO, а проверки возвращают ошибки на следующий цикл настройки. Языковые модели Alignment Alignment — работа над тем, чтобы поведение AI соответствовало заданным человеческим целям и ограничениям. Для языковых моделей это включает обучение… 6 мин Аниматор подключает модуль движения к базовой диффузионной модели, которая сохраняет стиль кадра; временная связь превращает фазы прыжка белого кота в короткую анимацию. Видео AnimateDiff AnimateDiff — способ заставить обычную модель Stable Diffusion рисовать не один кадр, а короткое видео. К модели подключается отдельный «модуль… 6 мин Бэкенд-разработчик принимает данные приложения, добавляет ключ из защищённого хранилища, отправляет запрос через API к сервису и раздельно обрабатывает ответ, ошибку и журнал вызова. Основы AI API Application Programming Interface API — программный интерфейс: правила, по которым одна программа обращается к другой. Через API можно передать модели текст, изображение или… 8 мин Арт-директорка сравнивает один танцевальный сюжет в квадратном, горизонтальном и вертикальном кадрах: меняются пропорции ширины и высоты и композиция, но фигура не растягивается. Параметры Aspect Ratio AR Aspect Ratio описывает форму кадра как отношение ширины к высоте. Оно влияет на композицию и на то, насколько размер близок… 5 мин Иллюстраторка и кот показывают AUTOMATIC1111: модель, промпт и параметры собираются в браузерной форме, локальный компьютер создаёт изображение и сохраняет данные генерации в PNG Info. Инструменты AUTOMATIC1111 AUTOMATIC1111, или Stable Diffusion WebUI, — интерфейс для генерации изображений с помощью совместимых моделей Stable Diffusion. Промпт, параметры и результат… 7 мин Операторка показывает Batch Size: четыре портрета животных идут через модель вместе, следующие кассеты — по очереди, память ограничивает пачку, а градиенты накапливаются до обновления весов. Параметры Batch Size Batch Size — количество примеров в одном вычислительном пакете. При генерации он влияет на память, задержку и пропускную способность; при… 5 мин Аналитик сравнивает модели на одном бенчмарке: общий тестовый набор, промпт, настройки и метрика дают сопоставимые результаты, которые затем проверяют на закрытых и собственных задачах. Языковые модели Benchmark Benchmark — общий набор задач, правил запуска и метрик для сравнения моделей. Результат имеет смысл только вместе с версией набора… 6 мин Промышленный дизайнер показывает Canny Edge: снимок мотоцикла проходит сглаживание, градиенты, истончение и двойной порог, а контурная карта сохраняет геометрию в новом стиле. Адаптеры Canny Edge Canny Edge — алгоритм извлечения контуров изображения, изобретённый Джоном Канни в 1986-м. В Stable Diffusion через ControlNet Canny используется как… 7 мин Операторка показывает CFG Scale: безусловное и условное предсказания задают направление к промпту, усиление повышает соответствие, а чрезмерная сила приводит к насыщению и артефактам. Параметры CFG Scale Classifier-Free Guidance CFG Scale управляет тем, насколько сильно диффузионная модель отталкивается от безусловного предсказания в сторону промпта. Слишком слабое влияние может дать… 6 мин Девушка работает со станцией ChatGPT, где модель GPT соединена с поиском, файлами, изображениями, голосом и кодом. Языковые модели ChatGPT ChatGPT — AI-ассистент OpenAI с чатом, поиском, памятью и инструментами для файлов, изображений, голоса и кода. Это продукт вокруг семейства… 6 мин Библиотекарка и рыжий кот показывают Chunking: документ делится по структуре, перекрытие сохраняет контекст на границе, а метаданные помогают индексу находить релевантные фрагменты. Языковые модели Chunking Chunking — разбиение документов на фрагменты для поиска и подготовки контекста модели. Маленький фрагмент может потерять важное пояснение, большой —… 6 мин Исследовательница подаёт документы и вопрос в модель Claude, которая работает через приложение или API с контекстом и инструментами. Языковые модели Claude Claude — семейство языковых моделей и AI-ассистент от компании Anthropic, для работы с текстом, документами и кодом. Готовый чат помогает… 8 мин Две героини и рыжий кот показывают CLIP: текстовый и визуальный энкодеры создают векторы, подходящая пара сближается в общем пространстве, а неподходящая остаётся далеко. Генеративные модели CLIP Contrastive Language-Image Pretraining CLIP состоит из текстового и визуального энкодеров, обученных сближать подходящие пары «изображение — подпись» и отдалять неподходящие. Благодаря этому текст… 6 мин Художница соединяет узлы ComfyUI: модель, промпт и фотография русской борзой проходят через обработку к готовому изображению, а workflow сохраняется в JSON и метаданных. Инструменты ComfyUI ComfyUI — это визуальный интерфейс для запуска моделей генерации изображений на основе графа узлов. Каждый шаг пайплайна (загрузка модели, кодирование… 6 мин Специалистка и бигль показывают ComfyUI Manager: недостающий пакет находят в Registry, проверяют, устанавливают и тестируют, а снимок окружения помогает вернуть рабочую сборку. Инструменты ComfyUI Manager ComfyUI Manager помогает искать, устанавливать, обновлять и отключать сторонние ноды, находить недостающие пакеты из чужой схемы, управлять моделями и сохранять… 6 мин Механический компьютерный агент повторяет цикл из снимка экрана, решения, движения курсора, клика или ввода и нового снимка, останавливая важное действие у подтверждения. Языковые модели Computer Use Computer-Using Agent (CUA) Computer Use (CUA, компьютерный агент) — ИИ-агент, который управляет компьютером как человек: делает скриншот экрана, «видит» интерфейс, двигает курсор, кликает… 6 мин Редактор отбирает инструкции, память, документы и инструменты, упорядочивает и сжимает их в окно контекста, из которого модель формирует ответ; кошка играет с отброшенной запиской. Промпты Context Engineering Context Engineering — практика системно снабжать AI-модель нужным контекстом до того, как она ответит. Память о пользователе, документы через RAG,… 7 мин Девушка раскладывает инструкции, документы, диалог и вопрос на ограниченном столе, показывая границы контекстного окна модели. Языковые модели Context Window Контекстное окно — объём токенов, доступный модели во время одного вызова. Туда попадают инструкции, история диалога, документы, результаты инструментов и… 7 мин Танцовщица задаёт карту позы для ControlNet: обучаемая ветка передаёт пространственное условие замороженной модели, а промпт меняет образ в итоговой генерации без копирования исходника. Адаптеры ControlNet ControlNet — техника управления композицией в диффузионных моделях через зрительную подсказку: скелет позы (OpenPose), контур (Canny), карту глубины (Depth), набросок… 8 мин Аналитик и чёрно-белый кот показывают расчёт стоимости LLM API: input, output, кэш, инструменты и повторы сверяются с usage-логом и текущими ставками провайдера. Языковые модели Cost per Token Cost per Token описывает тарификацию LLM API по объёму входа и выхода. К итоговой сумме могут добавляться кэш, инструменты, хранение… 5 мин Инженерка показывает CUDA: код на CPU проходит через драйвер и runtime, данные попадают в VRAM, а kernel запускает параллельные потоки GPU для матричных операций. Инструменты CUDA Compute Unified Device Architecture CUDA связывает программы с видеокартами NVIDIA. Через её runtime, драйвер и библиотеки фреймворки запускают матричные операции, свёртки и attention на… 7 мин Девушка в Cursor связывает запрос с файлами проекта, получает diff изменений и запускает проверку кода. Инструменты Cursor Cursor — редактор на базе VS Code с AI-функциями для автодополнения, поиска по проекту и многофайловых изменений. Он соединяет контекст… 6 мин Инженер и бордер-колли показывают Custom Nodes: node pack содержит код, интерфейс и зависимости, принимает входы, выполняет операцию и добавляет выходы в workflow ComfyUI. Инструменты Custom Nodes Custom Nodes — сторонние расширения ComfyUI. Они добавляют новые загрузчики, модели, способы управления, обработку видео, звука и изображений. Пакеты из… 9 мин Иллюстратор отправляет текстовое описание в закрытое облачное ателье DALL-E, сравнивает варианты оранжереи, вносит правку и выбирает готовое изображение. Генеративные модели DALL-E DALL-E — семейство генераторов изображений OpenAI, с которым связаны ранние опыты рисования по тексту и редактирования в диалоге. Объясняем, чем… 6 мин Кураторка показывает путь датасета: собирает и размечает примеры, удаляет дубли, проверяет происхождение, покрытие и баланс, затем разделяет набор на train, validation и закрытый test. Обучение Dataset Dataset, или датасет, — организованный набор примеров для обучения, настройки или проверки модели. В нём важны не только объём и… 6 мин Фотографка подписывает снимок сиба-ину: фотография получает точное описание, затем снимок и подпись скрепляются в одну пару для обучения модели. Обучение Dataset Captioning Dataset Captioning — подготовка текстовых подписей к изображениям в обучающем датасете. Подпись связывает конкретный снимок с его содержанием и помогает… 6 мин Пять прозрачных слоёв Deep Learning превращают пиксели изображения кота в края, текстуры, части и целый объект, пока рядом сидит настоящий кот. Основы AI Deep Learning DL Deep Learning, или глубокое обучение, — область машинного обучения, где модель строится из нескольких обучаемых преобразований. Вместо заранее написанного списка… 6 мин Исследователь направляет одну задачу DeepSeek в облачный API или в локально запущенные доступные веса модели. Языковые модели DeepSeek DeepSeek — компания и семейство языковых моделей, включающее облачные API, модели рассуждения, варианты для кода и опубликованные веса. Облачный сервис… 6 мин Четыре снимка мейн-куна показывают Denoising Strength: чем выше сила и больше начального шума, тем заметнее результат отходит от исходника. Параметры Denoising Strength Denoising Strength задаёт, насколько сильно генерация может отойти от входного изображения. Чем выше сила, тем больше шума получает исходник перед… 7 мин Комната с таксой превращается в Depth Map: светлый передний план и тёмный фон сохраняют расстановку и перспективу при смене отделки интерьера. Адаптеры Depth Map Depth Map кодирует глубину сцены: какие поверхности находятся ближе, а какие дальше. Такая карта помогает генеративной модели сохранить расстановку и… 7 мин Типограф сравнивает генерацию текста: печатная машинка выдаёт токены слева направо, а диффузионная модель параллельно проявляет весь блок через маску, черновик и готовый текст. Языковые модели Diffusion LLM Diffusion Language Model Diffusion LLM, или dLLM, генерирует текст через несколько раундов уточнения. В маскированном варианте модель начинает с пропусков и постепенно заполняет… 5 мин Четыре снимка показывают, как диффузионная модель шаг за шагом превращает визуальный шум в фотографию девушки с котёнком. Генеративные модели Diffusion Model Diffusion Model — семейство генеративных моделей, которые учатся восстанавливать данные из зашумлённого состояния. При генерации процесс идёт от случайного шума… 7 мин Фотограф обучает DreamBooth по снимкам одного корги; отдельная ветвь сохраняет класс собак, а выходы показывают новые сцены, полные веса и LoRA. Адаптеры DreamBooth DreamBooth — рецепт персонализации text-to-image модели по нескольким изображениям конкретного объекта. Во время обучения редкий идентификатор связывается с его внешностью,… 9 мин Промышленный инженер показывает Edge AI: датчик передаёт сырые данные устройству рядом с мотором, локальный инференс даёт результат на месте, а в облако уходят только нужные данные. Инструменты Edge AI Edge AI запускает модель на телефоне, компьютере, камере, автомобиле или локальном сервере рядом с устройством. Такой подход уменьшает зависимость от… 6 мин Диктор записывает голос у микрофона, а звукоинженер ведёт четыре ветви ElevenLabs — синтез речи, клон с согласием, дубляж и голосового агента, затем прослушивает результат. Видео ElevenLabs ElevenLabs — облачная платформа для работы с AI-аудио. Она превращает текст в речь, создаёт и клонирует голоса, переводит аудио и… 7 мин Руки размещают карточки с кошкой, котёнком, щенком и автомобилем на карте смысловой близости эмбеддингов. Языковые модели Embedding Embedding (эмбеддинг) — числовой вектор, которым модель представляет объект: слово, фрагмент текста, изображение или другой материал. Если модель обучена для… 8 мин Шесть фотографий серого кота сгруппированы в три batch по две и лежат вокруг кругового сканера: полный круг по всем примерам обозначает одну эпоху. Обучение Epoch Epoch, или эпоха, — один проход через весь обучающий набор. Она показывает, сколько раз данные были охвачены тренировкой, но сама… 7 мин Юристка оценивает назначение, контекст и роль компании, после чего AI-система попадает в одну из веток EU AI Act: запрет, высокий риск, прозрачность или минимальный риск. Этика и регулирование EU AI Act EU AI Act регулирует AI в Евросоюзе с учётом назначения системы, уровня риска и роли компании. Для запрещённых практик, высокорисковых… 6 мин Аудитор прослеживает через линзу путь от входных данных через модель к решению; объяснение показывает причины, верность процессу, понятность человеку и границы знания. Этика и регулирование Explainable AI XAI Explainable AI объединяет методы, которые помогают исследовать вклад признаков, сравнивать возможные решения и объяснять работу системы разным людям. Одно объяснение… 6 мин На рабочем столе показано сравнение размытого лица и восстановленного портрета, где обработка исправляет только проблемную область. Инструменты Face Restoration Face Restoration — обработка лица на фотографии или сгенерированном кадре. Специальная модель добавляет правдоподобные детали, а автоматический inpainting перерисовывает выбранную… 6 мин Три синтетических портрета показывают, как Faceswap переносит лицо-источник в позу, мимику и свет целевого кадра, сохраняя отметку согласия и изменения. Инструменты Faceswap Faceswap переносит черты лица из изображения-источника в фотографию или видео. Система находит лицо, сопоставляет его с позой и мимикой человека… 5 мин Портниха меняет детали готового костюма на манекене: метафора fine-tuning, который адаптирует основу на примерах. Обучение Fine-tuning Fine-tuning продолжает обучение готовой модели на данных конкретной задачи. Так можно закрепить формат, стиль, терминологию или способ принимать решения. Полное… 6 мин Дизайнер ведёт FLUX по двум ветвям: создаёт новую сцену из текстового промпта и редактирует фотографию русской борзой с помощью исходника и референсов, затем проверяет варианты. Генеративные модели FLUX FLUX — семейство генеративных моделей Black Forest Labs для создания и редактирования изображений. В нём есть облачные варианты и модели… 6 мин Мастер сравнивает шкалы FP16, BF16 и двух вариантов FP8; отдельный коллектор показывает масштабирование и суммирование в более высокой точности. Параметры FP16, BF16, FP8 FP16, BF16 и FP8 по-разному делят биты между экспонентой и дробной частью. FP16 оставляет больше значащих битов, BF16 сохраняет диапазон… 9 мин Модель выбирает инструмент и формирует имя с аргументами, приложение проверяет схему и права, выполняет функцию, возвращает результат модели и получает итоговый ответ. Языковые модели Function Calling Function Calling позволяет модели выбрать описанную функцию и вернуть её имя с JSON-аргументами. Функцию выполняет приложение, а не сама LLM.… 6 мин Журналист подаёт текст, изображение, аудио и видео в модель Gemini, затем получает доступ к ней через приложение или API и подключает инструменты. Языковые модели Gemini Gemini — семейство моделей Google для текста, изображений, аудио, видео и работы с инструментами. Доступ к нему встроен в пользовательские… 6 мин Три девушки получают от генеративного AI новые варианты текста, изображения с котом, звука и видео из одного промпта и выбирают подходящий результат. Основы AI Generative AI Генеративный AI Генеративный AI создаёт текст, изображения, звук, видео, код и другие данные по примерам и условиям. Модель не обязана искать готовый… 6 мин Инженер собирает GGUF из метаданных, тензоров и параметров токенизатора, показывает необязательную квантизацию, один файл и части модели; рядом лежит рыжий мейн-кун. Инструменты GGUF GPT-Generated Unified Format GGUF — переносимый формат тензоров и метаданных, тесно связанный с llama.cpp и совместимыми приложениями. Файл может содержать квантизированные веса, сведения… 7 мин Разработчица показывает устойчивый путь Google AI Studio: промпт и мультимодальные данные проходят через браузерный эксперимент, проверку ответа, Get code, Gemini API и прототип приложения. Инструменты Google AI Studio Google AI Studio помогает испытать модели Gemini в браузере, настроить промпт и мультимодальный вход, получить пример вызова API и собрать… 6 мин Типографский механизм GPT связывает входные токены контекстом и печатает следующий токен, показывая смысл частей названия. Языковые модели GPT Generative Pre-trained Transformer GPT расшифровывается как Generative Pre-trained Transformer. Это семейство моделей OpenAI, которые предварительно обучаются на больших наборах данных, а затем настраиваются… 6 мин Химик наблюдает за молекулярным графом: соседние узлы передают сообщения по рёбрам, центральный узел агрегирует их, обновляет своё представление и расширяет видимую окрестность. Основы AI Graph Neural Networks GNN Графовые нейросети учитывают не только свойства объектов, но и связи между ними. Так можно исследовать молекулы, искать подозрительные транзакции или… 8 мин Редактор направляет диалог, файлы, изображения и поиск в Grok, различая ассистента, модели, приложение, API и инструменты, а найденные сведения проверяет по источникам. Языковые модели Grok Grok — семейство моделей и AI-ассистент, разработанные xAI. Он умеет отвечать на вопросы, работать с текстом и кодом, а при… 6 мин Картограф показывает на одной латунной направляющей предсказания U, C и GUIDED; рядом схема отделяет CFG от встроенного параметра guidance и весов адаптеров. Параметры Guidance Guidance — семейство способов направлять генерацию к условию. Классический CFG усиливает разницу между условным и опорным предсказаниями, некоторые модели получают… 9 мин Девушка и кот проверяют уверенный ответ по книгам и источникам: метафора правдоподобной галлюцинации модели. Языковые модели Hallucination Галлюцинация LLM — правдоподобное, но неверное утверждение в ответе языковой модели. Она может придумать источник, приписать программе несуществующую функцию или… 6 мин Слева агентский harness ведёт задачу через модель, инструмент и проверку по кругу, справа оценочный harness проводит одинаковые задания через модель к метрике и отчёту. Инструменты Harness Harness — это программный слой, который организует работу модели: собирает вход, ведёт состояние, вызывает разрешённые инструменты, проверяет результат и сохраняет… 8 мин Маленький портрет девушки с котом увеличивается, а затем проходит повторную прорисовку: композиция сохраняется, волосы, ткань и шерсть становятся детальнее. Параметры Hires.fix Hires.fix строит изображение в два прохода. Сначала модель создаёт базовый кадр и его композицию. Затем кадр увеличивается и частично зашумляется,… 9 мин Запрос о тихом вентиляторе AX-17 делится на поиск по точным словам и по смыслу, после чего обе ветки объединяются в общий список результатов. Языковые модели Hybrid Search Hybrid Search объединяет несколько способов найти документы. Лексическая ветка удерживает точные слова и коды, семантическая замечает близкий смысл и перефразировки,… 8 мин Малая сеть Hypernetwork получает ключи K и значения V, добавляет к ним регулируемую поправку и возвращает изменённый сигнал внимания в базовую модель с замороженными при обучении адаптера весами. Адаптеры Hypernetwork Hypernetwork в генерации изображений — отдельный обучаемый модуль, который влияет на работу attention — механизма внимания. В загрузчике ComfyUI он… 7 мин Режиссёр превращает исходный снимок корги в последовательность согласованных фаз движения: изображение задаёт внешний вид, модель достраивает движение объекта, камеры и ход времени. Видео Image-to-Video Image-to-Video (I2V) — модель берёт статичную картинку и достраивает движение объектов, камеры и света во времени. Исходник задаёт внешний вид… 7 мин Иллюстраторка превращает фотографию полосатого кота через кодирование, шум и денойзинг в две новые версии: более похожую на исходник и более свободно переосмысленную. Инструменты img2img image-to-image img2img — генерация на основе существующего изображения. В типичной схеме Stable Diffusion исходник кодируется в латентное представление, зашумляется и перерабатывается… 7 мин Новые данные проходят через готовую модель с неизменными весами; отдельная лента показывает prefill всего запроса и decode по одному токену. Основы AI Inference Inference, или инференс, начинается, когда готовая модель получает новые данные и строит результат: класс, прогноз, текст, изображение или эмбеддинг. В… 10 мин Ретушёр выделяет маской красную бандану на снимке корги, заменяет её по текстовой инструкции на синий вязаный шарф и сохраняет позу, шерсть и фон вне выбранной области. Инструменты Inpainting Inpainting меняет часть изображения внутри маски и старается связать новую область с окружением. Так удаляют предметы, меняют одежду, исправляют детали… 7 мин Диспетчерка пропускает запрос о билете через смысловой сортировщик, который отделяет намерение купить билет от параметров Казань и пятница и отправляет неясные фразы на уточнение. Промпты Intent Recognition Распознавание намерений помогает понять, зачем человек написал сообщение: хочет заказать еду, узнать статус доставки или отменить заказ. Параметры — адрес,… 7 мин Текстовая карточка и фотография витража входят в IP-Adapter раздельными каналами, создавая новый портрет девушки с рыжим котом в цвете референса. Адаптеры IP-Adapter Image Prompt Adapter IP-Adapter добавляет к текстовому промпту визуальное условие. Визуальный энкодер превращает референс в признаки, а отдельная ветка внимания передаёт их диффузионной… 9 мин Специалист по безопасности со служебной собакой наблюдает попытку обойти правила модели; данные и действия защищают разделение инструкций, минимальные права, проверка и наблюдение. Языковые модели Jailbreak Jailbreak — попытка добиться от AI ответа или поведения, которое запрещено его защитными правилами. Обычно речь идёт об обходе через… 6 мин Разработчица пропускает ответ модели через ворота JSON-грамматики: режим ограничивает синтаксис, но поля и типы внутри могут меняться и требуют проверки в коде. Языковые модели JSON Mode JSON Mode ограничивает ответ языковой модели синтаксисом JSON. Это удобнее обычной просьбы «верни JSON», но режим не задаёт обязательные поля,… 5 мин Девушка раскладывает один граф из четырёх нод в два JSON-листа: формат редактора сохраняет расположение, а API-формат — исполняемую структуру и параметры. Инструменты JSON Workflow JSON Workflow хранит структуру графа, типы нод, их параметры и связи в машиночитаемом тексте. В ComfyUI есть формат для визуального… 9 мин Исследовательница проводит документы, код и изображения через длинный контекст Kimi; модель отмечает нужные фрагменты, вызывает инструмент и связывает ответ с исходными местами. Языковые модели Kimi Kimi — продукт Moonshot AI: чат, модели, API и агентные инструменты для поиска, кода и работы с файлами. Сервис стал… 7 мин Архивист связывает сущности «человек», «проект» и «технология» подписанными отношениями; запрос подсвечивает путь и источник каждого факта. Языковые модели Knowledge Graph Knowledge Graph, или граф знаний, хранит сущности и утверждения о связях между ними. В нём можно явно показать, что человек… 9 мин Мастер ведёт стеклянный latent по латунной шкале от высокого к низкому шуму; подписи разделяют seed, scheduler, sampler, CFG и denoise. Сэмплеры KSampler KSampler объединяет модель, условия генерации, исходный латент и настройки в один узел ComfyUI. Scheduler строит последовательность уровней шума, sampler задаёт… 9 мин Бумажный запрос проходит сеть, очередь и prefill до первого токена, затем телетайп выдаёт поток токенов и полный ответ с разметкой TTFT, ITL и E2E. Языковые модели Latency Latency описывает, сколько времени проходит от отправки запроса до результата. У потоковой языковой модели отдельно измеряют ожидание первого токена, интервалы… 10 мин Фотолаборант проводит изображение через VAE в компактный пространственный латент; отдельные линии показывают добавление шума, работу модели и текстовые условия. Генеративные модели Latent Space Latent space — внутреннее пространство представлений, с которым работает модель. В латентной диффузии изображение представлено компактным пространственным тензором. Модель меняет… 10 мин На рельефной карте три маршрута показывают маленький, чрезмерный и подходящий learning rate: шаги не доходят, перескакивают долину или устойчиво сходятся к минимуму. Обучение Learning Rate LR Learning rate задаёт масштаб обновлений, которые делает оптимизатор. Слишком маленький шаг может не успеть за бюджет обучения, слишком большой —… 8 мин Исполнительница в студии соединяет исходные видеокадры с новой аудиодорожкой; монтажный механизм синхронизирует область губ, а последовательность кадров помогает проверить звук и мимику. Видео Lip Sync Lip Sync меняет движение губ в видео так, чтобы оно совпадало с новой речью. Техника помогает при дубляже, замене реплик… 6 мин Рыжий кот и библиотечный механизм показывают, как LLM учитывает контекст и выбирает следующий токен для продолжения текста. Языковые модели LLM Large Language Model LLM — большая языковая модель, обученная работать с языком на множестве примеров. Она может составить письмо, объяснить код, перевести текст… 7 мин Мастер подключает к замороженной базовой модели небольшой LoRA-адаптер из матриц A и B, чтобы получить обновление под задачу или стиль; рядом сидит длинношёрстная такса. Адаптеры LoRA Low-Rank Adaptation LoRA позволяет адаптировать модель к задаче, обучая небольшие добавки к выбранным весам вместо полного набора параметров. В генерации изображений так… 7 мин Девушка загружает в модель фотографии собак; цикл предсказания, проверки ошибки и настройки параметров ведёт к распознаванию новой собаки. Основы AI Machine Learning ML Машинное обучение помогает программе находить закономерности в данных и использовать их для предсказаний, распознавания или генерации. Вместо подробного списка правил… 7 мин Руководитель и бордер-колли ведут задачу Manus от цели и плана через браузер, код и файлы; неудачный шаг возвращается на перепланирование, а результат выходит отчётом, таблицей и сайтом. Языковые модели Manus Manus — облачный AI-агент, который получает цель, использует браузер, код и файлы, а затем возвращает результат: таблицу, отчёт или сайт.… 6 мин Оранжевая лейка рядом с девушкой и чёрным котом выделяется белой маской с серым краем, после чего на её месте появляется корзина цветов. Параметры Mask Mask — одноканальная карта, которая задаёт, где операция действует полностью, частично или совсем не действует. В inpainting маска ограничивает область… 9 мин Системная архитекторка управляет MCP-хостом: отдельные клиенты ведут к локальному и удалённому серверу и дают инструменты, ресурсы и промпты с учётом прав доступа. Языковые модели MCP Model Context Protocol MCP (Model Context Protocol) задаёт общий способ, которым AI-приложение обнаруживает инструменты, читает доступные данные и вызывает внешние действия. Протокол разделяет… 7 мин Пользователь и такса показывают память ассистента: факты из прошлых чатов сохраняются во внешней картотеке и по релевантности попадают в контекст нового запроса, не меняя веса модели. Языковые модели Memory Память AI-ассистента сохраняет сведения для дальнейших обращений: предпочтения, договорённости, описание проекта или итоги прошлой работы. Приложение выбирает, что добавить в… 6 мин Девушка сравнивает варианты Midjourney, созданные по промпту и референсу, выбирает кадр и отмечает область для редактирования. Генеративные модели Midjourney Midjourney создаёт изображения по тексту и визуальным референсам, предлагает варианты и позволяет продолжать выбранный кадр в редакторе. Это облачный сервис:… 6 мин Звукорежиссёр наблюдает, как маршрутизатор направляет токен к части экспертных модулей, объединяет их выходы и оставляет невыбранные модули в общем пуле; рядом сидит чёрный кот. Обучение Mixture of Experts MoE В разреженной Mixture of Experts (MoE) часть слоёв содержит несколько экспертных модулей. Маршрутизатор выбирает для каждого токена часть из них.… 6 мин Слева MMLU проверяет выбор ответа среди A–D по разным предметам, справа HumanEval превращает описание функции в код и запускает его через тестовый стенд. Языковые модели MMLU и HumanEval MMLU проверяет выбор ответа по разным предметам, а HumanEval — способность написать небольшую функцию, которая проходит тесты. Обе цифры полезны,… 8 мин Инженерка соединяет архитектуру с весами, настроенными обучением на данных; собранная модель преобразует вход в выход, а другие данные и цели могут дать другую модель. Основы AI Model Модель машинного обучения преобразует данные, используя закономерности, найденные при обучении. Для нейросетевой модели нужны архитектура, веса, конфигурация и обработчики входа… 6 мин Архивистка изучает лицензию точной версии модели; рядом отдельные папки весов, кода, данных, API и результатов показывают, что условия могут различаться. Основы AI Model License Лицензия модели описывает, что разрешено делать с конкретными весами: использовать, изменять и распространять их, в том числе в коммерческих сценариях.… 9 мин Молодая мастер совмещает две стеклянные матрицы весов A и B в латунном прессе; схема показывает пропорцию 70/30, совместимость тензоров и отдельные MODEL, CLIP и VAE. Обучение Model Merge Model Merge создаёт новую модель из весов нескольких совместимых моделей. Простое смешивание интерполирует одинаковые тензоры, delta merge переносит разницу между… 9 мин Три исследовательницы подают текст, изображение с котом, звук и видео через энкодеры в общую модель; выходы показывают текстовый ответ, новое изображение и синтез речи. Основы AI Multimodal AI Multimodal AI принимает или создаёт данные нескольких типов: текст, изображения, аудио, видео и сигналы датчиков. Возможности не обязаны быть симметричными:… 6 мин Певица-продюсер соединяет описание и мелодию с ритмом, гармонией, тембром, структурой и вокалом, собирает трек и отдельно проверяет права; у микрофона сидит корелла. Видео Music Generation Музыкальные модели создают аудио по описанию, напеву, референсу или заданной структуре. Одни генерируют готовую песню с вокалом, другие — инструментал,… 6 мин Художница направляет генерацию портрета чёрного кота двумя карточками: positive prompt тянет к желаемой сцене, а negative prompt ослабляет размытие, надписи и пластиковую шерсть. Промпты Negative Prompt Negative Prompt описывает признаки, от которых генерацию нужно оттолкнуть. В распространённой схеме classifier-free guidance модель сравнивает предсказания с положительным и… 6 мин Кот и четыре прозрачных слоя показывают, как нейросеть превращает фотографию в пиксели, контуры, части формы и предсказание «кот». Основы AI Neural Network NN, ANN Нейросеть (neural network, искусственная нейронная сеть) — математическая модель, в которой простые элементы-«нейроны» собраны в слои и обмениваются числами. На… 6 мин Пять стеклянных фотопластин постепенно проявляют смотрителя маяка с собакой: бордовая кривая задаёт уровни шума, а точки обозначают шаги процесса. Сэмплеры Noise Schedule Noise schedule задаёт, какой уровень сигнала и шума соответствует каждому моменту диффузионного процесса. При генерации сэмплер идёт по выбранным точкам… 8 мин Исследовательница задаёт вопрос по выбранным источникам; NotebookLM находит фрагменты, собирает ответ с цитатами и связывает его с оригиналом, конспектом и аудиообзором. Инструменты NotebookLM (Gemini Notebook) NotebookLM собирает отдельное рабочее пространство из документов, ссылок, аудио и других источников. Чат отвечает с переходами к использованным фрагментам, а… 6 мин Куратор раскрывает AI-релиз как архив из весов, кода, сведений о данных и лицензий; пакет open-weight ведёт только к секции с весами. Основы AI Open-source AI Open-source AI даёт свободу использовать, изучать, изменять и распространять систему, а также материалы, без которых её нельзя осмысленно доработать. Доступные… 10 мин Две девушки повторяют одну позу по схеме ключевых точек, показывая перенос движения через OpenPose. Адаптеры OpenPose OpenPose оценивает положение ключевых точек тела, лица и кистей на изображении. В генерации такую карту можно передать совместимому ControlNet, чтобы… 6 мин Квадратный снимок девушки с таксой помещается на расширенный холст с маской, после чего по бокам появляются продолжение луга, пледа и летнего света. Инструменты Outpainting Outpainting расширяет холст и генерирует сцену в новых областях за пределами исходного кадра. Модель опирается на пиксели возле старой границы,… 9 мин Три похожих студийных портрета девушки сходятся в связку «героиня плюс фон», поэтому на проверочном снимке пляж перекрывает знакомая синяя штора. Обучение Overfitting Overfitting, или переобучение, возникает, когда модель всё точнее подстраивается под обучающие примеры, но хуже работает на новых данных. В генерации… 8 мин Обучение по ошибке настраивает в модели веса, смещения и масштабы; checkpoint сохраняет положения регуляторов, а inference применяет их к новому снимку собаки. Основы AI Parameters Параметры модели — обучаемые числа внутри матриц и других тензоров нейросети. При обучении эти значения подбираются по данным, а затем… 7 мин Рыжий кот прослеживает путь вопроса Perplexity через найденные страницы к ответу со ссылками и проверяет исходный фрагмент через лупу. Языковые модели Perplexity Perplexity соединяет веб-поиск с языковой моделью: находит страницы, собирает связный ответ и показывает ссылки. Такой формат удобен для обзора темы,… 6 мин Девушка собирает промпт из контекста, задачи и формата; стрелки ведут через модель к ожидаемому результату. Промпты Prompt Промпт — запрос, который задаёт модели задачу и исходные условия. Он может включать инструкцию, текст для обработки, примеры и желаемый… 7 мин Редактор собирает промпт из задачи, контекста, примера, ограничений и формата ответа, проверяет его на тестовых входах, сравнивает результаты и возвращает на правку. Промпты Prompt Engineering Промпт-инженерия — работа над запросом к языковой модели: формулировкой задачи, исходными данными, примерами и форматом ответа. Запрос проверяют на разных… 8 мин Мужчина сортирует правила, данные и опасную записку, показывая, как prompt injection подменяет маршрут действий модели. Промпты Prompt Injection Prompt injection — попытка изменить задачу AI через текст или другие данные, которые приложение не должно принимать за команды. Инструкция… 6 мин Бумажные фразы проходят через разборщик промпта с тремя регуляторами веса; красный шарф становится заметнее в итоговом портрете, а сетка композиции остаётся отдельным инструментом. Промпты Prompt Weighting Prompt Weighting усиливает или ослабляет отдельные фрагменты текстового условия до генерации. Запись вроде `(красный шарф:1.2)` работает только там, где интерфейс… 6 мин Инженер проводит тензоры через модель PyTorch: прямой проход строит граф и вычисляет ошибку, autograd идёт назад за градиентами, а оптимизатор обновляет веса. Инструменты PyTorch PyTorch — библиотека с открытым исходным кодом для работы с тензорами, нейросетями и автоматическим дифференцированием. Модель описывается обычным Python-кодом, autograd… 7 мин Стеклянная волна точных значений округляется к ближайшим уровням и помещается в компактную кассету, показывая экономию памяти и потерю части точности. Параметры Quantization Quantization переводит веса или активации модели в более компактное числовое представление. Данных для хранения и передачи становится меньше, но значения… 8 мин Исследовательница раскрывает семейство Qwen: текст, код, математику, изображения и аудио; модели доступны как открытые веса, через API и приложение, а кот касается карточки изображения. Языковые модели Qwen Qwen — семейство моделей Alibaba для текста, кода, рассуждения и мультимодальных задач. Часть весов публикуется для локального запуска, а облачные… 5 мин Девушка ищет карточки документов в архиве и собирает ответ: схема работы RAG от вопроса к найденному контексту. Языковые модели RAG Retrieval-Augmented Generation RAG (Retrieval-Augmented Generation) — техника, в которой LLM перед ответом достаёт из внешней базы релевантные документы и использует их как… 7 мин Исследовательница наблюдает, как reasoning-модель перебирает подходы, проверяет и исправляет путь перед финальным ответом; рядом сидит русский голубой кот. Языковые модели Reasoning Models Reasoning-модели тратят дополнительные вычисления перед финальным ответом: разбивают задачу, пробуют варианты, используют инструменты и проверяют промежуточный результат. Это особенно полезно… 6 мин Две одинаковые фотопластины с самоедом показывают работу base и refiner: первая задаёт композицию, вторая при меньшем шуме уточняет шерсть, снег и отражения. Генеративные модели Refiner Refiner — отдельная модель или стадия, которая принимает промежуточный результат базовой модели и продолжает генерацию при небольшом уровне шума. Такой… 8 мин Три бумажные подсказки направляют области общей сцены: слева девушка читает, справа корги лежит на подушке, а фон занимает дождливый зимний сад. Промпты Regional Prompting Regional Prompting — семейство способов связать отдельные описания с нужными участками изображения. Маски, прямоугольники или другие пространственные условия помогают развести… 9 мин Запрос о ночном шуме вентилятора проходит через быстрый поиск кандидатов и повторную оценку, после которой карточка о тихом режиме оказывается первой в новом порядке. Языковые модели Reranking Reranking — второй этап поиска, на котором уже найденные документы получают новые оценки и меняются местами. Первичный поиск собирает кандидатов,… 8 мин Человек выбирает один из двух ответов, после чего RLHF передаёт предпочтение через модель награды и цикл подкрепления, а DPO напрямую сравнивает выбранный и отклонённый варианты. Обучение RLHF и DPO RLHF и DPO используют сравнения ответов, чтобы скорректировать поведение модели. В классическом RLHF отдельная модель награды оценивает новые ответы, а… 9 мин Три видеохудожницы проверяют Runway, Kling и Pika на одном снимке собаки и движении, сравнивая сохранение героя, движение, камеру, монтаж и условия использования без постоянного победителя. Видео Runway, Kling, Pika Runway, Kling и Pika — закрытые платформы генерации и редактирования видео. Их модели и тарифы меняются, поэтому устойчивое сравнение строится… 6 мин Инженерка показывает Safetensors: JSON-заголовок описывает имя, dtype, shape и offsets, затем идут байты тензоров, которые загрузчик переносит в память без исполнения кода. Инструменты Safetensors Safetensors — открытый формат хранения тензоров, в том числе весов нейросетей. Он описывает числовые массивы и не использует механизм pickle,… 6 мин Художница и серый кот показывают sampler: предсказание модели и правило шага вычисляют следующее состояние, а по выбранной траектории из шума возникает изображение. Сэмплеры Sampler sampling method Sampler задаёт правило обновления зашумлённого представления на каждом шаге генерации. Результат зависит также от расписания шума, модели и числа шагов.… 6 мин Три дорожки ведут от шумной пластины к чёткой фотографии бордер-колли, но контрольные точки равномерны, сгущены в середине или ближе к концу. Сэмплеры Scheduler Karras schedule Scheduler задаёт, на каких уровнях шума или временных точках sampler делает шаги генерации. При одинаковом числе шагов расписание может распределить… 9 мин Промпт проходит через два текстовых кодировщика; базовая модель SDXL превращает латентный шум в композицию, а необязательное уточнение деталей готовит итоговое изображение. Генеративные модели SDXL Stable Diffusion XL SDXL (Stable Diffusion XL) — поколение Stable Diffusion, рассчитанное на изображения примерно мегапиксельного масштаба. Оно использует два текстовых кодировщика, дополнительное… 6 мин Фотограф показывает, как seed задаёт стартовый шум: при тех же модели и настройках два запуска повторяют портрет рыжего кота, а другой seed меняет шум и композицию. Параметры Seed Seed (сид) — число, которое задаёт начальный шум для диффузионной модели. При одинаковой вычислительной среде он помогает повторить стартовую точку… 6 мин Цветная карта классов и фотография показывают одну композицию: девушка ведёт велосипед, рыжий кот сидит в корзине, рядом дерево, дом, небо и мостовая. Адаптеры Segmentation Map Segmentation Map делит изображение на области и хранит для каждого пикселя метку класса или экземпляра объекта. В генеративном конвейере такая… 9 мин Архивист и русская борзая показывают семантический поиск: запрос и документы проходят через одну embedding-модель, становятся векторами, а индекс возвращает ближайшие по смыслу материалы. Языковые модели Semantic Search Семантический поиск помогает находить материалы по смысловой близости, даже если запрос и документ сформулированы разными словами. В распространённой схеме тексты… 6 мин Полевая инженерка запускает SLM на устройстве для узкой задачи, проверяет качество и ресурсы и направляет сложный случай к более крупной модели; рядом ждёт поисковая собака. Языковые модели Small Language Models SLM Small Language Model — относительное название компактной LLM. Такая модель требует меньше памяти и вычислений, поэтому подходит для устройства, сервера… 6 мин Девушка управляет локальной установкой Stable Diffusion, превращающей промпт и латентный шум в изображение через последовательное уточнение. Генеративные модели Stable Diffusion Stable Diffusion — семейство диффузионных моделей изображений, начавшееся с выпуска открытых весов Stability AI. Поколения различаются архитектурой, лицензией и совместимыми… 7 мин Фотограф и золотистый ретривер показывают Steps: ранние, средние и поздние итерации уточняют изображение, а после точки насыщения время растёт быстрее заметного прироста. Параметры Steps Steps — число итераций, за которые sampler переводит шум в изображение. Больше шагов обычно означает больше вычислений, но улучшение быстро… 5 мин Архитектор данных показывает Structured Output: JSON Schema задаёт обязательные поля, типы и enum, ограничение генерации сохраняет форму, а содержание отдельно проверяется. Языковые модели Structured Output Structured Output ограничивает форму ответа схемой: обязательными полями, типами, списками допустимых значений и вложенными объектами. Это снимает многие ошибки парсинга,… 6 мин Инженер дата-центра показывает цикл устойчивого AI: измерить электроэнергию, воду и оборудование, применить меньшую модель, кэш, квантизацию и гибкий запуск, затем снова сверить качество. Этика и регулирование Sustainable AI Sustainable AI рассматривает энергию, воду и оборудование на всём жизненном цикле модели: обучение, инференс, хранение и замену серверов. Одна цифра… 6 мин Кураторка данных и корги показывают synthetic data: реальные примеры поступают в генератор, варианты проходят фильтр, смешиваются с реальными и проверяются на отдельном наборе. Обучение Synthetic Data Синтетические данные создаются программой, симулятором или другой моделью, а не собираются напрямую из наблюдений за реальным миром. Они помогают покрыть… 6 мин Режиссёрка задаёт system prompt из роли, тона, формата и границ; модель соединяет эту рамку с запросом пользователя и формирует ответ без гарантии абсолютного соблюдения. Промпты System Prompt System Prompt задаёт модели роль, правила, формат и границы конкретного приложения. Платформа обычно задаёт ему более высокий приоритет, чем запросу… 6 мин Аналитик подаёт одну задачу в неизменную модель и сравнивает быстрый одиночный проход с дополнительным поиском, несколькими попытками, проверкой и выбором ответа; рядом лежит бордер-колли. Языковые модели Test-Time Compute Inference-Time Scaling Test-Time Compute — способы потратить больше вычислений на конкретный ответ: сделать несколько попыток, провести поиск, проверить решение или увеличить внутренний… 5 мин Золотистый ретривер с красным шарфом проходит через последовательность согласованных кадров от текстового промпта к готовому видеоклипу. Видео Text-to-Video Text-to-Video — генерация видео по текстовому описанию. Есть облачные сервисы и открытые модели для локального запуска, в том числе через… 6 мин Четыре фотографии одной рыжеволосой девушки обучают латунную литеру MIRA, остальные веса заперты, а новый промпт переносит героиню к борзой в зимний сад. Адаптеры Textual Inversion TI Textual Inversion учит новое текстовое представление концепта по примерам, сохраняя остальные веса генеративной модели замороженными. Полученный embedding загружается в совместимый… 8 мин Дизайнер раскладывает большой постер на перекрывающиеся плитки; рядом с котом повторяется бесшовная ткань, а tiled VAE обрабатывает изображение окнами ради меньшей нагрузки на память. Адаптеры Tile / Tiling Tile называют сразу несколько разных приёмов: обработку большого изображения перекрывающимися фрагментами, тайловый денойзинг, tiled VAE для снижения пиковой нагрузки на… 8 мин Типографка пропускает русский текст через токенизатор: он делит фразу на кусочки разной длины, сопоставляет им идентификаторы, собирает контекст и передаёт его модели для ответа. Языковые модели Token Токен — элемент словаря модели: целое слово, часть слова, знак, пробел или последовательность байтов. Токенизатор превращает текст в идентификаторы, а… 7 мин Операторка подаёт модели запрос и описания инструментов; модель выбирает встроенный или собственный вариант, внешний контур проверяет и выполняет вызов, а результат возвращается для ответа. Языковые модели Tool Calling Tool Calling позволяет модели предложить вызов поиска, калькулятора, базы или другой функции в структурированном виде. Само действие выполняет приложение или… 7 мин Исследовательница с бордер-колли показывает цикл обучения модели: данные дают предсказание, loss измеряет ошибку, backpropagation вычисляет градиенты, а оптимизатор обновляет веса. Основы AI Training Training, или обучение модели, — процесс настройки её параметров на примерах. Модель делает предсказание, функция потерь измеряет ошибку, а оптимизатор… 6 мин Карточки слов и цветные линии условно показывают связи внутри фразы: «убежала» связано с «кошка». Это иллюстрация идеи, а не измеренная карта внимания. Основы AI Transformer Transformer — архитектура нейросети, представленная в статье Attention Is All You Need в 2017 году. Она обрабатывает последовательность через attention:… 7 мин Три фотографии одной девушки подписаны меткой TOK, нити связывают их с адаптером, а новый промпт переносит ту же героиню и серого кота в дождливый город. Промпты Trigger Word Trigger word — слово или короткая фраза, которую во время обучения связывают с персонажем, предметом или стилем. Повтор той же… 7 мин Аудиторка и лабрадор показывают доверие к AI: назначение, границы, данные и тесты проходят проверку, человек сохраняет контроль, а обратная связь и пересмотр замыкают цикл. Этика и регулирование Trust in AI Доверие к AI полезно, когда оно соответствует реальной надёжности системы. Пользователю нужны понятное назначение, проверенные ограничения, источники, возможность отменить действие… 6 мин Радиоведущая показывает два направления голосового AI: STT превращает речь из микрофона в текст, а TTS преобразует текст в озвучку с ритмом, паузами и интонацией. Видео TTS и STT STT превращает запись речи в текст, а TTS — текст в звучащую речь. Вместе они лежат в основе транскрипции, дубляжа… 6 мин Маленький пиксельный снимок самоеда проходит через увеличитель и становится большим детальным отпечатком с напоминанием, что новые детали могут быть достроены. Инструменты Upscaler Upscaler делает изображение крупнее. Обычная интерполяция вычисляет новые пиксели по соседним, а обученная модель ещё и оценивает, какие контуры и… 8 мин Фотография рыжего кота проходит через VAE Encoder в маленький латент, а Decoder восстанавливает второй отпечаток с немного изменившимися деталями шерсти. Генеративные модели VAE Variational Autoencoder VAE переводит изображение в компактный латентный тензор и декодирует его обратно в пиксели. В txt2img обычно работает decoder, а в… 10 мин Запрос об уютном уголке для чтения превращается в вектор, индекс подсвечивает ближайшие карточки, а база возвращает связанные изображения и метаданные. Языковые модели Vector Database Vector DB Vector Database хранит векторы признаков вместе со ссылками на исходные объекты и метаданными. Для нового запроса она находит ближайшие записи… 10 мин Создательница прототипа описывает цель AI-агенту, который печатает код и запускает результат; ошибка возвращается в новое описание, а отдельная ветка добавляет ревью и тесты. Промпты Vibe Coding Vibe Coding — название для подхода, в котором человек описывает желаемое поведение, принимает сгенерированный код и ориентируется на результат, почти… 6 мин Девушка даёт VLA-модели команду положить мяч в корзину: робот видит сцену с собакой, понимает цель, переносит мяч и получает обратную связь. Мультимодальные модели VLA Vision-Language-Action Vision-Language-Action-модель получает изображение или видео и текстовую задачу, затем предсказывает действия робота. Вместо жёсткого сценария «увидел метку — выполнил одну… 6 мин Владелица голоса подтверждает согласие, затем образец и новый текст проходят через представление голоса и синтез речи к маркированной новой фразе; рядом сидит серый попугай. Видео Voice Cloning Voice Cloning помогает синтезировать речь с признаками конкретного голоса. Одни методы используют образец сразу, другие дообучаются на записях. Названия режимов… 6 мин Открытая видеокарта показывает VRAM: веса модели, активации и рабочие буферы помещаются рядом с GPU, а лишние данные переносятся в системную RAM. Параметры VRAM Video RAM VRAM хранит данные, с которыми графический процессор работает прямо сейчас: веса модели, активации, кадры и временные буферы. Чем больше данных… 8 мин Аудиоредакторка превращает речь в спектрограмму; кодировщик Whisper строит представление сигнала, декодер выдаёт текстовые токены, а транскрипция проходит проверку по записи. Видео Whisper Whisper — семейство моделей OpenAI для многоязычного распознавания речи и перевода аудио в английский. Веса опубликованы для локального запуска, а… 6 мин Разработчица меняет действие в диораме, а World Model обновляет состояние мира, сохраняет скрытый объект в памяти и сравнивает несколько будущих состояний. Мультимодальные модели World Models World Model Мировая модель хранит внутреннее представление среды и предсказывает её следующее состояние. Она помогает агенту представить последствия действия до того, как… 6 мин Две редакционные доски сравнивают zero-shot с одной инструкцией и few-shot с размеченными снимками питомцев, показывая, как примеры задают образец ответа. Промпты Zero-shot и Few-shot Zero-shot означает, что модель получает инструкцию и новую задачу без готовых примеров. При few-shot в тот же контекст добавляют несколько… 9 мин