Computer Use
computer use — ИИ-агент, который смотрит на экран и сам двигает мышь, как человек
Computer Use (CUA, компьютерный агент) — ИИ-агент, который управляет компьютером как человек: делает скриншот экрана, «видит» интерфейс, двигает курсор, кликает и печатает в реальных приложениях и браузере — без специальных API. Такой доступ расширяет охват автоматизации, но добавляет ошибки наведения, задержку и риск принять содержимое экрана за инструкцию. Поэтому важные действия требуют узких прав, проверки результата и подтверждения человека.
Коротко
Коротко. Computer Use — способ дать агенту зрительный канал, клавиатуру и мышь. Агент получает снимок экрана, выбирает действие, выполняет его и смотрит на новый снимок. Так можно работать даже с программой без API, но визуальный интерфейс остаётся менее надёжным каналом, чем типизированная функция: кнопку легко перепутать, окно — потерять, а текст на странице — принять за команду.
Что это такое
Языковая модель сама по себе только предлагает следующий фрагмент текста. Чтобы она могла нажать кнопку, среда должна показать ей экран, принять структурированное действие и вернуть результат. Computer Use добавляет именно эту петлю восприятия и действия.
Это расширяет охват: старую бухгалтерскую программу, корпоративный портал или форму поставщика можно использовать через тот же интерфейс, который видит человек. Но «есть экран» ещё не значит «задача автоматизируется безопасно». Система должна различать данные и команды, понимать состояние окна и уметь остановиться до необратимого шага.
Как это работает
Внутри — простой на вид цикл, который крутится десятки раз за задачу:
- Скриншот. Агент делает снимок экрана.
- Зрение. Мультимодальная модель «смотрит» на картинку интерфейса: где кнопки, поля, текст.
- Решение. Модель выбирает следующее действие: кликнуть в точку (x, y), напечатать текст, прокрутить, нажать сочетание клавиш.
- Действие. Команда выполняется через реальные системные вызовы.
- Новый скриншот — и цикл повторяется с учётом того, что изменилось.
В чистом визуальном режиме модель не получает HTML или внутреннее дерево приложения — только пиксели. Чтобы нажать кнопку, она связывает смысл элемента с координатами на снимке. Некоторые продукты дополняют картинку DOM или accessibility tree, но тогда это уже гибридный канал.
Каждый шаг требует нового снимка и нового решения, поэтому визуальный маршрут обычно медленнее прямого API. Одинаковая задача также может пройти по разным траекториям: всплывающее окно, задержка загрузки или небольшая перестановка элементов создают новый сценарий.
Безопасный контур добавляет остановку перед оплатой, отправкой сообщения, удалением или изменением прав. Само наличие диалога подтверждения недостаточно: человеку показывают точное действие, цель, получателя и данные, которые уйдут наружу.
Пример на практике
Представим внутренний портал без API. Агент открывает заявку, переносит данные из утверждённой таблицы и доходит до кнопки отправки. Перед ней он показывает сотруднику сводку: номер заявки, получателя и изменённые поля. После подтверждения делает снимок результата и проверяет, появился ли номер регистрации. Здесь ценность не в эффектной скорости, а в том, что скучный маршрут можно выполнить с видимой точкой контроля.
С чем часто путают
- Computer Use и обычный AI Agent с tool calling — агент с tool calling вызывает заранее описанные функции через API: чисто, быстро, надёжно, но только там, где API есть. Компьютерный агент не знает об API вообще — он смотрит на экран и кликает. Это открывает легаси-системы, но обрушивает скорость и надёжность.
- Computer Use и RPA — классическая RPA автоматизирует интерфейс по жёстким правилам (координаты, селекторы). Сдвинули кнопку — RPA сломалась. Агент адаптируется, потому что понимает смысл интерфейса.
- Computer Use и агентный браузер — браузер может сочетать визуальное управление с DOM, поиском и внутренними инструментами. Computer Use — один из возможных каналов внутри такого продукта.
- Computer Use и скрипт/макрос — макрос — заранее записанная последовательность шагов, не понимающая контекста. Агент сам планирует шаги из задачи на естественном языке и исправляется на ходу.
- Computer Use и API-интеграция — интеграция через API быстра и детерминирована, но требует, чтобы сервис её предоставлял. Агент работает там, где API нет совсем.
Частые ошибки и заблуждения
- «Агенту можно доверить всё, как виртуальному сотруднику». Нет. Капчи, всплывающие окна, неоднозначные формы и изменения интерфейса снижают надёжность. Необратимые действия требуют отдельного подтверждения и узких прав.
- «Это просто продвинутые макросы». Макрос сломается от любого изменения интерфейса. Агент планирует многошаговую стратегию из описания цели, замечает ошибку на экране и переписывает план. Другой класс систем.
- «Работает надёжно, как человек». Нет. Один успешный проход не гарантирует повторяемости, а цепочка скриншотов и действий добавляет задержку и новые точки отказа.
- «Раз он просто смотрит на экран, это безопасно». Наоборот. Именно то, что агент читает весь экран, создаёт новую угрозу.
Связанные термины
- AI Agent — общая категория автономных систем; компьютерный агент — частный случай с управлением через GUI.
- Agentic AI — парадигма, где модель действует итеративно и сама, а не отвечает на один запрос.
- Tool Calling / Function Calling — альтернативный способ действовать: через API, а не через экран.
- MCP — открытый протокол для подключения инструментов; может работать вместе с компьютерным агентом или вместо него.
- Prompt Injection — атака через данные; для компьютерного агента это её визуальный вариант — инструкции прямо на экране.
Частые вопросы
Чем компьютерный агент отличается от обычного бота? Обычный бот действует через API или жёсткие скрипты. Компьютерный агент смотрит на экран и кликает, как человек, поэтому работает там, где API нет, но платит за это скоростью и надёжностью.
Кто сделал это первым? Управление интерфейсом существовало задолго до LLM в RPA и системах компьютерного зрения. Современный этап отличается тем, что языковая модель выбирает действие по цели и изображению экрана; у него нет одного бесспорного «первого» продукта.
Можно ли уже доверить ему свою почту и банк? Для чтения почты и тем более банка нужен режим минимальных прав. Отправка, удаление, платёж и изменение реквизитов должны останавливаться перед выполнением и требовать понятного подтверждения человека.
Почему он такой медленный? Каждый шаг — это «скриншот → подумать → действие → новый скриншот». Планирование съедает большую часть времени, а целиться курсором по пикселям трудно. Отсюда минуты там, где человек тратит секунды.
Чем это отличается от агентного браузера? Агентный браузер — продуктовая оболочка, которая может сочетать DOM, поисковый индекс, API и управление экраном. Computer Use описывает сам способ взаимодействия через визуальный интерфейс; внутри продукта он бывает лишь одним из нескольких каналов.
Главное
Computer Use даёт модели зрительный канал и управление мышью с клавиатурой. Так агент может работать с программой без специального API, но платит за универсальность задержкой, хрупкостью интерфейса и риском принять содержимое экрана за команду. Поэтому практичная система сочетает визуальное управление с узкими правами, журналом действий, проверкой результата и остановкой перед необратимым шагом.