Computer Use

computer use — ИИ-агент, который смотрит на экран и сам двигает мышь, как человек

Раздел
Языковые модели
Сокращ.
Computer-Using Agent (CUA)
Обновлено
03.10.26

Компьютерный AI-агент читает экран, нажимает кнопки и вводит текст в приложениях. Разберём, как он работает, почему может промахнуться и какие действия лучше оставлять на подтверждение человеку.

Коротко

Коротко. Computer Use — способ дать агенту зрительный канал, клавиатуру и мышь. Агент получает снимок экрана, выбирает действие, выполняет его и смотрит на новый снимок. Так можно работать даже с программой без API. Но управление через экран добавляет неопределённость: кнопку легко перепутать, окно — потерять, а текст на странице — принять за команду.

Что это такое

Фраза «нажми кнопку» сама по себе ничего не меняет в программе. Нужна связка: модель получает снимок экрана, выбирает действие, а программа управления выполняет его и возвращает новый снимок. Так агент видит, что получилось, и выбирает следующий шаг.

Это расширяет охват: старую бухгалтерскую программу, корпоративный портал или форму поставщика можно использовать через тот же интерфейс, который видит человек. Но «есть экран» ещё не значит «задача автоматизируется безопасно». Система должна различать данные и команды, понимать состояние окна и уметь остановиться до необратимого шага.

Как это работает

В основе — повторяющийся цикл:

  1. Скриншот. Агент делает снимок экрана.
  2. Зрение. Мультимодальная модель «смотрит» на картинку интерфейса: где кнопки, поля, текст.
  3. Решение. Модель выбирает следующее действие: кликнуть в точку (x, y), напечатать текст, прокрутить, нажать сочетание клавиш.
  4. Действие. Команда выполняется через реальные системные вызовы.
  5. Новый скриншот — и цикл повторяется с учётом того, что изменилось.

В чистом визуальном режиме модель не получает HTML или внутреннее дерево приложения — только пиксели. Чтобы нажать кнопку, она связывает смысл элемента с координатами на снимке. Некоторые продукты дополняют картинку DOM или accessibility tree, но тогда это уже гибридный канал.

Снимки экрана, решения модели и ожидание загрузки добавляют задержку. Агент может объединять несколько действий, но после изменения интерфейса ему всё равно нужно проверить результат. Одинаковая задача также может пройти по разным траекториям: всплывающее окно, задержка загрузки или небольшая перестановка элементов создают новый сценарий.

Безопасный контур добавляет остановку перед оплатой, отправкой сообщения, удалением или изменением прав. Само наличие диалога подтверждения недостаточно: человеку показывают точное действие, цель, получателя и данные, которые уйдут наружу.

Пример на практике

Представим внутренний портал без API. Агент открывает заявку, переносит данные из утверждённой таблицы и доходит до кнопки отправки. Перед ней он показывает сотруднику сводку: номер заявки, получателя и изменённые поля. После подтверждения отправляет форму и проверяет, появился ли номер регистрации. Сотруднику не нужно вручную переносить каждое поле, но он видит и подтверждает, что именно уйдёт получателю.

С чем часто путают

  • Computer Use и вызов инструментов — не противоположности. Управление мышью тоже можно предоставить модели как инструмент. Один агент способен заполнять форму через экран, а получать данные через API.
  • Computer Use и RPA — RPA обычно следует заранее настроенному сценарию. Она может находить кнопку по свойствам элемента, а не только по координатам, поэтому перестановка окна не обязательно её сломает. Агенту с моделью проще поручить задачу словами, но способность выбирать шаги не гарантирует, что он выберет их верно.
  • Computer Use и агентный браузер — браузер может сочетать визуальное управление с DOM, поиском и внутренними инструментами. Computer Use — один из возможных каналов внутри такого продукта.
  • Computer Use и скрипт/макрос — макрос — заранее записанная последовательность шагов, не понимающая контекста. Агент сам планирует шаги из задачи на естественном языке и исправляется на ходу.
  • Computer Use и API-интеграция — API даёт явные параметры и структурированный ответ. Это часто удобнее, чем искать кнопку, хотя ошибки и сбои возможны в обоих случаях. Визуальное управление полезно там, где подходящего API нет.

Частые ошибки и заблуждения

  • «Агенту можно доверить всё, как виртуальному сотруднику». Нет. Капчи, всплывающие окна, неоднозначные формы и изменения интерфейса снижают надёжность. Необратимые действия требуют отдельного подтверждения и узких прав.
  • «Это просто записанный макрос». Агент может выбирать следующий шаг по цели и состоянию экрана, а не воспроизводить одну запись. Однако он тоже способен повторять неудачное действие или не заметить ошибку.
  • «Работает надёжно, как человек». Нет. Один успешный проход не гарантирует повторяемости, а цепочка скриншотов и действий добавляет задержку и новые точки отказа.
  • «Раз он просто смотрит на экран, это безопасно». На снимке могут оказаться чужая инструкция, личное письмо или секретный код. Важно не только ограничить действия, но и понять, кому передаются сами снимки.

Связанные термины

  • AI Agent — общая категория автономных систем; компьютерный агент — частный случай с управлением через GUI.
  • Agentic AI — подход, при котором модель выбирает действия, получает их результаты и продолжает работу с учётом того, что изменилось.
  • Tool Calling / Function Calling — механизм вызова инструментов, в том числе инструментов управления экраном.
  • MCP — протокол подключения инструментов и данных. Сам по себе не заменяет агента: через него можно предоставить агенту разные способы действий.
  • Prompt Injection — атака через данные; для компьютерного агента это её визуальный вариант — инструкции прямо на экране.

Частые вопросы

Чем компьютерный агент отличается от обычного бота? Обычный бот действует через API или жёсткие скрипты. Компьютерный агент смотрит на экран и кликает, как человек, поэтому работает там, где API нет, но платит за это скоростью и надёжностью.

Кто сделал это первым? Управление интерфейсом существовало задолго до LLM в RPA и системах компьютерного зрения. Современный этап отличается тем, что языковая модель выбирает действие по цели и изображению экрана; у него нет одного бесспорного «первого» продукта.

Можно ли доверить ему свою почту и банк? Для чтения почты и тем более банка нужен режим минимальных прав. Отправка, удаление, платёж и изменение реквизитов должны останавливаться перед выполнением и требовать понятного подтверждения человека.

Почему он такой медленный? Время уходит на получение снимков, ответы модели, загрузку страниц и повторные попытки. Их доля зависит от задачи: иногда медленнее всего отвечает сайт, иногда агент долго ищет нужное поле.

Чем это отличается от агентного браузера? Агентный браузер — продуктовая оболочка, которая может сочетать DOM, поисковый индекс, API и управление экраном. Computer Use описывает сам способ взаимодействия через визуальный интерфейс; внутри продукта он бывает лишь одним из нескольких каналов.

Главное

Компьютерный агент может заполнить форму или поработать в программе, у которой нет API: он видит экран и управляет мышью и клавиатурой. Но всплывающее окно, задержка загрузки или похожие кнопки способны сбить его с пути. Ограниченный доступ, журнал действий и проверка результата помогают заметить ошибку; перед отправкой, оплатой или удалением агенту нужно подтверждение человека.

О том, как устроен цикл действий, рассказывает документация Anthropic. Разницу между координатами и поиском элемента по свойствам объясняет документация UiPath.