AI Agent
ai agent — модель, которая выбирает действия и пользуется инструментами
AI-агент — система, которая выбирает действия для решения задачи и получает обратную связь от среды. Агент на базе языковой модели может искать сведения, читать файлы и запускать проверки через инструменты. Самостоятельность ограничивают разрешениями, бюджетом и условиями остановки.
Коротко
Коротко. В этой статье AI Agent — агент на базе языковой модели, с инструментами и циклом действий. В более широком смысле агенты не обязательно используют LLM. В отличие от обычного чата, агент не отвечает за одно сообщение: он получает цель, разбивает её на шаги, выбирает нужный инструмент (поиск, код, файл, API), выполняет, смотрит результат и решает, что делать дальше. Цикл заканчивается результатом, запросом к человеку или остановкой по ограничениям. Так могут работать помощники для программирования, исследовательские агенты, операторы интерфейсов.
Что это такое
Tool calling позволил перейти от одного текстового ответа к циклу «выбрать действие — получить результат — скорректировать план». На этой схеме строятся редакторы кода, исследовательские помощники и другие агентские продукты, хотя набор инструментов и степень автономности у них различаются.
AI Agent — это не отдельная модель и не отдельная технология. В случае языковых моделей это способ построить систему вокруг LLM: вместо «один промпт — один ответ» появляется «цель — серия действий — результат».
Базовая конструкция:
- Цель — то, что нужно достичь.
- Инструменты — что агент умеет делать (вызывать функции).
- Цикл рассуждения — модель сама решает, какой следующий шаг сделать.
- Контекст — память между шагами (что уже сделано, что узнали).
Это превращает LLM из «отвечающего на вопросы» в «решающего задачи». И открывает целый класс задач, которые одним ответом не решаются.
К качеству ответа добавляется ещё один вопрос: как дать модели возможность действовать, не открывая ей лишний доступ.
Как это работает
Один из подходов — чередовать рассуждение и действие, как в ReAct. Упрощённый цикл выглядит так:
- Приложение передаёт цель, ограничения и описание инструментов. API может принимать инструменты отдельным параметром, а не в системном промпте. Например:
search_web,read_file,run_python,add_to_calendar,send_message. - Модель рассуждает. «Чтобы решить задачу, мне нужно сначала найти X, потом проверить Y, потом обновить Z».
- Модель выбирает инструмент и передаёт ему параметры в структурированном виде (JSON):
{"tool": "search_web", "query": "расписание выбранного рейса на указанную дату"}(условный формат, зависящий от API). - Программная среда проверяет разрешение, выполняет действие и возвращает результат: список рейсов, текст файла, вывод кода.
- Модель наблюдает результат и решает следующий шаг: «Из этих рейсов самый дешёвый — Y, проверю расписание возврата».
- Цикл повторяется до достижения цели или предела шагов.
Число действий не равно автоматически числу обращений к модели. Один ответ может содержать несколько вызовов инструментов, а на проверку одного действия могут понадобиться дополнительные обращения. Историю также можно сокращать или сохранять частично.
Типичные категории агентов:
- Code agents. Claude Code, Cursor, Devin. Цель — изменить кодовую базу. Инструменты: чтение/запись файлов, выполнение команд, тесты, git.
- Исследовательские агенты. Собирают и синтезируют информацию через поиск, браузер и другие источники. Качество определяется не названием режима, а полнотой поиска и проверкой цитат.
- Computer-use agents. Такие агенты наблюдают интерфейс, например по снимкам экрана, и выбирают клики или ввод текста. После действия они получают новое состояние.
- Workflow agents. Zapier AI, n8n + LLM. Цель — автоматизировать процессы. Инструменты: триггеры из API, отправка в Slack/email.
- Multi-agent systems. Несколько агентов распределяют роли: планирование, выполнение, проверка. При этом они могут использовать одну и ту же модель.
MCP (Model Context Protocol) — один из открытых способов описать подключение инструментов и источников к AI-приложению. Он уменьшает число специальных адаптеров, но не отменяет авторизацию, проверку аргументов и ограничения каждого сервера.
Пример на практике
Допустим, видеомонтажёр хочет собрать план правок по клиентским письмам. Агент получает доступ только к выбранным сообщениям и заметкам о проектах. Открывать монтажную программу и менять проекты для этой задачи не требуется.
- Находит письма за указанный период.
- Сопоставляет обращения с проектами по названию и внутреннему номеру.
- Читает заметки о готовности материалов.
- Готовит список правок со ссылками на письма и отмечает неоднозначные пожелания.
- Возвращает черновик плана монтажёру, не отправляя его клиентам.
Если в письме написано «сделайте динамичнее», агент не обязан придумывать точное решение и срок. Он может выделить это как вопрос для уточнения. Получается полезная подготовка к работе, а не обещание самостоятельно закончить монтаж за полминуты.
Такая схема требует настроенных подключений и разрешений. Само наличие LLM-ноды в ComfyUI не позволяет модели произвольно управлять остальным графом: для выбора действий нужна соответствующая логика.
С чем часто путают
- Agent и Chatbot — chatbot отвечает на сообщения, agent выполняет действия. Чат может быть интерфейсом агента, но одиночный вызов функции ещё не означает самостоятельного многошагового процесса.
- Agent и Multi-agent system — один агент может обращаться к разным моделям. В многоагентной системе взаимодействуют несколько исполнителей с отдельными ролями или состояниями. Сложнее в разработке, не всегда лучше работает.
- Agent и Workflow — workflow это заранее определённая последовательность шагов. Agent выбирает шаги динамически. Заданный процесс проще предсказать; агентный подход даёт больше свободы выбора. Надёжность обоих зависит от реализации.
- Tool use и Function calling — function calling — распространённый способ описывать вызовы функций в API, а не единый стандарт одного поставщика. Tool use — более широкое понятие использования инструментов.
- MCP и LangChain — MCP это протокол подключения инструментов. LangChain — фреймворк сборки агентов (может использовать MCP внутри).
Частые ошибки и заблуждения
- «Agent — это автономный AI». Не совсем. Современные агенты работают в рамках, заданных разработчиком: набор инструментов, ограничения, мониторинг. «Автономия» — это автономия в выборе шагов, не в целях.
- «Agent сам разберётся, не нужны промпты». Нужны понятные цель и ограничения. При этом разрешения на доступ должны проверяться программой, а не только описываться текстом.
- «Чем больше шагов, тем умнее агент». Число шагов зависит от задачи. Повторение одних и тех же неудачных действий без новых данных — повод остановиться; длинная осмысленная работа сама по себе не ошибка.
- «Любая LLM может работать как агент». У разных моделей отличаются следование инструкциям и работа с инструментами. Размер в параметрах не заменяет проверки: небольшая модель может подойти для узкой задачи, а крупная — ошибиться в сложной.
- «Дороже модель → лучше агент». До определённого предела. После — упирается в качество промптов, дизайн инструментов и обработку ошибок.
Связанные термины
- Tool use / Function calling — основной механизм работы агента.
- MCP — открытый протокол подключения инструментов к моделям.
- ReAct — паттерн «рассуждение + действие» внутри агентного цикла.
- Chain-of-thought — последовательное рассуждение; не обязательный открытый текст каждого агентного шага.
- Multi-agent system — несколько агентов с ролями, общающихся.
- LLM — модель, лежащая в основе агента.
- Context window — лимит, ограничивающий длину истории агента.
- Prompt injection — попытка навязать инструкции через обрабатываемые данные.
Частые вопросы
Чем агент отличается от Cursor или Claude Code? «Агент» — тип системы, а Cursor и Claude Code — продукты с агентными возможностями для работы с кодом. Конкретные режимы и разрешённые действия зависят от настроек.
Можно ли запустить агента локально? Да. Программу агента можно запустить на своём компьютере. Но если она обращается к облачной модели или внешнему поиску, эти данные покидают компьютер. Полностью локальная работа требует локальных моделей и инструментов. Надёжность зависит от точной модели и схем инструментов; её проверяют на обычных, неоднозначных и опасных запросах.
Что такое Agentic RAG? RAG, в котором поиск делается не один раз, а агентом — модель сама решает, какой запрос задать, какие документы прочитать дальше, когда остановиться. Это может помочь со сложным поиском, но добавляет стоимость и риск неверного маршрута; преимущество проверяют на конкретных вопросах.
Базовый поиск без агентного цикла можно разобрать в материале «RAG и AI-поиск». Там показан обычный поиск по документам, на который затем можно наращивать агентные действия.
Сколько токенов «съедает» агент за одну задачу? Обычно больше одиночного ответа: каждый шаг добавляет историю, описание инструментов и их результаты. Бюджет зависит от числа итераций, сжатия контекста, кэширования и объёма наблюдений, поэтому его измеряют на типичной задаче и ограничивают заранее.
Где почитать про создание собственного агента? В Anthropic Cookbook есть учебные примеры работы с моделями и инструментами. Размер демонстрации не отражает объём готового приложения: обработка ошибок, разрешения и проверки требуют отдельной работы.
Главное
AI-агент — это схема, в которой языковая модель не только пишет ответ, но и вызывает инструменты: ищет данные, меняет файлы, запускает код или работает в интерфейсе. Надёжность зависит от границ задачи, качества обратной связи и обработки ошибок. Чем серьёзнее возможные последствия, тем меньше оснований оставлять агенту широкие права без подтверждения человека.