AI Agent

ai agent — модель, которая выбирает действия и пользуется инструментами

Раздел
Языковые модели
Обновлено
11.08.26

AI Agent (AI-агент) — это LLM, которая не просто отвечает на вопрос, а решает задачу через несколько шагов и использует внешние инструменты. У агента есть цель, доступные действия (поиск, код, файлы, API) и цикл «выбрать следующий шаг → выполнить → посмотреть результат → следующий шаг». Простой пример: «найди лучший рейс на пятницу и сохрани в календарь» — агент сам ищет, сравнивает, выбирает, добавляет в календарь.

Коротко

Коротко. AI Agent — это LLM с инструментами и циклом действий. В отличие от обычного чата, агент не отвечает за одно сообщение: он получает цель, разбивает её на шаги, выбирает нужный инструмент (поиск, код, файл, API), выполняет, смотрит результат и решает, что делать дальше. Цикл повторяется, пока цель не достигнута. Так работают современные code-помощники, исследовательские агенты, операторы интерфейсов.

Что это такое

Tool calling позволил перейти от одного текстового ответа к циклу «выбрать действие — получить результат — скорректировать план». На этой схеме строятся редакторы кода, исследовательские помощники и другие агентские продукты, хотя набор инструментов и степень автономности у них различаются.

AI Agent — это не отдельная модель и не отдельная технология. Это паттерн использования LLM: вместо «один промпт — один ответ» появляется «цель — серия действий — результат».

Базовая конструкция:

  1. Цель — то, что нужно достичь.
  2. Инструменты — что агент умеет делать (вызывать функции).
  3. Цикл рассуждения — модель сама решает, какой следующий шаг сделать.
  4. Контекст — память между шагами (что уже сделано, что узнали).

Это превращает LLM из «отвечающего на вопросы» в «решающего задачи». И открывает целый класс задач, которые одним ответом не решаются.

Сложность сместилась: раньше было «как заставить модель отвечать правильно», теперь — «как заставить модель планировать и не ломать систему».

Как это работает

Базовый агентный цикл (ReAct = Reason + Act):

  1. Цель и инструменты передаются в system prompt. Список доступных функций: search_web, read_file, run_python, add_to_calendar, send_message.
  2. Модель рассуждает. «Чтобы решить задачу, мне нужно сначала найти X, потом проверить Y, потом обновить Z».
  3. Модель выбирает инструмент и передаёт ему параметры в структурированном виде (JSON): {"tool": "search_web", "query": "лучшие рейсы Москва-Берлин пятница"}.
  4. Runtime выполняет действие и возвращает результат: список рейсов, текст файла, вывод кода.
  5. Модель наблюдает результат и решает следующий шаг: «Из этих рейсов самый дешёвый — Y, проверю расписание возврата».
  6. Цикл повторяется до достижения цели или предела шагов.

Каждый шаг — это один inference-запрос к LLM. Поэтому агент с 10 шагами — это 10 API-запросов, обычно с расширяющимся контекстом (история всех предыдущих шагов).

Типичные категории агентов:

  • Code agents. Claude Code, Cursor, Devin. Цель — изменить кодовую базу. Инструменты: чтение/запись файлов, выполнение команд, тесты, git.
  • Исследовательские агенты. Собирают и синтезируют информацию через поиск, браузер и другие источники. Качество определяется не названием режима, а полнотой поиска и проверкой цитат.
  • Computer-use agents. Такие агенты получают скриншоты, координаты кликов и ввод текста, чтобы работать с интерфейсом примерно как пользователь. Конкретные продукты и доступные действия меняются, а базовый цикл «увидел → выбрал действие → получил новый экран» остаётся тем же.
  • Workflow agents. Zapier AI, n8n + LLM. Цель — автоматизировать процессы. Инструменты: триггеры из API, отправка в Slack/email.
  • Multi-agent systems. Несколько LLM играют разные роли (planner, executor, reviewer) и общаются между собой.

MCP (Model Context Protocol) — один из открытых способов описать подключение инструментов и источников к AI-приложению. Он уменьшает число специальных адаптеров, но не отменяет авторизацию, проверку аргументов и ограничения каждого сервера.

Пример на практике

Видеомонтажёр хочет автоматизировать рутину: каждое утро агент должен проверить почту, найти запросы на правки от клиентов, открыть соответствующие проекты в DaVinci и составить план работы на день.

  • Tools: чтение Gmail (через MCP-server), чтение файловой системы, обращение к DaVinci API через скрипты.
  • Runtime: Claude Code (запускается локально, виден весь процесс).

Шаги одного утра:

  1. Цель: «Проверь почту за вчера, найди запросы на правки видео, открой соответствующие .drp файлы, составь план».
  2. Получает 5 писем.
  3. Шаг 2: агент читает каждое письмо через gmail.get_message(id). Извлекает имя проекта, типы правок.
  4. Сопоставляет имена.
  5. Шаг 4: для каждого проекта читает заметки в notes.md (где видеомонтажёр пишет о состоянии каждого проекта).
  6. Шаг 5: агент рассуждает: «Проект A — простая правка (30 мин), проект B — пересборка (3 часа), проект C — ждёт ответа от клиента (отложить)».
  7. Шаг 6: агент формирует план и отправляет в мессенджер: «План: A — утром, B — после обеда, C — ждать ответа клиента».

Это всё — один промпт пользователя, дальше 6 итераций между моделью и инструментами, итог в полминуты.

Тот же подход в ComfyUI: LLM-нода с инструментами-нодами вокруг (Image Loader, File Saver, Web Search). Workflow становится «полу-агентным» — модель решает, какую ноду использовать в зависимости от входа.

С чем часто путают

  • Agent и Chatbot — chatbot отвечает на сообщения, agent выполняет действия. Граница условная: ChatGPT с включёнными «функциями» — это уже агент.
  • Agent и Multi-agent system — простой агент это одна LLM с инструментами. Multi-agent — несколько LLM с разными ролями, общающихся между собой. Сложнее в разработке, не всегда лучше работает.
  • Agent и Workflow — workflow это заранее определённая последовательность шагов. Agent выбирает шаги динамически. Workflow надёжнее, agent гибче.
  • Tool use и Function calling — function calling это конкретный API-стандарт (OpenAI) для tool use. Tool use — общий термин для возможности модели вызывать функции.
  • MCP и LangChain — MCP это протокол подключения инструментов. LangChain — фреймворк сборки агентов (может использовать MCP внутри).

Частые ошибки и заблуждения

  • «Agent — это автономный AI». Не совсем. Современные агенты работают в рамках, заданных разработчиком: набор инструментов, ограничения, мониторинг. «Автономия» — это автономия в выборе шагов, не в целях.
  • «Agent сам разберётся, не нужны промпты». Нужны, и тщательнее, чем обычно. У агента десятки точек принятия решений; на каждой нужен правильный prompt-инжиниринг.
  • «Чем больше шагов, тем умнее агент». Часто наоборот. Хороший агент решает задачу за 3–5 шагов. Циклится на 20+ — обычно знак того, что задача не подходит или промпт плохой.
  • «Любая LLM может работать как агент». Технически — да, на практике — нет. Слабые модели (3B–7B) часто путаются в выборе инструментов, выдумывают аргументы, циклятся. Нужны фронтирные модели для надёжной работы.
  • «Дороже модель → лучше агент». До определённого предела. После — упирается в качество промптов, дизайн инструментов и обработку ошибок.

Связанные термины

  • Tool use / Function calling — основной механизм работы агента.
  • MCP — открытый протокол подключения инструментов к моделям.
  • ReAct — паттерн «рассуждение + действие» внутри агентного цикла.
  • Chain-of-thought — приём, помогающий агенту планировать.
  • Multi-agent system — несколько агентов с ролями, общающихся.
  • LLMмодель, лежащая в основе агента.
  • Context window — лимит, ограничивающий длину истории агента.
  • Prompt injection — главная угроза агентным системам.

Частые вопросы

Чем агент отличается от Cursor или Claude Code? Не отличается. Cursor и Claude Code — это конкретные реализации code-agents. Они объединяют LLM + чтение файлов + редактирование кода + запуск команд + git.

Можно ли запустить агента локально? Да. Локальный runtime можно соединить с tool calling напрямую или через фреймворк. Надёжность зависит от точной модели и схем инструментов; её проверяют на обычных, неоднозначных и опасных запросах.

Что такое Agentic RAG? RAG, в котором поиск делается не один раз, а агентом — модель сама решает, какой запрос задать, какие документы прочитать дальше, когда остановиться. Обычно работает лучше простого RAG на сложных вопросах.

Базовую, неагентную версию этого пайплайна можно разобрать в материале «RAG и AI-поиск». Там показан обычный поиск по документам, на который затем можно наращивать агентные действия.

Сколько токенов «съедает» агент за одну задачу? Обычно больше одиночного ответа: каждый шаг добавляет историю, описание инструментов и их результаты. Бюджет зависит от числа итераций, сжатия контекста, кэширования и объёма наблюдений, поэтому его измеряют на типичной задаче и ограничивают заранее.

Где почитать про создание собственного агента? Anthropic Agents Cookbook, документация OpenAI Function Calling, гайды LangChain и AutoGen. Базовая реализация — 100 строк Python.

Главное

AI-агент — это схема, в которой языковая модель не только пишет ответ, но и вызывает инструменты: ищет данные, меняет файлы, запускает код или работает в интерфейсе. Надёжность зависит от границ задачи, качества обратной связи и обработки ошибок. Чем серьёзнее возможные последствия, тем меньше оснований оставлять агенту широкие права без подтверждения человека.