API

api — программный интерфейс для обращения к AI-моделям

Раздел
Основы AI
Сокращ.
Application Programming Interface
Обновлено
19.06.26

API (Application Programming Interface) в контексте AI — это способ программно отправлять запросы к языковой модели и получать ответы. Вместо ручного ввода в chat-интерфейсе ваша программа шлёт POST-запрос с промптом и параметрами и получает JSON с ответом. Каждый запрос тарифицируется по токенам. Через API работают чат-боты, RAG-системы, агенты, любые AI-интеграции в продуктах.

Коротко

Коротко. API даёт программный доступ к AI-моделям. Ваш код отправляет HTTPS-запрос с промптом и параметрами, провайдер возвращает JSON с ответом. Стоимость считается по входным и выходным токенам. Через API строится почти всё, что не «открытый чат»: чат-боты в продуктах, RAG-помощники, агенты, автоматизация контента. Главные провайдеры: OpenAI, Anthropic, Google, плюс облака с open-source моделями.

Что это такое

Март 2023-го. OpenAI открывает GPT-3.5 через API. Поднимается волна стартапов: каждый второй продукт «GPT-внутри». В 2024 году к API подключаются Claude, Gemini, Mistral, Together, Groq, Cerebras. К 2026-му AI API — это стандартный компонент любого современного приложения: чат-бот в банке, помощник в Notion, автокомплит в IDE, перевод в почте.

API в контексте AI означает обычный HTTP-API, как у любого современного web-сервиса. Вы шлёте JSON-запрос на специальный URL, получаете JSON-ответ. Разница только в том, что внутри — не БД, а GPU-кластер с моделью.

Базовый пример (псевдокод):

response = openai.chat.completions.create(
    model="gpt-4o",
    messages=[
        {"role": "system", "content": "Ты — эксперт по DaVinci Resolve."},
        {"role": "user", "content": "Как настроить ColorChecker?"}
    ],
    temperature=0.7,
    max_tokens=500
)

print(response.choices[0].message.content)

Под капотом — HTTPS POST на api.openai.com/v1/chat/completions с заголовком авторизации (API-ключ). Ответ — JSON с текстом ответа, количеством использованных токенов, причиной завершения.

Это и есть AI API в самом базовом виде. Дальше начинаются нюансы: streaming, structured output, function calling, batching, разные модели с разной ценой.

Как это работает

Базовый цикл одного запроса:

  1. Клиент собирает payload. Список сообщений (system + user + history), параметры (temperature, max_tokens, top_p, stop), название модели.
  2. HTTP POST на endpoint провайдера. Авторизация через Bearer-токен в заголовке.
  3. Сервер очищает запрос: проверяет авторизацию, лимиты, токенизирует ввод.
  4. GPU кластер делает inference с заданными параметрами. Если streaming — токены идут потоком.
  5. Ответ возвращается клиенту в JSON: текст, количество input/output токенов, причина остановки, опционально метаданные.
  6. Клиент парсит и использует.

Главные API-параметры, которые есть у всех:

  • model — какую конкретно модель использовать.
  • messages — список сообщений с ролями (system / user / assistant).
  • temperature — «творчество» (0 = детерминистично, 1+ = случайнее).
  • max_tokens — лимит длины ответа.
  • top_p / top_k — альтернативные способы контроля сэмплинга.
  • stream — отдавать ответ потоком или одним блоком.
  • tools / functions — описание доступных инструментов для агентов.
  • response_format — структурированный ответ (JSON Schema, текст).

Стоимость почти всегда считается по токенам, отдельно input и output:

Модель (2026) Input $/1M Output $/1M
GPT-4o $5 $15
GPT-4o-mini $0.15 $0.60
Claude 3.5 Sonnet $3 $15
Claude 3.5 Haiku $1 $5
Gemini 1.5 Pro $1.25 $5
Llama 3 70B (Together) $0.88 $0.88

Кроме базового inference, провайдеры предлагают специальные endpoint'ы:

  • Embeddings API — посчитать embedding текста.
  • Image API — генерация картинок (DALL-E, Imagen).
  • Audio APIWhisper для транскрипции, TTS для синтеза.
  • Batch API — отложенная пакетная обработка (вдвое дешевле, но 24 часа на ответ).
  • Files API — загрузить файлы для fine-tuning или RAG.

Пример на практике

Видеомонтажёр пишет скрипт автоматических подписей к видео на Python. Каждый день — 5–10 новых роликов; описания должны быть в фирменном стиле, на русском, 150–200 слов.

Базовая интеграция через Claude API:

import anthropic

client = anthropic.Anthropic(api_key="sk-ant-...")

def generate_description(transcript, theme):
    response = client.messages.create(
        model="claude-3-5-sonnet-20241022",
        max_tokens=400,
        system="Ты — SMM-менеджер YouTube-канала про видеомонтаж. Стиль: дружелюбный, без канцелярита, 150-200 слов. Без эмодзи.",
        messages=[
            {"role": "user", "content": f"Тема видео: {theme}\n\nТранскрипт:\n{transcript}\n\nНапиши описание."}
        ]
    )
    return response.content[0].text

Скрипт читает папку с MP4-файлами, прогоняет через Whisper-API для расшифровки, передаёт в generate_description, сохраняет результат в .txt рядом с видео.

Стоимость одного видео:

  • Whisper (15 мин аудио): $0.09.
  • Claude Sonnet (input 1500 токенов, output 300): 0.0045 + 0.0045 = $0.009.

Итого: ~9 центов на видео. За месяц 200 видео — $18. Дешевле подписки на Notion.

Та же логика собирается в ComfyUI через специальные API-ноды: OpenAI Chat, Anthropic Chat, Whisper Transcribe. Workflow — без кода: «загрузить аудио → Whisper → Claude с system prompt → сохранить в файл». Удобно, когда нужно прототипировать без программирования.

С чем часто путают

  • AI API и обычный API — это и есть обычный HTTP API, только с моделью на бэкенде. Никакой магии.
  • API и UI — у одной и той же модели разный UX в API и в chat-приложении. ChatGPT.com добавляет фичи (память, search, плагины), которые в API недоступны.
  • API и SDK — SDK (Python, JS, Go) это удобная обёртка вокруг API. Можно работать напрямую через requests/fetch, но SDK упрощает жизнь.
  • API key и password — API key это секрет, дающий доступ к вашему аккаунту с биллингом. Утечка ключа = чужие могут тратить ваши деньги. Хранить так же осторожно, как пароли.
  • Public API и Internal API — публичный API доступен всем (за деньги/ключ). Internal API — внутри одной компании. AI-провайдеры обычно публичные.

Частые ошибки и заблуждения

  • «API безлимитный». Нет. У каждого провайдера лимиты по requests-per-minute и tokens-per-minute, плюс месячный лимит расходов. Превышение → ошибка 429 (rate limit).
  • «Можно вшить API key в frontend». Категорически нет. Ключ нельзя отправлять в браузер — любой посетитель сайта его утащит и потратит. API-вызовы делает бэкенд.
  • «Если ответ медленный — модель плохая». Часто причина в инфраструктуре: батчинг, очередь, сетевая задержка. Один и тот же Llama 70B через Groq в 5 раз быстрее, чем через стандартный API.
  • «Streaming усложняет интеграцию». Сильно упрощает UX. Без streaming пользователь ждёт 5 секунд молча; со streaming видит ответ по словам.
  • «API всегда дороже локального». Зависит от объёма. На малом потоке (тысячи запросов в день) API дешевле, чем содержать GPU. На большом — локалка побеждает.

Связанные термины

  • LLMмодель, доступ к которой даёт API.
  • Token / Cost per Token — единица тарификации.
  • Streaming — режим, в котором ответ приходит по частям.
  • Function calling / Tool use — расширенный режим API для агентов.
  • Rate limit — ограничения частоты запросов.
  • Structured output — режим API с гарантированным JSON.
  • OpenAI-compatible — стандарт совместимости, который реализуют большинство провайдеров.
  • Batch API — асинхронная обработка со скидкой.

Частые вопросы

Как начать работу с API?

  1. Регистрация у провайдера (OpenAI/Anthropic). 2. Получить API key. 3. Положить ключ в .env. 4. Установить SDK (pip install openai или anthropic). 5. Скопировать пример из docs, заменить промпт.

Как контролировать расходы? Установите hard limit в настройках аккаунта (OpenAI/Anthropic дают такую опцию). Используйте более дешёвые модели для несложных задач (mini-варианты). Кэшируйте повторяющиеся запросы. Следите за usage dashboard.

Чем платный API лучше бесплатного? У платного — выше лимиты, доступ к новейшим моделям, лучшая стабильность. Бесплатные tier'ы (особенно у Groq, Google AI Studio) хороши для прототипов, но в продакшен лучше с платным.

Можно ли использовать API из России? OpenAI и Anthropic географически блокируют. Решения: VPN, прокси, или провайдеры без блокировок (Together, Replicate, Fireworks, Groq для open-source моделей). Российские: Yandex GPT API, GigaChat API.

Что такое stateless API? Каждый запрос — независимый. API не помнит, что вы спрашивали в прошлый раз. История диалога передаётся клиентом в каждом запросе через массив messages. Это упрощает архитектуру и масштабирование на стороне провайдера.

Главное

API — это способ программно обратиться к AI-модели. Не магия и не отдельная экосистема: обычный HTTPS, JSON, токены. Провайдеры стандартизированы вокруг OpenAI-совместимого формата, что даёт свободу выбора и быстрый переход между моделями. Стоимость считается по токенам — обычно меньше, чем кажется. Понимая базовые параметры (temperature, streaming, function calling) и риски (утечка ключей, rate limits), можно интегрировать AI в любой продукт без специализированного бэкенда.