API
api — программный интерфейс для обращения к AI-моделям
API (Application Programming Interface) в контексте AI — это способ программно отправлять запросы к языковой модели и получать ответы. Вместо ручного ввода в chat-интерфейсе ваша программа шлёт POST-запрос с промптом и параметрами и получает JSON с ответом. Каждый запрос тарифицируется по токенам. Через API работают чат-боты, RAG-системы, агенты, любые AI-интеграции в продуктах.
Коротко
Коротко. API даёт программный доступ к AI-моделям. Ваш код отправляет HTTPS-запрос с промптом и параметрами, провайдер возвращает JSON с ответом. Стоимость считается по входным и выходным токенам. Через API строится почти всё, что не «открытый чат»: чат-боты в продуктах, RAG-помощники, агенты, автоматизация контента. Главные провайдеры: OpenAI, Anthropic, Google, плюс облака с open-source моделями.
Что это такое
Март 2023-го. OpenAI открывает GPT-3.5 через API. Поднимается волна стартапов: каждый второй продукт «GPT-внутри». В 2024 году к API подключаются Claude, Gemini, Mistral, Together, Groq, Cerebras. К 2026-му AI API — это стандартный компонент любого современного приложения: чат-бот в банке, помощник в Notion, автокомплит в IDE, перевод в почте.
API в контексте AI означает обычный HTTP-API, как у любого современного web-сервиса. Вы шлёте JSON-запрос на специальный URL, получаете JSON-ответ. Разница только в том, что внутри — не БД, а GPU-кластер с моделью.
Базовый пример (псевдокод):
response = openai.chat.completions.create(
model="gpt-4o",
messages=[
{"role": "system", "content": "Ты — эксперт по DaVinci Resolve."},
{"role": "user", "content": "Как настроить ColorChecker?"}
],
temperature=0.7,
max_tokens=500
)
print(response.choices[0].message.content)
Под капотом — HTTPS POST на api.openai.com/v1/chat/completions с заголовком авторизации (API-ключ). Ответ — JSON с текстом ответа, количеством использованных токенов, причиной завершения.
Это и есть AI API в самом базовом виде. Дальше начинаются нюансы: streaming, structured output, function calling, batching, разные модели с разной ценой.
Как это работает
Базовый цикл одного запроса:
- Клиент собирает payload. Список сообщений (system + user + history), параметры (temperature, max_tokens, top_p, stop), название модели.
- HTTP POST на endpoint провайдера. Авторизация через Bearer-токен в заголовке.
- Сервер очищает запрос: проверяет авторизацию, лимиты, токенизирует ввод.
- GPU кластер делает inference с заданными параметрами. Если streaming — токены идут потоком.
- Ответ возвращается клиенту в JSON: текст, количество input/output токенов, причина остановки, опционально метаданные.
- Клиент парсит и использует.
Главные API-параметры, которые есть у всех:
- model — какую конкретно модель использовать.
- messages — список сообщений с ролями (system / user / assistant).
- temperature — «творчество» (0 = детерминистично, 1+ = случайнее).
- max_tokens — лимит длины ответа.
- top_p / top_k — альтернативные способы контроля сэмплинга.
- stream — отдавать ответ потоком или одним блоком.
- tools / functions — описание доступных инструментов для агентов.
- response_format — структурированный ответ (JSON Schema, текст).
Стоимость почти всегда считается по токенам, отдельно input и output:
| Модель (2026) | Input $/1M | Output $/1M |
|---|---|---|
| GPT-4o | $5 | $15 |
| GPT-4o-mini | $0.15 | $0.60 |
| Claude 3.5 Sonnet | $3 | $15 |
| Claude 3.5 Haiku | $1 | $5 |
| Gemini 1.5 Pro | $1.25 | $5 |
| Llama 3 70B (Together) | $0.88 | $0.88 |
Кроме базового inference, провайдеры предлагают специальные endpoint'ы:
- Embeddings API — посчитать embedding текста.
- Image API — генерация картинок (DALL-E, Imagen).
- Audio API — Whisper для транскрипции, TTS для синтеза.
- Batch API — отложенная пакетная обработка (вдвое дешевле, но 24 часа на ответ).
- Files API — загрузить файлы для fine-tuning или RAG.
Пример на практике
Видеомонтажёр пишет скрипт автоматических подписей к видео на Python. Каждый день — 5–10 новых роликов; описания должны быть в фирменном стиле, на русском, 150–200 слов.
Базовая интеграция через Claude API:
import anthropic
client = anthropic.Anthropic(api_key="sk-ant-...")
def generate_description(transcript, theme):
response = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=400,
system="Ты — SMM-менеджер YouTube-канала про видеомонтаж. Стиль: дружелюбный, без канцелярита, 150-200 слов. Без эмодзи.",
messages=[
{"role": "user", "content": f"Тема видео: {theme}\n\nТранскрипт:\n{transcript}\n\nНапиши описание."}
]
)
return response.content[0].text
Скрипт читает папку с MP4-файлами, прогоняет через Whisper-API для расшифровки, передаёт в generate_description, сохраняет результат в .txt рядом с видео.
Стоимость одного видео:
- Whisper (15 мин аудио): $0.09.
- Claude Sonnet (input 1500 токенов, output 300): 0.0045 + 0.0045 = $0.009.
Итого: ~9 центов на видео. За месяц 200 видео — $18. Дешевле подписки на Notion.
Та же логика собирается в ComfyUI через специальные API-ноды: OpenAI Chat, Anthropic Chat, Whisper Transcribe. Workflow — без кода: «загрузить аудио → Whisper → Claude с system prompt → сохранить в файл». Удобно, когда нужно прототипировать без программирования.
С чем часто путают
- AI API и обычный API — это и есть обычный HTTP API, только с моделью на бэкенде. Никакой магии.
- API и UI — у одной и той же модели разный UX в API и в chat-приложении. ChatGPT.com добавляет фичи (память, search, плагины), которые в API недоступны.
- API и SDK — SDK (Python, JS, Go) это удобная обёртка вокруг API. Можно работать напрямую через requests/fetch, но SDK упрощает жизнь.
- API key и password — API key это секрет, дающий доступ к вашему аккаунту с биллингом. Утечка ключа = чужие могут тратить ваши деньги. Хранить так же осторожно, как пароли.
- Public API и Internal API — публичный API доступен всем (за деньги/ключ). Internal API — внутри одной компании. AI-провайдеры обычно публичные.
Частые ошибки и заблуждения
- «API безлимитный». Нет. У каждого провайдера лимиты по requests-per-minute и tokens-per-minute, плюс месячный лимит расходов. Превышение → ошибка 429 (rate limit).
- «Можно вшить API key в frontend». Категорически нет. Ключ нельзя отправлять в браузер — любой посетитель сайта его утащит и потратит. API-вызовы делает бэкенд.
- «Если ответ медленный — модель плохая». Часто причина в инфраструктуре: батчинг, очередь, сетевая задержка. Один и тот же Llama 70B через Groq в 5 раз быстрее, чем через стандартный API.
- «Streaming усложняет интеграцию». Сильно упрощает UX. Без streaming пользователь ждёт 5 секунд молча; со streaming видит ответ по словам.
- «API всегда дороже локального». Зависит от объёма. На малом потоке (тысячи запросов в день) API дешевле, чем содержать GPU. На большом — локалка побеждает.
Связанные термины
- LLM — модель, доступ к которой даёт API.
- Token / Cost per Token — единица тарификации.
- Streaming — режим, в котором ответ приходит по частям.
- Function calling / Tool use — расширенный режим API для агентов.
- Rate limit — ограничения частоты запросов.
- Structured output — режим API с гарантированным JSON.
- OpenAI-compatible — стандарт совместимости, который реализуют большинство провайдеров.
- Batch API — асинхронная обработка со скидкой.
Частые вопросы
Как начать работу с API?
- Регистрация у провайдера (OpenAI/Anthropic). 2. Получить API key. 3. Положить ключ в
.env. 4. Установить SDK (pip install openaiилиanthropic). 5. Скопировать пример из docs, заменить промпт.
Как контролировать расходы? Установите hard limit в настройках аккаунта (OpenAI/Anthropic дают такую опцию). Используйте более дешёвые модели для несложных задач (mini-варианты). Кэшируйте повторяющиеся запросы. Следите за usage dashboard.
Чем платный API лучше бесплатного? У платного — выше лимиты, доступ к новейшим моделям, лучшая стабильность. Бесплатные tier'ы (особенно у Groq, Google AI Studio) хороши для прототипов, но в продакшен лучше с платным.
Можно ли использовать API из России? OpenAI и Anthropic географически блокируют. Решения: VPN, прокси, или провайдеры без блокировок (Together, Replicate, Fireworks, Groq для open-source моделей). Российские: Yandex GPT API, GigaChat API.
Что такое stateless API? Каждый запрос — независимый. API не помнит, что вы спрашивали в прошлый раз. История диалога передаётся клиентом в каждом запросе через массив messages. Это упрощает архитектуру и масштабирование на стороне провайдера.
Главное
API — это способ программно обратиться к AI-модели. Не магия и не отдельная экосистема: обычный HTTPS, JSON, токены. Провайдеры стандартизированы вокруг OpenAI-совместимого формата, что даёт свободу выбора и быстрый переход между моделями. Стоимость считается по токенам — обычно меньше, чем кажется. Понимая базовые параметры (temperature, streaming, function calling) и риски (утечка ключей, rate limits), можно интегрировать AI в любой продукт без специализированного бэкенда.