Sustainable AI
sustainable ai — измерение и снижение экологического следа AI-систем
Sustainable AI рассматривает энергию, воду и оборудование на всём жизненном цикле модели: обучение, инференс, хранение и замену серверов. Одна цифра «на запрос» редко переносится между системами, поэтому устойчивость измеряют на конкретной полезной задаче и сравнивают варианты при одинаковом качестве.
Коротко
Коротко. Sustainable AI — подход к разработке, при котором вместе с качеством и ценой учитывают энергию, выбросы, воду и жизненный цикл оборудования. Цель не в том, чтобы объявить любой AI «вредным» или «зелёным», а в том, чтобы измерить конкретную систему и уменьшить ресурсы на единицу полезного результата.
Что входит в экологический след
У AI-системы есть несколько разных источников воздействия.
Обучение. Большой вычислительный запуск использует ускорители, сеть, хранение и охлаждение. Эксперименты до финального обучения тоже входят в расход.
Инференс. Каждый запрос может быть небольшим, но миллионы вызовов, длинный контекст, reasoning и генерация видео складываются в постоянную нагрузку.
Дата-центр. Помимо серверов энергия нужна охлаждению, сети, дискам и резервированию.
Вода. Некоторые системы охлаждения расходуют воду на объекте, а производство электричества может добавлять косвенный водный след.
Оборудование. Производство ускорителей и серверов требует материалов и энергии. Замена исправного парка ради небольшого ускорения переносит часть воздействия из эксплуатации в производство.
Источник электричества. Одинаковое число киловатт-часов даёт разные выбросы в зависимости от региона и времени.
Почему цифры «на один запрос» спорны
Запрос может означать короткую классификацию, анализ книги, генерацию изображения или длинную агентную цепочку. Даже внутри одного чата расход меняют:
- размер и архитектура модели;
- длина входа и выхода;
- batch и загрузка сервера;
- число проб и инструментов;
- точность вычислений;
- тип ускорителя;
- эффективность дата-центра;
- источник энергии;
- доля простаивающей инфраструктуры.
Поэтому сравнение «AI-запрос против поискового запроса» без одинаковой задачи и методики быстро вводит в заблуждение. Полезнее измерять функцию: например, энергия на тысячу корректно обработанных документов.
Как измерять
Базовая схема связывает четыре величины:
энергия × углеродная интенсивность электричества
+ воплощённые выбросы оборудования
÷ единица полезной работы
Единицей может быть успешно обработанный документ, час расшифрованной записи или изображение, прошедшее контроль качества. Она должна быть одинаковой у сравниваемых вариантов.
В отчёте полезно отдельно показывать:
- границы измерения;
- регион и период;
- модель, оборудование и точность;
- число запросов и долю повторов;
- качество результата;
- operational и embodied impact;
- неизвестные и оценочные данные.
Software Carbon Intensity предлагает похожую логику для программных систем: энергия, углеродная интенсивность и embodied emissions делятся на функциональную единицу.
Пример на практике
Команда обрабатывает обращения клиентов. Сравниваются три схемы:
- крупная модель отвечает на каждое обращение;
- небольшая модель сортирует простые запросы, крупная получает только сложные;
- одинаковые вопросы кэшируются, а модели обрабатывают только новые случаи.
Для каждой схемы измеряются точность, число повторов, задержка и энергия на тысячу закрытых обращений. Каскад может выиграть, если лёгкая модель надёжно распознаёт границы своих возможностей. Если она часто ошибается и задача запускается заново, экономия исчезнет.
Такой тест одновременно полезен для бюджета и устойчивости: оба показателя зависят от объёма вычислений.
Что обычно помогает
- выбрать модель минимального достаточного размера;
- сократить лишний контекст и ответ;
- кэшировать повторяемые части;
- использовать batch там, где задержка не критична;
- квантизировать или дистиллировать модель с проверкой качества;
- маршрутизировать сложные запросы отдельно;
- выключать простаивающие ресурсы;
- выбирать подходящий ускоритель и kernel;
- планировать гибкую нагрузку на время с более чистой или доступной энергией;
- продлевать срок службы оборудования, когда это разумно;
- уменьшать хранение ненужных промежуточных данных;
- измерять воду и embodied impact, а не только электричество.
Оптимизация одного слоя может перенести расход в другой. Локальная модель экономит сеть и облако, но миллионы плохо загруженных устройств тоже имеют embodied cost.
Rebound effect
Если запрос стал в десять раз дешевле, продукт может начать делать его в сто раз чаще. Тогда эффективность одной операции растёт, а общий расход — тоже.
Поэтому рядом с метрикой «на запрос» нужна абсолютная величина за период: сколько энергии и ресурсов потребила вся система. Это помогает увидеть, не съела ли новая функция техническую экономию ростом использования.
С чем часто путают
- Sustainable AI и Green AI. Термины часто пересекаются; sustainable AI обычно шире и включает социальный и жизненный цикл.
- Энергия и выбросы. Киловатт-час — не то же самое, что CO₂e. Нужна интенсивность источника энергии.
- Operational и embodied emissions. Первые возникают при работе, вторые — при производстве и утилизации оборудования.
- Эффективность и малый общий след. Очень эффективный сервис может потреблять много ресурсов из-за огромного масштаба.
- Локальный запуск и экологичность. Локальность меняет размещение нагрузки, но не отменяет электричество и оборудование.
- Компенсации и сокращение. Покупка сертификатов не равна физическому уменьшению вычислений или выбросов.
Частые ошибки и заблуждения
«Достаточно посчитать обучение». Для популярного продукта длительный инференс способен стать большей частью жизненного цикла.
«Один запрос имеет фиксированный след». Без модели, задачи, длины и инфраструктуры такая цифра почти не переносится.
«Возобновляемый контракт означает нулевые выбросы». Физическая сеть, время потребления и способ учёта важны. Нулевая маркетинговая метка не всегда означает нулевой marginal impact.
«Квантизация всегда экологичнее». Она уменьшает вычисления, но может увеличить число неудачных ответов. Сравнение включает качество.
«Большая модель всегда расточительна». На сложной задаче она может решить проблему одним вызовом, где маленькая потребует каскад и повторы.
Частые вопросы
Как начать измерение без доступа к дата-центру? Можно зафиксировать количество и тип запросов, токены, время GPU, повторы и качество. Провайдерская энергия останется оценкой, но такая телеметрия уже позволяет сравнивать архитектурные изменения.
Что важнее: обучение или инференс? Зависит от жизненного цикла. У исследовательской модели доминирует обучение, у массового сервиса — длительная эксплуатация. Их считают отдельно.
Помогает ли RAG? Он может позволить меньшей модели отвечать по точным данным, но добавляет embeddings, индекс и reranking. Итог измеряют на полном pipeline.
Где смотреть оценки сектора? Международное энергетическое агентство публикует обновляемые отчёты Energy and AI. Прогнозы лучше воспринимать как сценарии с допущениями, а не вечные факты.
Главное
Sustainable AI начинается с честной границы измерения и полезной единицы результата. Энергия, углерод, вода и оборудование рассматриваются вместе с качеством. Самые устойчивые решения обычно похожи на хорошие инженерные решения: меньше лишних вычислений, выше загрузка, яснее маршрутизация и дольше живёт оборудование.