Explainable AI

explainable ai — способы понять поведение и решения AI-системы

Раздел
Этика и регулирование
Сокращ.
XAI
Обновлено
11.08.26

Explainable AI объединяет методы, которые помогают исследовать вклад признаков, сравнивать возможные решения и объяснять работу системы разным людям. Одно объяснение не доказывает справедливость или правильность модели: его сверяют с данными, процессом и реальными результатами.

Коротко

Коротко. Explainable AI, или XAI, помогает ответить не только на вопрос «что решила модель», но и на «какие факторы повлияли», «что изменило бы результат» и «где объяснение перестаёт быть надёжным». Для разных моделей и аудитории нужны разные методы.

Зачем нужны объяснения

Число или метка сами по себе редко помогают разобраться в решении. Если система оценила риск, отклонила заявку или выделила подозрительный снимок, людям нужны разные виды ясности:

  • пользователю — понятная причина и возможный следующий шаг;
  • специалисту — признаки, данные и уверенность модели;
  • разработчику — след ошибки и чувствительность к входу;
  • аудитору — документация, тесты и воспроизводимый процесс.

Одного универсального текста для всех нет. Техническая диаграмма может быть полезна инженеру и бесполезна человеку, которого затронуло решение.

Интерпретируемость и объяснимость

Интерпретируемой часто называют модель, логику которой можно проследить напрямую: небольшое дерево решений, линейную формулу или набор явных правил.

Объяснимость шире. Сложную модель можно исследовать внешними методами и строить приближённое описание её поведения. Такое описание полезно, но не тождественно самой модели.

Из этого следует важная граница: красивое объяснение может быть понятным, но неверно отражать внутреннюю причину ответа.

Локальные и глобальные объяснения

Локальное объяснение относится к одному примеру. Оно отвечает: почему эта заявка получила такой балл или какие области этого изображения сильнее повлияли на вывод.

Глобальное объяснение описывает общие закономерности модели: какие признаки обычно важны, где меняется решение, на каких группах растёт ошибка.

Локальный результат нельзя автоматически переносить на весь датасет. И наоборот, средняя важность признака не объясняет каждый отдельный случай.

Основные методы

Вклад признаков

Методы семейства SHAP оценивают, насколько каждый признак сдвинул прогноз относительно выбранной базы. Результат зависит от фонового набора данных и допущений о зависимостях между признаками.

LIME строит простую локальную модель рядом с исследуемым примером. Она показывает поведение в небольшой окрестности, но может меняться при другом способе возмущения данных.

Контрфактуальные примеры

Контрфактуал отвечает: «какое небольшое изменение входа могло бы изменить решение?» Например, другой уровень долговой нагрузки мог бы перевести заявку через порог.

Такой пример должен быть реалистичным и этичным. Совет изменить возраст или другой неизменяемый признак формально объясняет границу, но не помогает человеку.

Карты важности для изображений

Градиентные методы и карты активаций подсвечивают участки входа, связанные с прогнозом. Они помогают заметить, что модель смотрит на фон, водяной знак или медицинский маркер вместо нужного объекта.

Подсветка не доказывает причинность. Её стоит проверять удалением, заменой или маскированием области.

Примеры и ближайшие случаи

Иногда понятнее показать похожие объекты из обучающего или справочного набора. Это помогает увидеть границу классов, но требует контроля приватности и качества данных.

Документация системы

Model cards, datasheets, журнал версий и отчёт об оценке объясняют не один прогноз, а происхождение системы: назначение, данные, ограничения и известные риски. Для принятия решения это часто не менее важно, чем график важности признаков.

Наглядный пример

Модель отмечает банковскую операцию как подозрительную. Хорошее объяснение разделяется на три слоя.

Для клиента: «операция временно задержана из-за необычного получателя и нетипичной суммы; подтверждение можно пройти таким способом».

Для аналитика: вклад признаков, похожие случаи, история решений и порог срабатывания.

Для аудитора: версия модели, датасет проверки, частота ложных срабатываний по группам и правила ручного пересмотра.

Фраза «так решила нейросеть» не объясняет ничего. Но и один график SHAP не заменяет процедуру обжалования.

Как проверяют качество объяснения

У объяснения несколько независимых свойств:

  • верность модели — отражает ли оно реальное поведение, а не удобную историю;
  • устойчивость — меняется ли оно без причины при небольшом изменении входа;
  • понятность — может ли целевая аудитория правильно его прочитать;
  • полезность — помогает ли оно найти ошибку или принять следующий шаг;
  • полнота — показаны ли ограничения, неопределённость и важный контекст.

Проверка может включать удаление важных признаков, повторные запуски, сравнение методов, пользовательское исследование и анализ ошибок на отдельных группах.

Объяснение не равно доказательству

XAI не подтверждает автоматически, что модель:

  • использует качественные данные;
  • не дискриминирует;
  • правильно оценивает причинность;
  • защищена от сдвига распределения;
  • соответствует требованиям закона;
  • безопасна для выбранного сценария.

Эти вопросы требуют отдельных тестов, документации и управления риском. Объяснение — один источник доказательств, а не итоговый сертификат.

Правовой контекст

Законы могут требовать прозрачности, информации для затронутых людей, человеческого контроля, документации или возможности оспорить решение. Конкретная обязанность зависит от страны, роли компании и сценария применения.

Ни GDPR, ни EU AI Act нельзя свести к универсальному правилу «любая нейросеть обязана объяснить каждый ответ». Для юридически значимого процесса требования проверяют по тексту нормы и у профильного специалиста, а техническое объяснение проектируют под эту обязанность.

Частые ошибки

  • Принимать attention за готовое объяснение. Связь внимания с причиной ответа нужно проверять отдельно.
  • Показывать только один метод. Разные методы могут расходиться из-за разных допущений.
  • Объяснять модель её же текстом. Свободный пересказ может звучать уверенно и не соответствовать вычислению.
  • Игнорировать базовый уровень. Вклад признака зависит от того, с чем сравнивают прогноз.
  • Забывать аудиторию. Инженерное объяснение и уведомление пользователю решают разные задачи.
  • Скрывать неопределённость. Точная диаграмма не делает неточный прогноз надёжным.

Частые вопросы

Какая техника объяснимости лучше?

Та, которая отвечает на конкретный вопрос и проходит проверку верности. Для табличной модели это может быть вклад признаков и контрфактуал, для изображения — карта плюс тест с маскированием, для всего продукта — документация и анализ ошибок.

Можно ли объяснить языковую модель?

Можно исследовать чувствительность к контексту, анализировать источники, строить контрфактуальные запросы и проверять поведение тестами. Свободное «рассуждение» самой модели не считается точным отчётом о внутренних вычислениях.

Достаточно ли XAI для аудита?

Нет. Нужны также происхождение данных, оценка качества, безопасность, права доступа, журнал изменений и наблюдение после запуска.

Главное

Explainable AI — набор способов исследовать и сообщать, почему система ведёт себя определённым образом. Полезное объяснение соответствует аудитории, показывает ограничения и проверяется экспериментом. Оно помогает увидеть проблему, но не заменяет оценку качества, справедливости, безопасности и правовых обязанностей.