Alignment

alignment — настройка модели на безопасное и полезное поведение

Раздел
Языковые модели
Обновлено
05.09.26

Alignment — работа над тем, чтобы поведение AI соответствовало заданным человеческим целям и ограничениям. Для языковых моделей это включает обучение на примерах, предпочтениях и принципах, а также проверку ошибок. Полезность, достоверность и безопасность здесь — цели настройки, а не гарантированные свойства готовой модели.

Коротко

Коротко. Alignment помогает приблизить поведение модели к тому, что от неё ожидают: отвечать по делу, замечать нехватку данных и не выполнять опасные действия. Для этого нужны явные критерии и проверки. Модель может хорошо пройти знакомые тесты и всё же ошибиться в новой ситуации.

Что это такое

Ассистенту предлагают дополнить отзыв клиента. Он пишет гладкий текст, но добавляет похвалу, которой в оригинале не было. Формально продолжение выглядит правдоподобно; задачу сохранить смысл оно нарушает.

Alignment касается таких расхождений между поведением системы и ожиданиями людей. Знать много фактов, следовать инструкции и понимать границу разрешённого — разные требования. Настройка одного не гарантирует остальные.

В языковых моделях часто используют:

  1. SFT — обучение на примерах. Модели показывают запросы и подходящие ответы.
  2. Обучение на предпочтениях. Для одного запроса сравнивают несколько ответов и учат модель учитывать выбранные критерии.
  3. Обучение с опорой на принципы. Правила помогают составлять и оценивать учебные примеры.
  4. Проверки поведения. Команда ищет ошибки, уточняет данные и повторяет настройку.

Базовое предварительное обучение даёт модели многие способности; последующая настройка меняет способы их применения. Это упрощённое разделение: на поведение влияют и исходные данные, и системные инструкции, и инструменты вокруг модели.

В формуле HHH цели называют helpful, honest, harmless: полезность, честность и снижение вреда. Но люди могут по-разному понимать подходящий ответ. Поэтому разработчикам приходится описывать критерии конкретнее, чем «будь хорошим помощником».

Как это работает

Один из известных подходов — RLHF, обучение с подкреплением на основе человеческой обратной связи. В схеме, описанной в работе об InstructGPT, используются такие этапы:

  1. Сбор данных предпочтений. Людям показывают пары ответов, они выбирают более подходящий по заданным критериям. Получается набор сравнений «A предпочтительнее B».
  2. Модель награды — reward model. Она учится предсказывать, какой ответ предпочтут оценщики. Это приближение их суждений, а не объективный измеритель истины.
  3. Обучение с подкреплением. Языковую модель настраивают так, чтобы повышать оценку награды, ограничивая слишком сильное отклонение от исходной модели. PPO — один из алгоритмов такой настройки, но RLHF не сводится только к нему.

Другой подход — DPO, прямая оптимизация предпочтений:

  • Тот же сигнал предпочтений.
  • Без отдельной reward model.
  • Модель обучается на парах предпочтительных и менее подходящих ответов с помощью специальной функции потерь. Это не означает один проход по данным.

В Constitutional AI Anthropic исследует использование набора принципов при обучении:

  • Модель критикует и исправляет ответы с опорой на заданные правила.
  • Конституция — список принципов: «не вреди», «уважай автономию пользователя», «будь честным».
  • AI-оценки используются для обучения предпочтениям; люди по-прежнему определяют принципы и проверяют результат.

Пример на практике

Команда настраивает ассистента службы поддержки. Ему нужно объяснять правила возврата и не обещать исключений, которых нет в документах.

  1. Собирает примеры обычных и спорных обращений.
  2. Описывает критерии: ответ относится к вопросу, верно передаёт условия, не выдаёт догадку за правило.
  3. Сравнивает варианты ответов и использует выбранные данные для настройки.
  4. Проверяет модель на других обращениях, не вошедших в обучение.
  5. Отдельно смотрит случаи, где сведений недостаточно или требуется решение сотрудника.

Если ответы стали вежливее, но модель чаще выдумывает условия, задача ещё не решена. Хорошая подача — только один из критериев.

У генераторов изображений также различают настройку модели и внешние проверки. Например, фильтр результата — отдельный компонент, а не доказательство, что модель обучена всем нужным ограничениям. В ComfyUI состав этих компонентов зависит от конкретного рабочего процесса.

С чем часто путают

  • Alignment и Fine-tuning — дообучение является одним из средств настройки поведения. Сам вопрос соответствия системы человеческим целям шире отдельного метода обучения.
  • Alignment и Censorship — Alignment это технический процесс. Цензура — субъективная оценка результата. Один и тот же refusal один назовёт alignment, другой — цензурой.
  • RLHF и DPO — в классической схеме RLHF есть модель награды и обучение с подкреплением. DPO напрямую использует пары предпочтений. Подходящий метод зависит от данных и задачи.
  • Настройка модели и защитные фильтры — фильтры могут проверять вход, выход или действия во время работы. Они дополняют обучение, но могут иметь собственные ошибки.
  • Alignment tax и качество модели — так называют возможную потерю полезных способностей из-за ограничений или настройки. Её наличие и величину нужно измерять, а не предполагать заранее.

Частые ошибки и заблуждения

  • «Aligned модель = модель без галлюцинаций». Не так. Alignment учит модель признавать незнание, но не делает её всезнающей. Галлюцинации остаются.
  • «Чем больше отказов, тем лучше alignment». Нет. Полезная настройка различает опасный и обычный запрос, а чрезмерные отказы сами становятся ошибкой качества.
  • «Open-weight модели всегда без alignment». Instruction- и chat-версии часто проходят дополнительную настройку. Base checkpoint и instruct-вариант нужно различать по карточке модели.
  • «Alignment делает модель политически нейтральной». Не делает. Любой alignment отражает ценности команды-разработчика.
  • «Alignment полностью исключает нежелательное поведение». Нет. Настройка снижает риск в проверенных сценариях, но новые формулировки, инструменты и контекст могут открыть другие способы обойти ограничения.

Связанные термины

  • RLHF — настройка с подкреплением на основе человеческой обратной связи.
  • DPO — обучение по парам предпочтительных и менее подходящих ответов.
  • Constitutional AI — Anthropic-подход к alignment.
  • Jailbreak — обход alignment.
  • Prompt Injection — атака на инструкции, иногда обходит alignment.
  • Red Teaming — практика тестирования.
  • HHH (Helpful, Honest, Harmless) — цели alignment.

Частые вопросы

В каких моделях есть alignment? Многие разговорные и instruct-модели проходят настройку поведения. Но суффикс в названии не описывает весь процесс. Источник сведений — карточка модели и отчёт о её обучении и проверках.

Можно ли «снять» alignment с модели? Некоторые вмешательства меняют склонность модели отказываться. Это не возвращает исходную базовую модель и не отменяет остальные последствия обучения. Изменение также может ухудшить качество и безопасность.

RLHF или DPO — что лучше? Единого победителя нет. Сравнивают качество на нужных задачах, доступные данные и сложность обучения. Название метода не заменяет оценку готовой модели.

Что такое RLAIF? Обучение с подкреплением, где сигнал обратной связи получают от AI. Оно может сократить объём ручной разметки, но наследует ограничения модели-оценщика и выбранных критериев.

Кто решает, что считать «вредным»? Команда AI safety каждого провайдера. Anthropic публикует Acceptable Use Policy; OpenAI — Usage Policies; у каждого свой документ. Спорные кейсы решаются итеративно.

Alignment = censorship? Зависит от точки зрения. Технически — нет (alignment делает модель более полезной по определённым критериям). Критически — некоторые refusals воспринимаются как цензура.

Главное

Смысл alignment виден в конкретном поведении: сохранила ли модель факты, заметила ли нехватку данных, остановилась ли перед действием вне разрешённой задачи. Названия методов объясняют, как её настраивали. Насколько настройка удалась, показывают проверки — в том числе на неудобных и новых примерах.