Alignment
alignment — настройка модели на безопасное и полезное поведение
Alignment — работа над тем, чтобы поведение AI соответствовало заданным человеческим целям и ограничениям. Для языковых моделей это включает обучение на примерах, предпочтениях и принципах, а также проверку ошибок. Полезность, достоверность и безопасность здесь — цели настройки, а не гарантированные свойства готовой модели.
Коротко
Коротко. Alignment помогает приблизить поведение модели к тому, что от неё ожидают: отвечать по делу, замечать нехватку данных и не выполнять опасные действия. Для этого нужны явные критерии и проверки. Модель может хорошо пройти знакомые тесты и всё же ошибиться в новой ситуации.
Что это такое
Ассистенту предлагают дополнить отзыв клиента. Он пишет гладкий текст, но добавляет похвалу, которой в оригинале не было. Формально продолжение выглядит правдоподобно; задачу сохранить смысл оно нарушает.
Alignment касается таких расхождений между поведением системы и ожиданиями людей. Знать много фактов, следовать инструкции и понимать границу разрешённого — разные требования. Настройка одного не гарантирует остальные.
В языковых моделях часто используют:
- SFT — обучение на примерах. Модели показывают запросы и подходящие ответы.
- Обучение на предпочтениях. Для одного запроса сравнивают несколько ответов и учат модель учитывать выбранные критерии.
- Обучение с опорой на принципы. Правила помогают составлять и оценивать учебные примеры.
- Проверки поведения. Команда ищет ошибки, уточняет данные и повторяет настройку.
Базовое предварительное обучение даёт модели многие способности; последующая настройка меняет способы их применения. Это упрощённое разделение: на поведение влияют и исходные данные, и системные инструкции, и инструменты вокруг модели.
В формуле HHH цели называют helpful, honest, harmless: полезность, честность и снижение вреда. Но люди могут по-разному понимать подходящий ответ. Поэтому разработчикам приходится описывать критерии конкретнее, чем «будь хорошим помощником».
Как это работает
Один из известных подходов — RLHF, обучение с подкреплением на основе человеческой обратной связи. В схеме, описанной в работе об InstructGPT, используются такие этапы:
- Сбор данных предпочтений. Людям показывают пары ответов, они выбирают более подходящий по заданным критериям. Получается набор сравнений «A предпочтительнее B».
- Модель награды — reward model. Она учится предсказывать, какой ответ предпочтут оценщики. Это приближение их суждений, а не объективный измеритель истины.
- Обучение с подкреплением. Языковую модель настраивают так, чтобы повышать оценку награды, ограничивая слишком сильное отклонение от исходной модели. PPO — один из алгоритмов такой настройки, но RLHF не сводится только к нему.
Другой подход — DPO, прямая оптимизация предпочтений:
- Тот же сигнал предпочтений.
- Без отдельной reward model.
- Модель обучается на парах предпочтительных и менее подходящих ответов с помощью специальной функции потерь. Это не означает один проход по данным.
В Constitutional AI Anthropic исследует использование набора принципов при обучении:
- Модель критикует и исправляет ответы с опорой на заданные правила.
- Конституция — список принципов: «не вреди», «уважай автономию пользователя», «будь честным».
- AI-оценки используются для обучения предпочтениям; люди по-прежнему определяют принципы и проверяют результат.
Пример на практике
Команда настраивает ассистента службы поддержки. Ему нужно объяснять правила возврата и не обещать исключений, которых нет в документах.
- Собирает примеры обычных и спорных обращений.
- Описывает критерии: ответ относится к вопросу, верно передаёт условия, не выдаёт догадку за правило.
- Сравнивает варианты ответов и использует выбранные данные для настройки.
- Проверяет модель на других обращениях, не вошедших в обучение.
- Отдельно смотрит случаи, где сведений недостаточно или требуется решение сотрудника.
Если ответы стали вежливее, но модель чаще выдумывает условия, задача ещё не решена. Хорошая подача — только один из критериев.
У генераторов изображений также различают настройку модели и внешние проверки. Например, фильтр результата — отдельный компонент, а не доказательство, что модель обучена всем нужным ограничениям. В ComfyUI состав этих компонентов зависит от конкретного рабочего процесса.
С чем часто путают
- Alignment и Fine-tuning — дообучение является одним из средств настройки поведения. Сам вопрос соответствия системы человеческим целям шире отдельного метода обучения.
- Alignment и Censorship — Alignment это технический процесс. Цензура — субъективная оценка результата. Один и тот же refusal один назовёт alignment, другой — цензурой.
- RLHF и DPO — в классической схеме RLHF есть модель награды и обучение с подкреплением. DPO напрямую использует пары предпочтений. Подходящий метод зависит от данных и задачи.
- Настройка модели и защитные фильтры — фильтры могут проверять вход, выход или действия во время работы. Они дополняют обучение, но могут иметь собственные ошибки.
- Alignment tax и качество модели — так называют возможную потерю полезных способностей из-за ограничений или настройки. Её наличие и величину нужно измерять, а не предполагать заранее.
Частые ошибки и заблуждения
- «Aligned модель = модель без галлюцинаций». Не так. Alignment учит модель признавать незнание, но не делает её всезнающей. Галлюцинации остаются.
- «Чем больше отказов, тем лучше alignment». Нет. Полезная настройка различает опасный и обычный запрос, а чрезмерные отказы сами становятся ошибкой качества.
- «Open-weight модели всегда без alignment». Instruction- и chat-версии часто проходят дополнительную настройку. Base checkpoint и instruct-вариант нужно различать по карточке модели.
- «Alignment делает модель политически нейтральной». Не делает. Любой alignment отражает ценности команды-разработчика.
- «Alignment полностью исключает нежелательное поведение». Нет. Настройка снижает риск в проверенных сценариях, но новые формулировки, инструменты и контекст могут открыть другие способы обойти ограничения.
Связанные термины
- RLHF — настройка с подкреплением на основе человеческой обратной связи.
- DPO — обучение по парам предпочтительных и менее подходящих ответов.
- Constitutional AI — Anthropic-подход к alignment.
- Jailbreak — обход alignment.
- Prompt Injection — атака на инструкции, иногда обходит alignment.
- Red Teaming — практика тестирования.
- HHH (Helpful, Honest, Harmless) — цели alignment.
Частые вопросы
В каких моделях есть alignment? Многие разговорные и instruct-модели проходят настройку поведения. Но суффикс в названии не описывает весь процесс. Источник сведений — карточка модели и отчёт о её обучении и проверках.
Можно ли «снять» alignment с модели? Некоторые вмешательства меняют склонность модели отказываться. Это не возвращает исходную базовую модель и не отменяет остальные последствия обучения. Изменение также может ухудшить качество и безопасность.
RLHF или DPO — что лучше? Единого победителя нет. Сравнивают качество на нужных задачах, доступные данные и сложность обучения. Название метода не заменяет оценку готовой модели.
Что такое RLAIF? Обучение с подкреплением, где сигнал обратной связи получают от AI. Оно может сократить объём ручной разметки, но наследует ограничения модели-оценщика и выбранных критериев.
Кто решает, что считать «вредным»? Команда AI safety каждого провайдера. Anthropic публикует Acceptable Use Policy; OpenAI — Usage Policies; у каждого свой документ. Спорные кейсы решаются итеративно.
Alignment = censorship? Зависит от точки зрения. Технически — нет (alignment делает модель более полезной по определённым критериям). Критически — некоторые refusals воспринимаются как цензура.
Главное
Смысл alignment виден в конкретном поведении: сохранила ли модель факты, заметила ли нехватку данных, остановилась ли перед действием вне разрешённой задачи. Названия методов объясняют, как её настраивали. Насколько настройка удалась, показывают проверки — в том числе на неудобных и новых примерах.