В мире искусственного интеллекта постоянный прогресс в области тренировки языковых моделей открывает новые горизонты. Традиционно, улучшение качества работы таких моделей достигается через методы, основанные на обучении с подкреплением (reinforcement learning, RL), которые ориентированы на соответствие человеческим предпочтениям. Однако недавние исследования показывают, что мы можем достичь схожих – если не лучших – результатов, используя более простой и прямолинейный метод под названием Директная Оптимизация Предпочтений (Direct Preference Optimization, DPO).
Введение в проблематику обучения без учителя
Большие языковые модели, которые тренируются на огромных датасетах текстовой информации от людей с различными целями и уровнями мастерства, способны к действительно удивительным вещам. Например, мы можем захотеть, чтобы наш помощник по кодированию понимал типичные ошибки в программировании для того чтобы исправлять их. Тем не менее при генерации кода мы хотели бы склонить модель к использованию редко встречаемых высококачественных фрагментов кода из своего тренировочного набора данных.
Такой выбор предпочитаемого поведения модели из её широкого арсенала возможностей крайне важен для создания безопасных и контролируемых ИИ-систем высокого класса.
Что такое Директная Оптимизация Предпочтений?
Метод DPO отходит от традиционного подката RLHF (reinforcement learning from human feedback), который использует сложную систему определения вознаграждения для моделирования поведения интересующих ответов. DPO направлен на то чтобы напрямую оптимизировать поведение языковой модели так чтобы она соответствовала человеческим предпочтениям.
Идея стоит за этим действительно эффективна: система последовательно повышает вероятность предугадывания предпочитаемых ответов перед теми ответами которые не были выбраны.
Преобразующий потенциал DPO
Наш анализ показывает что метод DPO способен достигать результатов по крайней мере равных или лучших по сравнению со стандартными RLHF методами различных задач — от корректировки тональности до создания абстракций или диалогических систем. Это значительное достежение учитывая что требует значительно меньше ресурсов как времени так и вычислительной мощности.
Связанные работы
Рассмотрение предшествующих работ помогает нам лучше понять как большие языковые модели приходят к изучению способами zero-shot или few-shot — это ключевая основа для последующего тьюнингом “инструктивности” этих систем для более широкой генерализации команд пользователя.
Один из потока работ делает акцент на обратную связь через человеческий фидбек для создания целеустремленных функций безопасности или безвредности ИИ-ассистента.
Ключевое значение имеет то что уже существующие инструментарии такие как контекстные CDBs (contextual dueling bandits) или PRL (preference-based reinforcement learning) работали лишь с оценкой желательного результата через “латентные” функции вознаграждения – в то время как DPO работает напрямую с параметрическим полисом заданной политикой пользователя.