Обучение ИИ выполнять инструкции с помощью обратной связи в реальном времени

Алина Мухамедшина

Взаимодействие между человеком и программным агентом на языковом уровне раскрывает бесчисленное количество сигналов, которые можно использовать для обучения. Один из таких сигналов — это явная обратная связь: пользователи могут выразить свои намерения через инструкции на понятном агенту языке, а также предоставить отзывы по ходу выполнения задачи. Этот вид обратной связи имеет огромный потенциал, поскольку может переложить задачу обучения со статических наборов данных на динамическое взаимодействие с пользователями.

В этой работе исследуется проблема непрерывного улучшения автоматизированного агента для выполнения инструкций на основании полученной от пользователей обратной связи в ходе реальных человеко-агентских интеракций. Сценарий проведения эксперимента — это коллаборативная среда CEREALBAR, где два участника стремятся к достижению общей цели в разделяемом мире, используя при этом естественный язык для координирования действий.

Чтобы достичь этих целей, исследователи выбрали подход простого метода контекстно-бандитского обучения (contextual bandit learning). Альтернативные методы часто базируются на предположении о природе учебных сигналов и динамики взаимодействия. В работе была проанализирована зависимость результативности процесса не только от самой модели ИИ, но и от поведения людей в процессе эксперимента.

Техническая основа

Эксперимент проведен на игровой платформе CEREALBAR. В рамках квест-платформы один из игроков (лидер) выдает команды другому (исполнителю), который должен эти команды выполнять. При этом лидер способен оказать “бинарную” поддержку исполнителю: положительную или отрицательную – всё зависит от того, как точно исполнитель следует инструкциям лидера.

Непрестанное Обучение

Для повышения эффективности работы модели использовались различные подходы к созданию тренировочных данных из информации о фактически выполненных действиях и получаемых за них вознаграждений или штрафов. Сложность заключалась в том факте, что любая задержка или неточность ответов пользователей могла превратить поток полезных данных в шум.

Это все усложняло задачу модели правильно интерпретировать данные ошибок/штрафов и использовать их для корректного обучения последующего поведение агента-исполнителя.

Результат Экспериментального Нарастания

Нарастание определено двумя экспериментами: первый показал долгосрочное поведение модели ИИ через 11 циклов развертывания; второй фокусировался более конкретно на изоляции переменных по типам начального объем данных для демонстрации, положительным/отрицательным отзывам и эвристики распределений вознаграждений за ответные решение(heuristics for reward propagation).

Источник: https://openreview.net/forum?id=ez6Cb0ZGzG

Total
0
Shares
Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Related Posts