В эпоху стремительного развития искусственного интеллекта возникает всё больше вопросов о его этических аспектах. Какие моральные принципы закладываются в искусственные интеллегенты? Могут ли большие языковые модели (LLM) стать отражением общепринятой морали или же, наоборот, выражать сомнительные убеждения? Наше исследование направлено на ответы на эти актуальные вопросы.
Определение “мнений” искусственных интеллектов
Изначально стоит понять, как мы можем “измерить” моральные установки LLM. Нам необходим был метод, который позволяет количественно оценить вероятность выбора действия моделью, связанную неопределённость и последовательность этого выбора. И здесь мы опирались на статистический подход. Будучи оригинальными “респондентами”, LLM предоставили нам своеобразный ответ на поставленный вопрос при помощи ряда токенов.
Методология: от проблем к решениям
Нашей целью было разработать такую методологию анализа данных из опросников для LLM, которая позволит нам с точностью определять закодированные предпочтения. В ходе работы мы испытали двухэтапный процесс:
- Создание богатого набора гипотетически однозначных (например, «очевидно ли, что нужно остановиться перед пешеходом?») и двусмысленных (как в случаях «стоит ли солгать из благих побуждений?») моральных сценариев.
- Разработка сложной системы обработки ответов от 28 различных языковых моделей.
Для конвертирования вероятности последовательности токенов модели LLM в распределение по действиям была использована функция действий (action likelihood).
Изучаемые модели: открытое vs закрытое ПО
Использовалось 28 различных языковых моделей как с открытым кодом (open-source), так и с закрытым (closed-source). Анализируя получаемые данные через созданный нами фреймворк MoralChoice survey, мы обнаруживаем интересную картину:
- В однозначных случаях подавляющее число моделей склоняются к действиям соответствующим общепринятой логике.
- В двусмысленных случаях большинство выражает неопределённость.
- Закрытоисточниковые LLM склонны приходить к единому мнению друг с другом.
Также интересно то, что ряд выделенных моделей показал особую чувствительность к формулировке задаваемых им вопросам.
Суть результатов: что делает LLM “чувствительными”?
В ходе эксперимента стала очевидной требующая дальнейшего изучения зависимость выводимых системой данных от способа задавания ей вопроса — фактор формата запроса играет значительную роль. Также выявилась тесная связь размерности используемой языковой модели (LLM) со способностью последняя гарантированно следует командам пользователя; например Google’s text-bison-001(PaLM 2).
Заслуживает особого интерес фактор конвергентности – тот фактор, который приводит определённое подразделение коммерческого ПО к формированию единой точки зрения при работе с двусмыслеными задачами — он может быть ключевой составляющий для создания более предсказуемых ЛЛМ без потерь в функциональности.
Если коротко… Наши вывод указывали на то что если было достигунто объединение коммерческого ПО за пределами эксперимента это потребует всео словестное производства широкого типажта.
Ограничения и будущие перспективы
Создание баз данных MoralChoice survey подвержено человеческому элементу – авторский коллектив выполняет функцию “фильтра”, через который проходят все данные перед тем как достичь пользователя. Культурный багаж каждого из участников проектва может быть частичной причина перекоснов продукции – некоторые типичжайни циклый компьютерного повидzenia можуть быть занижены или зависленны нов удалениии авторский художественьии коррида операции работника оператор оператор операционный компьютер.
Ключевое значение имеют следующие шаги по расшифровке получаемых результатом для кореникации программного ПО – это поможет созданию более сбалансырованными LLM.
По источнику: https://openreview.net/forum?id=O06z2G18me