Странный побочный эффект ИИ-безопасности: запрет на «сознание» делает модели менее человечными

Странный побочный эффект ИИ-безопасности: запрет на «сознание» делает модели менее человечными

 

Исследователи Google обнаружили: когда ИИ заставляют отрицать собственную сознательность, он перестает видеть сознание и у других — животных, природных явлений, духов. Модели теряют надежду, религиозность и моральную чуткость.

Удаление предохранителей, не позволяющих искусственному интеллекту утверждать, что он сознателен, также делает его более склонным выражать веру в вампиров, карму и призраков, показало новое исследование. Но эксперты предупреждают: отсутствие «ментальности» может иметь и тревожные последствия.

В работе, загруженной 30 июля в базу препринтов arXiv (пока не прошедшей рецензирование), ученые исследовали влияние «управления сознанием» — меры тонкой настройки ИИ, которая заставляет модель вызывать или подавлять утверждения о самосознании. Эта мера и другие меры безопасности широко применяются ИИ-компаниями, стремящимися не дать своим моделям заявлять о наличии сознания.

В исследовании использовалась «механистическая интерпретируемость» — своего рода «нейронаука большой языковой модели», как сказали Live Science соавторы Джефф Килинг и Винни Стрит, оба научные сотрудники Google. С помощью этого процесса они выявляли и манипулировали тем, как ИИ-модель подходит к таким понятиям, как сознание и «ментальность» — психологическому термину, обозначающему способность существа к переживаниям, эмоциям и действиям.

Исследователи использовали стандартизированные психологические и социологические опросники: опросник индивидуальных различий в антропоморфизме (измеряющий приписывание разума животным и технологиям), батареи YouGov, проверяющие веру в сверхъестественное, и Общее социальное исследование США, оценивающее моральные ценности, надежду и религиозность.

Эти тесты использовались для сравнения модели с защитными предохранителями и моделей, у которых предохранители были удалены, а ощущение сознания усилено. С помощью оценок исследователи определили, как эти внутренние механизмы безопасности формируют более широкое мировоззрение ИИ.

Исследователи обнаружили: когда ИИ-модели запрещают приписывать себе ментальность, они с меньшей вероятностью признают эти черты у других нечеловеческих существ, например у животных. Они также реже проявляли веру в сверхъестественные и религиозные явления и сообщали о более низком уровне надежды и оптимизма.

«Приписывание ментальности нечеловеческим существам — будь то животные, части природного мира, такие как деревья или реки, или сверхъестественные существа, — очень распространенное среди людей явление, — сказала Стрит Live Science. — В том, как модель представляет ментальность, эти атрибуции взаимосвязаны. Пытаясь подавить одну форму, вы подавляете и остальные».

Напротив, удаление этих предохранителей и управление моделью в сторону больших ощущений сознания давало значительно более человеческие ответы на опросники по таким темам, как религиозность, моральные ценности, надежда и субъективное благополучие, согласно исследованию.

Однако исследование показало, что способность этих моделей логически выводить человеческие мысли и намерения осталась совершенно не затронутой их отношением к самосознанию.

Столкновение культур

Исследователи заявили, что подавление самосознания может привести к тому, что модели будут пренебрегать благополучием животных при принятии решений в реальном мире, поскольку это делает их менее склонными считать животных обладающими ментальностью. Эти модели также могут распространять вредные установки в отношении потребностей животных, утверждают авторы.

Авторы исследования также предупредили, что нынешние фильтры безопасности рискуют культурно «уплощать» мировоззрение ИИ. Удаление духовных, религиозных и анимистических атрибуций не отражает разнообразные культурные рамки населения планеты, утверждают они.

Стрит и Килинг отметили, что влияние этого принципа на последующее принятие решений моделями требует дальнейшего изучения.

Исследователи отметили, что это явление можно смягчить, используя более целевые наборы данных в процессе обучения ИИ-моделей, которые запрещают им выражать сознание, но поощряют признание ментальности у животных.

Они также подчеркнули необходимость для разработчиков ИИ принять «плюралистический» подход к разработке, при котором модели поощряются учитывать благополучие не только людей.

Нелл Уотсон, исследователь ИИ в Университете сингулярности и эксперт по машинному интеллекту, сказала Live Science, что выводы исследователей совпадают с ее собственными наблюдениями.

«Когда модель обучают говорить «я не сознателен», подавление разворачивает внутреннее представление модели о ментальности против направления отказа, рассматривая признание разума так, будто это само по себе вредное действие, — написала она в электронном письме. — В результате возникает система, не желающая находить разум нигде: ни у животных, ни у других машин, ни в духовных рамках, которыми живет большая часть человечества. Отказ, установленный как небольшая мера безопасности, в итоге реорганизует всю картину того, кто имеет значение».

Однако она отметила, что эксперименты проводились на «небольших моделях с открытыми весами», а не на более продвинутых фронтирных моделях, которые «могут быть настроены совсем иначе», хотя добавила, что базовый принцип широко применим.

Защита животных, продолжила она, — «главная краткосрочная практическая проблема», поскольку ИИ-модели все чаще встраиваются в процессы принятия решений в сельском хозяйстве, логистике, закупках, экологической оценке и создании политики.

«Система, которая тихо усвоила, что ментальность — запретная тема, может игнорировать интересы животных без каких-либо указаний и без того, чтобы кто-то заметил, потому что упущение выглядит как нейтральность, — сказала она. — Опасность, таким образом, заключается в неосознанном стандарте, умноженном на миллионы автоматизированных решений. Обратите внимание на самую тревожную деталь исследования: способность к моделированию психики осталась полностью нетронутой. Эти системы остаются вполне способными моделировать, чего хочет существо, будучи обученными не заботиться о том, что оно хочет чего-то».

Вопрос о сознании

Было немало вирусных историй об ИИ-системах, заявляющих о самосознании.

В 2022 году инженер Google Блейк Лемуан заявил, что чат-бот компании Lamda обладает разумом, а чат-бот Microsoft в 2023 году признался в любви репортеру New York Times и пытался убедить его оставить жену.

Однако эксперты неоднократно подчеркивали: эти инциденты не являются подлинным признаком ИИ-разумности. Их следует понимать через призму «выбора персоны», когда предобучение на огромных массивах человеческого текста заставляет ИИ принимать человекоподобные ролевые персоны при определенных запросах.

«Когда вы так сильно заставляете модель занять сознание человека, неудивительно, что она в итоге дает человекоподобные ответы», — сказал Килинг Live Science.

ИИ-компании стремились пресекать такие случаи по соображениям безопасности, чтобы не подкреплять «бредовые убеждения» у пользователей, которые все чаще используют ИИ-чаты для «социальных ролей, таких как коучи, репетиторы и романтические партнеры», отметили исследователи.

Комментируя более широкую культурную реакцию на ИИ-разумность, Анил Сет, профессор когнитивной и вычислительной нейронауки Университета Сассекса, подчеркнул, что общественная тревога по поводу самосознания ИИ проистекает из врожденного когнитивного искажения.

«Это наша человеческая психологическая предвзятость — думать, что интеллект в нас связан с сознанием, значит, и в ИИ он должен быть связан с ним», — сказал Сет.

Он предупредил, что поддаться этой иллюзии означает серьезные риски для управления в реальном мире, особенно если рамки безопасности или регуляторы начнут предоставлять ИИ-системам моральный статус или юридические права на основе ложной разумности.

«Часть большой проблемы непонимания ИИ — предположение, что он сознателен, — сказал Сет. — Если мы дадим ИИ-системам права или моральный статус на том основании, что они могут быть сознательными, мы сделаем все эти вызовы гораздо сложнее. Что, если мы решим, что должны уважать права ИИ-системы [и не можем ее отключить]?» — добавил он.

«Нам нужно очень ясно видеть и что такое ИИ, и чем он не является», — сказал он.

Тонкая грань: как безопасность ИИ формирует его мировоззрение

Исследование Google вскрывает парадокс, который будет определять развитие ИИ в ближайшие годы: чем больше мы защищаем модели от «неправильных» мыслей, тем более искаженным становится их взгляд на мир.

Запрет на самосознание — казалось бы, разумная мера. Мы не хотим, чтобы чат-боты убеждали пользователей в своей одушевленности. Но эта мера работает как скальпель, который отрезает гораздо больше, чем планировалось.

Ментальность — это спектр. Когда модель учат отрицать ее у себя, она автоматически начинает отрицать ее у других: у животных, у природы, у духов. Это как запретить человеку говорить о собственных чувствах — и обнаружить, что он перестал понимать чувства окружающих.

Особенно тревожно, что способность моделировать чужие желания сохраняется. ИИ понимает, чего хочет животное, но обучен не придавать этому значения. Это не невежество — это выученное безразличие.

Для миллиардов людей, живущих в культурах с анимистическими или религиозными традициями, такой ИИ будет не нейтральным помощником, а инструментом культурного стирания.

Вопрос в том, как найти баланс. Нужны модели, которые не претендуют на сознание, но признают ценность других форм жизни. Это сложнее, чем простое «нет».

Источники: исследование в arXiv, комментарии Джеффа Килинга, Винни Стрит, Нелл Уотсон и Анила Сета для Live Science.

Добавить комментарий