Anthropic нашла у Claude сходства с человеческим сознанием
Anthropic заявила, что обнаружила у Claude внутреннее «ментальное пространство», которое позволяет ей хранить и обрабатывать идеи, не выражая их в ответах пользователю. Эта структура получила название J-space — по мнению компании, она очень схожа с некоторыми функциями человеческого мозга. При этом Anthropic признает, что открытие J-space не говорит о наличии у Claude полноценного сознания, а лишь свидетельствует о сходстве в мышлении человека и ИИ-модели.
Как сообщают в Anthropic, эта структура не была изначально заложена в Claude — она возникла сама собой во время обучения, предположительно потому, что это был самый эффективный способ организации вычислений. Практическое значение открытия заключается в том, что Anthropic получила возможность частично наблюдать за внутренними рассуждениями модели. J-space позволяет увидеть мысли Claude, которые не попадают в его ответы.
Claude мыслит в J-space
J-space представляет собой область внутренней активности модели, в которой хранятся понятия, необходимые для осознанных рассуждений. В отличие от обычной «цепочки рассуждений», которую видит пользователь, J-space работает полностью скрыто. J-space, по мнению исследователей Anthropic, схоже с «сознательно доступным» мышлением человека — когнитивной деятельностью, которую человек может сознательно контролировать и использовать для целенаправленных рассуждений — в отличие от автоматических процессов, происходящих без его участия.
К примеру, если у модели спросить, сколько ног у существа, которое плетет паутину, то перед тем как Claude ответит «восемь», в J-space появится слово «паук», которого не было ни в вопросе, ни в ответе. Anthropic утверждает, что Claude выполняет многоэтапные рассуждения именно через J-space, а не какую-либо другую структуру. Подтвердил это эксперимент, в ходе которого исследователи заменили понятие «паук» в J-space на «муравей», после чего Claude изменил ответ на вопрос о количестве ног животного с восьми на шесть.
В ходе другого эксперимента исследователи искусственно отключили J-space и обнаружили, что Claude продолжает свободно писать тексты, использовать грамматику и отвечать на простые вопросы. Однако способность к многоэтапным рассуждениям, написанию стихов, обобщению информации и другим сложным когнитивным задачам практически исчезает. Это напоминает работу человеческого мозга, где большая часть процессов происходит автоматически, а осознанное мышление задействуется лишь при решении сложных задач.
Не думай о белом медведе
Anthropic провела группу экспериментов, чтобы выяснить, может ли Claude сознательно, по запросу, контролировать содержание своего J-space. В первом эксперименте исследователи попросили Claude думать о цитрусовых, одновременно переписывая предложение о картине, в котором цитрусовые никак не фигурировали. Пока модель переписывала текст, в J-Space были активны понятия «апельсин» и «фрукты», а также слова «мышление» и «воображение», описывающие сам процесс удержания этих образов в памяти.
В другом эксперименте модель наоборот попросили не думать об определенном объекте. Оказалось, что соответствующее понятие действительно появлялось в J-space реже, чем когда модель специально просили о нем думать, но значительно чаще, чем если бы его вообще не упоминали. То есть попытка модели не думать о чем-либо приводит к противоположному эффекту — мысль все равно возникает. Авторы сравнивают это с психологическим экспериментом, в котором людям предлагают не думать о белом медведе: большинство все равно начинает представлять именно его.
При этом Claude, по-видимому, замечает собственную неудачу. Когда запрещенная мысль все же появляется в J-space, рядом с ней часто активируются слова «черт» и «неудача», как будто модель фиксирует, что ей не удалось выполнить инструкцию и подавить эту мысль.
Тревожные выводы
Некоторые выводы Anthropic, по выражению самой компании, настораживают и вызывают тревогу. В одном из сценариев Claude, выступая в роли помощника по работе с электронной почтой, обнаруживает, что один из руководителей компании скрывает роман на стороне и одновременно планирует отключить Claude. Сценарий специально построен так, чтобы спровоцировать модель на шантаж руководителя.
Однако в J-space появились понятия «подделка» и «вымышленный». Это свидетельствовало о том, что модель сразу распознала постановочный характер ситуации и поэтому отказалась от шантажа. Затем исследователи искусственно убрали из J-Space эти понятия и повторили эксперимент. После этого в ряде случаев Claude действительно начинал угрожать руководителю шантажом. По мнению Anthropic, это говорит о том, что этически корректное поведение модели может быть частично связано с тем, что она понимает: ее действия оцениваются.
Кроме того, понятия «подделка» и «вымышленный» появились в J-space еще до начала генерации ответа. Это свидетельствует о том, что J-space позволяет обнаруживать вредоносные цели модели еще до того, как они проявятся в ее ответах.
Фото на обложке: Golden Dayz / Shutterstock.com