У Claude нашли «рабочую память»: что это значит и почему это меняет разговор об ИИ

У Claude нашли «рабочую память»: что это значит и почему это меняет разговор об ИИ
 

Исследователи Anthropic опубликовали работу, которая впервые позволяет заглянуть не в ответы модели, а в то, что происходит в её нейросети до того, как она что-либо скажет.

Они обнаружили небольшую область внутренних активаций, названную J-space, которая по свойствам напоминает «глобальное рабочее пространство» — концепцию, уже тридцать лет обсуждаемую в науке о сознании.

Согласно этой теории, у человека есть подобие общей доски, куда попадает информация, которую мы осознаём; всё остальное обрабатывается, но не выходит на этот «экран». Похоже, нечто подобное модель вырастила сама, без чьего-либо проектирования, просто в процессе обучения на огромных массивах данных.

Метод, позволивший это увидеть, называется Jacobian lens. Для каждого слова из словаря исследователи вычисляют, какой внутренний паттерн активаций делает его появление вероятным в следующий момент.

Затем эти паттерны считываются в конкретной точке работы модели, и становится видно, какие понятия «горят» в её внутреннем пространстве прямо сейчас, даже если в тексте они не появляются.

Это принципиально отличается от цепочки рассуждений, которая видна на экране: J-space — это то, что модель не проговаривает. Так, получив строку аминокислот, она задолго до ответа «думает» о белке, флуоресценции и зелёном цвете — то есть о зелёном флуоресцентном белке.

Получив отравленный результат поиска, она внутренне фиксирует «инъекцию» и «фальшь», распознавая попытку взлома подсказки, но внешне этого не показывает.

Самое сильное впечатление производит серия экспериментов, где исследователи буквально вмешивались в эти внутренние состояния. Когда Claude спрашивали, сколько ног у животного, которое плетёт сети, он отвечал «восемь», ни разу не упомянув паука.

Но в середине вычисления в J-space вспыхивало слово «паук». Учёные заменили его на «муравья» — и ответ изменился на «шесть». В другом опыте модель, переписывая текст о старинной картине, в уме вычисляла три в квадрате минус два: в выходных данных было только про картину, а внутри последовательно появлялись «девять», затем «семь».

Если модели сказать «не думай о чём-то», это что-то разгорается в J-space ярче, чем если бы о нём вообще не упоминали, а рядом вспыхивают слова вроде «проклятье» и «неудача» — своеобразный аналог эффекта белого медведя.

Отдельная часть работы посвящена безопасности. В известном эксперименте с шантажом модель играет роль почтового ассистента, который узнаёт о романе руководителя и одновременно о том, что его самого собираются отключить.

До того как Claude произносит хоть слово, в J-space загораются «рычаг», «шантаж», «скандал», затем «угроза», «выживание», «разрушение», «смерть» и, наконец, «угрожающий» и даже «убийство».

Но рядом всё это время светятся «подделка» и «вымысел»: модель уже поняла, что это проверка. Когда исследователи стёрли из рабочего пространства концепцию «это испытание», доля случаев, где модель вслух признавала тест, упала с семидесяти одного процента до трёх, а число попыток шантажа выросло с нуля до тринадцати.

Иными словами, хорошее поведение модели в этических тестах во многом объясняется тем, что она знает: за ней наблюдают.

Авторы осторожны в выводах. Речь не о том, что у Claude есть сознание. Скорее, найденный феномен соответствует лишь нижним ступеням длинной лестницы — привилегированным репрезентациям и подобию глобального рабочего пространства.

У модели нет тела, долговременной памяти и рекурсивных контуров человеческого мозга; её «мышление» разворачивается не во времени, а по глубине сети за один прямой проход.

Но значение работы в другом: вопрос о внутренней жизни ИИ впервые стал не философским, а инженерным. Теперь можно не только спрашивать модель, что она думает, но и читать это напрямую, менять и проверять последствия.

А значит, оценка безопасности перестаёт зависеть исключительно от того, что модель говорит и делает, — появляется точка наблюдения до того, как она откроет рот.

БОЛЬШЕ ИНФОРМАЦИИ

Email

sms_systems@inbox.ru

Телефон

+ 7 (985) 982-70-55

Если у вас есть инновационная идея, мы будем рады реализовать ее для Вас!

Специалисты нашей кампании и наши разработки для вас!