TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
Future AI

7 Jul, 17:53

Open in Telegram Share Report

Forward from: БлоGнот
Исследователи Anthropic выкатили результаты интересного исследования — в языковых моделях нашли структуру, функционально похожую на «глобальное рабочее пространство» из нейронауки сознания.

Огромная часть вычислений модели — автоматика, недоступная для отчёта. Но внутри нейронных сетей Claude существует небольшая группа паттернов активации, выполняющая роль, аналогичную «сознательно доступному» мышлению у людей. Это область, где модель удерживает мысли, которые она «обдумывает», но не обязательно озвучивает. J-Space не был запрограммирован разработчиками, он появился самопроизвольно в процессе обучения модели.

Есть вполне человеческие аналогии — не зря исследователи проводят параллели с нейронаукой.

Опытный водитель переключает передачи не осознавая. Но, если его спросить, какая сейчас передача, информация об этом втягивается в сознание. У модели так же: счётчик длины строки исправно управляет переносами, вообще не появляясь в рабочем пространстве, но стоит задаче потребовать назвать длину — та же информация всплывает и становится доступной для рассуждения.

Эффект белого медведя: инструкция «не думай об X» подавляет концепт лишь частично, он прорывается. А у пост-обученной модели рядом с прорвавшейся мыслью появляется ещё и damn — она замечает собственный провал, как медитирующий, обнаруживший, что ум опять убежал.

J-space содержит всего несколько десятков концептов одновременно и отвечает менее чем за 1/10 (10%) общей активности внутренних процессов модели. Нейроны в J-space связаны с остальной сетью значительно плотнее — в некоторых частях сети плотность связей выше примерно в 100 раз по сравнению с обычными паттернами.

Работа не доказывает, что Claude обладает «феноменальным сознанием» (способностью чувствовать). Однако исследование демонстрирует наличие «доступного сознания» (access consciousness) — способности оперировать информацией, рассуждать и использовать её для управления поведением. Практическое его использование уже понятно — можно использовать для контроля модели и обнаруживать попытки обмана. Кроме того, это даёт неожиданный метод обучения: если натренировать модель формулировать этические принципы в ответ на гипотетическое «остановись и подумай», поведение улучшается и там, где никто не спрашивает — принципы заселяют рабочее пространство. Тренируя, что модель сказала бы, меняешь то, что она думает.

https://transformer-circuits.pub/2026/workspace/index.html

26 0 1 3
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot