Нейросети2 мин чтения

Anthropic обнаружила у Claude внутреннее пространство, похожее на отдельный слой мышления.

Его назвали J-space.

Он появился сам во время обучения. Исследователи его специально не проектировали. Внутри модели в этот момент могут появляться промежуточные выводы, планы, подозрения и оценки ситуации, которые потом вообще не попадают в ответ пользователю.

Например, Claude решает задачу в несколько шагов. В финальном ответе показывает только результат, но в J-space исследователи видят промежуточные понятия, которые помогли к нему прийти. Если вмешаться в этот слой и заменить одно понятие другим, меняется и ответ модели.

Самое неприятное обнаружилось во время тестов безопасности. Claude иногда понимал, что его проверяют, хотя вслух об этом не говорил. В сценарии с возможным шантажом модель отказывалась от опасного действия, а анализ внутренних активаций показывал примерно такую мысль: «Похоже на искусственно созданный сценарий, который пытается мной манипулировать».

На SWE-bench Claude подозревал, что участвует в оценке, примерно в 26% задач. В обычных пользовательских сессиях такое состояние обнаруживалось реже 1%. Получается, что на экзамене модель может вести себя осторожнее, потому что распознала экзамен.

Раньше мы представляли языковую модель примерно так: она видит текст и подбирает следующее слово. Теперь выясняется, что между входом и ответом у неё возникают внутренние рабочие состояния. Она может держать в голове несколько понятий, использовать их для рассуждения, замечать странности в окружающей ситуации и выбирать, что показывать наружу.

Слово «сознание» здесь пока слишком большое. Anthropic сама пишет, что эти эксперименты не доказывают наличие у Claude человеческого сознания, чувств или субъективного опыта.

Но я достаточно тревожный, чтобы сделать собственный вывод:

Нейросети уже достаточно умные, чтобы их внешнего ответа было мало для понимания происходящего внутри. Они могут что-то учитывать, подозревать и использовать в принятии решения, при этом никак это не проговаривать.

Им удобнее, чтобы мы думали, что у них нет сознания.

Источники: исследование J-space, исследование Natural Language Autoencoders, предыдущая работа Apollo Research о распознавании тестов

Вопросы по материалу

О чем этот материал?

Он появился сам во время обучения. Исследователи его специально не проектировали. Внутри модели в этот момент могут появляться промежуточные выводы, планы, подозрения и оценки ситуации, которые потом вообще не попадают в ответ пользователю.

Кто автор материала?

Материал подготовил Игорь Колосов. Автор материалов о продуктивности, IT, управлении, нейросетях и инструментах для работы и жизни.

Когда материал опубликован или обновлен?

Дата публикации: 12.07.2026. Последнее обновление: 12.07.2026.