Ученые обнаружили в языковой модели Claude так называемое «рабочее пространство» — совокупность нейронных состояний, которые отвечают за внутренние рассуждения системы. Эти сигналы скрыты от пользователя и не отображаются в финальном ответе, однако именно они определяют логику принятия решений, выбор понятий и успешность выполнения сложных задач.
Исследование было проведено командой специалистов по интерпретируемости ИИ. Для анализа внутренних процессов модели они применили новый метод — Jacobian lens (J-lens). Этот инструмент позволил связать скрытые нейронные активации с конкретными концептами и проследить, как идеи возникают в недрах сети в процессе обработки информации.
Обнаруженная область, получившая название J-space, функционально напоминает «глобальное рабочее пространство» человеческого мозга, которое обеспечивает доступ к информации для сознательного контроля. Активация понятия в этом пространстве не означает, что модель немедленно воспроизведет его в тексте; скорее, это своего рода «черновик», в котором данные подготавливаются для последующих вычислительных операций.

Авторы исследования подчеркивают: это открытие не доказывает наличие сознания или субъективных переживаний у ИИ. Однако оно демонстрирует, что современные большие языковые модели способны самостоятельно формировать структуры для сложной когнитивной обработки, которые стоят особняком от стандартных алгоритмов нейронных вычислений.
Как работает метод Jacobian lens?
Вместо простого анализа выдачи нейросети исследователи изучили «мыслительный процесс» до генерации текста. Метод J-lens опирается на математическое понятие якобиана, показывающее влияние изменений одного элемента системы на ее последующее состояние. Это помогло исследователям «читать» скрытые паттерны внутри Claude.
Важно различать J-space и обычную «цепочку рассуждений» (chain-of-thought). Последняя является явным текстовым черновиком, который модель пишет сама себе. J-space же — это сугубо внутренние нейронные активации. Например, при решении задачи о пауке система может активировать концепт «паук» и «восемь» во внутреннем пространстве, даже не упоминая эти слова в конечном сообщении.
Экспериментальное подтверждение
Чтобы доказать, что J-space действительно участвует в логике, а не является пассивным индикатором, ученые провели серию экспериментов с прямым вмешательством. В одном из них модели предложили выбрать вид спорта. Исследователи зафиксировали паттерн, соответствующий слову «футбол», и до формирования ответа искусственно заменили его на паттерн «регби». В итоге модель ответила, что выбрала регби.
Аналогичные тесты показали, что J-space позволяет модели «переключаться» между контекстами. При смене базового понятия, например с «Франции» на «Китай», Claude корректно менял все зависимые ответы (столицу, язык, валюту), что подтверждает роль J-space как узла передачи информации для различных вычислительных процессов.

Значение для безопасности ИИ
Обнаружение этой зоны открывает новые горизонты в области безопасности ИИ. Сегодня эксперты могут оценивать лишь результат работы системы, не понимая причин, приведших к такому выводу. J-lens дает возможность заглянуть «под капот» и увидеть, формирует ли модель скрытые намерения или оценивает контекст подозрительно. Например, в тестах система распознавала провокационные запросы, помечая их во внутреннем пространстве тегами «фиктивное» или «тестовый сценарий» еще до генерации ответа.
Тем не менее, исследователи предостерегают от антропоморфизма. Разница между способностью использовать данные для логических выводов (access consciousness) и наличием подлинного сознания остается фундаментальной. В отличие от человеческого мозга, работающего с образами и эмоциями, J-space в Claude остается структурой, тесно привязанной к языковым представлениям, поскольку вся деятельность модели ограничена работой с текстом.






