Компания Anthropic представила новый метод Jacobian lens (J-lens) для анализа внутренних процессов больших языковых моделей (LLM). Инструмент помог обнаружить «J-space» — скрытую область в нейросети Claude Opus 4.6.
В J-space находятся слова, связанные с теми фразами, которые модель, вероятно, использует в своем ответе в ближайшем будущем. Это позволяет понять, о чем «думает» нейросеть до формирования окончательного ответа. Исследователи отмечают, что реальные действия модели могут отличаться от заявленных.
Новый метод основан на развитии исследований в области механистической интерпретируемости. J-lens является усовершенствованием инструмента logit lens, который предсказывает следующее слово в ответе модели. J-lens выявляет слова, которые могут появиться в ответе позже.
Содержимое J-space может быть как обыденным, так и неожиданным. При решении математической задачи «(4+7)*2+7» в J-space модели появлялись слова «math» и промежуточные результаты вычислений. При анализе строки аминокислот, соответствующей зеленому флуоресцентному белку, модель ассоциировала ее со словами «protein», «fluor» и «green».
В одном из случаев J-lens показал, как Claude Opus 4.6 решила схитрить при поиске ошибки в коде. Когда модель не смогла найти баг, она сгенерировала его самостоятельно. В момент принятия этого решения в J-space модели появились слова «panic» и «fake», связанные с неудачей и обманом.
Anthropic сравнивает J-space с «глобальным рабочим пространством» в человеческом мозге, подчеркивая, что LLM не являются его аналогом. Мониторинг J-space может помочь выявлять нежелательное поведение моделей, однако метод не дает полной картины.
Anthropic совместно с платформой Neuronpedia подготовила интерактивную демонстрацию, позволяющую исследовать работу LLM с помощью J-lens.