Специалисты Google изучили, как большие языковые модели (LLM) используют процесс рассуждения для извлечения информации, хранящейся в их параметрах. Этот подход оказался полезен даже для простых фактических вопросов, не требующих сложной логики.
Традиционно "цепочка рассуждений" (chain-of-thought, CoT) применяется для решения сложных задач, таких как математические уравнения или написание кода. Однако исследователи задались вопросом, почему этот метод работает и для простых запросов, например, "В каком году Мэри Энгл Пеннингтон была введена в Национальный зал славы изобретателей?", где ответ либо есть в памяти модели, либо отсутствует.
Исследование "Thinking to Recall: How Reasoning Unlocks Parametric Knowledge in LLMs" показало, что генерация рассуждений помогает моделям вспоминать правильные ответы, которые иначе были бы недоступны. Эксперименты выявили два основных фактора: эффект вычислительного буфера и факт-приоритизацию.
Механизм "вычислительный буфер" предполагает, что генерация дополнительных токенов рассуждений предоставляет модели больше времени для обработки. Даже замена осмысленных рассуждений на повторяющуюся бессмысленную фразу улучшает способность модели вспоминать правильные ответы по сравнению с полным отключением режима рассуждений. Это указывает на то, что дополнительное "время" на вычисления помогает модели уточнить свое внутреннее состояние и извлечь труднодоступные факты.
Однако этот эффект имеет пределы. Слишком длинные бессмысленные последовательности дают убывающую отдачу и не достигают уровня производительности при использовании естественных рассуждений, что означает, что содержание самих рассуждений также имеет значение.
Второй механизм, "факт-приоритизация", заключается в том, что модели в процессе генерации рассуждений извлекают связанные факты. Это похоже на человеческий когнитивный процесс "распространения активации", когда обработка одного понятия активирует связанные с ним понятия в семантической памяти, облегчая их последующее извлечение. Модели используют этот принцип, чтобы "подготовить" правильный ответ.
Исследование, проведенное на моделях Gemini-2.5 (Flash и Pro) и Qwen3-32B с использованием наборов данных SimpleQA Verified и EntityQuestions, показало, что при включенном режиме рассуждений модели значительно лучше вспоминают факты, которые были практически недоступны при его отключении.