Google Research: ошибки GPT-5 и Gemini 3 связаны с воспроизведением знаний, а не с их отсутствием

Google Research: ошибки GPT-5 и Gemini 3 связаны с воспроизведением знаний, а не с их отсутствием

12 августа 2026 года Google Research представила исследование «Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality». Авторы — Нитай Кальдерон и Галь Йона. Они предложили различать «пустые полки» (факт не закодирован) и «потерянные ключи» (факт закодирован, но недоступен).

Новый подход — knowledge profiling — описывает состояние каждого факта одной из пяти категорий: отказ кодирования, отказ воспроизведения, прямое воспроизведение, воспроизведение с размышлением и вывод без кодирования. Это точнее, чем обычная точность ответов.

Для проверки авторы создали бенчмарк WikiProfile: 2150 фактов из Википедии, каждый снабжён десятью заданиями. Два задания проверяют кодирование, четыре — знание, ещё четыре — узнавание в формате множественного выбора. Факты извлекались из Википедии — ключевого источника предобучения LLM. Пайплайн полностью автоматический, с использованием Gemini-2.5-Pro с размышлением, плюс фильтрация через поисковую систему и ручная валидация.

Исследователи оценили 13 языковых моделей, включая Gemini 3 и GPT-5, в двух режимах — с «размышлением» и без него. Для каждой модели, факта и задания брали восемь ответов. Выяснилось: у моделей переднего края почти все факты закодированы, но многие недоступны в момент ответа.

Практический вывод: если проблема в воспроизведении, расширение данных или увеличение модели не поможет. Нужны пост-обучение и методы на этапе инференса — например, цепочки рассуждений или режим «thinking», которые позволяют модели использовать уже закодированные знания. Стандартные метрики точности смешивают оба типа ошибок и скрывают этот разрыв.