График, построенный исследовательской некоммерческой организацией METR, стал одним из самых цитируемых в дискуссиях об искусственном интеллекте. Он показывает, что возможности больших языковых моделей растут экспоненциально: каждые семь месяцев «временной горизонт» моделей удваивается. Однако, как признают сами авторы, этот график чаще всего понимают неправильно.
В декабре 2025 года METR сообщила, что модель Claude Opus 4.5 от Anthropic способна самостоятельно выполнить задачу, на которую у человека ушло бы около пяти часов. Это вызвало бурную реакцию: один из исследователей безопасности Anthropic заявил, что изменит направление своей работы, а другой написал «мама, забери меня, мне страшно». Но реальность оказалась сложнее.
Во-первых, оценки METR имеют значительные погрешности. По словам организации, Claude Opus 4.5 может справляться с задачами, которые занимают у человека от двух до двадцати часов. «Есть много способов, которыми люди читают в график слишком много», — говорит Сидни Вон Аркс, сотрудница технического персонала METR.
Во-вторых, график не измеряет общие способности ИИ. Он строится на основе тестов, в которых модели выполняют в основном задачи по программированию. Сложность задачи оценивается по времени, которое требуется человеку-эксперту для её выполнения. «Временной горизонт» модели — это точка, в которой она успешно справляется с 50% задач, занимающих у человека определённое время.
Многие ошибочно полагают, что цифры на оси Y (например, пять часов для Claude Opus 4.5) означают, как долго модель может работать автономно. На самом деле это время, которое требуется человеку для выполнения задач, с которыми модель справляется. «Я бы добавил слово «человек» каждый раз, когда упоминается время выполнения задачи», — говорит Томас Ква, один из ведущих авторов исследования.
Некоторые эксперты сомневаются, что время выполнения задачи человеком — хороший показатель сложности для ИИ. «Я не думаю, что это обязательно факт: если что-то занимает больше времени, то это более сложная задача», — отмечает Инолува Дебора Раджи, аспирантка UC Berkeley, изучающая оценку моделей.
Тем не менее, тренд очевиден: с середины 2020 года временной горизонт ведущих моделей вырос с девяти секунд до нескольких часов. Венчурные фонды, такие как Sequoia Capital, используют этот график для аргументации скорого наступления эры ИИ, который сможет работать как полноценный сотрудник. Однако авторы графика призывают к осторожности: «Вы абсолютно не должны привязывать свою жизнь к этому графику», — говорит Вон Аркс, добавляя: «Но я готова поспорить, что тренд сохранится».
Для белорусских читателей эта история — напоминание о том, что даже самые впечатляющие графики в сфере ИИ требуют критического осмысления. За экспоненциальными кривыми стоят сложные методологии и ограничения, которые важно учитывать, прежде чем делать далеко идущие выводы о будущем.