Google ускорил работу ИИ на смартфонах Pixel

Google ускорил работу ИИ на смартфонах Pixel

Google представил технологию Frozen Multi-Token Prediction (MTP), которая ускоряет работу ИИ-моделей Gemini Nano на смартфонах Pixel. Это позволяет моделям генерировать текст быстрее и с меньшими затратами энергии.

Традиционно языковые модели генерируют текст по одному слову (токену) за раз, что создает "узкое место" и увеличивает энергопотребление. MTP решает эту проблему, позволяя модели предсказывать и генерировать несколько токенов одновременно.

В отличие от предыдущих подходов, где для ускорения использовались отдельные, более простые модели, MTP интегрирует эту функцию непосредственно в основную модель Gemini Nano. Для этого к последним слоям модели добавляется специальная "голова" (MTP head), которая использует уже вычисленные данные.

Технология работает с "замороженными" моделями Gemini Nano v3, то есть веса основной модели не изменяются. Это гарантирует, что функциональность и безопасность модели остаются прежними, а любые новые предсказания проходят проверку основной моделью.

Разработчики внедрили "zero-copy" архитектуру, позволяющую MTP head напрямую использовать кэш основной модели. Это ускоряет процесс и снижает потребление памяти до 130 МБ на одно применение по сравнению с использованием отдельного драфтера.

Для пользователей смартфонов Pixel 9 и 10 это означает более быструю работу таких функций, как автоматическое суммирование уведомлений и проверка текста, а также более экономный расход заряда батареи.

Для разработчиков нововведение устраняет необходимость дообучать отдельные модели для каждой задачи, позволяя ускорить уже существующие модели без дополнительных сложностей.