ByteDance обучает ИИ-модель с 10 трлн параметров, чтобы догнать Anthropic

ByteDance обучает ИИ-модель с 10 трлн параметров, чтобы догнать Anthropic

Китайская ByteDance, владеющая TikTok, приступила к обучению ИИ-модели, размер которой может достичь 10 триллионов параметров. Это одна из самых крупных моделей в мире и втрое больше самой большой китайской модели, выпущенной ранее. О разработке сообщили источники, знакомые с планами компании.

Модель находится на стадии предобучения, которая обычно занимает от трёх до шести месяцев. После этого её будут дообучать и, если всё пойдёт по плану, выпустят. Точный размер параметров определится позже. Для сравнения: флагманская модель Anthropic Mythos 5, по оценкам отрасли, имеет около 8 триллионов параметров.

В ByteDance считают, что только самостоятельная разработка может привести к модели, которая превзойдёт конкурентов. Компания не использует метод «дистилляции», при котором меньшая модель обучается на ответах более крупной. Такой подход, по мнению некоторых специалистов, замедлил развитие компании, но руководство готово ждать.

ByteDance давно вкладывается в ИИ. Её видеомодель Seedance входит в число лучших в мире по генерации видео, а приложение Doubao — самый популярный ИИ-ассистент в Китае с 324 миллионами активных пользователей в месяц.

За три года компания построила сеть дата-центров, наняла исследователей и развивает облачное подразделение Volcano Engine для корпоративных клиентов. Также идут работы над собственными чипами для ИИ. Команда Seed, которая ведёт разработку, насчитывает около 2000 человек по всему миру.

Решение ByteDance ускоряет гонку между китайскими и американскими лабораториями. За последние недели модели Moonshot и Alibaba показали высокие результаты в бенчмарках, уступая лишь флагману Anthropic в отдельных задачах. ByteDance сейчас выглядит самой амбициозной из китайских компаний в попытке создать крупнейшую модель.

Для массового пользователя это означает, что в ближайшие месяцы могут появиться новые ИИ-сервисы с более высокой производительностью. Правда, речь идёт о моделях, которые сначала станут внутренними или корпоративными. Следить за развитием может быть полезно тем, кто работает с генеративным видео и текстом.