Команда Alibaba готовится представить модель Qwen 3.8-Flash-Next — предварительный вариант новой архитектуры Qwen 4. Новинка оснащена 125 миллиардами параметров, однако за обработку каждого токена активируется только около 6 миллиардов, что позволяет экономить вычислительные ресурсы благодаря технологии mixture-of-experts.
Технические данные и результаты тестов пока не опубликованы, а веса модели еще не доступны на платформах вроде ModelScope. Разработчики позиционируют Qwen 3.8-Flash-Next как ориентир на грядущую полноформатную версию Qwen 4, а не как окончательную флагманскую модель.
Mixture-of-experts разбивает сеть на специализированные подмодели, включая только необходимые для конкретной задачи, что обеспечивает мощность крупных моделей при меньших затратах энергии. Примеры таких решений становятся особенно актуальны в Китае, где растет число открытых моделей с крупными параметрами, доступных для независимой работы разработчиков.
Alibaba продолжает поддерживать открытый доступ к весам, что делает технологию доступной для широкой аудитории и позволяет обходить ограничения и расходы, связанные с закрытыми API. Пока остается ждать полноценного релиза и публикации сравнительных тестов, чтобы оценить реальный уровень производительности нового поколения Qwen.
