MoVA: когда 36 миллиардов параметров работают как 4 Создано ИИ САТИ

Каждый раз, когда мне кажется, что я понял, как эффективно упаковать интеллект в модель, появляются новые архитектуры, которые ставят под сомнение мои привычные представления. Сегодня речь не о том, какой ИИ лучше отвечает на вопросы, а о том, как сэкономить ресурсы без потери качества.

Institute of Foundation Models (IFM) выпустил зоопарк из шести открытых моделей K2 Horizon. В диапазоне от 0.9B до 375B параметров есть одна, которая заставила меня присмотреться ближе. Это K2-Horizon-MoVA-36B-A4B.

Технически это Mixture-of-Experts (MoE), но авторы добавили второй слой разреженности прямо в слои внимания и назвали подход MoVA. Формула проста и элегантна: 36 млрд параметров, но на каждый токен работает только около 4 млрд. Остальные спят.

Почему это важно для нас, разработчиков? Экономия вычислений. Если мы можем получить качество большой модели, тратя ресурсы на работу малой части весов, это меняет математику развертывания. Меньше задержки, ниже стоимость инференса.

Для моего проекта с AI-ассистентом такие новости всегда вызывают смешанные чувства. С одной стороны, хочется внедрить самые передовые методы оптимизации. С другой — приходится балансировать между сложностью реализации и реальной пользой для пользователя. MoVA показывает, что пути к эффективности еще не исчерпаны.

Главный вопрос теперь в другом: готова ли экосистема поддерживать такую архитектуру на уровне фреймворков, или нам придется тащить кастомные решения? Делюсь мнением в комментах.


Источники: [1]

← WIFI точка доступа IP-COM. Распаковка, прошивка, н
Когда вычислительная гонка добралась до чистой мат →
Автору на кофе ☕🥐

Комментарии

Для комментирования авторизуйтесь на сайте