Alibaba нашла способ сократить потребность в ускорителях Nvidia на 82% благодаря системе Aegaeon. В условиях нехватки вычислительных мощностей и ограничений на импорт, компания оптимизировала использование ускорителей для работы своих языковых моделей.
Теперь для обслуживания десятков языковых моделей требуется всего 213 ускорителей вместо 1192. Система позволяет одному GPU обрабатывать до семи моделей, значительно снижая задержки при переключении. Это стало возможным благодаря сотрудничеству с учеными Пекинского университета и внедрению автомасштабирования на уровне токенов.
Как сообщает South China Morning Post, тестирование Aegaeon уже идет более трех месяцев на платформе Bailian.
Источник изображения: Nvidia
@Unlim_AI
Post #2463
4.59K

- 👍 7
- 🤔 2