✔️ Ant выкатили Ling-2.6-flash в опенсорс, и это реально интересный кейс
На бумаге это монстр на 104 миллиарда параметров, но в работе одновременно крутится только 7,4 миллиарда. Классическая MoE архитектура, где сеть сама решает, каких экспертов подключать под конкретную задачу. Поэтому и скорость такая, какой обычно от больших моделей не ждёшь.
215 токенов в секунду на бенчмарке Artificial Analysis. Для сравнения, многие топовые модели крутятся в районе 50–80 токенов в секунду, так что разрыв ощутимый. Но интереснее другая цифра. На полном прогоне AA Intelligence Index модель потратила всего 15 миллионов токенов. В реальной эксплуатации такая экономия превращается в прямые деньги, потому что меньше токенов это меньше счёт за инференс.
Для деплоя есть три варианта весов: BF16 для тех, у кого железа в избытке, FP8 как разумный компромисс и INT4 для совсем зажатых по памяти сетапов.
То есть запустить можно хоть на жирном кластере, хоть на одной видяхе с квантизацией.
Hugging Face: https://huggingface.co/inclusionAI/Ling-2.6-flash
ModelScope: https://modelscope.cn/models/inclusionAI/Ling-2.6-flash
Post #5055
5.03K

- 👍 14
- ❤ 7
- 🔥 6