🚀 Масштабируем эмбеддинги, а не только экспертов - новый путь к более эффективным LLM
Главная идея: в режимах высокой разреженности (sparsity) использование N-граммных эмбеддингов дает более выгодный Pareto-баланс, чем простое наращивание числа MoE-экспертов.
На этом инсайте построена LongCat-Flash-Lite - первая open-source модель такого типа.
⚙️ 68.5B параметров всего (из них 37.13B не эмбеддинги)
Активно на токен: ~2.9B–4.5B
📊 Бенчмарки:
SWE-Bench - 54.4
τ²-Bench - 72.8
TerminalBench - 33.75
📃 Контекстное окно - 256K (на базе YARN)
✨ Оптимизирована под агентные задачи и кодинг, сильна и в общем рассуждении
⚡ Пиковая скорость инференса - около 700 токенов/с
Итог - модель достигает конкурентного качества в своем классе при заметно меньших затратах и задержках.
▪Hugging Face: huggingface.co/meituan-longcat/LongCat-Flash-Lite
▪Технический отчёт: huggingface.co/meituan-longcat/LongCat-Flash-Lite/blob/main/tech_report.pdf
Post #2523
3.49K


- 🔥 5
- ❤ 4
- 🤔 3