🤖 Зачем вызывать большую LLM, если агенту нужно просто выбрать «да» или «нет»?
Phocinae-Largha-150M-v1: модель на 144,3 млн параметров для локальных решений без генерации текста.
За один проход она отвечает «да/нет», выбирает вариант или выставляет оценку от 2 до 10. Вместе с ответом возвращает уверенность: сомнительные случаи можно передавать большой модели.
⚡ По данным авторов:
• Веса FP16 занимают 288,6 МБ, поддерживается CPU.
• Задержка на RTX 5090 составляет 21 мс.
• В тесте маршрутизации число вызовов LLM сократилось на 55%, а точность на уверенно обработанной части составила 99,36%.
Оговорка: это специализированная модель. Английский результат получен после обучения на train-части бенчмарка, китайская оценка включает машинные переводы.
modelscope.ai/models/PerryLink/Phocinae-Largha-150M-v1
Post #2027
348

- 👍 2
- ❤ 1