Что не видно в анонсе FRIDA-Decisions
Если вы пришли со стрима, что такое FRIDA-Decisions, вы уже знаете: энкодер на 823M, который выбирает вариант, ставит оценку и отвечает «да» или «нет» без генерации. Мне в ней интереснее всего три вывода, которые она подтверждает.
1. Даже с окном в 512 токенов можно закрыть много практических задач. Маршрутизация обращений, модерация, проверка релевантности — это короткие тексты. Наш бенчмарк razvilka из 15 таких задач тому пример.
2. Для таких решений достаточно модели меньше 1B. FRIDA-Decisions на 823M набирает 0.893, коммерческий TypeSafe Jev 0.897, разница статистически незначима. А модели вдвое больше, на 1.9B, набирают 0.833 и 0.853. Такой размер работает на домашней карте, около 28 мс на RTX 5060 Ti, и даже на CPU.
3. Чтобы обучить такую модель, хватает небольшого бюджета. По вычислениям оно сопоставимо с 50 часами работы одной потребительской карты уровня RTX 5060 Ti. Для достаточного качества кластер не нужен.
При этом мы много обсуждаем, куда расти дальше: увеличить контекст и добавить другие модальности. Веса под MIT на Hugging Face, подробный разбор уже доступен на Хабре.
Если вы уже пробовали FRIDA-Decisions, какие задачи она помогает решать? А какие хотелось бы добавить? Если еще не пробовали, напишите свою задачу.
Post #6
121
- 👍 3