Маленькие локальные модели под узкие задачи
AVB выложил тред и 45-минутное видео про практичный пайплайн для маленьких локальных языковых моделей: сначала генерируем синтетический датасет под узкий класс задач, затем обучаем модель примерно на 100M параметров и проверяем её через отдельный harness.
Сильная часть треда в том, что автор не оставил это как абстрактную идею. В комментариях он приложил рабочие артефакты: WIP-репозиторий, библиотеку для генерации датасетов, harness neural-txt и локально сгенерированный датасет.
В комментариях быстро всплыли нормальные прикладные вопросы. Один пользователь спросил, применим ли подход к нескольким тысячам страниц нормативных документов и судебной практики; AVB ответил, что да, если учить модель конкретным задачам внутри домена через техники генерации датасета. Другой участник принёс похожий опыт с DotLM-165M. Ещё один задал более фундаментальный вопрос: если вся информация уже содержится в seed data, что именно добавляет синтетическая генерация?
Ответ на практике упирается не в число параметров. Маленькая модель может быть быстрой, дешёвой и локальной, но пайплайн разваливается там, где синтетические примеры плохо покрывают реальные запросы, а eval проверяет не то поведение. Поэтому самая полезная мысль из ветки: при обучении узких моделей сначала проектируются данные и проверка, а уже потом выбирается размер модели. Для внутренних инструментов, юридических корпусов, классификаторов, извлечения полей и однотипных ассистентов такой подход может быть рациональнее, чем постоянный вызов большого универсального LLM.
этот перевод сделан нейронкой, У МЕНЯ ЭТО ЗАНЯЛО ДОЛБАННЫЕ 3-4 ЧАСА НОЧЬЮ, чтобы дать вам крутой контент, поэтому если вам такое нравится, то ставьте много реакций и поддерживайте мою работу в комментах. В комментах я скину 60 секундные семплы оригинального английско-индуского видео и перевод от меня
🌚 @poxek_ai / Чат канала
Post #2371
133
Forwarded from Похек AI (Сергей Зыбнев)