Papers with code x Meta внезапно выпустили свою модель под названием Galactica – LLM, но с уклоном в академию и науку
Она может саммаризировать статьи, генерировать обзоры литературы и выжимки лекций, предлагать цитирования и писать сниппеты кода (и много чего еще)
Секрет успеха, как это часто бывает, в датасете: 48M статей, 2M файлов с кодом, и много энциклопедий, учебников, баз знаний и т.д. Авторы утверждают, что гораздо тщательнее фильтровали и отбирали данные для датасета по сравнению с предыдущими scientific LLM
Одна интересная новация, которую они предалагают в сопровождающей статье, – токен <work> для создания working memory. Чтобы обеспечить возможность chain-of-thought для решений сложных примеров (где нужны промежуточные вычисления для ответа на вопрос) обычно используют промтинг по типу ‘Let’s think step by step’, чтобы модель расписывала свои шаги. Здесь же авторы помещают все входные данные и последовательность вычислений между <work>-токенами, что больше заточено под математические операции, чем описание словами после промта
Потыкать демо можно тут – https://galactica.org/
Только кажется, что там выставлен сильный лимит на длину генерации, и так же впечатляюще, как на их демонстрации, не получится 🤡 зато веса публичные!
Post #881
2.37K
- ❤ 15
- 👏 2