Здесь ты найдешь полезные репозитории с GitHub
Связь: @devmangx
РКН: https://clck.ru/3FocDP
Post #1307
3.32K

llm-madness
Обучение больших языковых моделей — это обычно целая цепочка из настройки окружения, подбора гиперпараметров и трекинга экспериментов. Процесс громоздкий, легко накосячить, а быстро проверить идею или разобраться в принципах работы — то ещё удовольствие.
И тут как раз попался open-source проект llm-madness на GitHub. Это лёгкий end-to-end пайплайн для обучения LLM с визуальным интерфейсом.
Он закрывает весь цикл: от сборки токенизатора и подготовки датасета до обучения GPT-модели. Плюс через веб-интерфейс можно в реальном времени смотреть, как меняется loss и какие сэмплы генерирует модель.
Внутри — реализация Transformer в GPT-стиле с возможностью кастомизировать архитектуру: количество слоёв, число attention-голов, размер эмбеддингов и т.д. Есть живые графики лосса, генерация примеров и визуализация attention.
Также встроено обучение BPE-токенизатора, что позволяет подгонять токенизацию под конкретный домен — код, математику, медицину и прочие специализированные корпуса.
Если хочется быстро проверить идеи по архитектуре модели или глубже понять, как устроен Transformer изнутри, без поднятия тяжёлого тренировочного стека — проект точно стоит посмотреть.
📁 Language: #Python 50.2%
⭐️ Stars: 88
➡️ Cсылка на GitHub
📱 @git_developer
Обучение больших языковых моделей — это обычно целая цепочка из настройки окружения, подбора гиперпараметров и трекинга экспериментов. Процесс громоздкий, легко накосячить, а быстро проверить идею или разобраться в принципах работы — то ещё удовольствие.
И тут как раз попался open-source проект llm-madness на GitHub. Это лёгкий end-to-end пайплайн для обучения LLM с визуальным интерфейсом.
Он закрывает весь цикл: от сборки токенизатора и подготовки датасета до обучения GPT-модели. Плюс через веб-интерфейс можно в реальном времени смотреть, как меняется loss и какие сэмплы генерирует модель.
Внутри — реализация Transformer в GPT-стиле с возможностью кастомизировать архитектуру: количество слоёв, число attention-голов, размер эмбеддингов и т.д. Есть живые графики лосса, генерация примеров и визуализация attention.
Также встроено обучение BPE-токенизатора, что позволяет подгонять токенизацию под конкретный домен — код, математику, медицину и прочие специализированные корпуса.
Если хочется быстро проверить идеи по архитектуре модели или глубже понять, как устроен Transformer изнутри, без поднятия тяжёлого тренировочного стека — проект точно стоит посмотреть.
📁 Language: #Python 50.2%
⭐️ Stars: 88
➡️ Cсылка на GitHub
📱 @git_developer
- ❤ 5
- 👍 3

















