minimind-o
Обучение полноценной мультимодальной модели на 0.1B параметров с нуля: одна общая модель обрабатывает текст, речь и изображения, а на выходе генерирует текст и потоковую речь.
MiniMind-O — мультимодальная модель всего на 0.1B параметров с двухконтурной архитектурой Thinker-Talker. Поддерживает текстовые, голосовые и визуальные входные данные, а в качестве вывода умеет генерировать текст и потоковую речь.
В проекте полностью открыты:
- исходный код;
- веса модели;
- тренировочные датасеты;
- технические отчёты.
Базовые алгоритмы реализованы с нуля на PyTorch, а обучение на мини-датасете можно завершить примерно за два часа даже на одной RTX 3090.
📁 Language: #Python 71%
⭐️ Stars: 755
➡️ Cсылка на GitHub
📱 @git_developer
Post #1603
2.56K

- 👍 4
- 🔥 3
- ❤ 1