Демка оценивающая оптимальный шаг обучения и размер батча для модели заданного размера, количества токенов на обучении и ширины эмбеда на основе формул из статьи про первый DeepSeek 🐋.
Оно еще предлагает конфигурации распараллеливания для разного количества нод.
Формула, правда, ломается для очень маленьких моделей.
Post #585
2.62K

- 👍 12
- 👀 5