Post #570
20
Nice IT Ну его нахрен, по такой логике пре-тренинг 75M модели займет 4 года. В общем я заброшу это дело на неопределенный срок. Возможно буду клепать бомж сервер для обучения нейросети

В общем забудьте что говорил тупой идиот DeepSeek, он сделал настолько дырявый и конченный скрипт что я решил его сравнить с скриптами других разработчиков и в итоге с помощью Qwen 3.7 написал новый