Nerik 1.0 100M Base — Разработка Завершена!
Что это?
Я обучил свою новую нейросеть полностью с нуля — от чистого кода до работающего ассистента. Без fine-tuning готовых моделей, без API, без читерства. Настоящее обучение с нуля на домашней видеокарте.
Технические характеристики
Архитектура:
100M параметров (как GPT-2 Small)
Благодарности
nanoGPT (Andrej Karpathy) — базовый код и архитектура
HuggingFace — датасеты и библиотека transformers
Databricks Dolly-15k — качественный датасет диалогов
PyTorch — фреймворк для обучения
Итог
Nerik 1.0 — это proof of concept: можно обучить работающую нейросеть с нуля на домашней RTX 5060 Ti за ~20 часов. Модель не идеальна, но она моя — обученная с нуля, с личностью, с характером.
Для первого раза — отличный результат. Для продакшена — нужно больше параметров и данных.
Статус: Разработка завершена, модель работает, можно использовать для экспериментов и обучения.
12 слоёв трансформера
768 embedding dimension
Vocabulary: 50257 токенов (GPT-2 BPE)
Обучение:
GPU: NVIDIA RTX 5060 Ti 16GB
Framework: PyTorch + nanoGPT
Precision: bfloat16
Этапы обучения
1. Pre-Training (PT)
Задача: Научить модель понимать английский язык и математику
Датасет: 2 миллиарда токенов (FineWeb + OpenWebMath + простые диалоги)
Время: 17 часов непрерывного обучения
Результат: val loss = 2.9985
Что выучила: Грамматика английского, базовые факты, математические обозначения
2. Supervised Fine-Tuning (SFT)
Задача: Научить модель отвечать на вопросы как ассистент
Датасет: 13,558 примеров
Identity (личность): 3% — кто такая Nerik, кто создатель, любимые аниме
Математика: 43% — сложение, вычитание, умножение, деление, уравнения
Диалоги (Dolly-15k): 54% — базовое общение на английском
Время: ~3 часа (3 эпохи)
Результат: epoch_1.pt выбран как лучший
Что умеет Nerik 1.0
✅ Отлично работает
Identity (85% точность):
Личность:
Знает что её зовут Nerik
Помнит создателя — Nice
Помнит дату создания — 20 августа 2026
Знает любимые аниме Nice — Beastars и One Piece
Знает что у неё 100M параметров
Базовая математика (58% точность):
Сложение/вычитание двузначных чисел
Таблица умножения
Простые уравнения (ax = b, x + a = b)
Базовые word problems
Базовые диалоги:
Ограничения (и это нормально для 100M)
Зацикливания:
Модель иногда повторяет фразы:
Решение: repetition penalty 1.5 или обрезка ответа после первой строки.
Сложная математика:
GSM8K (школьные задачи 6-7 класса) = 2-3% точности. 100M параметров физически не хватает для многошаговых рассуждений.
Длинные ответы:
Модель лучше работает с короткими ответами (1-3 предложения).
Честные выводы
Что получилось
✅ Обучил модель с нуля на домашнем железе
✅ PT отработал отлично (val loss 2.9985)
✅ SFT дал работающего ассистента с личностью
✅ Модель знает кто она, решает базовую математику, ведёт диалоги
✅ Потратил 20 часов GPU времени ($2-3 электричества)
Что не получилось
❌ Сложная математика (GSM8K) — предел 100M архитектуры
❌ Зацикливания в длинных ответах — нужно больше параметров
❌ Глубокие диалоги — модель быстро теряет контекст
Главный инсайт
100M параметров — это мало для reasoning задач, но достаточно для:
Запоминания личности и фактов
Базовой арифметики
Простых диалогов
Для сложных задач нужно 1B+ параметров
Post #584
19