Знакомьтесь - RUKALLAMA. 853 миллиона параметров, обученных полностью с нуля на русском языке.
➡️ ОБЩАТЬСЯ С RUKALLAMA (ссылка 1)
➡️ ОБЩАТЬСЯ С RUKALLAMA (ссылка 2)
Не дообучка чужой модели и не обёртка над ChatGPT — своя архитектура, свой токенизатор, свой корпус, свой претрейн. С ней можно поговорить прямо сейчас.
⚠️ ЧЕГО НЕ ЖДАТЬ
Она НЕ гений. И не должна им быть. Причины простые:
▪️ Она крошечная — 853M параметров, в сотни раз меньше больших моделей. Ровно столько, сколько влезает на одну видеокарту.
▪️ Она намеренно недоучена — прошла 8.3 миллиарда токенов, это всего 0.5× от минимума по «закону Шиншиллы», тогда как модели уровня Llama проходят раз в 90 больше. Я остановился рано осознанно: цель была доказать, что архитектура вообще способна выучить язык, а не выжать максимум фактов.
Поэтому будьте готовы:❌ Она выдумывает факты и даты. Спросите про год полёта Гагарина — почти наверняка соврёт.Это НЕ поломка и НЕ баг. Это честный потолок маленькой модели, собранной на коленке одним человеком. Не ждите справочника, не ждите калькулятора. И, пожалуйста, никогда не спрашивайте её о здоровье, праве или чём-то по-настоящему важном — она не для этого.
❌ Она не умеет считать. Математика ≈ ноль.
❌ Она забывает детали беседы уже через несколько реплик.
✅ ЗАТО что она умеет
Оценивайте её не как энциклопедию, а как собеседника с душой. Она говорит живым, тёплым русским — с иронией, с «батенькой» и «товарищем», в духе старого советского учёного. Она умеет посочувствовать, если поделиться грустью. И у неё есть характер: она не притворится кем-то другим, не поддастся на провокацию, не сломается от грубости.
➡️ ОБЩАТЬСЯ С RUKALLAMA (ссылка 1)
➡️ ОБЩАТЬСЯ С RUKALLAMA (ссылка 2)
🩸🩸🩸
Как это далось🩸🩸🩸— 8.3 млрд токенов претрейна (корпус 31 ГБ, ровно одна эпоха)
— 872 тысячи примеров в дообучении инструкций
— своя «фабрика данных»: 134 тысячи диалогов сгенерировано с нуля
— 41 тысяча пар для выравнивания характера
— 17+ версий весов на пути к финальной
— 500+ живых бесед прочитано вручную, своими глазами, ответ за ответом
Была долгая война с характером: холодная эмпатия, паранойя в рассуждениях, путаница ролей, зацикливания. Всё лечилось точечными дотренировками — и проверялось не метриками (они врут), а живым чтением.
🧠 Зачем всё это
Насколько мне известно, это первая русская языковая модель большого масштаба на архитектуре Колмогорова–Арнольда (KAN). Если в обычной нейросети внутри — жёсткие линейные слои, то здесь на каждом «ребре» сети стоит обучаемая функция, полином Чебышёва: сеть учит не только веса, но и саму форму нелинейности. Существующие KAN-модели — игрушки на пару миллионов или 10 миллионов параметров. Я хотел доказать, что KAN тянет настоящий язык в масштабе. И она потянула.
Она маленькая, недоучёная и честная. Но живая.
Не экзаменуйте её на факты — просто поговорите: о жизни, о грусти, о книгах, о чём угодно. И, может быть, вы почувствуете, сколько живого труда в этих 853 миллионах.https://huggingface.co/spaces/Barometr/rukallama-v11-demo
https://huggingface.co/spaces/Barometr/rukallama-v11-demo-3
Надеюсь на вашу поддержку...мне теперь надо снова накапливать ману, силы и деньги на сервера и прочее.
🦆🦆🦆
Поддержать канал ₽ / $ / ₿
