1) Что с СЕТУНЬ-2 Троичным процессором (название не могу использовать такое, поэтому будет другое).
Всё впорядке! Всё собрано и буду проводить на днях новый аудит чтобы снова предложить это здесь на канале и сделать правильную презентацию. Это тоже требует времени и сил.
Я в своё время спал по 3 часа и просто на марафоне лютом фигачил и доделал самое главное и важное, что должно было быть доделано - вписанный в железо демон, CPU-GPU и то и другое параллельно может, CPU тоже хитро сделал. Там целый конвейер внутри для математики.
Так что это не должно НИКУДА ИСЧЕЗНУТЬ И будет ИСПОЛЬЗОВАНО! потому что ЛЛМ развиваются в кодинге хорошо и можно действительно дельные вещи сделать.
Этот проект мне самому на вырост. Многие сами знают, что такое ВАЙБКОДИНГ, когда ты не шаришь в технологии. Это сложный процесс дообучения на конкретных действиях и документациях и долгие нервные разговоры с ЛЛМ потому ты НИХРЕНА НЕ ПОНИМАЕШЬ!
Да, я признаю это, я нихрена не понимал кроме самых фундаментальных вещей. И благодаря ЛЛМ смог это разобрать у себя в голове на рабочие асбтракции (это выражение такое, в точных науках мыслят абстракциями тоже) и смог вывести сам этот билд.
Запаковано и готов к аудиту. Но кем?
2) Что с Rukallama V11+ (Жнец, ты уже постов наплодил с метриками, а где блин модель и чат обещанный?)
Отвечаю: Rukallama V11+ была дотренирована с 8млрд токенов до 16млрд и сразу стала одуплять ГОРАЗДО БОЛЬШЕ!
Но какие остались проблемы?
Разделение на роли: несмотря на эмбеддинги ролей во внимании (и не только) и отступах в 32 токена от реплики Человек/Ассистент - это было решено частично, но во время взаимодействия ДИКО РАЗДРАЖАЕТ! Поэтому выкладывать такое всё равно стыдно. (ещё с прошлого раза не прошла мазоль, что ноет внутри, т.к. проект так и не был доведён до упора).
Математика: работает идеально - простые примеры, словесное написание прямой задачи, вплоть даже до матных формулировок работают как сказка какая-то. Работает на ALU-нейронах Поповича (это моя фамилия если что, когда так назвал и привязалось - мне нравится). Что такое нейроны Поповича? Бикамеральные авторегрессионные ALU-сетки с чёткими действиями по умножению: парсер-классификатор, дирижёр, переводчик и дополнятор (собирает входные данные в нужный язык для исполнения нейронами). Вся цепочка работает как часы!
РОВНО ТОЖЕ САМОЕ Я провернул с физикой с константами типа скорости света и так далее и с химией. Реализовать это позволила детерминированность этих дисциплин. Физика - формулы, химия - форумлы и , конечно же. правила. Зашил я это удачно и работает ВЕЛИКОЛЕПНО (по метрикам было всё видно).
Семантический гейт + Lora адаптеры: Это реальный выход из ситуации, т.к. на фоне fine-tune не приводит к забыванию (да, мой KAN имеет свойство забывания иначе он бы не сровнялся с MLP), но корректно и за 1 раз Lora можно подключать только ОДНУ ШТУКУ! Т.к. идёт разная работа с разными слоями и подобные адаптеры меняют всё почти непредсказуемым образом если будут работать в паре. (Кстати, бумаг как тренировать пару Lora вместе и совмещать усреднять складывая их свойства - не искал, надо поискать)
Какой выход? Правильно: Семантический гейт! Т.е. ты сначала определяешь намерения пользователя с 98% точностью и получаешь КОНЦЕНТРИРОВАННУЮ Lora для твоей задачи.
Именно поэтому были сумасшедшие метрики, которые ровнялись аж почти с фронтиром России этого года (его начала, если быть более точным). Но...а где модель Павел? Спросите вы и я не буду вилять. Читаем дальше:
1) Семантический гейт работает почти идеально, натуральных нарушений не было.
2) Но задачи иногда плавают так, что нужно что-то вроде сканирования по намерению всего промпта и возможность динамически сменять Lora друг с другом, т.к. могут быть смешанные задачи.
ВОТ ТУТ Я НАЧИНАЛ СЕБЯ СПРАШИВАТЬ, А НЕ МНОГО ЛИ Я ХОЧУ ОТ МОДЕЛИ? (ответ удивил оперативников)
Нет, не много...это исследование, в котором хочется понять - будет работать или нет? ну и вот в какой момент мне остановиться во время этого азарта? И я не понимаю...пошёл дальше исследовать. Нашёл решение - исполнил его. сработало...но поломалось другое.
3) Rukallama - это Kan модель у которой, внимание, KAN Moe эксперты и свой гейт специализированный внутри (по сути это уже итак лора в лоре...кхм). Но Lora под конкретную задачу работает ОФИГЕННО...но только не тогда когда идёт переключение с одной на другую прямо во время генерации - вот это уже приводило к mode collapse и модель уходила в повторы лютые.
Что это? Это, господа-товарищи, простой советский....МАЛЫЙ ОБЪЁМ МОДЕЛИ бл***ь!
Почему он маленький? Догадайтесь с 3х раз если у меня всего одна А100.
Кто-то скажет: Павел - ну google cloud и ваще столько предложений.
Ну, идите посчитайте модель покрупнее, допустим, на 7млрд параметров и найдите самое дешёвое предложение. Вот я уже пробовал по всякому, но шанса на ошибку там нет. А где тренироваться на кошках?
Т.е. либо ты профакиваешь бюджет , либо ты тыкаешься в небо и масштабируешься вслепую...т.е. опять профакиваешь бюджет. С учётом того, что у меня такой опыт появился лишь недавно ( я про обучение распределённое) - это и было триггером не пускаться во все тяжкие №1.
Но вы подумаете: Павел, но нейронки очень быстро исправляют ошибки!
И я отвечу: ДА! Вы абсолютно правы, но только забываете , что длинный претрейн это прежде всего крупные батчи, согласование между всеми видеокартами несмотря на готовые фреймворки и библы для этого (+ функции серверных стоек с картонами нужными), обратная пропагация, которая подразумевает 3 прохода через backward чтобы обновить все веса...это хуже чем авторегрессионная дырочка через которую модельки выпукивают свои ответы к нам...используя ТОННЫ раскалённого металла для генерации.
Так что о многих ошибках ты узнаешь из тестовых генераций. Показатель LOSS и перплексии (cross entropy loss) и val loss - НЕ ЯВЛЯЮТСЯ ВАЛИДАТОРАМИ КАЧЕСТВА НИ ПРИ КАКИХ ОБСТОЯТЕЛЬСТВАХ - если только ты не супер ультра гений оракул визионер. (открою секрет - это точно не я).
Инструкции и tool calling + MCP: работает неплохо. С этим можно жить, потому что модели такого размера не особо блистают в подобной работе. Было приятно увидеть хорошие метрики у Rukallama.
GSM8K и около подобные задачи на русском языке - ПОЛНЫЙ ПРОВАЛ!
Ничего не помогает...модель логически плохо очень размышляет и ей сложно вытаскивать ответ из задач по типу:
Андрей общался с Николаем некоторое время: 20 из которых они показывали друг другу монеты из своих коллекций, 7 минут уделили чаепитию, 3 минуты они потратили на то чтобы попращаться и разойтись по домам. Сколько минут общались Андрей с Николаем?
Проблема? Объём модели, ёмкость, вместимость - как хотите так и берите, любой выбранный вариант будет правильным.
Поверил ли я в этом? Нуууууууу....как вам сказать? И да и нет! С одной стороны кажется, что это безнадёжно, а с другой стороны я вижу , что она иногда ОЧЕНЬ СИЛЬНО СТРЕЛЯЕТ ПРЯМО В ПОНИМАНИЕ ДЛИННОЙ БЕСЕДЫ!
Буду решать. План - есть!
Вы спросите вновь: Паша, много инфы...а че с моделью то? 😃
Отвечаю: Она коллапсирует то тут то там, а метрики которыми я хвастался недавно это сборная солянка из того, что модель вообще может сделать по отдельности. Да - это неплохой результат. Но мне то хочется ах***ый результат! Правильно? Правильно.
Поэтому я буквально КАЖДЫЙ ДЕНЬ СШИВАЮ ЕЁ ВМЕСТЕ - чтобы все эти новые компоненты и функции работали нормально. Да, я делаю абляционные исследования, Я постоянно отключаю модули и наращиваю по одному. И ...терплю неудачу. Пока что.
Я работаю над этим. Вот что с Rukallama.
4) А что там Demon?
Демон впорядке. То, что я наметился сделать - на это нужно , как минимум, подписок штук 2, 3. Лимиты исчерпываются очень быстро, а исчерпать все edge cases (крайние экстремальные случаи на железках) задача КРАЙНЕ СЛОЖНАЯ. Особенно когда речь идёт о такой тонкой материи, которую решил затронуть я. Это оптимизация самого низкого уровня. BLAS ускорить это вам не шутки...а ещё при этом не потерять в скорости и не обновляя железо, а оставаясь на старом.