В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает.
Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно так, не скажет никто, включая её авторов. GLASS - попытка сделать наоборот. Гипотеза простая и дерзкая:
трансформер - не монолит. Его механизмы можно ОТЛИТЬ в прозрачные алгоритмы. Без единого шага обучения весов.
И это работает. Три силы трансформера, переплавленные в чистый счёт:
▸ Память модели (FFN) → n-gram таблицы. Буквально «какой токен чаще шёл после такого контекста». То, что нейросеть прячет в весах, здесь лежит открытым списком, который можно прочитать глазами.
▸ Внимание → induction. Модель ищет в живом тексте самый длинный повтор и копирует то, что шло следом. Никакого обучения - поиск прямо во время ответа.
▸ Мягкое внимание → kNN по прототипам. Один линейный решатель вместо спуска по градиенту.
Сверху - ещё две фигуры. СУБСТРАТ: внешняя сжатая память, где знание живёт не в весах, а снаружи - в 21 миллионе фактов; читатель вырезает ответ дословно из факта, поэтому система почти не выдумывает. И крошечный РУЛЬ - около 97 тысяч обученных параметров, которые смотрят только на сигналы движков и решают, как их смешать. Ни одного токена он не видит.
Итог, который до сих пор удивляет меня самого:
~97 тысяч обученных параметров рулят 2 миллиардами посчитанных токенов - и оно отвечает на вопросы по Википедии. Именем, с первого токена. Кто открыл Уран - Гершель. Длиннейшая река Европы - Волга. Кто изобрёл паровую машину - Уатт. Всё это из 21 миллиона фактов, на обычном процессоре, без единой видеокарты, примерно за секунду.
Зачем всё это? Способность = память × навык. Классические модели впихивают и знание, и навык в одни и те же веса. GLASS кладёт знание СНАРУЖИ - и оставляет весам только тонкий навык управления. А заодно ищет ответ на главный вопрос: что именно в трансформере нельзя заменить счётом? Где проходит та неделимая граница, за которой без обучения градиентом уже никак?
По ссылке - WIKI проекта. Коротко и наглядно:
◆ анатомия из четырёх фигур - Глассформер, Субстрат, Оркестратор и бикамеральный Плетун;
◆ живая анимация «как отвечает бот»: видно нутро - во что превратился вопрос, какие факты подняты и насколько они покрывают запрос, какую сущность вывела система;
◆ как модель росла по частям - один отлитый движок за другим: n-gram → внимание → сходство → лес;
◆ спокойная карта ограничений и направлений: куда это движется дальше.
Проект исследовательский и делается одним человеком. Он открывает не меньше вопросов, чем закрывает - и в этом весь смысл.
👇 Посмотреть, как язык становится прозрачным:
https://claude.ai/code/artifact/346211a0-d5b4-45fd-8626-820ffdd90f3b
Не забывайте поддерживать канал:🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL paperfunkrecordings@gmail.comПоддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
