TGViewer
Техножнец Техножнец @technojnec · 5.7K subscribers
Post #4519 2.36K
🔷 GLASS - как устроена языковая модель, которую видно насквозь

В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает.

Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно так, не скажет никто, включая её авторов. GLASS - попытка сделать наоборот. Гипотеза простая и дерзкая:

трансформер - не монолит. Его механизмы можно ОТЛИТЬ в прозрачные алгоритмы. Без единого шага обучения весов.

И это работает. Три силы трансформера, переплавленные в чистый счёт:

▸ Память модели (FFN) → n-gram таблицы. Буквально «какой токен чаще шёл после такого контекста». То, что нейросеть прячет в весах, здесь лежит открытым списком, который можно прочитать глазами.

▸ Внимание → induction. Модель ищет в живом тексте самый длинный повтор и копирует то, что шло следом. Никакого обучения - поиск прямо во время ответа.

▸ Мягкое внимание → kNN по прототипам. Один линейный решатель вместо спуска по градиенту.

Сверху - ещё две фигуры. СУБСТРАТ: внешняя сжатая память, где знание живёт не в весах, а снаружи - в 21 миллионе фактов; читатель вырезает ответ дословно из факта, поэтому система почти не выдумывает. И крошечный РУЛЬ - около 97 тысяч обученных параметров, которые смотрят только на сигналы движков и решают, как их смешать. Ни одного токена он не видит.

Итог, который до сих пор удивляет меня самого:

~97 тысяч обученных параметров рулят 2 миллиардами посчитанных токенов - и оно отвечает на вопросы по Википедии. Именем, с первого токена. Кто открыл Уран - Гершель. Длиннейшая река Европы - Волга. Кто изобрёл паровую машину - Уатт. Всё это из 21 миллиона фактов, на обычном процессоре, без единой видеокарты, примерно за секунду.

Зачем всё это? Способность = память × навык. Классические модели впихивают и знание, и навык в одни и те же веса. GLASS кладёт знание СНАРУЖИ - и оставляет весам только тонкий навык управления. А заодно ищет ответ на главный вопрос: что именно в трансформере нельзя заменить счётом? Где проходит та неделимая граница, за которой без обучения градиентом уже никак?

По ссылке - WIKI проекта. Коротко и наглядно:

◆ анатомия из четырёх фигур - Глассформер, Субстрат, Оркестратор и бикамеральный Плетун;
◆ живая анимация «как отвечает бот»: видно нутро - во что превратился вопрос, какие факты подняты и насколько они покрывают запрос, какую сущность вывела система;
◆ как модель росла по частям - один отлитый движок за другим: n-gram → внимание → сходство → лес;
◆ спокойная карта ограничений и направлений: куда это движется дальше.

Проект исследовательский и делается одним человеком. Он открывает не меньше вопросов, чем закрывает - и в этом весь смысл.

👇 Посмотреть, как язык становится прозрачным:
https://claude.ai/code/artifact/346211a0-d5b4-45fd-8626-820ffdd90f3b

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL paperfunkrecordings@gmail.com
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
  • 👍 36
  • 🔥 12
  • ❤ 2
More from @technojnec
  1. Sep 29, 2026Это прикольный подход. Одобряю очень!
  2. Sep 29, 2026Q-164M и Q-U-164M — новые модели от Q-Project, обучены с нуля на одной GPU. Q-164M — 164.6…
  3. Sep 29, 2026Комментариев нет, т.к. все пошли повторять 😃
  4. Sep 29, 2026ROTOR: память с четырьмя часами Языковая модель без attention · 33.6M параметров · с нуля…
  5. Sep 29, 2026Так так так...
  6. Sep 28, 2026Rukallama V11+ может: 1) Писать код Basic , причём рабочий и по запросу. 2) Писать код Pyt…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →