Percepta выкатили пост "Can LLMs Be Computers?" и твиттер сходит с ума. Если коротко: они собрали трансформер который исполняет WebAssembly.
Идея красивая, но давайте разберемся. (тут вам наверное лучше самим прочитать пост, хотя бы через самари ЛЛМки)
Они не обучили модель считать. Они руками сконструировали веса очень маленького трансформера так чтобы он работал как интерпретатор. Это не learning, это компиляция программы в веса.
Все обсуждают их ускорение attention с O(t) до O(log t). Но есть нюанс который все пропускают. Это работает только потому что они заменили softmax на hard-max. В их задаче на каждом шаге нужно достать конкретное значение из стека или памяти по адресу, не мягкую смесь всех значений. Для этого hard-max хватает. Нормальные LLM используют softmax где нужны скоры от всех ключей для взвешенной суммы. Их ускорение к этому неприменимо (и концептуально невозможно сделать softmax n величин быстрее чем O(n)).
Результат интересный как конструкция, но к реальным LLM это отношения не имеет, а нарратив "мы превратили LLM в компьютер" это чистый маркетинг.
P.S. Весь смысл работы это дифференцируемый интерпретатор WASM без tool calling. Но ни одного эксперимента с градиентами нет, как и обьяснения как оно хотя бы должно работать с next gen ллмками.
Post #239
2.25K

- 👍 12
- ❤ 5
- 🔥 4
- 😁 2
- 🤔 1