Исследователи из Percepta опубликовали статью, где рассказали об эксперименте по запуску кода на Си прямо внутри модели. Для этого они обучили трансформер работать как виртуальная машина (WASM-интерпретатор).
Это стало возможно благодаря их новому механизму 2D‑attention. Он позволяет модели искать данные в истории с логарифмической сложностью вместо квадратичной, достигая скорости в десятки тысяч токенов в секунду на обычном CPU при выполнении кода.
Пока это proof‑of‑concept — маленькая модель, специально заточенная под VM. Неясно, насколько такой подход будет интегрируем в большие мультимодальные LLM. А главный вопрос —
Чем это лучше привычного tool use?
«Ну, во-первых, это красиво». Во-вторых, если такой подход станет мейнстримом, мой папа больше не сможет использовать неспособность LLM в математику как аргумент, что ИИ — фигня :)
А если серьезно, то для целого класса задач исчезает потребность во внешней обвязке как таковой, что потенциально кардинально снижает latency — больше не нужно передавать контекст от нейронки к внешнему инструменту и обратно.
По крайней мере отзывы от мэтров звучат многообещающе.
Михаил Парахин:
Это похоже на настоящий прорыв. Так красиво, так просто задним умом — все признаки отличной работы! [1]
Андрей Карпатый:
Погодите-ка, это же так здорово!! И то, и другое: 1) компилятор Си в весах LLM и 2) hard-max attention с логарифмической сложностью, и потенциальные обобщения. Вдохновляет! [2]
Как думаете, когда мы увидим WASM VM внутри GPT или Claude?
[1] https://x.com/MParakhin/status/2033347801544065076
[2] https://x.com/karpathy/status/2033383295237734847
@devspotting
