короче, нашёлся какой-то чел, который перевайбкодил Jev (который в закрытой бете и втайне разрабатывался 2 года) - ЗА 2 ЧАСА и выложил на HF
это повторяет историю что была с Claude Cowork, который вышел в закрытой бете и за ночь его перевайбкодил какой-то гений из Китая.
Запасаемся попкорном.
Открытые (в отличии от Jev) веса качаем тут:
https://huggingface.co/harshatheg/Qwen-2.5-1B-RLCD
А вот как оно работает (разъяснение от HF):
Идея заключается в том, чтобы заменить авторегрессионную генерацию LLM использованием одного декодера Transformer (из состава предварительно обученной LLM), который обрабатывает контекст и JSON-схему всего один раз.
Ключи и значения (KV) для этих токенов сохраняются в кэше. Затем для каждого поля JSON-схемы мы выполняем следующие действия:
1. повторно пропускаем токены суффикса поля через декодер Transformer (повторно используя KV-кэш); 2. получаем итоговое скрытое состояние и пропускаем его через выходной слой языковой модели (head);
3. получаем оценки (также называемые логитами) для всех токенов из словаря LLM;
4. рассматриваем только оценки для тех токенов, которые важны для данного поля, и пропускаем их через функцию softmax для получения вероятностей, сумма которых равна 1;
5. выбираем токен с наибольшей вероятностью.
Преимущества такого подхода:
1. высокая скорость (не нужно генерировать JSON-схему по одному токену);
2. гарантированная корректность JSON (не нужно полагаться на способность модели сгенерировать валидную схему).
#Jev #Qwen
———
@tsingular
