Мне очень нравится идея Jev https://typesafe.ai/blog/introducing-system-one-models-and-jev
На вход получают контекст и варианты ответов. Взяли небольшой трансформер, на выходе не генерируют текст, а разом выдают вероятность ответов. Это можно использовать как fuzzy классификатор или как вероятности необходимых в данный момент действий. И это достаточно, чтобы играть в Doom, змейку, Fluppy Bird. Основной кейс применения — это встраивание в пайплайн, где нужна быстрая классификация. У нас в нескольких системах в проде для этого используется Gemini 2.5/3, она относительно быстро определяет по какой ветке алгоритму дальше нужно идти. Но это долго, потому что надо ждать генерация структурированного текста. Получил доступ к Jev, буду тестировать.
Из того, что по этому поводу вчера было в сети, больше всего понравилось это: https://github.com/vllm-project/vllm/pull/57250. У Google был смазанный релиз DiffusionGemma, которая очень быстро умеет генерировать текст с помощью Diffusion, итеративными уточнениями заполняя пропуски. Это очень недооцененная вещь, к которой относятся как у LLM. Но её сила в скорости, в одновременности генерации пропущенных токенов, и еще она умеет заполнять пропуски токенов между правой и левой частью — вписывать в контекст. Ну так оказалось, что DiffusionGemma из коробки может работать как Jev.
И ещё это породило у меня в голове такую конструкцию. Что если у нас будет трансформер, а ниже будет встроенный Jev как орган его мозга, который оценивает вероятность, нужно ли еще итерацию подумать (chain of thounght на уровне латентных векторов, не текстом), или нужно вызвать какой-то tool, или пора напечатать ответ.
Короче, Jev — очень простая идея из серии, жалко, что не я придумал, очень сильно ощущал в ней потребность.
Post #616
25
Forwarded from Макеев: как перестать вайбкодить и начать жить