Автор повторил закрытый сервис Jev на открытой Qwen3.5-4B и одной RTX 3090. Модель не генерирует текст, а сразу выдаёт вероятности заданных вариантов.
Большинство решений в агентах — это «повторить или нет», то есть по сути
if. Прямое чтение логитов заняло 1,02 с против 5,33 с у генерации компактного JSON-массива.Подвох в том, что ответы совпали с генерацией лишь на 18 критериях из 21. Автор честно называет это сравнением скорости, а не доказательством одинаковой семантики.
🔗 Подробнее
@nuancesprog #AI #Python
