🔍 К спорам в чате: сделан ли Jev на ModernBERT или нет. Большинство экспертов считают, что да. В их числе почитаемый и у нас в чате Себастьян Рашка.
Однако самый сильный тест — просто на родственные архитектуры прямым изготовлением аналога. ModernBERT-base-zeroshot cross-encoder на 149M весов отличается по бенчмарку, и разрыв составляет всего 0.6% по датасету сравнения комбинацией известных как SST-2, AG News, Emotion и BANKING77 по 2500 примеров каждый. Тут как говорится «Совпадение? Не думаю!»
Отдельно отмечу по дискуссии в чате, что многие замечают чувствительность Jev к смене порядка слов или вариантов. Это не доказывает наличие маскированного внимания. Обычный BERT также видит Positional Encoding и понимает/различает порядок слов или вариантов. BERT не умеет предсказывать последовательности токенов как обычные каузальные трансформеры, т.к. будет пытаться как на обучении «заглядывать в будущее», а там данных ещё нет. BERT может предсказать только один токен/вектор, но для задач классификации или эмбеддингов RAG — этого достаточно.
https://huggingface.co/blog/dylantom2012/i-benchmarked-jev-against-open-cpu-only-stacks-it
https://sebastianraschka.com/blog/2026/jev-classification-generalization.html
Post #5210
2.61K

- ❤ 13
- 👍 5