TGViewer
AI Projects AI Projects @turboproject · 11.2K subscribers
Post #5209 3.37K
🚩 Сейчас идёт настоящий бум Decision-моделей. В топе Hugging Face совсем не Qwen или DeepSeek, а Laya. Начался бум с Jev (API-аналог), который отвечает за 236–276 мс, но Laya ещё быстрее ~33 мс. Фантастическая скорость, крошечный размер и невероятная дешевизна в решениях выбора между вариантами создали бум таких моделей.

Однако я заметил, что многие откровенно наивно используют такие крошечные модели без понимания, что без дообучения они мало отличаются от подбрасывания монеты по точности. Разработчики Laya сами пишут: «Laya is a fast base to specialise, not a zero-shot decision engine». Zero-shot точность на typed-decisions составляет всего 0.362 — чуть выше случайного угадывания (0.318). Но после дообучения на тренировочном сплите того же бенчмарка точность поднимается до 0.766, обгоняя Jev (0.727).

Архитектурно такие модели построены на ModernBERT, но BERT имеет известную славу «мешка слов» и плохого понимания причинно-следственных связей. Это не нормальный трансформер с маскированным вниманием, который понимает «кто на ком стоял». Довольно наивно думать, что в 0.4B весов даже физически могут поместиться данные фактов, необходимые для сравнения вариантов под задачу.

Без обучения модель может отвечать только на простейшие общие вопросы типа «Есть ли фишинг в письме?», причём потребуется ещё сделать калибровку модели через Temperature Scaling (TS), Platt Scaling или Isotonic Regression.

Возможно ещё «подбрасывать факты» в промпт модели, то вам сразу нужен RAG, что убивает преимущества скорости.

Без тюнинга такие модели дают ответы крайне ненадёжно. То, что вы получили «какой-то ответ» — это не значит, что он правильный. Тут местами больше хайпа от тех, кто ещё не понял ограничений этих микроскопических моделей. Я бы напомнил тут про технику Single-Token Logit (STL) промптинга как альтернативу. Вы можете взять нормальную SLM/LLM и попросить модель выбирать вариант одним токеном. В логитах вы можете посмотреть также вероятности вариантов. Однако это нормальные трансформеры, которые знают много фактов мира и понимают причинно-следственные связи в вопросе. Ответ одним токеном тоже очень быстрый и почти ничего не стоит.

https://huggingface.co/convaiinnovations/laya
huggingface.co convaiinnovations/laya · Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 💯 16
  • ❤ 9
  • ✍ 5
  • 👍 2
  • 🙏 1
More from @turboproject
  1. Sep 23, 2026🚩 Fuli Luo опубликовала новую архитектуру HySparse2, на которую перейдёт MiMo V3. Сходств…
  2. Sep 23, 2026Лян Вэньфэн — создал DeepSeek, который лидер Flash-моделей Ян Чжилинь — создал Kimi, котор…
  3. Sep 23, 2026📉 Хороший пример краха «ларечного мышления в бизнесе», которое свойственно не только росс…
  4. Sep 23, 2026🎼 Claude Opus 5.5 в лидерах бенчмарков по композиции классической музыки. Auggie отмечает…
  5. Sep 23, 2026🚀 Qwen Image 2.1 стал самой мощной открытой моделью редактирования изображений на LM Aren…
  6. Sep 23, 2026📉 ИИ становится дешевле и доступнее, чем любая другая трансформационная технология в исто…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →