TGViewer
Технозаметки Малышева Технозаметки Малышева @tsingular · 12.9K subscribers
Post #8721 1.08K
О классификаторах.

Прогнал тесты по актуальным классификаторам ( не по всем, что было под рукой), делюсь результатами

Взял пять компактных моделей и прогнал их на одной машине (Apple M5 Max, 128 ГБ).
Всего получилось около 300 тестовых примеров.
Набор специально собирал с подвохами: отрицания, перефразировки, «ловушки» и спорные случаи.

Что получилось:
🔍 Qwen3-Reranker-0.6B (поиск нужного документа): 101 правильный ответ из 103, около 38 мс на запрос. Слабое место, - вопросы с отрицанием вроде «что НЕ вызывает…»: модель видит совпадение темы и не учитывает «не».

🧩 GLiNER2 (извлечение данных из текста): 0.956 по поиску сущностей и 0.96 по классификации, без дообучения.
Схема задаётся словами прямо в запросе. На русском надёжно извлекает только сущности.

🎯 Модели для решений по типу Jev, - новый класс. Они не пишут текст, а выбирают вариант переменной из списка и сообщают, насколько уверены.
На тесте по сортировке 100 обращений клиентов:

Nimble (Ollama 0.35) — лучший: 0.82 при выборе отдела и честная уверенность (ECE 0.081). Однако при этом она медленнее и больше ест памяти: 344 мс и 9.5 ГБ.

Laya — в 12 раз быстрее (28 мс, 1.6 ГБ), но точность ниже, 0.68, и уверенность нужно перекалибровать на своих данных

CLM-8B без дообучения использовать нельзя: 0.33 и уверенность, никак не связанная с точностью.

Главные выводы:
Важна не только точность, но и «калибровка»
Нужно измерять уверенность модели: уверенные ответы обрабатывать автоматически, если уровень самоуверенности модели низкий, - передавать человеку.

Nimble и Laya ошибаются в разных местах: из 45 ошибочных обращений обе промахнулись только на пяти. Их можно использовать в связке.

Сто примеров с трудными случаями показали то, что не заметно на 3х примерах: плохую калибровку, провал на оценке риска ухода и «1 мс» задержки, которая оказалась кэшем.

Так же подготовил презентацию-мастеркласс по этим тестам.
Кому интересно, - залетайте, забирайте.

Полная презентация, как и другие полезные материалы и записи эфиров, в ИИзбранном.

#классификаторы #презентации #руководства
———
@tsingular
  • 🔥 6
  • ❤ 4
  • ⚡ 1
  • 🤩 1
More from @tsingular
  1. Sep 30, 2026В конце первого рабочего дня менеджер спрашивает новенького: — Ну что, сколько клиентов? —…
  2. Sep 30, 2026Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточ…
  3. Sep 30, 2026Новые вопросы на StackOverflow по месяцам. Он, оказывается, совсем всё. https://data.stack…
  4. Sep 30, 2026Подписку ChatGPT теперь можно использовать в других приложениях OpenAI запустила возможнос…
  5. Sep 30, 2026ИИ создаёт нам очень странную ветку реальности, конечно. И это только начало. Невозможно б…
  6. Sep 30, 2026Карточные игры ВЫРЫВАЮТСЯ из стола — вайбкодеры превращают обычные партии в AR-баталии с п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →