💡Прочитала статью Степана Леонтьева и соавтора про обнаружение неуверенности локальных моделей
Сначала все поняла, потом пошла сложная математика, потом снова все поняла. Сложную математику мне помог разобрать Gemini 3.1. pro.
Что могу сказать?
Предложенная методика может отлично сработать как математическая подстраховка. Вам буквально цифрами подсказывают, где может быть неточность текста.
На первый взгляд это может сильно улучшить качество итогового документа. То есть вы сначала проверяете очевидно сомнительные моменты, а потом можете для верности валидировать документ целиком.
Нюансы:
1. Понятно, что это первая проба. И мы не знаем как точно будет работать методика на разных моделях. Как минимум, потому что токенизация отличается от модели к модели. И потому что надо учитывать на каком языке «думает» модель: английском, китайском или (маловероятно) на русском.
2. Будет круто, если доработать установку маячка с учетом семантики текста. Тогда должна уменьшиться вероятность разделения слова на разные токены. Потому что это поможет ставить маркер в более удачное место, чтобы он не врезался внутрь слова или другой смысловой единицы.
💕 В любом случае, это восхитительная работа. Стоит прочитать и точно иметь в виду для работы с локальными моделями.
Post #89
245