TGViewer
Лечим эйай Лечим эйай @lechim_ai · 461 subscribers
Post #20 371
Разметка. Часть 2.
6. Автотесты.
Большое количество ошибок являются не клиническими, а техническими. Отмечен тег норма, при этом размечен патологический полигон. На исследовании нет вообще никакой разметки - это значит, что ничего не найдено или случайно было пропущено? Прежде чем разметка попадет в ML отдел должны быть пройдены автоматические тесты, чтобы исключить возможность технических ошибок.
Что посчитать: долю исследований не прошедших автотесты.
7. Чаты разметчиков. Таких чатов бывает два вида: канал и чат, более того, нужно мотивировать людей пользоваться этими инструментами. Чат - место для обсуждения сложных кейсов. Канал - общее место сбора, где эксперт-валидатор выкладывает частые общие ошибки, дает пояснения и важные объявления.
8. Ротация, найм. Тут все как в спорте - нужна конкуренция. Необходимо постоянно нанимать новых специалистов, вести рейтинг имеющихся, отказываться от отстающих. Финансовой нагрузки от этого нет никакой, так как не важно 100 человек разметили по 1 исследованию или же 1 разметил 100, при этом повышается возможность выбора более сильных разметчиков.
Что посчитать: построить рейтинг специалистов, оценивая все вышесказанные метрики, плюс скорость разметки и любые другие показатели.
9. Инструменты разметки. Не стоит фиксироваться на выбранном когда-то инструменте, стоит осознавать какие в нем есть проблемы и дорабатывать (в случае опенсорса) или менять.
Что посчитать: количество технических ошибок и скорость разметки в зависимости от инструмента.
10. Honeypot. Для автоматической оценки качества разметки можно добавить часть уже ранее размеченных исследований (важно, чтобы качество их разметки не вызывало сомнений), еще лучше, если сам врач их до этого уже когда-то размечал.
Что посчитать: метрики относительно эталонной разметки и, если возможно, согласованности относительно себя же из прошлого.
11. Новые методы разметки. Не буду описывать все многообразие возможных подходов, скажу лишь только, что можно разбивать на этапы, использовать опенсорс или внутренние модели для предразметки и тд.

Хорошая разметка данных это 90% успеха совеременного эйай. Я описал далеко не все возможные подходы, но это тот примерно тот набор, с которым сегодня мы стараемся строить систему, при которой ML специалисты перестанут переживать за качество своих данных и углубятся в обучение моделей и research.

Это точно не последний пост на эту тему, так как она неимоверно горяча. Задавайте вопросы, ставьте реакции и пересылайте своим друзьям, которые пока еще не поняли, что делать с 50% ошибок в разметке.
#разметка #процессы

@lechim_ai
  • 🔥 10
  • ❤‍🔥 1
More from @lechim_ai
  1. Dec 31, 2025С Новым годом! В первую очередь спасибо, что вы со мной! Этот канал для меня - это ежеднев…
  2. Dec 13, 20259 девушек и 1 месяц Последнее время часто ловлю себя на раздражении вот в какой ситуации.…
  3. Oct 30, 2025LLM в медицине нельзя? Завтра выступаю на MedPrompt Summit. Конференция скорее для врачей,…
  4. Oct 17, 2025Немного откровения и о бюджете За последний месяц много размышлял о своем канале. Удивител…
  5. Sep 27, 2025Наконец-то добрался до конференции с самыми теплыми воспоминаниями! Сегодня весь день тусу…
  6. Sep 12, 2025Как я читаю резюме Пропал на месяц, прошу меня простить, буду стараться не повторять подоб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →