TGViewer
Channel Public Channel
Medical_AI

Medical_AI

@medical_ml_radar

Новости, исследования и практические кейсы применения ИИ в медицине.

Автор @mariya_math
Subscribers
413
Photos
3
Videos
0
Links
116
Recent Posts 20 shown
Post #142 63
Medical AI Digest: медицинские изображения

За последние три недели сильные imaging-работы всё реже сводятся к «новый backbone и +1%». Исследователи меняют способ взаимодействия модели с изображением — дают текстовые запросы, используют замороженные видеомодели, адаптируют сеть под конкретного пациента и проверяют, как AI меняет работу врача и создаёт новые риски.

PathSegmentor: сегментация патологии по текстовому запросу. Вместо отдельной модели под каждый тип ткани или ручных point/box prompts модель получает название структуры словами. PathSeg собрали из 21 открытого датасета и 275 200 пар «изображение–маска–объект»; один PathSegmentor проверили на 16 внутренних наборах и внешних публичных и клинических когортах. Интерфейс к сегментации становится семантическим — «найди лимфоциты» вместо «вот точка внутри объекта». Клинический workflow пока не проверен проспективно.

VBA-Net+: оценивать хирургический навык без обучения видеомодели с нуля. Авторы заморозили VideoPrism, V-JEPA2 и VideoMAE v2 и обучали только лёгкую голову. На FLS-задачах suturing и pattern cutting лучший вариант дал R² 0,637 и 0,926 для score и AUC 0,907 и 0,991 для pass/fail. Это foundation model как готовый extractor признаков, но пока на стандартизированных учебных заданиях, не в операционной.

AI-колпоскопия: внешняя проверка плюс reader study. На независимом WHO-наборе из 187 пациенток и 855 изображений standalone AI имел чувствительность 84,2% для CIN2+. У 45 колпоскопистов AI-поддержка подняла чувствительность с 84,8% до 90,6%, а число биопсий снизилось с 2,48 до 2,02 на случай; сильнее выиграли менее опытные врачи. Вопрос уже в workflow: можно ли пропускать меньше значимых поражений и делать меньше биопсий. Полного набора specificity/PPV в abstract нет, поэтому клинический баланс по этим цифрам не оценить.

Синтетическое УЗИ груди оказалось слишком правдоподобным. В blinded-фазе 12 врачей не знали, что видят synthetic images: только 3 из 12 спонтанно усомнились в происхождении, а синтетика получила более высокую субъективную оценку качества. При явной задаче real-vs-synthetic accuracy была 70,8%, с подсказками — 79,5%. Это не доказательство диагностической эквивалентности: вывод другой — provenance и проверка источника изображения становятся отдельным слоем безопасности.

xvr: модель, которая доучивается под пациента за пять минут. Мы эту статью с вами уже разбирали, но давайте вспомним. Для совмещения интраоперационного X-ray с предоперационным CT/MRI авторы генерируют синтетические рентгенограммы из 3D-скана пациента и адаптируют pretrained model без ручной разметки. Fine-tuning занимает около 5 минут, регистрация — секунды; на реальной флюороскопии разных анатомических областей, модальностей и больниц точность улучшилась примерно на порядок. Пока это rigid registration, но схема «physics simulation → patient-specific adaptation» шире одной задачи.

Если читать одну работу целиком — xvr: Rapid patient-specific neural networks for X-ray to volume registration. Она лучше всего показывает переход от одной универсальной сети к быстрой адаптации под конкретного пациента без новой ручной разметки.

#MedicalAIDigest #MedicalImaging #DigitalPathology
Nature Segment anything in pathology images with natural language Nature Computational Science - This Resource introduces PathSegmentor—a foundation model that segments 160 pathological categories via natural language prompts, generalizes across datasets...
  • ❤ 1
Post #141 180
Medical AI Digest: кардиология

За последние недели в cardiac AI хорошо виден сдвиг: модели всё реже делают «одну задачу на одном датасете» и всё чаще пытаются переиспользовать одно представление ECG или изображения для разных клинических вопросов. Но параллельно меняется и критерий качества: уже мало показать хороший AUROC — важно понять, переносится ли результат на другой центр и что он меняет в маршруте пациента.

1. ECG-CLIP: что делать, если для нужного диагноза мало разметки
Модель предобучили на более чем 1,7 млн ECG и парных врачебных заключениях от 542 тыс. пациентов, а затем проверили на независимом MIMIC-IV. В low-label режиме она достигала качества сильных конкурентов в среднем с 90,8% меньшим объёмом размеченных данных; при 10 положительных примерах AUC для инфаркта был 0,910. Важная оговорка: это эксперимент на label efficiency, а не доказательство, что клиническую модель можно валидировать на десяти пациентах.

2. BenchECG: общий экзамен для ECG foundation models
Пока разные модели тестируют каждая на удобном наборе задач, сравнивать их почти бессмысленно. BenchECG собирает 8 публичных датасетов, 421 тыс. пациентов, 1,67 млн ECG и 10 задач — от диагностики до survival и OOD-проверок. Их xECG получил лучший общий score 0,838. Для врача benchmark сам по себе ничего не диагностирует, но делает заявления «эта модель лучше» заметно проверяемее.

3. AI для подтипов инфаркта — уже на prospective cohorts
Здесь вопрос клинический: можно ли по обычной 12-канальной ECG раньше различать типы острого инфаркта у пациентов, которые уже поступили с подозрением на AMI? CNN обучили на 173 тыс. госпитализированных пациентов, затем prospectively проверили на 7 591 и внешне ещё на 4 370. Для STEMI AUROC был 0,96 против 0,89 у врачебной интерпретации; для occlusion MI — 0,91. Но NSTEMI с окклюзией модель всё ещё часто пропускала — то есть пока это скорее дополнительный triage-сигнал, чем самостоятельное клиническое решение.

4. Маммография как дополнительный источник cardiovascular risk
Можно ли использовать уже сделанную screening-маммограмму ещё и для оценки 5-летнего риска MACE — крупных сердечно-сосудистых событий? На 22 497 женщинах foundation models дали AUROC 0,823/0,822 против 0,765 у модели только по возрасту. Но событий было всего 500 — 2,2% когорты. Поэтому одного AUROC здесь мало: без выбранного operating threshold мы пока не знаем, сколько женщин получат false-positive сигнал и сколько дополнительных обследований это создаст. Плюс cohort пока single-center, без внешней валидации.

Если собрать всё вместе, главный тренд не просто в «более универсальных моделях». Вопрос постепенно смещается к более полезному: у кого модель работает, при каком пороге и что врач должен делать после её ответа?

Если читать одну работу целиком — BenchECG. Хороший benchmark может изменить поле сильнее, чем ещё один рекорд AUROC.

#MedicalAIDigest #FoundationModels #Biosignals
  • 👍 3
Post #140 209
На днях TypeSafe AI выпустили Jev — первую модель из того, что они называют System One Models.

Идея довольно необычная на фоне нынешнего мира LLM: Jev не должен генерировать текст. На вход ему дают состояние системы и набор заранее определённых вопросов, а на выходе получают структурированные решения вместе с вероятностями и confidence.

Например, не «проанализируй пациента и напиши заключение», а сразу:

— какой из вариантов наиболее вероятен?
— насколько сильны доказательства?
— достаточно ли информации для решения?
— нужно ли передать случай человеку?

Про сам Jev и идею System One Models есть официальный анонс TypeSafe AI.

До медицины его уже тоже успели донести. В небольшом независимом эксперименте Jev прогнали по 2040 вопросам из MedQA, MedMCQA, medical MMLU, PubMedQA и MedExpQA. Получилось 84.75% accuracy. Но мне здесь интереснее не столько сама цифра, сколько поведение confidence: если оставлять только ответы с confidence ≥ 0.9, coverage падал до 68.4%, зато accuracy оставшихся ответов росла до 95.1%. При этом уверенные ошибки всё равно оставались — то есть confidence явно не превращается в сертификат правильности.

Эксперимент целиком: Jev and System One Models: when AI stops writing and starts deciding.

Но мне тут пришёл в голову немного другой вопрос.

А что если использовать такую модель не вместо медицинской image-модели, а поверх неё — как отдельный слой для оценки надёжности решения?

Например, обычная модель анализирует CT или X-ray и выдаёт prediction, uncertainty, OOD-score, согласованность нескольких моделей, какие-то характеристики activation map и т.д.

А Jev получает уже эти признаки и должен решить:

можно ли доверять этому предсказанию / нужно ли отправить случай человеку?

То есть сделать из него learned failure detector и сравнить, например, с logistic regression, XGBoost или небольшим MLP.

Сам Jev изображения пока непосредственно не принимает — в текущих демонстрациях TypeSafe работает со structured state/text. Поэтому как раз схема vision model → набор сигналов о предсказании → Jev → accept/review выглядит довольно естественной.

Не знаю, окажется ли Jev здесь чем-то принципиально лучше обычного метаклассификатора. Но, кажется, это как раз хороший проверяемый исследовательский вопрос.

Если кто-то уже видел подобные эксперименты именно с Jev + medical imaging — кидайте ссылки.

Подробнее

#MedicalImaging #CT #DomainShift
typesafe.ai Introducing System One Models & Jev - TypeSafe AI Blog TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
  • 👍 3
Post #138 258
Персональная нейросеть за 5 минут вместо «универсальной» регистрации

Во время многих малоинвазивных вмешательств врач видит пациента в 2D — на рентгеновской флюороскопии, — хотя до операции уже есть объёмный CT или MRI. Чтобы понимать, где именно находится инструмент в 3D, эти изображения нужно точно совместить. И это одна из тех задач, где старые методы требуют ручной настройки, а обычный deep learning плохо переносится между анатомическими областями.

В новой работе в Nature авторы предлагают xvr — довольно красивую комбинацию self-supervision, физической симуляции и patient-specific обучения.

Идея такая: берём предоперационный 3D-скан конкретного пациента и через differentiable X-ray renderer генерируем множество синтетических рентгенов с известными положениями C-arm. Они автоматически становятся обучающей выборкой — ручная разметка позы вообще не нужна.

Но обучать сеть с нуля для каждого пациента было бы слишком долго. Поэтому сначала используется foundation model, предобученная на тысячах whole-body scans, а под конкретного пациента и нужную анатомию она дообучается примерно за 5 минут.

Во время процедуры сеть даёт начальную оценку положения, после чего её ещё уточняет gradient-based optimization уже по реальному fluoroscopy image. Финальная оптимизация занимает примерно 1–10 секунд.

По данным авторов, это крупнейшая на сегодня проверка 2D/3D registration на реальной флюороскопии: разные анатомические области, CT и MRI, несколько клинических центров. По точности xvr улучшает существующие методы примерно на порядок и выходит на миллиметровый уровень регистрации.

Мне здесь особенно нравится архитектура решения. Вместо надежды, что одна сеть когда-нибудь «обобщится на всё», часть задачи переносится на уровень конкретного пациента: synthetic data создаются из его собственного скана, foundation model даёт хорошую инициализацию, а реальное изображение используется для финального физически осмысленного уточнения.

Ограничение важное: пока речь идёт о rigid registration. Деформации органов это само по себе не решает. Но код открыт, а несколько benchmark-датасетов авторы ещё и привели к единому формату.

Подробнее

#MedicalImaging #CT #FoundationModels
Nature Rapid patient-specific neural networks for X-ray to volume registration Nature - xvr makes pan-anatomical 2D/3D rigid registration accessible to broad clinical and research communities.
  • 👍 5
  • ❤ 3
Post #137 278
Синтетические данные в медицине: помощь или новый domain gap?

Короткая вводная для тех, кто не живёт внутри ML. Synthetic data — это данные, которые не были напрямую получены от пациента, а были сгенерированы или искусственно изменены. Например, можно добавить движение к хорошему MRI, чтобы получить «испорченный» снимок, или сгенерировать спектр крови для человека с заданным возрастом и BMI.

Зачем это нужно? В медицине данных часто мало, редкие группы представлены ещё хуже, а получить идеальные пары «до/после» бывает почти невозможно. Но если синтетика устроена чуть иначе, чем реальные данные, модель может отлично решить искусственную задачу и провалиться на пациентах.

1. Когда синтетика действительно полезна.
В работе в npj Digital Medicine generative models обучали на инфракрасных спектрах крови. Модель позволяла генерировать данные при заданных возрасте и BMI — например, строить виртуальные траектории старения или увеличивать редкие группы. Здесь synthetic data становятся чем-то вроде in-silico лаборатории для controlled experiments.

2. Когда synthetic test слишком удобный.
В NIMARC-MRI U-Net учили исправлять respiratory motion на MRI, куда движение добавляли искусственно. На synthetic test всё выглядело хорошо: SSIM 0.863, PSNR 30.1 dB. Но на реальных motion-degraded scans радиологи не увидели устойчивого улучшения, а примерно в 28% случаев результат после коррекции оценивали хуже исходного.

3. Похожая история с CT.
В работе про AI-generated thin-slice CT удобные synthetic pairs получали, искусственно превращая thin-slice CT в thick-slice. Когда их сравнили с реальными парными реконструкциями из одного raw acquisition, обнаружился заметный synthetic-to-real gap.

Общий вывод тут довольно простой: вопрос не только в том, насколько реалистично выглядит synthetic sample.

Нужно отдельно валидировать сам процесс генерации: воспроизводит ли он те свойства реальных данных, которые важны для downstream-задачи, и сохраняется ли эффект на настоящих пациентах.

Иначе можно получить очень хороший benchmark — для задачи, которой в клинике на самом деле нет.

#MedicalImaging #CT #GenerativeAI
Nature Conditional deep generative modeling of blood-based infrared spectra enables controlled in-silico phenotyping studies npj Digital Medicine - Conditional deep generative modeling of blood-based infrared spectra enables controlled in-silico phenotyping studies
  • ❤ 4
  • 👍 3
Post #136 329
ECG foundation models обещают уметь «всё». Но как проверить, что это действительно так?

Foundation model для ЭКГ сначала обучают на большом количестве сигналов, а потом адаптируют к разным клиническим задачам. Звучит логично — но сравнивать такие модели оказалось surprisingly сложно: одна статья тестирует аритмии, другая возраст, третья использует другой датасет и другой protocol. В итоге красивые цифры плохо отвечают на вопрос, какая модель действительно лучше переносится на новые задачи.

Авторы свежей статьи в npj Digital Medicine сделали BenchECG — единый открытый benchmark для ECG foundation models. В нём 8 публичных датасетов, 421 171 пациент и 1,67 млн записей, а главное — сразу 10 довольно разных задач: classification, detection, regression, survival analysis и segmentation. Отдельно есть out-of-distribution проверки.

То есть модель должна не просто хорошо распознавать одну патологию на знакомом датасете, а показать, насколько полезны её representations в разных условиях.

Заодно авторы предложили собственный baseline — xECG. Это не Transformer, а recurrent-модель на xLSTM, которую предварительно обучают self-supervised методом SimDINOv2. На BenchECG она получила лучший общий score — 0.838, средний rank 1.5 из 5 моделей, а обучение, по данным авторов, оказалось примерно в 5 раз быстрее transformer-baselines.

Но мне здесь интереснее даже не победитель, а сам benchmark. Если мы называем модель foundation model, хорошо бы требовать от неё устойчивого transfer не на двух удобных classification-задачах, а на действительно разных типах задач и данных.

Есть и оговорки. Все датасеты публичные, поэтому для будущих сравнений критично следить, не видел ли конкретный foundation model часть benchmark во время pretraining. Один агрегированный score также может скрывать провалы на отдельных задачах. И, конечно, лидерство в benchmark ещё не означает клиническую пользу.

Зато с воспроизводимостью здесь приятно: опубликованы benchmark-код, конфиги и веса xECG. Получился хороший кандидат на общий стандарт проверки того, насколько «foundation» на самом деле foundation.

Подробнее

#Biosignals #ECG #DomainShift
Nature BenchECG and xECG: a benchmark and baseline for ECG foundation models npj Digital Medicine - BenchECG and xECG: a benchmark and baseline for ECG foundation models
  • ❤ 3
  • 🤔 1
Post #135 357
Когда одна biological age clock для всех начинает смешивать биологию

Для начала немного контекста. Biological age clock — это модель, которую учат предсказывать хронологический возраст человека по каким-то биологическим данным: например, MRI, белкам крови или метаболитам. Если человеку 60 лет, а модель по его данным предсказывает 67, разницу prediction − age = +7 можно интерпретировать как признак более «старого» состояния соответствующего органа или системы.

Обычно такие модели обучают на общей популяции. Но здесь возникает довольно фундаментальный вопрос: относительно какой именно нормы мы считаем это отклонение?

В новой работе в Nature Medicine авторы построили sex-specific normative models отдельно для женщин и мужчин. Использовали данные разных типов: изображения органов на MRI, протеомику — то есть профиль белков — и метаболомику, то есть малые молекулы и продукты обмена. После отбраковки нестабильных моделей осталось 38 clocks для 15 систем органов.

Важно, что сравнение с pooled-моделями делали аккуратно: размеры обучающих выборок и возрастные распределения матчились, обучение шло с nested cross-validation. Для части clocks stratified-модели меньше переобучались, хотя сама задача предсказания возраста оставалась довольно шумной — MAE около 5 лет.

Но интереснее оказалось другое: разница была не только в качестве age prediction. Мужская и женская версии одного и того же clock начинали связываться с разными биологическими факторами. Например, для некоторых protein-based clocks заметно различалась сила генетической компоненты.

А на данных ADNI — крупного исследования старения и болезни Альцгеймера — более высокий brain age gap предсказывал переход от MCI (mild cognitive impairment, лёгкие когнитивные нарушения) к болезни Альцгеймера у обоих полов, но связь была сильнее у женщин: HR 2.25 против 1.74 у мужчин.

С ML-точки зрения здесь особенно интересна сама постановка. Fairness обычно проверяют уже после обучения: сравнивают ошибки и calibration по группам. Здесь потенциальный bias возникает раньше — в самой reference distribution, относительно которой определяется target.

Если задача нормативная, одна смешанная «норма» может сгладить реальную структуру данных ещё до того, как мы вообще начнём смотреть на subgroup performance.

При этом авторы не утверждают, что stratification всегда лучше: pooled- и interaction-модели тоже остаются полезными. Ограничения существенные — генетический анализ только на European ancestry, sex задан бинарно, повторных мультимодальных измерений мало, а внешней биобанковской валидации сопоставимого масштаба пока нет.

Подробнее

#MedicalImaging #MRI
Nature Sex-specific biological aging clocks across organs and omics Nature Medicine - Sex-specific biological aging clocks across multiple organs and molecular systems show that female and male aging patterns can differ in organ-specific, disease-relevant ways.
  • 👍 5
  • ❤ 1
Post #134 503
4 архитектурные идеи из свежего Medical ML

За последние несколько недель нашлось несколько работ, где интересно не только что получилось, но и как именно авторы перестроили задачу под особенности медицинских данных.

1. Не уменьшать гигантское изображение, а научиться выбирать нужные патчи.
В TopKSigLIP проблема простая: маммограмма огромная, а патологический сигнал может занимать крошечную область. Вместо downsampling авторы добавили differentiable TopK-Patch module, который сам выбирает небольшое число high-resolution patches. Их координаты заодно дают встроенную локализацию. А стандартный contrastive loss заменили на Sup-sigmoid: для маммографии много отчётов семантически похожи, и обычный CLIP начинает искусственно «раздвигать» почти одинаковые пары.

2. Прототип класса — не глобальный, а внутри конкретного исследования.
В AnatoProto ищут стандартный кадр в fetal ultrasound blind sweep, где положительных кадров меньше 3%. Frozen BiomedCLIP дополняют anatomy-weighted pooling, а positive prototype считают отдельно внутри каждого sweep. Затем решения поднимают с уровня frame → segment → whole case. Особенно забавно: prototype loss сам по себе ухудшал recall на 12 п.п., а вместе с анатомическим prior уже улучшал его на 6.5 п.п. Хороший пример того, что inductive biases могут работать только в связке.

3. Из 2D foundation model сделать модель для 3D+time через JEPA.
MR-JEPA рассматривает cardiac MRI как spatiotemporal data, а не набор независимых срезов. Авторы берут 2D CMR foundation model, переходят к tubelet tokenization и spatiotemporal masking и обучают JEPA-objective на cine, LGE и mapping без разметки. Получается один frozen encoder для EF, strain и disease classification. На strain-задачах MAE снизился на 21–27% относительно сравниваемых baseline-моделей.

4. Missing modality превратить из проблемы в supervision.
В PULSE идея уже не только про картинки. У каждой модальности свой variational encoder, есть отдельная ветка Past-State для истории пациента, а представления мягко выравниваются в общем latent space. Затем модель реконструирует отсутствующие модальности текущего визита. То есть вместо обычного late fusion получается динамическое latent-состояние пациента, которое учится сразу и по cross-modal, и по longitudinal согласованности.

Если смотреть на эти работы вместе, общий паттерн хорошо виден: архитектуру всё чаще строят вокруг структуры самих медицинских данных — огромных sparse images, соседних кадров одного исследования, 3D+time и хронически неполной мультимодальности.

Именно такие решения особенно интересны: медицинские ограничения здесь не просто мешают стандартному ML-пайплайну, а сами подсказывают, как его перестроить.

#MedicalImaging #MRI #FoundationModels
arXiv.org Solving the Needle-in-a-Haystack Problem in Mammography... There is growing interest in adopting CLIP-style vision--language model (VLM) pretraining for mammography. However, models that directly employ the standard CLIP architecture and training...
  • ❤ 6
Post #133 425
Карты активации как детектор ошибок: что уже пробовали?

Продолжаю тему INFORMER. Вопрос был такой: можно ли использовать saliency/activation maps не только как картинку для человека, а как дополнительный сигнал того, что модель на конкретном объекте, возможно, ошиблась — даже если сама она уверена?

Оказалось, что идея существует давно, но до сих пор остаётся довольно нишевой.

Самый прямой пример — Predicting Model Failure using Saliency Maps ещё 2019 года. Там вообще не пытались «объяснить» ошибку человеку: на saliency map основной модели обучали вторую модель — failure predictor, которая должна была предсказать величину ошибки steering-модели. Работа не медицинская и довольно ранняя, но постановка почти ровно та, которая нас интересует: карта сама становится признаком для оценки надёжности.

В медицине похожая идея недавно появилась в более инженерном виде. В работе Fanale et al. для histopathology объединяют Grad-CAM, SHAP и LIME в ExpiScore и затем обучают отдельный trust meta-model на XAI-derived features. На test set ошибки действительно имели более низкий ExpiScore: TP 0.313, FP 0.258, FN 0.224. Если отправлять эксперту 20% случаев с самым высоким predicted error risk, post-routing accuracy выросла с 0.9898 до 0.9983 — правда, при сильном допущении, что эксперт исправит все отправленные ему случаи.

Есть и другой вариант: карту не анализирует алгоритм — её использует человек. В Folke et al. на 631 участнике и 94 582 решениях saliency maps помогали лучше замечать случаи, где AI ошибся. Но был неприятный симметричный эффект: когда AI был прав, карты, наоборот, ухудшали способность это понять. То есть explanation может быть warning signal, но одновременно создавать лишнее недоверие.

И наконец — главный холодный душ. В Radiology: AI проверили семь saliency methods на >190 тыс. рентгенограмм и brain MRI. Связь между изменением prediction и изменением карты оказалась слабой: максимум PSC 0.25 для sensitivity и 0.12 для robustness. У commercial prototype AUC удалось снизить на 8.6%, практически не изменив saliency map.

Поэтому ответ пока такой: идея не уникальна для INFORMER, но зрелого стандартного подхода здесь ещё нет. Видно три направления: обучать failure predictor прямо на карте; строить признаки из структуры/согласованности нескольких explanations; или отдавать карту человеку как сигнал для review.

А главный открытый вопрос мне кажется очень хорошим: есть ли в explanation map новая информация об ошибке, которой уже нет в confidence, embeddings и других внутренних сигналах модели — и сохраняется ли она при смене больницы, модели и самого explainer?

#DigitalPathology #MRI #Robustness #Interpretability
arXiv.org Predicting Model Failure using Saliency Maps in Autonomous Driving Systems While machine learning systems show high success rate in many complex tasks, research shows they can also fail in very unexpected situations. Rise of machine learning products in safety-critical...
  • 👍 3
  • ❤ 2
Post #132 334
Medical_AI Как понять, что модель на рентгене ошиблась, если сама она уверена? Обычный confidence score смотрит только на выход сети: насколько высока вероятность класса. Но модель может быть очень уверенной и при этом опираться на странный участок изображения. Авторы…
А давайте зададимся вопросом: что мы вообще знаем про использование карт активации для ответа на вопрос — ошиблась ли модель на конкретном объекте?
Причём особенно интересен неприятный случай, когда сама модель в своём ответе вполне уверена.😏😏
Вчера мы разбирали INFORMER — там авторы как раз используют различия между class-specific saliency maps как дополнительный сигнал того, что предсказанию, возможно, не стоит доверять.
Но насколько это вообще распространённая идея? Что уже пробовали делать с картами активации именно для failure prediction, а не просто для визуального объяснения решения модели?
Я решила немного покопаться в литературе.
И тут оказалось, что есть важное разделение.
Сам по себе вопрос «как понять, что модель ошиблась?» изучен очень хорошо: confidence, calibration, selective classification, отдельные confidence-модели, расстояния в embedding space, ensembles и так далее.
А вот использование самой структуры explanation / activation maps как автоматического сигнала ошибки встречается заметно реже.
И это уже становится интересным: может ли то, как модель пришла к ответу, дать информацию, которой нет в её confidence, logits или внутренних признаках?
Дальше попробую собрать несколько хороших работ, где к этому вопросу подходили с разных сторон.
Post #131 299
Как вообще находят новую лекарственную мишень — и где здесь может пригодиться AI?

Когда говорят про AI в разработке лекарств, часто представляют генерацию новых молекул. Но до этого есть более ранний и, кажется, не менее важный вопрос: на что вообще должно действовать лекарство?

Лекарственная мишень — обычно белок или ген, изменение активности которого может повлиять на заболевание. И прежде чем придумывать молекулу, которая с ним свяжется, нужно накопить доказательства, что вмешиваться именно сюда действительно имеет смысл.

Один из способов искать такие мишени — CRISPR-screen. Грубо говоря, исследователи по очереди выключают или изменяют тысячи генов и смотрят, какие вмешательства меняют нужный фенотип: например, делают опухолевую клетку более уязвимой для иммунных клеток. На выходе получается длинный список потенциальных hits. Но дальше начинается менее автоматизированная часть: какие из них действительно интересны, что уже известно об этих генах, насколько результат согласуется с другими экспериментами и что стоит проверять следующим?

Именно сюда авторы AutoScreen вставили систему из AI-агентов. До эксперимента она может по текстовому описанию задачи предложить perturbation library — какие гены включить в screen. После эксперимента — взять сырые статистические hits и переупорядочить их, собирая биологические evidence более чем из 26 баз данных. Отдельные агенты ищут информацию, структурируют её и формируют объяснимый ranking кандидатов с provenance.

На 320 genome-wide CRISPR screens AutoScreen находила примерно на 19% больше подтверждённых hits в top-100, чем лучший из сравниваемых agent-baselines. А для того же числа hits на уровне top-500 ей требовалась примерно в 1.2 раза меньшая библиотека.

Есть и более интересная проверка. В screen устойчивости лейкозных клеток к NK-клеткам система подняла MUC1 с места 118 на 5, PDPN — с 81 на 44, LRRC15 — с 1384 на 659. Затем все три гена отдельно perturbировали и проверили в tumor-killing assay с первичными человеческими NK-клетками — все три подтвердились. На двух prospective T-cell screens AutoScreen восстановила 77.1% hits, определённых консенсусом двух стандартных pipelines.

Но это ещё не «AI нашёл три новых лекарства». CRISPR-hit не гарантирует, что мишень druggable, безопасна и даст терапевтический эффект у пациента. Есть и методологический вопрос: большая часть benchmark — старые публичные screens, а агенты ищут по современным базам и литературе. Без жёсткого temporal cutoff часть успеха может быть восстановлением уже известного знания.

Мне здесь нравится сама смена точки приложения AI: не обязательно сразу генерировать молекулу. Сначала можно помочь исследователю решить более фундаментальный вопрос — какую биологическую мишень вообще стоит проверять следующей.

Открыть статью

#GenerativeAI #DrugDiscovery
bioRxiv AutoScreen: AI Co-Scientist System for Target Discovery in Functional Genomics Target discovery in functional genomics remains largely manual and time-consuming, lacking systematic tools for efficient and reproducible gene-level hypothesis generation. We introduce AutoScreen , an AI co-scientist system supporting target discovery through…
  • ❤ 1
  • 🤔 1
Post #130 265
Как понять, что модель на рентгене ошиблась, если сама она уверена?

Обычный confidence score смотрит только на выход сети: насколько высока вероятность класса. Но модель может быть очень уверенной и при этом опираться на странный участок изображения. Авторы INFORMER предлагают проверять не только ответ, но и то, как он сформировался — через gradient/saliency patterns.

Берётся обычный DenseNet-121, обученный на CheXpert на пяти находках. Для каждого предсказания строятся карты LRP или Input×Gradient, а затем оценивается, насколько объяснение конкретного класса отличается от объяснений остальных классов. Если внутренняя «картина» классов слишком похожа, предсказание помечается как ненадёжное. В RE-INFORMER к этому добавляется retrieval: для подозрительного случая система показывает похожие примеры того же класса из reference set.

На отфильтрованной выборке CheXpert — 90 (839 train / 128 val / 284 test) — INFORMER дал mean F1 0.574 против 0.563 у output-based baseline, а лучший вариант — sensitivity 0.752 против 0.700. Для atelectasis прирост sensitivity достигал 14%. При искусственном Gaussian noise retrieval-вариант показывал относительный прирост bootstrapped F1 на 21.9% по сравнению с baseline.

Но здесь важно не увлечься цифрами. После фильтрации test set — всего 284 изображения, внешней валидации нет, а clinician check retrieval-примеров состоял лишь из семи наборов. То есть пока это скорее интересная инженерная идея для monitoring layer, чем доказанный safety mechanism.

Сам сдвиг постановки мне кажется полезным: reliability можно оценивать не только по вероятности ответа, но и по внутренним признакам того, на чём модель его построила. Для medical imaging это потенциально практичный слой поверх уже обученных моделей.

Открыть статью

#DigitalPathology #XRay #Interpretability
SpringerLink INFORMER—Interpretability-Founded Monitoring of Medical Image Deep Learning Models: Application to Chest X-ray Pathologies Journal of Imaging Informatics in Medicine - Deep learning has demonstrated strong performance in medical imaging. However, its limited interpretability remains a major barrier to clinical trust...
  • ❤ 3
Post #129 249
Может ли ИИ спроектировать систему доставки РНК?

Может ли модель не просто предсказывать структуру белка, а помочь создать белковую конструкцию с новой функцией — например, переносить РНК в клетки?

Этим вопросом задались авторы свежей работы в Nature. Они взяли белковые сборки, спроектированные с помощью RFdiffusion, добавили к ним домены, отвечающие за связывание РНК, взаимодействие с мембраной и выход из клетки, и собрали более 100 вариантов synthetic transfer vehicles — STV.

Получилось интересно. Лучше всего сработала конструкция STV-C8 с необычной для природных вирусных капсидов симметрией. В экспериментальных системах она переносила РНК на несколько порядков эффективнее протестированных природных аналогов и используемых в клинике липидных наночастиц.

Авторы проверили не только reporter RNA. Через STV доставляли gene editors, программируемые противовирусные конструкции и транскрипционные факторы. Для одной из конструкций сделали подробный анализ распределения in vivo у мыши и тесты безопасности в двух животных моделях.

А дальше попробовали уже почти терапевтический сценарий: доставили CRISPR–Cas9 для удаления 51-го экзона дистрофина — сначала в клетки пациентов с мышечной дистрофией Дюшенна, затем в скелетные мышцы свиньи.

До готовой терапии здесь далеко: сами авторы подчёркивают, что использованная внутримышечная доставка для DMD напрямую не подходит, а таргетинг и специфичность по типам клеток ещё нужно дорабатывать.

Но как демонстрация смены роли AI работа очень показательная: модель здесь помогает не анализировать уже существующий биологический объект, а создавать новый, после чего его проверяют обычным экспериментом.

Открыть статью

#BioAI #ProteinDesign #GenerativeAI
Nature Creating bottom-up RNA transfer vehicles from synthetic protein assemblies Nature - Synthetic virus-like protein architectures designed by artificial intelligence show superior ability to deliver RNA into cells, compared with their naturally occurring counterparts, by...
  • 👍 2
Post #128 225

Forwarded from Котики и вышмат

Коллеги-медики из отделения спортивной медицины пришли к нам с запросом проанализировать свои данные. Ну как это обычно бывает — вытащите из данных что-нибудь, чего мы еще не знали, а лучше помогите это красиво визуализировать, чтобы мы это увидели. Этот запрос наложился на запрос коллег из отделения детской психологии.

Иии… мы решили сделать проектный семинар по визуализации временных рядов:) (данные у коллег как раз про это).
В рамках проектного семинара студенты сначала быстренько сделают доклады по основам для работы над темой, а дальше уже будут работать над проектами (большую часть семестра).

Делюсь с вами подборкой тем и соответствующих статей для докладов студентов:


1. Visualization of time series
 
2. Time Series Feature Extraction

3. Motifs

4. Shapelets

5. Anomaly Detection

6. Handling Missing Values
 
7. Scagnostics
 
8. Dimensionality Reduction
 
9. Dynamic tSNE

10. LD-tSNE + PCD-tSNE

11. Distance Measures  

12. Time Series Clustering 

13. Time Series Classification 

14. Explainable AI for Time Series Classification

15. Prediction / Forecasting


Если у вас есть на примете прикольные источники для студентов- новичков, напишите пожалуйста:)
Post #127 233
Правильный ответ на маммограмме ещё не значит, что VLM смотрит на опухоль

В medical VLM обычно радуются accuracy: модель ответила правильно — значит, «поняла» изображение. Эта работа проверяет более неприятный вопрос: а исчезнет ли правильный ответ, если убрать именно патологический очаг?

Авторы сравнили 16 vision-language models на маммографии. Для каждого задания они создавали контрфактуал: lesion удаляли и локально восстанавливали ткань; где возможно, делали ещё control — удаляли случайную область такого же размера. И отдельно смотрели не только classification, но и умеет ли модель перестать быть уверенной, когда диагностического evidence больше нет.

Разрыв получился довольно жёсткий. Лучший Pathology Macro-F1 — 53.75%, лучший Exact Match для abnormality — 52.44%. Но максимум Grounded Answer Success составил только 21.99%, Counterfactual Specificity — 35.19%, а Joint Reliability — всего 6.47%.

То есть модель может довольно часто выдавать формально правильный ответ и при этом плохо демонстрировать, что этот ответ действительно опирается на нужную область изображения. Для клинических моделей это важнее очередных нескольких пунктов accuracy: правильный ответ «по неправильной причине» особенно опасен при смене больницы, протокола или популяции.

Есть и существенное ограничение: это препринт, а сам benchmark зависит от того, насколько аккуратно выполнено удаление очага. Если реконструкция создаёт артефакты, часть эффекта может быть связана уже с новым distribution shift.


Мне кажется, здесь полезен сам принцип оценки: для medical VLM accuracy стоит дополнять интервенциями над evidence и проверкой abstention. Иначе мы можем измерять способность угадать ответ, а называть это надёжным визуальным reasoning.

Подробнее

#DigitalPathology #VisionLanguageModels
medRxiv Accuracy Overstates Evidence Grounding and Abstention Reliability in Mammography Vision-Language Models Answer accuracy alone cannot determine whether a Vision-Language Model (VLM) relies on clinically relevant mammographic evidence or recognizes when that evidence is unavailable. We introduce an evidence-grounded selective evaluation benchmark that evaluates…
Post #126 213
Когда prospective validation портит красивый ML

Очень полезная работа вышла в npj Digital Medicine — не потому, что модель поставила рекорд, а ровно наоборот.

Авторы взяли ML-модели для предсказания грамотрицательной бактериемии, которые раньше разработали в своём центре, и проверили их уже проспективно на реальном потоке ICU. В исследование вошли 289 посевов крови у взрослых пациентов с подозрением на инфекцию; в 97 случаях выявили грамотрицательную бактериемию. На вход модели шли клинические и лабораторные данные за предыдущие 48 часов.

И вот здесь начинается самое интересное: на всей проспективной когорте discrimination оказалась лишь умеренной. До AUROC примерно 0.70 модели добрались только в post-hoc подгруппе — если оставить посевы, взятые на 4–10-й день пребывания в ICU. Причём обычные клинические score тоже были связаны с бактериемией.

Это хороший пример того, почему «мы сделали ML-модель» и «у нас есть клинически полезная модель» — две очень разные стадии исследования. Case mix, момент применения алгоритма и сама логика отбора пациентов могут менять качество сильнее, чем очередная замена одного классификатора на другой.

Но есть важная оговорка: улучшение для дней 4–10 нашли post hoc. После такого анализа очень легко начать рассказывать, что модель просто надо применять в правильный момент. На самом деле эту гипотезу ещё нужно проверить на новой проспективной когорте — иначе мы снова подстраиваем решение под уже увиденные данные.

То есть как будто ценность здесь имеет именно неудача модели. Такие prospective validation papers гораздо лучше показывают расстояние между хорошим retrospective benchmark и реальным clinical ML, чем ещё один AUROC 0.9 на случайном train/test split.

Подробнее

#Benchmark
Nature Prospective validation of machine learning models predicting Gram negative bacteremia in ICU versus clinical scores npj Digital Medicine - Prospective validation of machine learning models predicting Gram negative bacteremia in ICU versus clinical scores
Post #125 197
Medical AI Digest: онкология

За последние три недели в oncology AI особенно заметен сдвиг от «ещё одной модели с высоким AUC» к более практичным вопросам: где алгоритм действительно можно встроить в workflow, когда он должен отказаться от ответа и может ли AI уже не только анализировать опухоль, но и участвовать в создании терапии.

1. Самоуправляемый микроскоп вместо дорогого slide scanner. ALLocate — AI-плагин для обычного микроскопа, который сам ищет информативные области костного мозга и анализирует клетки при подозрении на острый лейкоз. Обучение и тестирование включали >11 000 размеченных областей и 130 000 клеток; независимая multi-institutional проверка — 165 физических стёкол. На slide-level диагнозе точность составила 88%. Здесь важна не столько цифра, сколько попытка сделать pathology AI доступным без WSI-сканера.

2. MSI по H&E, но модель умеет сказать «не знаю». Для colorectal cancer обучили attention-based WSI-модель на 1 242 случаях из трёх архивов и проверили на 1 094 пациентах из пяти независимых внешних когорт. При selective prediction чувствительность была >97%, но автоматическое решение выдавалось только для 40–76% случаев. Остальные отправлялись на стандартное тестирование. Это гораздо реалистичнее идеи «заменим молекулярный тест картинкой»: AI здесь работает как triage.

3. Liquid biopsy + ML для раннего head-and-neck cancer. Модель объединила copy-number, fragment-size и methylation-признаки cfDNA. Обучение — 144 пациента с HNSCC и 148 контролей; внешняя валидация — 193 человека. External AUC — 0.966, чувствительность при 95% specificity — 81.1%. Выглядит сильно, но главный следующий тест — prospective screening в популяции с низкой prevalence: именно там красивые case-control AUC часто оказываются недостаточными.

4. Virtual cell начинает моделировать не клетку, а её реакцию на лечение. ProteinTalks обучили на >38 млн временных измерений белков после perturbations в breast-cancer cell lines. Модель предсказывает drug response и synergy, ищет потенциальные механизмы resistance и переносит представления на organoids и клинические biopsies. Интересный сдвиг: вместо статичной omics-таблицы модель учится на динамике после воздействия препарата.

5. Generative AI проектирует CAR-T binders — и реальная биология быстро показывает границы дизайна. В Nature Biomedical Engineering протестировали 1 758 AI-designed binders к BCMA, CD19 и CD22: от protein binding до T-cell activation и in-vivo killing. Выяснились три типичных провала — tonic signalling, недоступный в нативной структуре epitope и off-target binding. То есть генерация кандидатов уже масштабируется, а bottleneck смещается в экспериментальную проверку того, будет ли красиво спроектированная молекула работать внутри живой системы.

Если читать одну работу целиком — про AI-designed CARs. Она хорошо показывает нынешнее состояние generative biology: сильный computational design сам по себе ещё не терапия, и именно анализ неудачных кандидатов здесь, пожалуй, полезнее очередного рекорда на benchmark.

#MedicalAIDigest #Oncology
  • ❤ 3
Post #124 203
Federated learning в хирургии: когда даже centralized model не спасает

Federated learning обычно продают как красивый ответ на главную проблему медицинского AI: данные лежат в разных клиниках, делиться ими нельзя, значит обучаем модель локально и обмениваемся только весами. FedSurg проверяет, что происходит с этой идеей на реальном хирургическом видео — и результат получился куда полезнее очередного победного benchmark.

В challenge вошли 223 записи лапароскопической аппендэктомии из четырёх немецких центров. На трёх центрах модели обучались федеративно, четвёртый был полностью unseen. Задача — по видео определить степень воспаления аппендикса. Сравнивали три submissions, centralized training, Swarm Learning и несколько вариантов локальной адаптации.

Главная цифра здесь довольно отрезвляющая: даже модель, которой разрешили собрать все training-данные централизованно, получила на unseen-клинике всего 26.31% macro-F1. То есть federated learning действительно добавляет свою цену, но основная проблема начинается раньше: сильный межклинический domain shift и сама сложность задачи.

При этом один устойчивый сигнал всё-таки появился. Подходы, которые моделировали видео во времени, переносились между центрами лучше frame-level классификаторов. А простое fine-tuning на маленьких локальных выборках иногда приводило к classifier collapse — особенно при дисбалансе классов.

Отдельный плюс этой работы в том, что авторы не пытаются превратить слабые абсолютные результаты в «почти готово для клиники». Test set небольшой, статистическая мощность ограничена, а приемлемого клинического порога для такой классификации вообще пока нет.

Для меня это хороший negative-result paper: privacy-preserving обучение само по себе не решает generalization. Если модель разваливается при переходе в новую больницу даже в centralized режиме, более хитрый способ агрегировать веса — уже второй вопрос.

Подробнее

#MedicalImaging #MedicalAIChallenge
  • ❤ 1
  • 🤔 1
Post #123
Channel photo updated
Post #121 207
Как восстановить сосудистую волну без «чёрного ящика»: Bayesian pulse deconvolution

PPG и другие сосудистые сигналы выглядят простыми, но перед любым ML там обычно происходит довольно много «магии»: фильтрация шума, поиск границ пульсовой волны, выделение её формы. Проблема в том, что эти операции связаны между собой — неудачный фильтр может сдвинуть момент пульса и одновременно исказить морфологию волны.

Авторы свежей работы в npj Digital Medicine предлагают решать это одной моделью — Bayesian pulse deconvolution. Это не нейросеть, а аналитическая генеративная модель сосудистого сигнала с физическими и биологическими priors. Она одновременно оценивает искажения сигнала, timing и форму пульсовой волны.

На симуляциях разница заметная: по сравнению с существующими алгоритмами медианная ошибка фильтрации снизилась на 84%, ошибка определения времени пульса — на 60%, а ошибка выделения формы — на 85%.

Но важнее, что метод проверили и на реальных PPG, синхронизированных с ECG. Если считать интервалы R–R на ECG прокси-ground truth, ошибка оценки интервалов по PPG составила 5.1 мс против 8.3 мс у обычных алгоритмов — примерно на 40% меньше, p=1e-10.

Мне здесь нравится сама постановка: вместо ещё одного end-to-end классификатора авторы чинят слой, который часто принимают как «безобидный preprocessing», хотя именно там можно незаметно испортить downstream-анализ. Код открыт, а данные Aurora-BP доступны исследователям по DUA.

Ограничение существенное: самые эффектные цифры получены на симуляциях, а человеческая часть показывает прежде всего точность timing, а не улучшение диагностики или прогноза. Поэтому пока это убедительная методологическая работа про обработку биосигналов, а не доказательство клинического эффекта. Но именно такие методы могут сделать последующий Medical ML заметно честнее.

Подробнее

#Biosignals #ECG #GenerativeAI
Nature Vascular waveform analysis using Bayesian pulse deconvolution npj Digital Medicine - Vascular waveform analysis using Bayesian pulse deconvolution
  • ❤ 1
  • 🥰 1
Older posts →

About this channel

How can I read @medical_ml_radar without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Medical_AI: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Medical_AI have?
Medical_AI (@medical_ml_radar) has 413 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Medical_AI know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →