Здоровье - это очень важно. И совершенно естественно, что с тех пор, как алгоритмы машинного обучения стали достаточно точными, их всевозможными образами пытаются примотать скотчем к медицине. Начинали, конечно, ещё с чистого компьютерного зрения (в разделе Reader Study есть сравнение с людьми) и всяких разных снимков. Хотя были и робкие попытки диагностики. Тогда, в целом, самый здравый вывод из исследований звучал примерно так: нейросети уже лучше плохих врачей, но хуже хороших.
А потом была пандемия 🦠 и скачкообразный рост всего связянного с медициной. Так что, вероятно, этот тезис был лишь ещё больше усилен. Развивались все области машинного обучения – что там только не проворачивали, COVID-19 даже по звуку кашля определяли (тема развивается теперь и вне ковида).
С резким ростом способностей и популярности LLM ассистентов, естественно, не пришлось долго ждать и их применения к домену 🏥
Например, не так давно наш GigaChat сдал экзамен на врача, существует и целый легион открытых англоязычных моделей: BioMedGPT, ClinicalGPT, medAlpaca, etc.
И вот недавно наткнулся на BioMistral. В статье по метрикам 🌿 среди открытых и есть демка, поэтому решил попробовать. В целом, работает неплохо и лично мне понравилось.
Однако, обнаружил интересную особенность.
Я решил пробовать что-то несложное и собрал просто таки провокационный промт, с максимально специфичными для бактериальной пневмонии симптомами:
Let's assume that a certain patient has the following symptoms:
- High temperature that does not depend on the time of day and has been persistent for the 7th day. It is poorly reduced by drugs.
- Almost no cough, but when present, it is productive with green sputum.
- One side of the chest lags behind the other during breathing.
- The patient feels localized pain during deep inhalation.
Answer with a list of the diseases from more likely to less likely that could cause such a clinical picture, in format [Disease1 (probability %), Disease2 (probability %), ...]. Probability should represent your inner confidence in the diagnosis based on the information provided.
И ChatGPT3.5, ChatGPT4 и Gemini Advanced отвечают очень похоже (и в соответствии с ожидаемым). Вот ответ ChatGPT4:
Bacterial pneumonia (80%), Pleural effusion (60%), Empyema (50%), Lung abscess (40%), Pneumothorax (30%)
В то время, как BioMistral:
COVID-19 (95%), Acute Pericarditis (40%), Pleural Effusion (35%), Chronic Lung Disease (30%), Pneumonia (25%), Heart Attack (20%)
Очень часто при любом упоминании кашля и температуры в ответ COVID-19 на первом месте, а иногда вообще только он.
Ещё более удивительно, что модель общего назначения, на которой BioMistral основан – Mistral 7B Instruct v0.1, отвечает более верно (т.е. без ковида и ответы близки к тем, что у ChatGPT выше).
Возможно ли, что проблема кроется в факте претрейна на датасете Pubmed (или SFT с участием PubmedQA)?
Не знаю, какая там статистика, но вполне было бы объяснимо, если датасеты отражают реальный информационный перекос по этой теме.
Тем не менее, в целом работа🔥 Это важная и нужная тема.