#ИИ #аналитика
Большие языковые модели против специализированного медицинского ИИ: российские исследователи сравнили кто точнее — и сколько это стоит
Специалисты компании Webiomed сравнили большие языковые модели DeepSeek, YandexGPT и GigaChat со специализированными ML-моделями Webiomed SC на задачах первичной диагностики. Тест провели на 171 клиническом случае, которые предварительно разметили три врача-эксперта. Оценивали не только качество диагностики, но и время разработки, вычислительные затраты и стоимость эксплуатации.
Результат интересный. Лучшая из протестированных LLM — YandexGPT-5-Lite-8B — показала точность Top-3 67%. Ровно столько же получила специализированная ML-модель, обученная на 1 млн медицинских записей. Но когда объем обучающих данных специализированной модели увеличили до 18 млн записей, ее результат вырос до 78%. То есть на большой медицинской выборке специализированный ИИ пока заметно выигрывает у универсальной LLM.
Зато LLM разгромно выигрывает по скорости создания прототипа: 8 человеко-часов на настройку против 340 человеко-часов для базовой ML-модели. Вычислительные затраты на этапе настройки LLM оказались в 14 раз ниже, чем при обучении специализированной модели на большом корпусе. Но есть важный нюанс: уже при промышленной эксплуатации ситуация переворачивается — расходы на работу LLM существенно выше, чем на обслуживание специализированных моделей.
Получается довольно трезвый ответ на вопрос «заменят ли LLM специализированный медицинский ИИ?». Для быстрого прототипа — LLM выглядят очень привлекательно: быстро и относительно дешево. Для массовой промышленной СППВР специализированные модели пока выигрывают за счет точности и более низкой стоимости эксплуатации. Возможно, будущее медицинского ИИ не в выборе между LLM и классическим ML, а в их комбинации внутри одной системы.
@medicalksu теперь и в MAX
Post #6506
696
- ❤ 4