Бюро продуктовых исследований в фемтехе и первое русскоязычное медиа о технологиях в сфере женского здоровья. Рассказываем о новинках, берем интервью у профессионалов индустрии, консультируем и публикуем вакансии
18+
Партнерство https://goo.su/dq6T
Post #3167
1.52K

📈 29 миллионов шагов, 6 миллионов ударов сердца, и ни одного надёжного вывода: кейс ChatGPT Health
Привет! Меня зовут Ольга Титова, я работаю AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и каждую неделю делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.
Сегодня — разбор кейса, который отлично иллюстрирует, где проходит граница между впечатляющей демонстрацией и надёжным продуктом.
💥 Что случилось?
Технологический обозреватель Washington Post Джеффри Фаулер загрузил в ChatGPT Health данные с Apple Watch за 10 лет — 29 миллионов шагов, 6 миллионов измерений пульса — и попросил оценить здоровье сердца. Результат оказался неожиданным ChatGPT Health (о котором мы уже писали в этом году) поставил оценку F, очень низкий балл. При повторных запросах с теми же данными оценка прыгала.
Журналист поочередно получил оценки C и B, задавая один вопрос и используя те же данные. При этом врач, к которому обратился Фаулер, сказал, что риск сердечных проблем у него крайне низкий — настолько, что страховая могла бы отказаться покрывать дополнительные обследования просто потому, что для них нет оснований.
🔶Почему так произошло?
ИИ интерпретирует данные без понимания контекста. ChatGPT Health опирался на показатели вроде VO2 max и вариабельности пульса (HRV), которые в Apple Watch являются оценками тенденций, а не точными медицинскими измерениями. Он также не учёл, что заметные изменения в данных о пульсе в определенный момент были связаны не с физиологией, а со сменой модели часов и улучшением датчиков.
ИИ теряет одни данные и додумывает другие. В нескольких сессиях ChatGPT Health упускал базовые параметры (например, возраст и пол пользователя), несмотря на имеющийся доступ к этим данным. А иногда игнорировал свежие лабораторные результаты, которые тоже были подключены.
Эксперты говорят, что выводы не основаны ни на чем. Кардиолог Эрик Топол, один из ведущих специалистов по ИИ в медицине, прямо сказал, что выводы сервиса не имеют обоснования. Он назвал такие оценки двойным риском: они могут перепугать здоровых людей или успокоить тех, кто действительно нуждается в помощи.
💥 Техническая суть проблемы
Мионг Ча, Chief Product Officer в Verily (ранее — Apple), написал подробный технический разбор в своём блоге. Он объяснил, что универсальные LLM не были построены для анализа медицинских временных рядов. Они могут впечатляюще имитировать статистическое мышление, но надёжность этой имитации неравномерна.
🔶 Также важно, что данные с Apple Watch — это не готовая аналитика, а сырой поток.
При экспорте из Apple Health туда попадают все зашумлённые считывания, которые собственные алгоритмы Apple фильтруют и отбрасывают. LLM видит всё, но не применяет инженерную логику валидации, которую Apple годами выстраивала для каждой функции.
Андрей Карпатый, один из основателей и бывших сотрудников OpenAI, называет это «network-to-product gap», разрывом между нейросетью и продуктом. Он вспоминает, как в 2013 году проехал на беспилотном автомобиле 40 минут без единой ошибки и решил, что автономное вождение вот-вот станет реальностью. Двенадцать лет спустя мы всё ещё работаем над этим. Демо требует, чтобы работало что-то одно. А продукт — чтобы работало всё сразу, особенно в областях, где цена ошибки высока.
💥 Значит ли это, что LLM бесполезны для здоровья?
Нет. LLM отлично справляются там, где задача задействует их сильные стороны: объяснить, а что вообще такое VO2 max, помочь разобраться в результатах конкретных анализов с конкретными вводными, подготовить вопросы для визита к определенному врачу. Сам Фаулер отметил, что ему понравилось использовать ChatGPT Health для визуализаций и узких вопросов.
Проблема начинается там, где интерфейс приглашает задавать неограниченные вопросы о здоровье (такие как «оцени моё сердце»), а модель уверенно отвечает, не имея для этого надёжных оснований.
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #ОльгаТитова
Привет! Меня зовут Ольга Титова, я работаю AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и каждую неделю делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.
Сегодня — разбор кейса, который отлично иллюстрирует, где проходит граница между впечатляющей демонстрацией и надёжным продуктом.
💥 Что случилось?
Технологический обозреватель Washington Post Джеффри Фаулер загрузил в ChatGPT Health данные с Apple Watch за 10 лет — 29 миллионов шагов, 6 миллионов измерений пульса — и попросил оценить здоровье сердца. Результат оказался неожиданным ChatGPT Health (о котором мы уже писали в этом году) поставил оценку F, очень низкий балл. При повторных запросах с теми же данными оценка прыгала.
Журналист поочередно получил оценки C и B, задавая один вопрос и используя те же данные. При этом врач, к которому обратился Фаулер, сказал, что риск сердечных проблем у него крайне низкий — настолько, что страховая могла бы отказаться покрывать дополнительные обследования просто потому, что для них нет оснований.
🔶Почему так произошло?
ИИ интерпретирует данные без понимания контекста. ChatGPT Health опирался на показатели вроде VO2 max и вариабельности пульса (HRV), которые в Apple Watch являются оценками тенденций, а не точными медицинскими измерениями. Он также не учёл, что заметные изменения в данных о пульсе в определенный момент были связаны не с физиологией, а со сменой модели часов и улучшением датчиков.
ИИ теряет одни данные и додумывает другие. В нескольких сессиях ChatGPT Health упускал базовые параметры (например, возраст и пол пользователя), несмотря на имеющийся доступ к этим данным. А иногда игнорировал свежие лабораторные результаты, которые тоже были подключены.
Эксперты говорят, что выводы не основаны ни на чем. Кардиолог Эрик Топол, один из ведущих специалистов по ИИ в медицине, прямо сказал, что выводы сервиса не имеют обоснования. Он назвал такие оценки двойным риском: они могут перепугать здоровых людей или успокоить тех, кто действительно нуждается в помощи.
💥 Техническая суть проблемы
Мионг Ча, Chief Product Officer в Verily (ранее — Apple), написал подробный технический разбор в своём блоге. Он объяснил, что универсальные LLM не были построены для анализа медицинских временных рядов. Они могут впечатляюще имитировать статистическое мышление, но надёжность этой имитации неравномерна.
🔶 Также важно, что данные с Apple Watch — это не готовая аналитика, а сырой поток.
При экспорте из Apple Health туда попадают все зашумлённые считывания, которые собственные алгоритмы Apple фильтруют и отбрасывают. LLM видит всё, но не применяет инженерную логику валидации, которую Apple годами выстраивала для каждой функции.
Андрей Карпатый, один из основателей и бывших сотрудников OpenAI, называет это «network-to-product gap», разрывом между нейросетью и продуктом. Он вспоминает, как в 2013 году проехал на беспилотном автомобиле 40 минут без единой ошибки и решил, что автономное вождение вот-вот станет реальностью. Двенадцать лет спустя мы всё ещё работаем над этим. Демо требует, чтобы работало что-то одно. А продукт — чтобы работало всё сразу, особенно в областях, где цена ошибки высока.
💥 Значит ли это, что LLM бесполезны для здоровья?
Нет. LLM отлично справляются там, где задача задействует их сильные стороны: объяснить, а что вообще такое VO2 max, помочь разобраться в результатах конкретных анализов с конкретными вводными, подготовить вопросы для визита к определенному врачу. Сам Фаулер отметил, что ему понравилось использовать ChatGPT Health для визуализаций и узких вопросов.
Проблема начинается там, где интерфейс приглашает задавать неограниченные вопросы о здоровье (такие как «оцени моё сердце»), а модель уверенно отвечает, не имея для этого надёжных оснований.
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #ОльгаТитова
- ❤ 24
- 🔥 9
- 👍 4
- 💔 1














