Crescent Moon Health.

Помогаем выбирать безопасное лечение и надежных врачей

Новость

Почему высокие показатели ИИ в медицине не гарантируют безопасность пациентов

По данным The Clinical Trial Vanguard, высокие результаты клинических ИИ-систем на стандартных бенчмарках не коррелируют с улучшением исходов у пациентов.

Почему высокие показатели ИИ в медицине не гарантируют безопасность пациентов

Издание формулирует требование: до интеграции в клинические рабочие процессы такие инструменты должны проходить валидацию методом рандомизированных контролируемых испытаний (РКИ), аналогичных регистрационным исследованиям лекарственных средств.

Разрыв между метрикой и пациентом

Оценка медицинского ИИ строится на тестировании алгоритма на размеченных датасетах. Измеряются точность, чувствительность, специфичность, площадь под ROC-кривой (AUC). Эти показатели описывают работу модели на фиксированных данных, а не её поведение в реальной клинической среде.

Дрейф распределения, неоднородность популяции, различия в технике забора биоматериала, ошибки на этапе интеграции в рабочий процесс — факторы, способные обнулить преимущество, зафиксированное на тестовом наборе. The Clinical Trial Vanguard указывает: для решения о внедрении ИИ-инструмента в рутинную практику требуются проспективные исследования с заранее определёнными клиническими конечными точками и контрольной группой. Технические метрики отдельно от исходов у пациентов доказательной силы не имеют.

РКИ в этой логике выполняет функцию, аналогичную регистрационным испытаниям лекарственных средств: проверяется не корректность работы алгоритма на данных, а его влияние на клинически значимый результат — выживаемость, частоту осложнений, продолжительность госпитализации. Ретроспективные сравнения и квазиэкспериментальные дизайны такой нагрузки не несут.

Пробелы в дизайне исследований

Параллельно STAT опубликовал материал о структурных недостатках реестра ClinicalTrials.gov. Издание обращает внимание на отсутствие обязательной отметки о беременности и лактации участниц — параметре, определяющем применимость полученных данных для оценки безопасности терапии в этих группах населения.

Ситуация характерна для более широкой проблемы доказательной медицины: даже действующие механизмы регистрации клинических исследований не всегда содержат обязательные поля, необходимые для полноценной оценки рисков. Для медицинского ИИ проблема острее — единые стандарты отчётности результатов клинической валидации отсутствуют, а дизайн исследования определяется разработчиком алгоритма.

Что проверять пациенту

Перед согласием на применение ИИ-инструмента в рамках лечения пациент вправе запросить у клиники следующие сведения:

  • Публикация результатов валидации в рецензируемом журнале.
  • Дизайн исследования: ретроспективный анализ данных или проспективное РКИ.
  • Размер выборки и характеристика популяции.
  • Конечные точки: технические метрики (точность модели) либо клинические исходы (смертность, осложнения, качество жизни).
  • Сведения о конфликте интересов разработчиков и исследователей.
  • Срок действия сертификата регулятора и условия применения.

Регуляторный контекст

Дискуссия о границах применения ИИ не ограничивается медициной. Пример — позиция китайских властей в отношении ИИ-генерируемых дорам: государство ограничивает автоматизацию контента и поддерживает работу живых актёров. Логика сопоставима — в зонах повышенного риска замена человеческого фактора автоматизированными системами требует отдельного регуляторного обоснования и публичной верификации результатов.