На первом этапе авторы предлагают проводить техническую валидацию ИИ на независимых данных нескольких медицинских центров. Это должно показать, сохраняет ли модель точность при работе с пациентами из разных популяций, данными из разных учреждений и различными способами их получения. Перед проверкой версию модели, ее параметры и пороговые значения необходимо зафиксировать: дополнительная настройка по результатам тестирования не допускается, а измененный алгоритм должен рассматриваться как новая версия и проходить повторную проверку.
Второй этап предполагает испытание ИИ в реальной больничной инфраструктуре, но в «теневом», или невидимом для врачей, режиме. Алгоритм получает реальные клинические данные и формирует результаты, однако они не используются при принятии медицинских решений. Это позволяет оценить стабильность системы, задержки при обработке информации, частоту сбоев, пропускную способность, вычислительную нагрузку и устойчивость к изменениям поступающих данных без риска повлиять на лечение пациентов.
На третьем этапе исследователи предлагают оценивать взаимодействие врача и ИИ. Сначала самостоятельную диагностическую способность алгоритма можно сравнить с работой специалистов разного уровня подготовки, а затем проверить, как помощь ИИ меняет точность, скорость и уверенность врачей. Отдельно необходимо оценивать риск автоматизационного смещения – ситуации, когда специалист чрезмерно доверяет алгоритму и из-за ошибочной подсказки может изменить первоначально правильное решение. Для подтверждения пользы совместной работы предлагаются исследования с несколькими врачами и множеством клинических случаев.
Четвертый этап должен показать уже не просто высокую точность модели, а ее реальную клиническую пользу. Для этого предлагается проводить проспективные рандомизированные исследования, сравнивая стандартную медицинскую помощь с использованием ИИ. В зависимости от назначения системы можно оценивать точность диагностики, скорость работы, число ненужных вмешательств, осложнения, повторные госпитализации, продолжительность пребывания в больнице и другие исходы для пациентов. На этой стадии также предлагается учитывать экономическую эффективность технологии, включая затраты и потенциальную экономию для системы здравоохранения.
Пятый этап охватывает период после внедрения ИИ в обычную клиническую практику. Разработчики и медицинские организации должны отслеживать долгосрочную эффективность и безопасность алгоритма, его работу в разных учреждениях и группах пациентов, а также возможный дрейф данных (изменение статистических свойств) и снижение точности со временем. При появлении серьезных отклонений предусмотрены возврат к предыдущим этапам проверки, локальная перенастройка, откат к ранее проверенной версии или временная приостановка использования системы.
Всего исследователи систематизировали восемь методологических подходов и 18 вариантов проведения исследований – от многоцентровой ретроспективной проверки и «теневых» испытаний до оценки взаимодействия врачей с ИИ, рандомизированных клинических испытаний и пострегистрационного мониторинга. При этом пятиэтапная схема не является строго линейной: обновление алгоритма, ухудшение его показателей, дрейф данных или появление сигналов безопасности могут потребовать возвращения на более раннюю стадию оценки.
Авторы подчеркивают, что предложенная система пока является концептуальной методологической моделью, а не клинически подтвержденным стандартом. Ее применимость еще предстоит проверить в разных медицинских областях и системах здравоохранения. Кроме того, схема в первую очередь разработана для диагностических и прогностических медицинских ИИ-систем. Для генеративных, непрерывно обучающихся и других типов алгоритмов потребуется дополнительная адаптация.
Ранее исследователи из Медицинского колледжа Вейлла Корнелла (США), Гетеборгского университета (Швеция) и других научных центров представили концепцию ASTRA – многоагентной системы ИИ для автоматизации работы центров клинических исследований. Центральный ИИ-агент в ней должен координировать специализированные цифровые команды, занимающиеся управлением данными, контролем качества, биостатистикой, мониторингом безопасности и другими процессами, тогда как ключевые клинические и регуляторные решения остаются за специалистами.



