В исследовании приняли участие 623 человека без медицинского образования и 153 врача первичного звена. Для эксперимента ученые использовали алгоритм, обученный на 108 585 изображениях кожных заболеваний из 16 различных наборов данных.
Участникам предлагали диагностировать заболевания кожи по 12 клиническим изображениям, используя различные варианты ИИ-поддержки: только прогноз модели с уровнем уверенности, похожие клинические случаи, тепловые карты или текстовые объяснения, сформированные LLM. При этом неспециалисты определяли, является ли родинка злокачественной, а врачи проводили дифференциальную диагностику нескольких кожных заболеваний.
Использование ИИ повысило точность диагностики у неспециалистов с 69,7% до 75,8%. Наибольший эффект обеспечили объяснения на основе LLM, увеличившие точность на 7,7%. Однако именно они сильнее других усиливали доверие к алгоритму. Если ИИ давал правильный ответ, такие объяснения повышали точность диагностики на 13,4%, но при ошибке модели снижали ее на 21,1%, поскольку пользователи продолжали следовать рекомендациям системы.
У врачей результаты оказались иными. Использование ИИ повысило точность постановки первого диагноза на 21,5%, а вероятность включить правильный диагноз в тройку наиболее вероятных – на 43,5%. При этом наиболее эффективным оказался вариант, когда система предоставляла только прогноз без дополнительных текстовых объяснений. По мнению исследователей, специалисты оценивают рекомендации ИИ критически, сопоставляя их со своими знаниями и клиническим опытом, поэтому чаще выявляют ошибки алгоритма.
Авторы также протестировали модель, обученную с учетом различий в оттенках кожи пациентов. Она повысила общую точность диагностики и одновременно сократила различия в качестве распознавания заболеваний у пациентов с разным цветом кожи почти на 47% среди неспециалистов и примерно на 36% среди врачей.
Кроме того, исследование показало, что степень доверия к ИИ зависит от того, когда пользователь получает рекомендацию. Если подсказка появляется до того, как человек самостоятельно сформулирует предварительный диагноз, вероятность некритичного согласия с алгоритмом заметно возрастает. Наиболее склонными полагаться на ИИ оказались участники, которые хуже всего справлялись с диагностикой без его помощи.
По мнению авторов, результаты свидетельствуют, что универсального подхода к разработке медицинских ИИ-систем не существует. Одни и те же объяснения могут быть полезны врачу, но вводить в заблуждение пользователя без медицинской подготовки. Так, исследователи считают, что более безопасным подходом может стать сценарий, при котором человек сначала самостоятельно формулирует диагностическую гипотезу, а затем получает рекомендацию ИИ как дополнительное мнение, а не готовое решение.
Проблема взаимодействия пользователей с медицинским ИИ поднимается и в других исследованиях. Так, ученые медицинского факультета Университета Бенхи (Египет) установили, что лишь 18,4% студентов-медиков и 19,6% медицинских работников положительно относятся к использованию искусственного интеллекта, несмотря на его широкое применение в обучении и работе. Авторы связали это с опасениями по поводу ошибок алгоритмов, предвзятости моделей и защиты персональных данных.
Вопрос безопасного использования медицинского ИИ становится все более актуальным на фоне роста популярности таких сервисов. По данным опроса West Health-Gallup, около 66 млн американцев уже используют искусственный интеллект для получения медицинской информации, а каждый четвертый взрослый обращается к таким инструментам за советами по вопросам физического и психического здоровья.
