OpenEvidence относится к системам с поиском по медицинским источникам: перед формированием ответа платформа извлекает информацию из отобранной биомедицинской литературы и приводит ссылки на использованные материалы. По приведенным авторами данным самой компании, сервис ежедневно используют более 40% врачей в США. Исследователи отмечают, что масштабы внедрения технологии пока значительно опережают объем независимых данных о ее эффективности и безопасности.
Наиболее высокие результаты OpenEvidence показала в задачах, основанных на клинических рекомендациях. Например, при ответах на 126 вопросов по костно-суставным инфекциям точность системы составила 94,4%, или 119 правильных ответов из 126. В другом исследовании, посвященном неврологическим рекомендациям, показатель достиг 82%. При оценке 50 реальных вопросов врачей OpenEvidence давала клинически релевантные ответы, подкрепленные существующими доказательствами, в 48% случаев, тогда как у универсальных языковых моделей этот показатель составлял менее 5%.
При этом преимущество специализированной медицинской системы сохранялось не во всех сценариях. В исследовании по структурным заболеваниям сердца ChatGPT-4o полностью правильно ответил на 66,7% вопросов, а OpenEvidence – на 26,7%. Авторы обзора связывают такие различия в том числе с неодинаковой сложностью задач и подчеркивают, что результаты отдельных тестов нельзя напрямую переносить на всю клиническую практику. Исследования существенно различались по специальностям, наборам вопросов, моделям для сравнения и критериям оценки.
Отдельным преимуществом систем с поиском по источникам оказалась более высокая надежность цитирования. В исследовании по имплантологии OpenEvidence достигла точности 80% без сфабрикованных ссылок, тогда как у универсальных генеративных моделей галлюцинации встречались значительно чаще. Однако наличие корректной ссылки само по себе не гарантировало правильности ответа: исследователи фиксировали случаи неверной интерпретации информации даже при отсутствии вымышленных источников. Поэтому снижение числа галлюцинаций авторы не считают эквивалентом общей клинической безопасности системы.
Еще одно ограничение связано с влиянием ИИ на решения врачей. В исследованиях с реальными клиническими случаями OpenEvidence чаще подтверждала уже выбранную врачом тактику, чем приводила к ее изменению. Авторы считают, что на нынешнем этапе подобные системы эффективнее использовать для поиска, обобщения и контекстуализации медицинских данных, а не как автономный инструмент принятия решений. Они также указывают на риск чрезмерного доверия к уверенно сформулированным ответам ИИ.
Доказательная база пока остается небольшой: в обзор вошли только 11 исследований, количество вопросов или клинических случаев в отдельных работах составляло от 15 до 130, а большинство результатов оценивали эксперты, а не реальные исходы лечения пациентов. Кроме того, OpenEvidence постоянно обновляется – меняются базовые модели, механизмы поиска и наборы источников. Из-за этого результаты тестирования, полученные в определенный момент времени, могут быстро устаревать.
Авторы считают необходимыми проспективные исследования OpenEvidence в реальной клинической практике, единые критерии оценки медицинских ИИ-систем и регулярное повторное тестирование после их обновлений. Отдельного изучения требуют вопросы безопасности, конфиденциальности и прозрачности поиска источников. По мнению исследователей, широкое распространение таких платформ среди врачей пока не сопровождается сопоставимым объемом данных, позволяющих оценить их влияние на качество медицинской помощи и результаты лечения пациентов.
Сейчас OpenEvidence продолжает развивать инструменты для повышения надежности ответов. Компания запустила модуль EvidenceGrade, который оценивает качество используемых медицинских публикаций по шкале от A до D. Инструмент учитывает дизайн исследования, согласованность результатов, точность и применимость данных к конкретному вопросу и должен помогать врачам отличать более надежные доказательства от экспертных мнений, отдельных клинических случаев и доклинических данных. Кроме того, разработчик расширил доступ к Doctor Dialer – ИИ-инструменту для защищенной коммуникации врачей с пациентами, поддержки клинических решений и ведения документации.
В 2025 году OpenEvidence привлекла $210 млн в инвестиционном раунде под руководством Google Ventures и Kleiner Perkins, после чего оценка компании достигла $3,5 млрд. Тогда же разработчик анонсировал ИИ-агента DeepConsult, предназначенного для углубленного анализа и сопоставления сотен научных публикаций. В отличие от основной платформы, рассчитанной на быстрые ответы во время работы с пациентами, DeepConsult ориентирован на подготовку развернутого доказательного анализа медицинской литературы.
