Osler отвечает примерно за 5 секунд и предназначена для вопросов, возникающих непосредственно во время приема пациентов; она станет моделью по умолчанию на платформе. Sackett затрачивает около 30 секунд и проводит более глубокий анализ доказательной базы, запрашивая при необходимости дополнительный клинический контекст. Snow, пришедшая на смену Deep Consult, формирует ответ в течение примерно пяти минут, изучая несколько направлений медицинской литературы. Все три модели соответствуют единым стандартам клинической точности, различаясь лишь скоростью и глубиной поиска.
Флагманская модель Darwin показала 100% на бенчмарке MedQA, основанном на вопросах медицинских лицензионных экзаменов, а также 72,8% – на MedXpertQA, 82,7% – на HealthBench Professional и 87,2% – на NOHARM, превзойдя конкурирующие решения. Доступ к ней ограничен из-за рисков двойного использования в таких областях, как вирусология, биологическое оружие и редактирование герминальной линии человека. Среди первых пользователей – американская Национальная организация редких заболеваний, которая применит Darwin для сложных случаев.
Запуск моделей последовал за раундом финансирования на $250 млн при оценке в $12 млрд в январе 2026 года. В июле OpenEvidence заключила партнерство с детской больницей Бостона для интеграции ИИ в электронные медицинские карты и изучения влияния на оказание помощи, а также расширила доступ для клинического персонала больниц Нью-Йорк-Пресвитериан, Колумбийского университета и Медицинского колледжа Вейл Корнелл. Компания планирует постепенно внедрять проверенные возможности Darwin в модели Osler, Sackett и Snow по мере подтверждения их безопасности.
В августе 2026 года международная группа исследователей систематизировала первые данные об эффективности OpenEvidence – платформы на основе искусственного интеллекта, предназначенной для поиска медицинской информации и поддержки принятия клинических решений. Авторы проанализировали 11 исследований, опубликованных в 2024–2026 годах. В целом система давала клинически релевантные и подкрепленные источниками ответы и реже выдумывала ссылки, чем универсальные большие языковые модели. Однако ее результаты заметно различались в зависимости от медицинской задачи.


