Авторы оценили четыре квантованные LLM, доступные для локального развертывания: DeepSeek-R1 7B и 14B, YandexGPT-5-Lite-8B и GigaChat-20B. Их результаты сравнили с двумя версиями специализированной модели Webiomed SC, обученными на 1 млн и 18 млн медицинских записей. Тестирование проводилось на 171 реальном клиническом случае, диагнозы по которым независимо проверили три врача-эксперта. В итоговую выборку включили только случаи, где специалисты достигли полного согласия.
Лучший результат среди LLM показала YandexGPT-8B: показатель Top-3 Accuracy составил 67%. Это означает, что в 67% случаев правильный диагноз входил в три наиболее вероятных варианта, предложенных моделью. Более специализированная версия Webiomed SC2.1, обученная на 18 млн записей, достигла 78%. Остальные языковые модели уступили: GigaChat-20B показала 56%, DeepSeek-14B – 51%, DeepSeek-7B – 34%. Специализированные модели также работали быстрее: среднее время ответа Webiomed составляло около 0,2 секунды против 1,54 секунды у YandexGPT-8B.
Главным преимуществом LLM оказалась стоимость входа. На настройку YandexGPT-8B исследователям потребовалось 8 часов и вычислительные ресурсы стоимостью 2,3 тысячи рублей. Для базовой версии Webiomed было необходимо 340 часов, а дообучение и валидация более крупной версии заняли еще 168 часов. Вычислительные затраты на этот этап для Webiomed SC2.1 оценили в 31,8 тысячи рублей – примерно в 14 раз больше, чем при настройке LLM.
Однако при постоянной работе преимущество LLM по стоимости исчезает. Для YandexGPT-8B нужен сервер с GPU, содержание которого авторы оценили примерно в 61,4 тысячи рублей в месяц. Специализированной ML-модели достаточно значительно менее мощного оборудования стоимостью около 3,8 тысячи рублей в месяц. В результате эксплуатация LLM обходится примерно в 16 раз дороже, поэтому при большой нагрузке специализированные модели могут быть выгоднее для постоянного использования, несмотря на более дорогую разработку.
Исследователи предлагают использовать двухэтапный подход: сначала на базе открытой LLM за несколько дней создавать прототип и проверять востребованность сервиса, сценарии его применения и требования пользователей, а после подтверждения жизнеспособности проекта переходить к специализированной модели или доработанному LLM-решению. Локальное развертывание языковых моделей, по их оценке, также позволяет работать с медицинскими данными без передачи информации внешним облачным API.
Авторы отдельно подчеркивают, что результаты нельзя рассматривать как полноценную клиническую валидацию LLM. Выборка включала только 171 случай, стоимость интеграции с медицинскими информационными системами не оценивалась, а языковые модели использовались без подключения внешних источников знаний и специализированного дообучения. В дальнейшем исследователи предлагают изучить гибридные архитектуры, в которых LLM применяются для обработки сложной неструктурированной информации, а специализированные ML-модели – для массовых диагностических задач.
Ранее LLM уже начали внедрять в российские медицинские сервисы. Например, летом 2026 года Ассоциация детских ревматологов и Центр технологий для общества «Яндекса» запустили ИИ-ассистента в системе дистанционного мониторинга детей с юношеским артритом. Решение на базе больших языковых моделей помогает собирать недостающие данные у пациентов, готовить резюме обращений и черновики ответов для врачей. По данным разработчиков, использование ассистента позволило в несколько раз сократить время подготовки ответа, а долю обращений, решенных врачом при первом контакте, увеличить на 40%.


