Одной из причин исследователи называют неравномерное представительство языков в данных, на которых обучаются ИИ-модели. Например, в корпусе ROOTS (крупном наборе текстов на разных языках для обучения ИИ) на английский приходится 30,03% данных, на китайский – 16,16%, французский – 12,9%, испанский – 10,85%. Еще заметнее дисбаланс в специализированных медицинских данных: MMedC объемом 25,5 млрд токенов (слов и частей слов, на которые ИИ разбивает текст при обработке) включает шесть языков, причем 41,4% приходится на английский. Арабский, хинди, бенгальский и португальский в нем отсутствуют.
Чтобы оценить последствия такого дисбаланса, авторы отобрали 442 вопроса из MedQA (набора заданий медицинских лицензионных экзаменов) на английском и китайском языках. Вопросы перевели на арабский, бенгальский, хинди и португальский, после чего предложили их четырем моделям – DeepSeek Chat от DeepSeek, Gemini 2.5 Flash от Google, GPT-3.5 Turbo и GPT-4o от OpenAI.
Затем исследователи сравнили результаты с показателями моделей на исходных английских и китайских вопросах. Для португальского точность снизилась всего на 0,73%, для хинди – на 4,64%, бенгальского – на 7,24%, арабского – на 10,29%. Небольшое снижение для португальского авторы связывают с его близостью к другим романским языкам, которые лучше представлены в обучающих данных. Результаты, по их мнению, показывают, что способность современных LLM хорошо переводить тексты не позволяет полностью компенсировать нехватку обучающих данных на отдельных языках. При этом часть выявленных различий могла быть связана с ошибками автоматического перевода вопросов, что авторы называют одним из ограничений эксперимента.
По словам исследователей, в здравоохранении значение имеет не только язык, на котором пациент обращается к ИИ, но и страна его проживания. Клинические рекомендации и распространенность заболеваний могут различаться в зависимости от региона, поэтому одинаковые ответы модели не всегда подходят пользователям из разных стран. Авторы предлагают учитывать местные медицинские стандарты, в частности, с помощью RAG-систем (технологии, при которой ИИ перед ответом получает информацию из заданных источников), подключенных к актуальным региональным клиническим рекомендациям.
Еще одним направлением исследователи называют создание международной базы клинических рекомендаций из разных стран и расширение многоязычных медицинских наборов данных, размеченных специалистами. Кроме того, предлагается разработать специальные тесты для проверки качества медицинских LLM на разных языках, регулярно публиковать результаты таких проверок и учитывать обратную связь врачей и пациентов.
По мнению авторов, языковые различия должны стать отдельным критерием оценки медицинских ИИ-систем. Если модели будут хорошо работать преимущественно с языками, широко представленными в обучающих данных, внедрение таких технологий может дать пользователям неравный доступ к надежной медицинской информации в зависимости от того, на каком языке они говорят.
Проблема языкового неравенства актуальна и для доступа к медицинским знаниям в целом. Специалисты Елецкого государственного университета им. И.А. Бунина выяснили, что 85% опрошенных студентов медицинского факультета считают изучение иностранного языка важной частью подготовки врача. При этом 51,7% респондентов назвали главным преимуществом владения английским возможность читать научную литературу в оригинале, а 19% – общаться с зарубежными коллегами и пациентами.


