Языковая модель собрала медкарту из разговора у кресла: 100 приёмов в трёх специальностях
Исследователи научили каскад больших языковых моделей превращать аудиозапись стоматологического приёма в стандартизированную электронную медкарту. На 100 реальных записях по пародонтологии, ортодонтии и ортопедии добавление проверки фактов и консенсусного голосования снизило разброс качества на 33,8–55,9%.
Цель работы — разработать и оценить модульную систему на основе больших языковых моделей (LLM), которая формирует стандартизированные электронные медицинские карты из аудиозаписей стоматологического приёма, сделанных прямо у кресла, — в условиях акустических помех и разнородности клинических специальностей.
Как устроена система
Авторы собрали управляемый конвейер: многоступенчатое улучшение звука, локальное автоматическое распознавание речи и каскадный генератор на LLM. Базовую сквозную систему (система 1) сравнили с системой 2, дополненной двумя модулями. Модуль A собирал сведения из нескольких источников и строил таблицу фактов, модуль B обеспечивал совместную работу нескольких версий ответа с голосованием за консенсус (N = 3, консенсус ≥ 2/3).
Что оценивали
В анализ вошли 100 обезличенных записей амбулаторных приёмов по пародонтологии, ортодонтии и ортопедической стоматологии. Качество выхода оценивали двойным слепым методом: баллы выставляли врачи и автоматическая система оценки — по четырём измерениям, от 0 до 100 по каждому.
- полнота;
- качество языка;
- медицинская точность;
- структурная стандартизация.
Результаты
Система 1 показала клинически приемлемое качество на всех использованных моделях, причём наибольшую стабильность продемонстрировала Kimi-K2. Система 2 повысила устойчивость: стандартное отклонение снизилось на 33,8% в пародонтологии, на 55,9% в ортодонтии и на 42,6% в ортопедической стоматологии, а наибольший выигрыш пришёлся на сложные ортопедические случаи.
Анализ характеристик набора данных и акустических паттернов подтвердил клиническую подлинность собранного корпуса записей и его пригодность для оценки качества работы системы. Баллы, выставленные искусственным интеллектом, коррелировали с оценками экспертов (r = 0,823; R² = 0,678) при устойчивом положительном смещении — в среднем на 12,54 балла выше.
Вывод авторов
Система на LLM, опирающаяся на извлечённые факты и ограниченная консенсусом нескольких версий ответа, продемонстрировала методологическую осуществимость создания электронных медицинских карт из подлинного аудио, записанного у кресла: выросли медицинская точность и согласованность, а разброс результатов в сложных клинических сценариях уменьшился.



