Универсальная модель Gemini нашла кариес по внутриротовым фото без дообучения: чувствительность 0,95

На 1255 внутриротовых снимках проверили, может ли универсальная мультимодальная модель находить кариес без обучения под задачу. В режиме zero-shot чувствительность на уровне снимка достигла 0,95, но при склонности к гипердиагностике авторы требуют клинической валидации до реального скрининга.

Внутриротовая фотография — самый доступный способ увидеть зубы дистанционно, но её интерпретация требует специалиста. Диагностическое исследование проверило, способна ли универсальная мультимодальная модель (LMM) находить кариес по таким снимкам без обучения под конкретную задачу — оценивая как классификацию на уровне изображения, так и локализацию поражения на уровне отдельного зуба.

Как проверяли

Использовали эталонную тестовую выборку из 1255 общедоступных внутриротовых снимков. Модели Gemini 3.1 в вариантах reasoning и instant запрашивали через Vertex AI API без сохранения состояния, со структурированными подсказками для последовательного сканирования зуб за зубом. Каждую конфигурацию прогоняли в 10 независимых запусках. Работали в двух режимах: zero-shot — без единого размеченного примера, и five-shot — с пятью аннотированными образцами.

Предсказания модели (ограничивающие рамки) сравнивали с экспертной разметкой по критерию greedy Intersection-over-Union (IoU ≥ 0,5). Истинно-положительным считали пространственное совпадение на уровне зуба либо хотя бы одно верно локализованное поражение на уровне снимка. Качество описывали чувствительностью, точностью (precision), F1-мерой и mAP@50.

Что получили

Результат сильно зависел от ракурса снимка и типа модели: надёжные показатели давали в основном reasoning-модели на окклюзионных изображениях. На уровне снимка режим zero-shot показал высокую чувствительность при более низкой точности — 0,95, 0,80 и 0,87 для чувствительности, точности и F1 соответственно. Режим five-shot дал более сбалансированный профиль: 0,88, 0,87 и 0,87.

На уровне отдельного зуба zero-shot reasoning сохранил тот же приоритет чувствительности над точностью: чувствительность, точность, F1 и mAP@50 составили 0,88, 0,49, 0,63 и 0,62. Five-shot улучшил точность и выровнял локализацию — соответствующие значения 0,77, 0,57, 0,64 и 0,63.

Выводы авторов

Универсальные мультимодальные модели вроде Gemini потенциально способны стать масштабируемым автоматизированным инструментом скрининга кариеса для теле-стоматологии без узкоспециальной донастройки. Инженерия подсказок эффективно регулирует баланс между чувствительностью и точностью.

Склонность модели к гипердиагностике требует строгой клинической валидации и контроля до реального применения в качестве публичного скринингового инструмента.
Универсальная модель Gemini нашла кариес по внутриротовым фото без дообучения: чувствительность 0,95 - ClinicIQ Journal