Новый инструмент выявляет скрытые ошибки в данных для медицинского ИИ

Исследователи разработали способ находить в медицинских наборах данных скрытые закономерности, из-за которых искусственный интеллект может делать правильные выводы по неправильным причинам. Инструмент проверяет данные ещё до внедрения модели и показывает, какие особенности сбора информации способны привести к ошибкам при работе с реальными пациентами.

Работу провели специалисты Университета Джонса Хопкинса (Johns Hopkins University) совместно с федеральными экспертами США по оценке медицинских изделий. Старшими авторами стали Натан Дренкоу (Nathan Drenkow) и Матиас Унберат (Mathias Unberath).

Результаты опубликованы в журнале npj Digital Medicine.

Почему медицинский ИИ может «угадать» диагноз

Системы искусственного интеллекта (ИИ) обучаются находить статистические закономерности в больших массивах информации. Например, модель может анализировать медицинские изображения и определять вероятность злокачественной опухоли.

Проблема заключается в том, что алгоритм самостоятельно выбирает признаки, которые помогают получить наиболее точный ответ. При этом он не понимает, имеют ли найденные закономерности клинический смысл.

Модель может обратить внимание не на особенности опухоли, а на качество изображения, тип оборудования, название больницы или предмет, случайно попавший в кадр. Пока те же особенности сохраняются и в обучающих, и в проверочных данных, точность будет выглядеть высокой.

Но после переноса системы в другую клинику побочный признак исчезнет — и модель начнёт ошибаться.

Такое поведение называют обучением по ложным сокращённым признакам. Алгоритм находит простой путь к правильному ответу, не осваивая закономерность, ради которой его создавали.

Причём здесь «умная» лошадь Ганс

Авторы сравнивают эту проблему с феноменом Умного Ганса.

В начале XX века прославилась лошадь, которая якобы умела считать и отвечала на вопросы, ударяя копытом нужное количество раз. Позднее выяснилось, что Ганс не решал математические задачи. Он замечал едва различимые изменения в позе и выражении лица человека, который знал правильный ответ.

Лошадь действительно отвечала верно, но использовала совсем не тот признак, который ей приписывали.

Медицинский ИИ может действовать похожим образом. Он правильно классифицирует изображения во время испытания, но ориентируется на подсказки, не связанные с биологией заболевания.

Как качество камеры может стать «признаком рака»

Исследователи приводят пример набора фотографий кожных образований, собранного в двух медицинских учреждениях.

Одна часть изображений поступила из специализированной онкологической клиники, куда чаще направляли людей с высоким риском рака кожи. Другая — из обычного дерматологического отделения, где злокачественные опухоли встречались реже.

В учреждениях использовали разное оборудование. Из-за этого качество и цветовые особенности изображений различались.

Алгоритм мог установить статистическую связь: фотографии определённого качества чаще соответствуют раку. В результате характеристики камеры становились для него более удобной подсказкой, чем форма, цвет или структура самого образования.

Если такую систему использовать для фотографий со смартфона или с другого медицинского оборудования, качество изображения перестанет соответствовать риску заболевания. Точность может резко снизиться.

Линейка на снимке тоже способна ввести модель в заблуждение

В специализированной клинике врачи чаще фотографировали подозрительные образования рядом с линейкой, чтобы измерять их размер и наблюдать за изменениями.

Алгоритм мог усвоить, что наличие линейки означает высокую вероятность злокачественной опухоли. С клинической точки зрения вывод неверен: линейка не вызывает рак и не является свойством опухолевой ткани.

Но внутри конкретного набора данных такая связь действительно существовала.

После внедрения модель могла недооценивать опасные образования на фотографиях без линейки и переоценивать доброкачественные изменения, если измерительный инструмент оказался в кадре.

Что такое G-AUDIT

Разработанный метод получил название Generalized Attribute Utility and Detectability-Induced bias Testing (G-AUDIT). Его можно перевести как обобщённая проверка смещения, вызванного полезностью и распознаваемостью признаков.

Инструмент исследует не только работу уже обученной модели, но и сам набор данных, на котором её собираются обучать.

Он сопоставляет три вида информации:

  • целевые метки, например наличие или отсутствие заболевания;
  • непосредственно измеряемые данные — изображения, тексты или показатели из таблиц;
  • метаданные — сведения об обстоятельствах получения информации.

Метаданные могут включать возраст и пол пациента, медицинское учреждение, тип оборудования, способ получения снимка, время обследования и другие условия.

G-AUDIT оценивает, насколько каждый такой признак связан с нужным ответом и можно ли распознать его по исходным данным. Если признак одновременно хорошо виден алгоритму и тесно связан с диагнозом, возникает риск, что модель воспользуется именно им.

Инструмент составляет перечень самых опасных признаков

Допустим, в определённой больнице обследуется больше тяжёлых пациентов. Если название учреждения или особенности используемого там оборудования можно восстановить по снимку, модель потенциально научится воспринимать «больницу» как признак тяжёлого заболевания.

G-AUDIT должен обнаружить такую связь и показать разработчикам, что её необходимо проверить.

Инструмент ранжирует признаки по предполагаемому риску. Это помогает исследователям не перебирать вручную сотни характеристик, а начать с тех, которые с наибольшей вероятностью станут ложными подсказками.

По словам Матиаса Унберата (Mathias Unberath), разработчикам часто известно, что модель может усвоить смещение, но непонятно, что именно следует проверять. Новый подход помогает заранее определить наиболее уязвимые места.

Проверку проводили на изображениях, текстах и таблицах

Авторы применили G-AUDIT к нескольким видам медицинской информации:

  • диагностическим изображениям;
  • медицинским текстам;
  • табличным данным с показателями пациентов.

Это важно, поскольку ложные закономерности встречаются не только в рентгенограммах или фотографиях кожи.

В медицинских записях алгоритм может ориентироваться на стиль врача, особенности оформления или название отделения. В таблицах — использовать наличие пропущенного анализа как признак диагноза, хотя на самом деле этот анализ просто чаще назначают тяжёлым пациентам.

Исследователи сообщают, что метод выявлял потенциальные сокращённые признаки, которые можно пропустить при обычной ручной проверке данных.

Чем новый подход отличается от проверки готовой модели

Многие существующие методы оценивают систему уже после обучения. Специалисты проверяют её точность в разных группах пациентов, анализируют ошибки и пытаются понять, на какие части изображения или текста она обращала внимание.

G-AUDIT переносит часть проверки на более ранний этап. Исследователи сначала изучают структуру данных и определяют, какие ложные связи модель потенциально способна усвоить.

По словам соавтора Митчелла Павлака (Mitchell Pavlak), такой подход позволяет искать проблемы до того, как они проявятся в работе готовой системы.

Ранняя проверка может помочь изменить набор данных: добавить недостающие примеры, сбалансировать медицинские учреждения, удалить технические метки или спланировать отдельное испытание в условиях, где подозрительный признак отсутствует.

Почему обычной точности недостаточно

Медицинскую модель часто обучают на одной части набора данных, а проверяют на другой. Если обе части получены из одинаковых источников, в них сохраняются одни и те же побочные закономерности.

Например, линейки будут присутствовать рядом с подозрительными образованиями и в обучающей, и в проверочной выборке. Система покажет высокую точность, хотя так и не научится надёжно оценивать само образование.

Поэтому особенно важна внешняя проверка — испытание на данных из других клиник, с другого оборудования и среди пациентов, не представленных в первоначальном наборе.

Даже успешная внутренняя проверка не гарантирует, что алгоритм будет правильно работать в реальной медицинской практике.

Ложные закономерности могут усиливать неравенство

Ошибка способна затронуть не всех пациентов одинаково.

Если модель обучалась преимущественно на данных людей определённого происхождения, возраста или уровня дохода, её точность в других группах может быть ниже. Технические признаки также нередко отражают различия между обеспеченными и недостаточно оснащёнными клиниками.

Например, алгоритм, привыкший к изображениям с дорогого оборудования, может хуже работать со снимками из небольших больниц или с фотографиями, сделанными обычным смартфоном.

В результате технология, предназначенная для расширения доступа к диагностике, способна усилить уже существующие различия в качестве медицинской помощи.

Что G-AUDIT пока не умеет

Инструмент не исправляет набор данных автоматически и не гарантирует безопасность модели.

Он указывает на статистические связи, которые могут представлять риск, но исследователи должны самостоятельно определить, являются ли они клинически обоснованными.

Некоторые особенности действительно важны для прогноза. Например, возраст может быть связан с вероятностью определённого заболевания. Его использование не обязательно является ошибкой, хотя требует проверки точности в разных возрастных группах.

Метод также зависит от полноты метаданных. Если разработчики не записали, на каком оборудовании получен снимок или в какой клинике обследовали пациента, G-AUDIT не сможет проверить соответствующий признак.

Кроме того, инструмент не обнаружит неизвестную характеристику, о существовании которой нет никаких сведений.

Как следует проверять медицинский алгоритм

Аудит набора данных должен быть только одной частью оценки.

Перед внедрением медицинской системы необходимо:

  • проверить качество и происхождение исходных данных;
  • оценить работу модели в разных группах пациентов;
  • провести испытание в независимых медицинских учреждениях;
  • изучить последствия ложноположительных и ложноотрицательных ответов;
  • определить, как алгоритм влияет на решения врачей;
  • продолжать наблюдение после начала клинического применения.

Нужно также заранее решить, в каких ситуациях результат ИИ допустимо использовать, а когда требуется обязательная проверка специалистом.

Даже хорошо проверенная модель не должна рассматриваться как полностью самостоятельный диагност.

Что результаты означают для пациентов

Исследование не представляет новый способ диагностики заболевания. Оно предлагает инструмент контроля качества для разработчиков и регулирующих органов.

Для пациента его возможная польза заключается в снижении вероятности того, что медицинский алгоритм будет принимать решение по случайным техническим подсказкам.

Работа также подчёркивает: высокая точность, указанная в описании системы, не даёт полной информации о её надёжности. Важно знать, на каких данных обучалась модель, проходила ли она независимую проверку и одинаково ли хорошо работает для разных групп людей.

Искусственный интеллект может помогать врачам анализировать большие объёмы информации, но его выводы должны оцениваться с учётом клинической картины. О том, почему эффективное применение подобных систем требует согласованной работы человека и алгоритма, рассказывается в материале «Как люди и машины учатся понимать друг друга: гибридное выравнивание».

Литература

Drenkow N., Pavlak M., Harrigian K., Zirikly A., Subbaswamy A., Farhangi M. M., Petrick N., Unberath M. Detecting dataset bias in medical AI using a generalized and modality agnostic auditing approach // npj Digital Medicine. – 2026. – DOI: 10.1038/s41746-026-02807-y.

Ведущий специалист отдела организации клинических исследований, терапевт, врач ультразвуковой диагностики  ООО «ВеронаМед» (г. Санкт-Петербург), главный редактор Medical Insider,  а также автор статей.

E-mail для связи – xuslan@yandex.ru;

ПроДокторов;

НаПоправку

Medical Insider