HarmonyFidelisHarmonyFidelis
Войти
НовостиКрупные проектыУчастникиАкадемия

NeuroVFM: базовая модель нейровизуализации, обученная на сырых данных больницы

Трёхмерная модель, кодировщик которой обучен без меток на 5,24 миллиона рутинных объёмов КТ и МРТ, достигает AUROC 92,68 % по 82 диагнозам КТ и 92,49 % по 74 диагнозам МРТ. При идентичном архиве разрыв создаёт именно цель обучения — предсказание в латентном пространстве.

NeuroVFM: базовая модель нейровизуализации, обученная на сырых данных больницы

Визуальная базовая модель, обученная непосредственно на изображениях, полученных в ходе повседневной помощи, — несортированных, неаннотированных, даже без текста заключений — превосходит модели, построенные на публичных корпусах. Но самый поучительный результат не в этом: несколько из побеждённых моделей черпали из того же больничного архива. Исследование выделяет именно эффект цели обучения.

Источник: nature.com

Открытие

ПараметрЗначение
ПубликацияNature Medicine, 10 июля 2026 — рецензировано, открытый доступ (CC BY 4.0)
ПредшествованиеПрепринт arXiv 2511.18640, 23 ноября 2025
КомандаKondepudi, Rao, Zhao… Hollon (Michigan Medicine, Мичиганский университет)
МодельNeuroVFM — трёхмерный Vision Transformer, обученный посредством Vol-JEPA
ДанныеUM-NeuroImages: 5,24 млн объёмов КТ и МРТ, 566 915 исследований, многоцентровые, > 20 лет
ПарадигмаHealth system learning — самообучение на неотобранных клинических данных
Первичный критерийМакроусреднённая AUROC по 156 задачам: 82 диагноза КТ + 74 диагноза МРТ
Ключевой результат92,68%92{,}68\%92,68% на КТ (95 % ДИ: 92,27–93,08) и 92,49%92{,}49\%92,49% на МРТ (95 % ДИ: 92,14–92,82)
Проспективная сортировкаТихое исследование осуществимости, 1 неделя (18–25 января 2026), 1 155 исследований
РаспространениеКод под лицензией MIT; веса на Hugging Face (CC-BY-NC-SA 4.0, доступ частично обусловлен)

Техническое объяснение

1. Почему нейровизуализация отсутствует в публичном достоянии. Отправная точка не техническая, а регуляторная: объём краниальной КТ или МРТ содержит лицо пациента, реконструируемое в 3D. Эта внутренне присущая идентифицируемость удерживала нейровизуализацию вне больших открытых корпусов, вскормивших базовые модели. Данные существуют — миллионами, в PACS-архивах каждой больницы, — но они частные, разнородные и неаннотированные. Ставка авторов состоит в том, чтобы пойти за ними туда, где они есть, вместо того чтобы ждать публичного корпуса, который не появится.

2. Vol-JEPA — предсказывать в латентном пространстве, а не в пространстве пикселей. Это механическое ядро работы, и оно отчётливо отличается от классического маскированного автокодировщика. Трёхмерный объём сначала нарезается на патчи (объёмные токены). После удаления фона оставшиеся патчи распределяются на небольшой видимый контекст и более обширную маскированную цель — именно эта асимметрия делает задачу трудной. Кодировщик-ученик — «онлайновый» трёхмерный Vision Transformer — вычисляет представление одного лишь контекста; затем предиктор должен из этого представления произвести то, каким было бы представление маскированных областей. Параллельно «офлайновый» кодировщик-учитель видит полный объём и поставляет цель, причём градиенты через него блокируются. Обучение минимизирует потерю Хьюбера (smooth L1) между предсказанием и целью:

ℓ(x)={0,5 x2si ∣x∣<1∣x∣−0,5sinon\ell(x)=\begin{cases}0{,}5\,x^{2} & \text{si } |x|<1\\ |x|-0{,}5 & \text{sinon}\end{cases}ℓ(x)={0,5x2∣x∣−0,5​si ∣x∣<1sinon​

Решающее различие: цель — не отсутствующий пиксель, а его кодирование. Реконструкция пикселей вынудила бы модель моделировать шум съёмки, артефакты движения, зерно детектора — всё, что меняется от аппарата к аппарату, не неся клинической информации. Предсказывая в латентном пространстве, модель вольна игнорировать непредсказуемое и сохраняет лишь структурно предсказуемое: анатомию и её изменения. Именно это делает подход терпимым к неотобранным данным.

3. Почему учитель не коллапсирует. Архитектура, в которой ученик учится подражать цели, произведённой сетью-близнецом, рискует тривиальным решением: обе сети выдают константу, потеря падает до нуля, ничего не выучивается. Предохранитель в том, что учитель не обучается градиентным спуском — его веса представляют собой экспоненциальное скользящее среднее весов ученика:

θenseignant←τ θenseignant+(1−τ) θeˊtudiant\theta_{\text{enseignant}} \leftarrow \tau\,\theta_{\text{enseignant}} + (1-\tau)\,\theta_{\text{étudiant}}θenseignant​←τθenseignant​+(1−τ)θeˊtudiant​

Учитель остаётся таким образом сглаженной и запаздывающей версией ученика: целью, которая эволюционирует слишком медленно, чтобы её нагнали обходным путём, но достаточно быстро, чтобы продвигаться вместе с ним. Ни одна метка, ни одно рентгенологическое заключение на этом этапе не вмешивается. (Явная форма этих двух уравнений — стандартный комментарий к методу, а не цитата из статьи.)

4. Что измеряет оценка — и что она доказывает. AUROC количественно выражает способность разделять наличие и отсутствие состояния, независимо от выбранного порога: AUROC=0,5\mathrm{AUROC}=0{,}5AUROC=0,5 равносильна случайности, 1,01{,}01,0 — совершенному разделению. Здесь она макроусреднённая: каждый диагноз весит одинаково, включая самые редкие. Именно этот выбор делает цифру информативной — среднее, взвешенное по частоте, было бы раздуто частыми и лёгкими случаями. Получить 92,68%92{,}68\%92,68% на 82 задачах КТ и 92,49%92{,}49\%92,49% на 74 задачах МРТ означает, следовательно, измерить компетентность, распределённую по 156 диагнозам, а не пик на нескольких доминирующих патологиях. Уточнение, важное для истолкования цифры: кодировщик замораживается после предобучения, и эти показатели дают обучаемые поверх него контролируемые классификационные зонды. Предобучение — без меток; оценка — нет.

5. Сравнение, которое имеет значение: тот же архив, разные цели. Это самый сильный методологический пункт статьи и тот, который скрывают сырые цифры. PRIMA, HLIP, NeuroMAE и NeuroVFM — все были предобучены на UM-NeuroImages. Сравнения, следовательно, контролируют источник данных, и разрывы относятся на счёт цели предобучения и архитектуры, а не происхождения изображений. NeuroMAE, к слову, не конкурирующая модель, опубликованная сторонней командой: это базовая линия с согласованным вычислительным бюджетом, построенная самими авторами (реконструкция вокселей, случайное маскирование на 85 %) с единственной целью выделить эффект цели обучения. По первичному критерию NeuroVFM опережает HLIP на +0,98+0{,}98+0,98 пункта (95 % ДИ: 0,76–1,20), NeuroMAE на +1,55+1{,}55+1,55, DINOv3 на +2,24+2{,}24+2,24, BiomedCLIP на +2,88+2{,}88+2,88 и PRIMA на +3,87+3{,}87+3,87 — причём последний разрыв стоит особняком, поскольку PRIMA обучалась и оценивалась только на подмножестве МРТ. Перекрытие к тому же никогда не бывает полным: HLIP обучалась на 444 188 парах «исследование–заключение», то есть на доле от 566 915 исследований.

6. От диагностики к сортировке: проспективное испытание. В связке с языковой моделью Qwen3-14B в архитектуре типа LLaVA-1.5 NeuroVFM питает систему, способную составить предварительное заключение и ранжировать исследования. Протокол — проспективное и тихое исследование осуществимости, при котором система работает, не влияя на ведение пациента, — проведён в масштабе системы здравоохранения в течение одной непрерывной недели, с 18 по 25 января 2026 года, и охватил 1 155 исследований (601 МРТ, 544 КТ). Сгенерированные заключения фильтруются отсеивающей языковой моделью, затем ослеплённая панель клиницистов-экспертов выносит сортировочное решение на основании сгенерированных заключений — именно оно оценивается — и эталонное решение на основании реальных заключений. Сбалансированная точность 92,6 % в группе NeuroVFM (95 % ДИ: 89,8–95,2) против 71,2 % в группе GPT-5 (95 % ДИ: 67,2–75,2), то есть +21,4+21{,}4+21,4 пункта, измеряет, следовательно, полную цепочку — модель, автоматический отсев и человеческое прочтение — а не одну лишь модель.

Почему это сработало

Выигрыш проистекает не столько из происхождения данных, сколько из цели обучения. Сырой архив — необходимое условие: без него не было бы 5,24 миллиона объёмов, — но его недостаточно, чтобы объяснить разрыв: три из пяти сравниваемых моделей черпали из того же архива. Статья устанавливает, что при идентичном источнике предсказание в латентном пространстве порождает представления, которые обобщаются тем лучше, чем выше разнообразие задач. Номинально наибольший разрыв (+3,87+3{,}87+3,87) — с PRIMA, но статья не подаёт его как таковой: упоминание самых широких разрывов она оставляет для моделей, обученных в интернет-масштабе, — DINOv3 (+2,24+2{,}24+2,24) и BiomedCLIP (+2,88+2{,}88+2,88), — там, где различаются и цель, и обучающие данные, а их эффекты складываются.

Ограничения заявлены прямо, и они существенно охлаждают повествование. Против HLIP — самой прочной базовой линии, обученной на том же архиве, — преимущество составляет всего 0,980{,}980,98 пункта: NeuroVFM берёт верх в 10 из 17 категорий КТ без единого поражения, но лишь в 5 из 18 категорий МРТ, причём воспалительную категорию выигрывает HLIP, а остальное незначимо. На CQ500, небольшом тестовом наборе, метки которого тесно следуют формулировкам заключений, HLIP даже опережает NeuroVFM на большинстве задач. Авторы делают отсюда верный вывод: модели, обучаемые под надзором заключений, остаются конкурентоспособными на специфических диагнозах, а преимущество NeuroVFM проявляется по мере роста разнообразия задач. При сортировке чувствительность упирается в потолок 86,5 % (95 % ДИ: 81,0–91,6) — 21 из 155 пациентов с критической аномалией были пропущены, то есть примерно один из семи, что исключает всякое автономное применение. Данные происходят из одной системы здравоохранения; обобщение на другие учреждения и популяции не показано. Наконец, «превзойти GPT-5» относится к конкретной задаче нейрорадиологической сортировки, против универсальной модели, никогда для этого не предназначавшейся, и внутри конвейера, где окончательное решение выносят клиницисты, — это не сравнение с рентгенологом в реальных условиях. Публичный репозиторий заявляет об этом без обиняков: только для исследовательского применения, это не медицинское изделие.

Причинная цепь

Свёрточные сети в медицинской визуализации (2010-е) → подъём самообучающихся базовых моделей на массивных публичных корпусах (2020-2023) → блокировка, специфичная для нейровизуализации: череп идентифицируем, данные остаются вне публичного достояния → осознание того, что больничные архивы уже содержат материал, неотобранный → первая волна моделей, обученных на данных системы здравоохранения под надзором текста заключений (HLIP, PRIMA) → адаптация цели JEPA к трёхмерным объёмам (Vol-JEPA), которая предсказывает в латентном пространстве и полностью обходится без меток → обучение на 5,24 млн объёмов из 566 915 исследований → макроусреднённая AUROC 92,68 % (КТ) и 92,49 % (МРТ) по 156 задачам, выше HLIP, NeuroMAE, DINOv3, BiomedCLIP и PRIMA → связка с Qwen3-14B и недельное тихое проспективное исследование сортировки (январь 2026) → публикация в Nature Medicine и распространение кода (MIT) и весов (июль 2026) → остающиеся препятствия: внешняя многоцентровая валидация и чувствительность 86,5 %, недостаточная для автономного применения

Анекдот

Парадокс медицинских данных умещается в одном образе: то, что закрыло нейровизуализации вход в публичные корпуса, — не абстрактная врачебная тайна, а лицо пациента: краниальная КТ реконструируется в 3D и возвращает узнаваемые черты. Дисциплина, богатейшая трёхмерными объёмами, оказалась беднейшей данными, пригодными для обмена. NeuroVFM не решает эту проблему, он её обходит: вместо того чтобы вывозить изображения в общий корпус, он идёт учиться туда, где они уже находятся, — в 566 915 исследований, накопленных за двадцать лет одной системой здравоохранения.

Наследие и текущие данные

Поле было заселено ещё до этой работы: HLIP и PRIMA, обе обученные на данных системы здравоохранения под надзором текста заключений, составляли основные подходы этого семейства — и фигурируют здесь как точки сравнения. Вопрос, следовательно, уже не в том, нужны ли базовые модели в визуализации, а в том, каким обучающим сигналом их строить: заключением рентгенолога или одним лишь изображением. Собственный вклад NeuroVFM — не клинический продукт (никакого рутинного внедрения не сообщается, а репозиторий прямо исключает применение в медицинских решениях), а принципиальная демонстрация, подкреплённая действительным распространением: код под лицензией MIT, веса опубликованы на Hugging Face под CC-BY-NC-SA 4.0, причём часть остаётся обусловленной институциональным запросом. Сами авторы помещают продолжение на сторону интеграции временны́х и мультимодальных данных — патология, геномика, продольный клинический исход.

Источники

Ссылки, проверенные в ходе фактологического аудита 5 августа 2026 года: это страницы, по которым сверялись утверждения настоящего бюллетеня.

  1. Health system learning enables generalist neuroimaging models — Nature Medicine (2026) — рецензировано, открытый доступ (CC BY 4.0), опубликовано 10 июля 2026 года. DOI: 10.1038/s41591-026-04497-1
  2. Health system learning achieves generalist neuroimaging models — препринт arXiv 2511.18640 (2025) — препринт, 23 ноября 2025 года. Более ранняя версия той же работы, не содержащая ни базовых линий PRIMA и NeuroMAE, ни проспективного исследования сортировки.
  3. Learning from routine health system data builds better neuroimaging AI models — Nature Medicine (2026) — Research Briefing от 31 июля 2026 года, написанный самими авторами исследования: это не независимый редакционный комментарий.
  4. Официальный репозиторий MLNeurosurg/neurovfm — GitHub — код (MIT), веса и пометка «research use only, not a medical device».

Прозрачность: числовые значения настоящего бюллетеня взяты из рецензированной статьи в открытом доступе и из официального репозитория авторов. Подробный состав когорт и кривые по каждому диагнозу построчно не перепроверялись.