Илья Першин
Илья Першин
Почта
i.pershin (at)
innopolis.ru
Лаборатория
«ИИ в медицине»,
Университет Иннополис

Публикации

Избранные работы, свежие сверху. У каждой — короткое пояснение, что в ней сделано. Полный список — в Google Scholar.

2026

Multilingual Synthetic Scanpaths: Cross-Language Generalization for Gaze GenerationA* workshop

Ivan Stebakov, Ilya Pershin

ICML 2026, SPIGM workshop, Seoul · OpenReview · Code

Представлена мультиязычная генеративная модель траекторий взгляда при чтении текста. Показано, что обучение модели на мультиязычных данных позволяет улавливать общие закономерности взгляда, улучшать моноязычные модели и лучше переносить её на новые языки, для которых записей взгляда нет вовсе. Синтетический взгляд из модели улучшает результаты на мультиязычном QA-бенчмарке — в том числе для языков, которых не было в обучении.

Simulating Concept Bottlenecks with Vision Language ModelsA* workshop

Karim Galliamov, Ivan Titov, Ilya Pershin

ICLR 2026, UCRL workshop · OpenReview · Code

Модели с «бутылочным горлышком» дают объяснимость: сначала предсказываются интерпретируемые концепты, а затем класс, но концепты нужно размечать вручную. LangCBM показывает, что горлышком может служить сама VLM: она порождает текстовые описания визуальных концептов, которые затем используются для классификации.

2025

Enhancing RLHF with Human Gaze ModelingA* main

Karim Galliamov, Ivan Titov, Ilya Pershin

EMNLP 2025 · ACL Anthology

RLHF позволяет LLM лучше соответствовать человеческим предпочтениям, но дорог вычислительно, а сама метка предпочтения не сохраняет того, как аннотатор к нему пришёл. Известно, что человек уделяет больше внимания тем участкам текста, которые наиболее значимы. Предложен способ формирования плотной награды для reward model на основе синтетических данных взгляда. Показано, что это позволяет ускорить RLHF в 1,5–2 раза без потери качества.

From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical ImagingA* main

Dmitry Lvov, Ilya Pershin

NeurIPS 2025 · OpenReview · NeurIPS

Не так давно была представлена модификация метода Logit Lens для VLM. Её результаты использованы, чтобы обогатить VLM семантической информацией при генерации синтетических данных взгляда на изображении. В статье представлена SOTA-модель LogitGaze-Med — мультимодальный трансформер, предсказывающий, куда посмотрит рентгенолог на снимке грудной клетки. Показана возможность использования синтетических данных взгляда для повышения качества классификации патологий.

Gaze Assistance for Efficient Segmentation Correction of Medical ImagesQ1

Leila Khaertdinova, Tatyana Shmykova, Ilya Pershin, Andrey Laryukov, Albert Khanov, Damir Zidikhanov, Bulat Ibragimov

IEEE Access, 2025 · doi · Code

Автоматическая сегментация медицинских изображений не достигла качества экспертов, поэтому врачам необходимо вносить ручные исправления. Представлена дообученная версия модели интерактивной сегментации MedSAM, которая может использовать последовательность координат взгляда в качестве промпта для корректировки сегментационной маски. Дообучение происходило на КТ брюшной полости из открытой базы WORD. Исследования с участием врачей показали, что коррекция взглядом повышает среднее качество сегментации почти на 62% в сложных случаях.

Uncertainty Estimation in Cardio Landmark Detection and Heart Disease Diagnosis on Chest X-Ray ImagesQ1

Dmitry Lvov, Ivan Stebakov, Alexei Kornaev, Ilya Pershin, Tamerlan Mustafaev, Danil Afonchikov, Ramil Kuleev, Iskander Bariev, Bulat Ibragimov

IEEE Access, 2025 · doi

Модель, которая предсказывает кардиометрический индекс, но не говорит, насколько в нём уверена, клинически непригодна. Предложена функция потерь с учётом неопределённости: модель предсказывает и значение индекса, и его дисперсию. Проверено примерно на 800 снимках, размеченных четырьмя практикующими рентгенологами.

How Well Can AI Models Generate Human Eye Movements During Reading?A* workshop

Ivan Stebakov, Ilya Pershin

EMNLP 2025, HCI+NLP workshop, Suzhou · ACL Anthology

Синтетические траектории взгляда — стандартный способ решения проблемы нехватки данных взгляда, но в литературе их оценивают по отдельным метрикам, а не по когнитивной правдоподобности в целом. Здесь предложена схема систематической оценки: существующие модели воспроизводят базовые паттерны, но не справляются с признаками, зависящими от части речи, и деградируют при переносе между предметными областями.

Zero-Shot Gaze-based Volumetric Medical Image SegmentationA* workshop

Tatyana Shmykova, Leila Khaertdinova, Ilya Pershin

CVPR 2025, MMFM-BIOMED workshop · arXiv

Интерактивные модели сегментации вроде SAM-2 и MedSAM-2 используют в качестве промпта вручную заданные ограничивающие рамки и клики мышью. В статье взгляд человека используется как новая модальность входных данных — первое применение айтрекинга к трёхмерной медицинской сегментации.

Temporal Gaze Dynamics as Zero-Shot Prompts for Volumetric Medical SegmentationA* workshop

Tatyana Shmykova, Ilya Pershin

NeurIPS 2025, TS4H workshop · OpenReview

В работе представлен zero-shot-подход для адаптации моделей интерактивной сегментации SAM-2 и MedSAM-2 к использованию последовательности взгляда человека в качестве промпта.

LogitGaze: Predicting Human Attention Using Semantic Information from Vision-Language ModelsA* workshop

Ilya Pershin, Dmitry Lvov

ICLR 2025, Reasoning and Planning for LLMs workshop · PDF

Предсказание траектории взгляда обычно опирается на низкоуровневые визуальные признаки и упускает смысловые факторы, которые взглядом на самом деле управляют. LogitGaze извлекает текстовые представления каждого фрагмента (патча) изображения в VLM методом logit lens и использует их как семантические признаки, улучшая все ключевые метрики предсказания взгляда в среднем на 15%.

Synthetic-based Retrieval of Patient Medical DataA* workshop

Rinat Mullahmetov, Ilya Pershin

ICLR 2025, SynthData workshop · OpenReview

Поисковые системы, позволяющие врачу находить релевантные протоколы исследований и описания пациентов, упираются в нехватку размеченных данных из-за требований приватности. Синтетические записи, порождённые большими языковыми моделями, улучшают качество поиска — и при обучении полностью на синтетике, и в смешанном режиме.

Evaluating Text Humanlikeness via Self-Similarity ExponentA* workshop

Ilya Pershin

ICLR 2025, Building Trust in Language Models workshop · OpenReview

В качестве безэталонной меры «человекоподобности» текста предложена фрактальная метрика — экспонента самоподобия S. У текстов, написанных людьми, S = 0,57; у моделей без инструктивной настройки значение выше, а у инструктивно настроенных приближается к человеческому.

2024

Automatic Calculation of Cardiometric Coefficients on Chest X-Ray ImagesQ1

Alexei Kornaev, Dmitry Lvov, Ilya Pershin, Sergey Kiselev, Danil Afonchikov, Iskander Bariev et al.

IEEE Access, 2024 · doi

Кардиометрические индексы считаются вручную и отнимают у рентгенолога заметное время. Четыре опытных врача разметили по 800 рентгеновских снимков грудной клетки; обученная на них модель предсказания индексов достигла уровня профессионалов.

Gaze-Assisted Medical Image Segmentation

Leila Khaertdinova, Ilya Pershin, Tatyana Shmykova, Bulat Ibragimov

NeurIPS 2024, AIM-FM workshop · arXiv · Code

Полуконтролируемая сегментация, в которой взгляд врача, записанный во время анализа снимков брюшной полости, служит подсказкой для дообучения MedSAM. Проверено на открытой базе WORD — 120 КТ, 16 органов. Средний коэффициент Дайса 90,5% против 85,8% у nnUNetV2, 86,7% у ResUNet и 81,7% у исходного MedSAM.

Awareness of Uncertainty in Classification Using a Multivariate Model and Multi-Views

Alexei Kornaev, Elena Kornaeva, Oleg Ivanov, Ilya Pershin, Danis Alukaev

Preprint · arXiv

Два вопроса: как научить модель оценивать неопределённость собственных предсказаний и что делать с неуверенными предсказаниями. Предложена функция потерь с учётом неопределённости для N-классовой классификации.

2023

Cross-Modal Conceptualization in Bottleneck ModelsA* main

Danis Alukaev, Semen Kiselev, Ilya Pershin, Bulat Ibragimov, Vladimir Ivanov, Alexey Kornaev, Ivan Titov

EMNLP 2023 · ACL Anthology · Code

Модели с «бутылочным горлышком» предполагают, что примеры размечены высокоуровневыми концептами, и выбор этих концептов с последующей разметкой является главным препятствием к их применению. В работе показано, что кроссмодальное обучение способствует формированию интерпретируемых концептов.

Changes in Radiologists’ Gaze Patterns Against Lung X-rays with Different Abnormalities: a Randomized Experiment

Ilya Pershin, Tamerlan Mustafaev, Dilyara Ibragimova, Bulat Ibragimov

Journal of Digital Imaging, 36(3), 2023 · doi

Рандомизированный эксперимент о том, как покрытие снимка взглядом меняется с ростом нагрузки и в зависимости от имеющейся патологии. Четыре рентгенолога проанализировали 400 рентгеновских снимков грудной клетки на рабочей станции с айтрекером. Среднее покрытие лёгких составило 55–65% у разных врачей и снижалось на 1,3–7,6% на каждые 100 прочитанных снимков.

2022

Artificial Intelligence for the Analysis of Workload-Related Changes in Radiologists’ Gaze Patterns

Ilya Pershin, Maksim Kholiavchenko, Bulat Maksudov, Tamerlan Mustafaev, Dilyara Ibragimova, Bulat Ibragimov

IEEE Journal of Biomedical and Health Informatics, 2022 · doi

Около 60–80% ошибок в лучевой диагностике связаны с пропущенными патологиями, и доля таких ошибок растёт к концу смены. Четыре рентгенолога проанализировали 400 рентгеновских снимков грудной клетки с записью движений глаз. Пройденное взглядом расстояние, покрытие снимка и покрытие лёгких статистически значимо ухудшались с накопленной работой у трёх врачей из четырёх.

AI-based analysis of radiologist’s eye movements for fatigue estimation: a pilot study on chest X-rays

Ilya Pershin, Maksim Kholiavchenko, Bulat Maksudov, Tamerlan Mustafaev, Bulat Ibragimov

SPIE Medical Imaging 2022: Image Perception, Observer Performance, and Technology Assessment · doi

Известно, что качество работы рентгенолога падает к концу смены, но количественные признаки взгляда, предсказывающие утомление, ранее не были известны. Признаки, сформированные на основе автоматической сегментации лёгких, оказались сильнейшими предикторами утомления с коэффициентом корреляции 0,82.

Gaze-based attention to improve the classification of lung diseases

Maksim Kholiavchenko, Ilya Pershin, Bulat Maksudov, Tamerlan Mustafaev, Y. Yuan et al.

SPIE Medical Imaging 2022: Image Processing · doi

Несмотря на большие открытые базы, системы компьютерной диагностики ошибаются на редких патологиях. Взгляд врача записывался при анализе 400 рентгеновских снимков грудной клетки из CheXpert, RSNA и SIIM-ACR; нейронная сеть с архитектурой ResNet34 обучалась предсказывать одновременно карту взгляда и метку патологии. Точность выросла до AUC 0,714 против 0,681 у той же сети, обученной только на метках.