Избранные работы, свежие сверху. У каждой — короткое пояснение, что в ней сделано. Полный список — в Google Scholar.
2026
Multilingual Synthetic Scanpaths: Cross-Language Generalization for Gaze GenerationA* workshop
Ivan Stebakov, Ilya Pershin
ICML 2026, SPIGM workshop, Seoul · OpenReview · Code
Представлена мультиязычная генеративная модель траекторий взгляда при чтении текста. Показано, что обучение модели на мультиязычных данных позволяет улавливать общие закономерности взгляда, улучшать моноязычные модели и лучше переносить её на новые языки, для которых записей взгляда нет вовсе. Синтетический взгляд из модели улучшает результаты на мультиязычном QA-бенчмарке — в том числе для языков, которых не было в обучении.
Simulating Concept Bottlenecks with Vision Language ModelsA* workshop
Karim Galliamov, Ivan Titov, Ilya Pershin
ICLR 2026, UCRL workshop · OpenReview · Code
Модели с «бутылочным горлышком» дают объяснимость: сначала предсказываются интерпретируемые концепты, а затем класс, но концепты нужно размечать вручную. LangCBM показывает, что горлышком может служить сама VLM: она порождает текстовые описания визуальных концептов, которые затем используются для классификации.
2025
Enhancing RLHF with Human Gaze ModelingA* main
Karim Galliamov, Ivan Titov, Ilya Pershin
EMNLP 2025 · ACL Anthology
RLHF позволяет LLM лучше соответствовать человеческим предпочтениям, но дорог вычислительно, а сама метка предпочтения не сохраняет того, как аннотатор к нему пришёл. Известно, что человек уделяет больше внимания тем участкам текста, которые наиболее значимы. Предложен способ формирования плотной награды для reward model на основе синтетических данных взгляда. Показано, что это позволяет ускорить RLHF в 1,5–2 раза без потери качества.
From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical ImagingA* main
Dmitry Lvov, Ilya Pershin
NeurIPS 2025 · OpenReview · NeurIPS
Не так давно была представлена модификация метода Logit Lens для VLM. Её результаты использованы, чтобы обогатить VLM семантической информацией при генерации синтетических данных взгляда на изображении. В статье представлена SOTA-модель LogitGaze-Med — мультимодальный трансформер, предсказывающий, куда посмотрит рентгенолог на снимке грудной клетки. Показана возможность использования синтетических данных взгляда для повышения качества классификации патологий.
Gaze Assistance for Efficient Segmentation Correction of Medical ImagesQ1
Leila Khaertdinova, Tatyana Shmykova, Ilya Pershin, Andrey Laryukov, Albert Khanov, Damir Zidikhanov, Bulat Ibragimov
IEEE Access, 2025 · doi · Code
Автоматическая сегментация медицинских изображений не достигла качества экспертов, поэтому врачам необходимо вносить ручные исправления. Представлена дообученная версия модели интерактивной сегментации MedSAM, которая может использовать последовательность координат взгляда в качестве промпта для корректировки сегментационной маски. Дообучение происходило на КТ брюшной полости из открытой базы WORD. Исследования с участием врачей показали, что коррекция взглядом повышает среднее качество сегментации почти на 62% в сложных случаях.
Uncertainty Estimation in Cardio Landmark Detection and Heart Disease Diagnosis on Chest X-Ray ImagesQ1
Dmitry Lvov, Ivan Stebakov, Alexei Kornaev, Ilya Pershin, Tamerlan Mustafaev, Danil Afonchikov, Ramil Kuleev, Iskander Bariev, Bulat Ibragimov
IEEE Access, 2025 · doi
Модель, которая предсказывает кардиометрический индекс, но не говорит, насколько в нём уверена, клинически непригодна. Предложена функция потерь с учётом неопределённости: модель предсказывает и значение индекса, и его дисперсию. Проверено примерно на 800 снимках, размеченных четырьмя практикующими рентгенологами.
How Well Can AI Models Generate Human Eye Movements During Reading?A* workshop
Ivan Stebakov, Ilya Pershin
EMNLP 2025, HCI+NLP workshop, Suzhou · ACL Anthology
Синтетические траектории взгляда — стандартный способ решения проблемы нехватки данных взгляда, но в литературе их оценивают по отдельным метрикам, а не по когнитивной правдоподобности в целом. Здесь предложена схема систематической оценки: существующие модели воспроизводят базовые паттерны, но не справляются с признаками, зависящими от части речи, и деградируют при переносе между предметными областями.
Zero-Shot Gaze-based Volumetric Medical Image SegmentationA* workshop
Tatyana Shmykova, Leila Khaertdinova, Ilya Pershin
CVPR 2025, MMFM-BIOMED workshop · arXiv
Интерактивные модели сегментации вроде SAM-2 и MedSAM-2 используют в качестве промпта вручную заданные ограничивающие рамки и клики мышью. В статье взгляд человека используется как новая модальность входных данных — первое применение айтрекинга к трёхмерной медицинской сегментации.
Temporal Gaze Dynamics as Zero-Shot Prompts for Volumetric Medical SegmentationA* workshop
Tatyana Shmykova, Ilya Pershin
NeurIPS 2025, TS4H workshop · OpenReview
В работе представлен zero-shot-подход для адаптации моделей интерактивной сегментации SAM-2 и MedSAM-2 к использованию последовательности взгляда человека в качестве промпта.
LogitGaze: Predicting Human Attention Using Semantic Information from Vision-Language ModelsA* workshop
Ilya Pershin, Dmitry Lvov
ICLR 2025, Reasoning and Planning for LLMs workshop · PDF
Предсказание траектории взгляда обычно опирается на низкоуровневые визуальные признаки и упускает смысловые факторы, которые взглядом на самом деле управляют. LogitGaze извлекает текстовые представления каждого фрагмента (патча) изображения в VLM методом logit lens и использует их как семантические признаки, улучшая все ключевые метрики предсказания взгляда в среднем на 15%.
Synthetic-based Retrieval of Patient Medical DataA* workshop
Rinat Mullahmetov, Ilya Pershin
ICLR 2025, SynthData workshop · OpenReview
Поисковые системы, позволяющие врачу находить релевантные протоколы исследований и описания пациентов, упираются в нехватку размеченных данных из-за требований приватности. Синтетические записи, порождённые большими языковыми моделями, улучшают качество поиска — и при обучении полностью на синтетике, и в смешанном режиме.
Evaluating Text Humanlikeness via Self-Similarity ExponentA* workshop
Ilya Pershin
ICLR 2025, Building Trust in Language Models workshop · OpenReview
В качестве безэталонной меры «человекоподобности» текста предложена фрактальная метрика — экспонента самоподобия S. У текстов, написанных людьми, S = 0,57; у моделей без инструктивной настройки значение выше, а у инструктивно настроенных приближается к человеческому.
2024
Automatic Calculation of Cardiometric Coefficients on Chest X-Ray ImagesQ1
Alexei Kornaev, Dmitry Lvov, Ilya Pershin, Sergey Kiselev, Danil Afonchikov, Iskander Bariev et al.
IEEE Access, 2024 · doi
Кардиометрические индексы считаются вручную и отнимают у рентгенолога заметное время. Четыре опытных врача разметили по 800 рентгеновских снимков грудной клетки; обученная на них модель предсказания индексов достигла уровня профессионалов.
Gaze-Assisted Medical Image Segmentation
Leila Khaertdinova, Ilya Pershin, Tatyana Shmykova, Bulat Ibragimov
NeurIPS 2024, AIM-FM workshop · arXiv · Code
Полуконтролируемая сегментация, в которой взгляд врача, записанный во время анализа снимков брюшной полости, служит подсказкой для дообучения MedSAM. Проверено на открытой базе WORD — 120 КТ, 16 органов. Средний коэффициент Дайса 90,5% против 85,8% у nnUNetV2, 86,7% у ResUNet и 81,7% у исходного MedSAM.
Awareness of Uncertainty in Classification Using a Multivariate Model and Multi-Views
Alexei Kornaev, Elena Kornaeva, Oleg Ivanov, Ilya Pershin, Danis Alukaev
Preprint · arXiv
Два вопроса: как научить модель оценивать неопределённость собственных предсказаний и что делать с неуверенными предсказаниями. Предложена функция потерь с учётом неопределённости для N-классовой классификации.
2023
Cross-Modal Conceptualization in Bottleneck ModelsA* main
Danis Alukaev, Semen Kiselev, Ilya Pershin, Bulat Ibragimov, Vladimir Ivanov, Alexey Kornaev, Ivan Titov
EMNLP 2023 · ACL Anthology · Code
Модели с «бутылочным горлышком» предполагают, что примеры размечены высокоуровневыми концептами, и выбор этих концептов с последующей разметкой является главным препятствием к их применению. В работе показано, что кроссмодальное обучение способствует формированию интерпретируемых концептов.
Changes in Radiologists’ Gaze Patterns Against Lung X-rays with Different Abnormalities: a Randomized Experiment
Ilya Pershin, Tamerlan Mustafaev, Dilyara Ibragimova, Bulat Ibragimov
Journal of Digital Imaging, 36(3), 2023 · doi
Рандомизированный эксперимент о том, как покрытие снимка взглядом меняется с ростом нагрузки и в зависимости от имеющейся патологии. Четыре рентгенолога проанализировали 400 рентгеновских снимков грудной клетки на рабочей станции с айтрекером. Среднее покрытие лёгких составило 55–65% у разных врачей и снижалось на 1,3–7,6% на каждые 100 прочитанных снимков.
2022
Artificial Intelligence for the Analysis of Workload-Related Changes in Radiologists’ Gaze Patterns
Ilya Pershin, Maksim Kholiavchenko, Bulat Maksudov, Tamerlan Mustafaev, Dilyara Ibragimova, Bulat Ibragimov
IEEE Journal of Biomedical and Health Informatics, 2022 · doi
Около 60–80% ошибок в лучевой диагностике связаны с пропущенными патологиями, и доля таких ошибок растёт к концу смены. Четыре рентгенолога проанализировали 400 рентгеновских снимков грудной клетки с записью движений глаз. Пройденное взглядом расстояние, покрытие снимка и покрытие лёгких статистически значимо ухудшались с накопленной работой у трёх врачей из четырёх.
AI-based analysis of radiologist’s eye movements for fatigue estimation: a pilot study on chest X-rays
Ilya Pershin, Maksim Kholiavchenko, Bulat Maksudov, Tamerlan Mustafaev, Bulat Ibragimov
SPIE Medical Imaging 2022: Image Perception, Observer Performance, and Technology Assessment · doi
Известно, что качество работы рентгенолога падает к концу смены, но количественные признаки взгляда, предсказывающие утомление, ранее не были известны. Признаки, сформированные на основе автоматической сегментации лёгких, оказались сильнейшими предикторами утомления с коэффициентом корреляции 0,82.
Gaze-based attention to improve the classification of lung diseases
Maksim Kholiavchenko, Ilya Pershin, Bulat Maksudov, Tamerlan Mustafaev, Y. Yuan et al.
SPIE Medical Imaging 2022: Image Processing · doi
Несмотря на большие открытые базы, системы компьютерной диагностики ошибаются на редких патологиях. Взгляд врача записывался при анализе 400 рентгеновских снимков грудной клетки из CheXpert, RSNA и SIIM-ACR; нейронная сеть с архитектурой ResNet34 обучалась предсказывать одновременно карту взгляда и метку патологии. Точность выросла до AUC 0,714 против 0,681 у той же сети, обученной только на метках.