Исследователи Университета Дьюка представили RateAR — созданный для этой работы набор изображений и видео дополненной реальности, собранных в разных сценах и условиях окружающей среды. Люди оценивали три свойства виртуального контента: правильность размещения, соответствие масштаба и согласованность теней.

На этих оценках проверили 11 коммерческих мультимодальных моделей — систем, способных работать одновременно с изображениями и текстом. Лучшая модель достигла ранговой корреляции Спирмена 0,8695. Такой показатель означает, что она почти в том же порядке расставляла сцены от худших к лучшим, что и люди. Он не показывает, совпадали ли числовые оценки модели с оценками отдельных участников.

Что измерял бенчмарк RateAR

Человеческие оценки получили высокую согласованность: показатель ICC(2,5) составил 0,90 или больше. Авторы характеризуют этот уровень как хорошую или отличную надёжность. При этом опубликованное описание не называет ни сами 11 моделей, ни устройство, на которое записывали AR-сцены. Поэтому определить конкретную модель с результатом 0,8695 нельзя.

Авторы связывают такой подход с высокой стоимостью пользовательских исследований. В дополненной реальности на восприятие сцены влияют ограниченная геометрия, пространственные рывки и нестабильность во времени. Автоматическая оценка может помочь разработчику проверять изменения во время итераций, не собирая тестовую группу после каждого перемещения объекта или изменения его размера.

В работе отдельно названы образовательные системы, медицинские сервисы и протоколы снижения рисков. В подобных сценариях неправильно закреплённый виртуальный объект может создать более серьёзную проблему, чем в демонстрационном приложении.

Автоматическая настройка прошла проверку на 21 участнике

Во второй части исследования авторы построили систему автоматической корректировки AR-контента на основе полученных оценок. Её проверили в пользовательском исследовании с участием 21 человека.

Более 90% участников заявили, что система улучшила согласованность размещения и размера виртуального контента. Это субъективная оценка небольшой группы, а не независимое измерение точности системы.

Дополнительный анализ показал, что контекстные подсказки команды лучше согласовывались с человеческими оценками, чем другие проверенные стратегии. При этом авторы стремились учитывать визуальные признаки без чрезмерного усложнения описания задачи.

RateAR остаётся бенчмарком, созданным специально для этой работы, а человеческие оценки служат его основной точкой сравнения. Поэтому результат показывает прежде всего способность моделей повторять решения людей, а не абсолютную правильность оценки AR-сцен.

Препринт разместили на arXiv 30 сентября 2026 года. В записи указано, что работу планируют опубликовать на симпозиуме ACM VRST 2026, который пройдёт в Сендае с 16 по 18 ноября.