Интеграция компьютерного зрения и искусственного интеллекта в коллаборативную робототехнику: обзор и перспективы на будущее

170
views

Интеграция передовых методов компьютерного зрения и искусственного интеллекта (ИИ) в системы совместной робототехники потенциально может произвести революцию во взаимодействии человека и робота, повысить производительность и безопасность. Несмотря на значительную исследовательскую активность, систематический анализ того, как зрение и ИИ совместно обеспечивают контекстно-ориентированные, адаптивные возможности коллаборативных роботов в области восприятия, планирования и принятия решений, по-прежнему отсутствует (особенно в последние годы).

Для решения этой проблемы наш обзор объединяет последние достижения в области визуального распознавания, глубокого обучения и семантического сопоставления в рамках структурированной таксономии, адаптированной для коллаборативной робототехники. Мы рассматриваем фундаментальные технологии, такие как обнаружение объектов, оценка позы человека и моделирование окружающей среды, а также новые тенденции, включая многомодальное слияние данных с датчиков, объяснимый ИИ и этически обоснованную автономность.

В отличие от предыдущих обзоров, которые узко фокусируются либо на зрении, либо на ИИ, этот обзор уникальным образом анализирует их интегрированное использование для реального взаимодействия человека и робота. Выделяя промышленные и сервисные приложения, мы обобщаем лучшие практики, определяем критические проблемы и представляем ключевые показатели эффективности для руководства будущими исследованиями. В заключение мы предлагаем стратегические направления — от масштабируемых методов обучения до стандартов совместимости — для содействия безопасному, надежному и инициативному партнерству человека и робота в предстоящие годы.

1. Введение

1.1. Мотивация и сфера применения

Быстрое развитие коллаборативных роботов, или коботов, трансформирует ландшафт промышленной и сервисной автоматизации [123]. В отличие от традиционных промышленных роботов, коботы разработаны для безопасной и интерактивной работы рядом с людьми, способствуя повышению производительности, безопасности и гибкости в динамичных средах [4]. Коботы преодолевают разрыв между ручным трудом и полной автоматизацией [5]. Преодоление разрыва между ручным трудом и полной автоматизацией повышает экономическую эффективность, безопасность, качество и гибкость. Коботы снижают затраты на рабочую силу, избегая при этом жесткости полной автоматизации.

Они повышают безопасность, выполняя опасные задачи, и обеспечивают бесшовную синергию человека и робота для адаптивного и эффективного производства. В основе этой трансформации лежит слияние компьютерного зрения и искусственного интеллекта (ИИ), позволяющее создавать перцептивные и контекстно-ориентированные роботизированные системы [6]. Компьютерное зрение позволяет коботам интерпретировать сложные сцены, обнаруживать и классифицировать объекты, воспринимать жесты и действия человека, а также моделировать окружающую среду в реальном времени [7]. Эти сенсорные возможности, интегрированные с методами ИИ (такими как глубокое обучение и когнитивное мышление), позволяют принимать интеллектуальные решения и адаптировать поведение. Такое слияние дает возможность коллаборативным роботам выйти за рамки пассивной работы и перейти к проактивному сотрудничеству, где роботы предвидят и реагируют на намерения человека и изменения окружающей среды [89].

Цель данного обзора — изучить и систематизировать самые последние и значимые достижения в области интеграции машинного зрения и искусственного интеллекта в системы совместной работы роботов. В частности, мы выделяем фундаментальные технологии, текущие приложения, новые тенденции и открытые исследовательские задачи, которые в совокупности определяют путь к сотрудничеству человека и робота следующего поколения.

1.2. Определения и междисциплинарный характер

Междисциплинарный характер коллаборативной робототехники требует точной терминологии. Искусственный интеллект (ИИ) включает в себя вычислительные методы, имитирующие человекоподобный интеллект [7]. Машинное обучение (МО), являющееся подразделом ИИ, фокусируется на разработке алгоритмов, которые обучаются на данных без явного программирования [10]. Глубокое обучение (ГО) дополнительно фокусируется на МО посредством глубоких нейронных архитектур, способных к иерархическому извлечению признаков [89]. Компьютерное зрение (КТ) находится на стыке ИИ и МО и призвано дать машинам возможность получать, обрабатывать и интерпретировать визуальную информацию [1011]. Понимание этих определений имеет решающее значение, поскольку современные коллаборативные роботизированные системы используют все эти области для достижения перцептивной осведомленности, семантического рассуждения и контекстно обоснованного выполнения действий.

1.3. Вклад обзора

Данный обзор вносит следующие основные вклады:

  • Комплексный обзор синергии зрения и ИИ: Мы обобщаем литературу из различных областей — роботизированного зрения, планирования с использованием ИИ, распознавания человеческой активности и мультимодального восприятия — в единую таксономию, адаптированную для коллаборативной робототехники.
  • Технологический ландшафт: Мы предлагаем структурированный обзор ключевых методов, включая визуальное обнаружение объектов, оценку позы человека и понимание сцены.
  • Одновременная локализация и картографирование (SLAM) и архитектуры глубокого обучения для HRC [12].
  • Оценка и сравнительный анализ: Мы обсуждаем показатели производительности, эталонные наборы данных и среды моделирования для коллаборативных роботов с поддержкой машинного зрения и ИИ, подчеркивая необходимость воспроизводимости и стандартизации [13].
  • Выявление проблем и перспективных направлений: Мы выделяем критически важные вопросы, такие как производительность в реальном времени, обработка неопределенности, этическое принятие решений и доверие человека к автономным системам [41415].
1.4. Методология и критерии отбора литературы

В данном обзоре использовался систематический и тематический подход для выявления, оценки и обобщения соответствующих исследований по интеграции компьютерного зрения (CV) и искусственного интеллекта (AI) в коллаборативную робототехнику. Первоначальный поиск проводился в основных академических базах данных, включая Scopus, Web of Science, IEEE Xplore и MDPI’s Applied Sciences, с использованием ключевых слов, таких как взаимодействие человека и робота, коллаборативные роботы, роботизированное зрение, семантическое понимание сцены, глубокое обучение в робототехнике и слияние данных с датчиков для HRC.

В результате этого процесса было получено приблизительно 1800 записей, опубликованных с 2015 года по май 2025 года. Критерии исключения применялись в несколько этапов: (i) удаление статей на неанглийском языке и источников, не прошедших рецензирование; (ii) фильтрация работ, не связанных с коллаборативной робототехникой (например, чисто промышленная автоматизация или общее компьютерное зрение без контекста HRC); и (iii) исключение дублирующихся записей и малорелевантных тезисов конференций. В результате этого отбора корпус был сужен примерно до 250 статей для полнотекстовой оценки.

После детальной оценки их технической глубины, применимости в реальных условиях и соответствия парадигме коллаборативных роботов, для включения в данный обзор было отобрано 138 исследований. Они охватывали различные темы, такие как обнаружение объектов, оценка позы человека, понимание сцены, визуальная SLAM, обучение с подкреплением и объяснимый ИИ в применении к коллаборативной робототехнике. Библиометрический анализ выявил заметные тенденции. Объем публикаций значительно вырос с 2018 года, отражая растущий интерес к объединению данных компьютерного зрения и ИИ для взаимодействия человека и робота. Включенные исследования охватывают работы из Европы, Северной Америки и Азии, с сильными исследовательскими кластерами в Германии, Китае, США и Японии. Тематические тенденции указывают на растущее внимание к объединению данных мультимодальных датчиков, проактивному и упреждающему взаимодействию человека и робота, объяснимому ИИ и адаптивному планированию в реальном времени.

Эта многоэтапная стратегия отбора гарантирует, что обзор обобщает репрезентативный, высококачественный и актуальный в глобальном масштабе массив литературы, что позволяет провести всестороннюю оценку текущих возможностей, проблем и будущих направлений в области совместной робототехники с использованием машинного зрения и искусственного интеллекта.

1.5. План работы
Дальнейшая структура данной статьи следующая: Раздел 2 содержит обзор основ и эволюции коллаборативной робототехники, компьютерного зрения и ИИ. Раздел 3 рассматривает основные технологии, обеспечивающие работу коллаборативных роботов на основе машинного зрения, включая восприятие, оценку положения и пространственное моделирование. Раздел 4 исследует принятие решений и автономность на основе ИИ, с акцентом на обучающие модели и объяснимость. Раздел 5 исследует технологические тенденции и проблемы. Раздел 6 освещает ключевые аспекты архитектуры системы, ИИ и алгоритмов коллаборативных роботов. Раздел 7 обсуждает проблемы и тенденции, связанные с взаимодействием человека с роботом. Раздел 8 рассматривает обзор литературы и намечает стратегические направления развития интеграции машинного зрения и ИИ в облачно-периферийных платформах и проактивном управлении человеческими ресурсами. Раздел 9 завершается обобщением соответствующих выводов и видением следующего поколения коллаборативных роботизированных систем с поддержкой машинного зрения.

2. Основы и эволюция

2.1. Обзор коллаборативной робототехники (коботов)

Коллаборативные роботы (коботы) — это роботизированные системы, специально разработанные для прямого физического взаимодействия с людьми в общем рабочем пространстве без необходимости использования традиционных защитных барьеров [1617]. В отличие от традиционных промышленных роботов, работающих в изолированных средах, коботы интегрируют внутренние механизмы безопасности — такие как гибкие приводы, датчики силы и крутящего момента и интеллектуальное планирование движения — для обеспечения тесного и безопасного взаимодействия [18]. Их гибкость, быстрое развертывание и возможность программирования путем демонстрации способствовали их внедрению в производственном, логистическом, медицинском и образовательном секторах [19]. Коботы представляют собой парадигматический сдвиг в сторону гибридных рабочих пространств, где человеческая креативность синергетически дополняется точностью роботов, способствуя повышению производительности, улучшению эргономики и созданию гибких производственных систем.

2.2. Историческая эволюция компьютерного зрения в робототехнике

Область компьютерного зрения (CV) претерпела глубокую эволюцию, перейдя от ранней эвристической обработки изображений в 1980-х годах к сложным системам восприятия, основанным на глубоком обучении, которые используются сегодня. Первоначальное роботизированное зрение фокусировалось на базовых задачах, таких как обнаружение границ, локализация объектов и избегание препятствий с использованием монокулярных камер [20]. Достижения в области датчиков, в частности RGB-D камер и LiDAR, позволили понимать трехмерные сцены и создавать пространственные карты в реальном времени [2122].

Одновременно прорывы в алгоритмических основах, таких как сверточные нейронные сети (CNN) и одновременная локализация и картирование (SLAM), трансформировали возможности восприятия [212324]. В коллаборативной робототехнике компьютерное зрение эволюционировало от пассивного метода восприятия к активному, предсказательному компоненту, который необходим для понимания сцен в реальном времени, распознавания активности человека и адаптивного выполнения задач [25].

2.3. Развитие искусственного интеллекта (ИИ) в робототехнике

Искусственный интеллект (ИИ) расширил функциональные возможности роботизированных систем от выполнения заданных задач до динамичного, целенаправленного поведения [726]. Ранняя интеграция ИИ включала системы, основанные на правилах, и программирование, управляемое экспертами. Внедрение машинного обучения (МО), в частности, методов обучения с учителем и обучения с подкреплением, позволило роботам обобщать данные, а не полагаться исключительно на заранее заданные правила [2728].

В последнее время архитектуры глубокого обучения (ГБО), такие как рекуррентные нейронные сети (РНН) и трансформеры, позволили роботам выполнять сложные задачи восприятия и принятия решений в высокодинамичных средах [29303132]. В рамках коллаборативной робототехники ИИ способствует планированию действий с учетом контекста, прогнозируемому распознаванию намерений человека и проактивным стратегиям сотрудничества [ 7 , 24 , 33 , 34 ]. Поскольку роботы все чаще обучаются на основе истории взаимодействий, мультимодальных сенсорных данных и обучения на основе демонстраций, границы адаптивной автономности продолжают расширяться.

3. Основные технологии в области робототехники, основанной на машинном зрении и взаимодействии с другими системами.

3.1. Визуальное восприятие и обнаружение объектов

Визуальное восприятие лежит в основе систем совместной робототехники [35], позволяя машинам интерпретировать окружающую среду и осмысленно взаимодействовать с объектами и людьми [3435]. Обнаружение объектов — определение местоположения и классификация объектов на изображении или в трехмерном пространстве — является критически важной компетенцией, достигаемой с помощью передовых моделей глубокого обучения, таких как YOLO (You Only Look Once), Faster R-CNN (Region-based Convolutional Neural Networks) и детекторов на основе трансформеров [36373839].

В приложениях коллаборативных роботов системы восприятия должны работать в условиях строгих ограничений реального времени [40], обеспечивая высокую точность при переменном освещении, перекрытии и динамическом фоне [41]. Недавние достижения используют мультимодальные данные (например, RGB-D и тепловизионные изображения) для повышения надежности, позволяя коллаборативным роботам идентифицировать заготовки, инструменты и препятствия с человекоподобной перцептивной беглостью [2042].

В таблице 1 количественно оценивается компромисс между скоростью и точностью детектора в сценариях использования коллаборативных роботов.

Детектор Точность (мА) Скорость вывода Применимость в режиме реального времени Сильные стороны Ограничения
YOLOv6-N/S/S-Quant 35,9–43,5% 1234–495 кадров в секунду (графический процессор T4) Очень высокий Очень высокая скорость, идеально подходит для развертывания на периферии сети. Умеренная точность, зависит от набора данных.
YOLOv7 ~56,8% при 30 кадрах в секунду (видеокарта V100) 30–160 кадров в секунду Высокий Лучший в своем классе баланс в режиме реального времени Зависимость от графического процессора, меньшая мобильная совместимость.
Faster R-CNN (с VGG16) ~55% mAP ~5 кадров в секунду (GPU) Умеренный Высокая точность, подходит для мелких объектов. Слишком низкая скорость для работы в режиме реального времени на лёгком оборудовании.
AT-LI-YOLO (роботы для обслуживания дома) +3,2% по сравнению с YOLOv3 (≈40%+ mAP) ~34 FPS (29 мс) Высокий Отлично подходит для съемки мелких/размытых/затененных объектов в помещении. По-прежнему специфично для конкретной задачи, требуются дополнения для устранения размытия.
YOLOv3 против YOLOv4 (роботизированная рука) YOLOv4 лучше, чем YOLOv3
(данных нет)
YOLOv4 обладает лучшей скоростью. Высокий YOLOv4 обладает большей скоростью и точностью по сравнению с v3. Контекстно-зависимая производительность

Одноступенчатые детекторы, включая самые современные YOLOv6/v7, обеспечивают производительность в реальном времени (от сотен до более 1000 кадров в секунду) с умеренной точностью (35–57% mAP), что идеально подходит для быстро развивающихся задач, таких как предотвращение столкновений и выбор объектов в контейнерах. Faster R-CNN, с другой стороны, достигает более высокой точности (~55% mAP), но ограничен ≈5 кадрами в секунду, что делает его менее подходящим для развертывания в реальном времени на периферии сети.

Специализированные варианты демонстрируют влияние индивидуальной настройки: AT-LI-YOLO достигает ~34 кадров в секунду и улучшает обнаружение мелких объектов примерно на 3% по сравнению с YOLOv3, в то время как Parallel YOLO–GG обеспечивает точность ~94% и на 14% большую скорость по сравнению с YOLOv3 в сценариях захвата. Кроме того, YOLOv4 был протестирован на роботизированных манипуляторах, показав повышение скорости и точности по сравнению с YOLOv3.

В системах коллаборативных роботов эталонная производительность обработки в реальном времени обычно составляет ≥15–30 кадров в секунду на периферийных устройствах. Таким образом, квантованные YOLOv6/N и YOLOv7 отлично подходят, особенно в сочетании с аппаратными ускорителями. Для задач, требующих точной локализации или обработки мелких объектов, привлекательными альтернативами являются специализированные облегченные версии (AT-LI-YOLO, YOLO–GG). Двухэтапные детекторы, такие как Faster R-CNN, могут по-прежнему использоваться в контекстах, где задержка модели приемлема или где высокая точность важнее скорости.

3.2. Оценка позы человека и распознавание активности

Эффективное взаимодействие человека и робота требует от роботов не только распознавания людей, но и понимания их поз, жестов и действий. Оценка позы человека — это задача локализации ключевых точек тела. Оценка позы человека имеет решающее значение для распознавания намерений человека, прогнозирования действий и обеспечения безопасного взаимодействия [4344]. Точность оценки позы существенно влияет на последующие задачи, такие как прогнозирование намерений и совместное планирование в общих рабочих пространствах [4445]. Ошибки обнаружения позы, превышающие 10–15 пикселей в области запястья или плечевого сустава, существенно снижают эффективность совместной работы [46].

Современные технологии, включая OpenPose, HRNet и Vision Transformers, позволили отслеживать нескольких человек в режиме реального времени в условиях загроможденной среды [47]. В сочетании с моделями распознавания активности, такими как трехмерные сверточные нейронные сети (3D-CNN) и архитектуры на основе LSTM (долговременной кратковременной памяти), коботы могут заблаговременно корректировать свое поведение в ответ на движения человека [4849].

3.3. Понимание сцены и моделирование окружающей среды

Помимо распознавания объектов и людей, целостное понимание сцены имеет важное значение для коллаборативных роботов, работающих в сложных средах [624]. Понимание сцены включает в себя семантическую сегментацию, пространственное мышление и обнаружение возможностей [50].

Создавая подробные семантические карты своего окружения, коллаборативные роботы могут определять зоны взаимодействия, динамически распределять ресурсы и предвидеть изменения окружающей среды. Такие методы, как DenseFusion для оценки положения объекта и алгоритмы SLAM, улучшенные с помощью глубокого обучения, способствовали значительному прогрессу в этой области [51].

3.4. SLAM и пространственная осведомленность для общих рабочих пространств

Совместные задачи часто разворачиваются в частично структурированных или динамически изменяющихся пространствах, что требует надежного пространственного восприятия. Одновременная локализация и картографирование (SLAM) позволяют коллаборативным роботам создавать и обновлять карты, одновременно определяя свое местоположение в них, что представляет собой основополагающую возможность для безопасной и надежной автономности [5253].

Современные подходы к SLAM на основе визуального восприятия, такие как ORB-SLAM3 и Deep-SLAM, интегрируют монокулярные, стереоскопические и глубинные входные данные с камер для поддержания ситуационной осведомленности даже в условиях, населенных людьми [545556]. Семантический SLAM расширяет традиционный SLAM, распознавая и исключая динамические объекты — это крайне важно в условиях, когда люди двигаются непредсказуемо. ORB-SLAM3, хотя и не является семантическим по умолчанию, повышает надежность за счет интеграции IMU и управления несколькими картами.

Опыт работы с ORB-SLAM3, как показано в [57], показывает, что он обрабатывает динамические перекрытия, создавая подкарты и поддерживая инерциальную согласованность, но он не может явно исключать людей без внешних семантических масок. Методы, такие как Dynamic-SLAM, используют сегментацию (например, Mask R-CNN) для фильтрации движущихся людей, уменьшая ошибки отслеживания и дрейф. Для надежного HRC передовая практика сочетает семантическую сегментацию для исключения движущихся людей с объединением IMU-визуальных данных для статического отображения. Некоторые примеры бенчмарков по SLAM и коррекции дрейфа можно увидеть в [5859606162].

Кроме того, семантические варианты SLAM обогащают карты аннотациями на уровне объектов. Эти варианты повышают способность кобота рассуждать об окружающей среде релевантным для задачи образом. Коррекция дрейфа SLAM, включающая методы замыкания контура, имеет решающее значение для минимизации дрейфа при длительном развертывании SLAM в динамичных средах, где люди совместно используют ресурсы [6364]. Будущие направления включают SLAM с учетом человеческого фактора, который не только фильтрует, но и прогнозирует движение человека для более безопасного и адаптивного сотрудничества.

Рисунок 1 и Таблица 2 иллюстрируют и обобщают основные технологии в области робототехники, основанной на машинном зрении и взаимодействии с другими системами.

Рисунок 1. Основные технологии машинного зрения, обеспечивающие работу коллаборативной робототехники.

Технологии Цель Репрезентативные методы Примеры применения
Обнаружение объектов
36 , 37 , 38 , 39 ]
Выявить и определить местоположение объектов, имеющих отношение к задаче. YOLOv8, Faster R-CNN, DETR Идентификация инструментов, распознавание препятствий
Оценка позы человека
43 , 44 , 45 , 46 , 47 , 48 , 49 ]
Фиксация анатомических ориентиров и движений человеческого тела. OpenPose,
HRNet, Vision Transformers
Распознавание жестов, мониторинг безопасности
Понимание сцены
6 , 24 , 50 , 51 ]
Семантическая маркировка и пространственное мышление DeepLabv3+, DenseFusion, Semantic SLAM Составление карты рабочего пространства, обнаружение возможностей взаимодействия.
Визуальный SLAM
52 , 53 , 54 , 55 , 56 , 63 , 64 ]
Локализация и реконструкция окружающей среды ORB-SLAM3, DeepFactors,
SemanticFusion
Навигация, адаптация общего рабочего пространства

4. Автономия и принятие решений на основе ИИ

4.1. Архитектуры глубокого обучения для восприятия и планирования

Глубокое обучение (DL) стало преобразующей силой в области роботизированной автономности [6566]. DL позволяет создавать сквозные конвейеры обучения, охватывающие восприятие, принятие решений и планирование движения [6768]. Схематические этапы этого конвейера описаны и проиллюстрированы на рисунке 2 , от сенсорных входных данных до действий кобота.

Рисунок 2. Обзор конвейера глубокого обучения для восприятия и действий коллаборативного робота — от входных датчиков до команд действий с помощью нейронной архитектуры политики.

Сверточные нейронные сети (CNN) широко используются для извлечения признаков на основе зрения [6970]. CNN легли в основу более современных архитектур, таких как трансформеры и графовые нейронные сети (GNN), которые облегчают пространственное мышление и реляционное моделирование в среде взаимодействия человека и робота [717273]. Более того, модели кодировщик-декодировщик и механизмы внимания повышают обобщающую способность в различных задачах и средах, позволяя коллаборативным роботам работать в условиях неопределенности, сохраняя при этом интерпретируемость [74].

4.2. Обучение с подкреплением для адаптивного поведения

Обучение с подкреплением (RL) наделяет коллаборативных роботов способностью изучать оптимальное поведение посредством взаимодействия с окружающей средой, получая обратную связь в виде вознаграждений [75]. В промышленных роботах-роботах-роботах алгоритмы RL с высокой эффективностью использования выборки имеют решающее значение, поскольку сбор больших объемов данных о взаимодействии в реальном мире занимает много времени и может представлять опасность для безопасности [76]. Эффективность использования выборки в методах RL, таких как мета-RL, обучение по учебной программе и перенос моделирования в реальность (Sim2Real), используется для снижения неэффективности данных в конвейерах обучения роботов с подкреплением [777879].

Последние достижения в области глубокого обучения с подкреплением (DRL) — в частности, глубокие Q-сети (DQN), мягкий актор-критик (SAC) и оптимизация проксимальной политики (PPO) — позволили коллаборативным роботам приобретать сложные навыки, такие как манипулирование, совместная сборка и адаптивное планирование траектории. [80818283].

В общих рабочих пространствах обучение с подкреплением способствует быстрой онлайн-адаптации к новым моделям поведения человека и динамическим ограничениям задачи [8485]. Подходы, основанные на моделях (например, World Models и MuZero), еще больше ускоряют обучение за счет моделирования результатов, что позволяет осуществлять проактивное планирование с меньшим количеством реальных примеров [86].

4.3. Объяснимый искусственный интеллект (XAI) и этическая автономия

Поскольку коллаборативные роботы берут на себя роли в принятии решений в человекоцентричных областях, объяснимость становится жизненно важной для доверия пользователей, прозрачности и соблюдения нормативных требований [87]. Методы объяснимого ИИ (XAI), такие как тепловые карты внимания, карты значимости и извлечение символических правил, позволяют понять, как и почему коллаборативный робот выбирает определенные действия [8889]. Закон ЕС об ИИ и стандарт ISO/IEC TR 24028 содержат рекомендации по надежному ИИ, призывая к интеграции объяснимости и управления рисками в автономные системы [90]. Этические стандарты ИИ: семейство стандартов IEEE P7000 и рекомендации ЕС по надежному ИИ определяют этические требования к проектированию, которые особенно важны при развертывании коллаборативных роботов, чувствительных к безопасности [91].

Помимо технической прозрачности, в коллаборативной робототехнике все большее значение придается этическим принципам автономии. Эти принципы включают такие аспекты, как непричинение вреда, сохранение конфиденциальности и подотчетность, в цели обучения или политику принятия решений. Гибридные подходы, сочетающие нейронное и символическое мышление, предлагают перспективный путь к созданию этически ответственных коллаборативных роботов, которые поддаются проверке и аудиту.

4.4. Когнитивные архитектуры для человекоподобного взаимодействия

Для эффективного сотрудничества коботы должны выйти за рамки реактивного управления и воплотить в себе когнитивные качества, такие как память, прогнозирование и внимание. Когнитивные архитектуры — такие как SOAR, ACT-R [92] и гибридные нейросимволические системы — моделируют эти возможности, интегрируя восприятие, рассуждение и обучение в единую структуру [9293].

В условиях совместной работы эти архитектуры поддерживают распределение задач, поочередное выполнение, совместное внимание и вывод о психическом состоянии. Например, интеграция моделей теории разума позволяет коллаборативным роботам рассуждать о человеческих убеждениях и целях, повышая их беглость и безопасность в сценариях совместных действий. Зрение играет здесь ключевую роль, поскольку визуальные сигналы (например, взгляд, жесты и выражение лица) информируют внутренние модели состояния, которые модулируют поведение робота в реальном времени [94]. В таблице 3 приведено краткое изложение этого раздела.

Таблица 3. Краткое описание методов принятия решений и автономного управления с использованием ИИ.

Метод Описание Основные преимущества Примеры приложений
Архитектуры глубокого обучения [65, 66, 67, 68, 69, 70, 71, 72, 73, 74] Комплексные модели для восприятия и планирования Высокая точность; обработка сложных сцен. Визуальное обнаружение частей; семантическое сопоставление
Обучение с подкреплением (RL)
[75, 76, 77, 78, 79, 80, 81, 82, 83, 84, 85, 86]
Обучение адаптивным стратегиям методом проб и ошибок. Справляется с динамичными, постоянно меняющимися задачами. Адаптивное планирование траектории; сборка с учетом силы нажатия
Объяснимый ИИ (XAI) и этическая автономия [87, 88, 89, 90] Интерпретируемое и безопасное принятие решений Повышает доверие и безопасность. Визуальная обратная связь; соответствие нормативным требованиям
Когнитивные архитектуры [91, 92, 93, 94] Человекоподобная интеграция восприятия и планирования Обеспечивает проактивное и интуитивно понятное взаимодействие. Прогнозирование намерений; совместная передача задач.

6. Вопросы, касающиеся коллаборативных роботов в системной архитектуре, искусственном интеллекте и алгоритмах.

6.1. Передовые системные архитектуры и интеграция

Современные коллаборативные роботы требуют интегрированных системных архитектур, которые органично объединяют восприятие, планирование и управление. Отходя от традиционных конвейеров «восприятие-планирование-действие», современные разработки используют промежуточные программные решения, такие как ROS-Industrial, для облегчения процессов слияния данных с датчиков в реальном времени и принятия решений [121]. Например, реализация автономной промышленной ячейки с использованием стереокамер «глаз в руке» и визуальной подачи демонстрирует эффективность таких интеграций в повышении гибкости и точности производственных линий [19].

Специализированные когнитивные стеки, такие как DAC-HRC, и конфигурации граничных вычислений оптимизированы для визуальных задач, чувствительных к задержке, что позволяет коллаборативным роботам эффективно обрабатывать сложные данные [122]. Эти достижения особенно полезны в производственных средах, где интеллектуальные коллаборативные системы, как было показано, улучшают взаимодействие человека и робота и общую производительность [16].

Переход к легковесным, специализированным платформам заменяет монолитные решения, тем самым повышая масштабируемость и адаптивность в различных секторах. В сфере интеллектуального производства внедрение подходов к обучению роботов с участием человека гарантирует, что коллаборативные роботы смогут адаптироваться к динамическим задачам, сохраняя при этом стандарты безопасности и эффективности [29123].

6.2. Эволюция парадигм ИИ: от глубокого обучения к базовым моделям.

Как уже упоминалось, ИИ в коллаборативной робототехнике переходит от моделей, ориентированных на конкретные задачи, к базовым моделям — крупномасштабным предварительно обученным моделям, которые адаптируются к множеству задач. Модели визуального языка (VLM) и большие языковые модели (LLM) теперь поддерживают понимание сцены и рассуждения о задаче без переобучения, что позволяет обобщать на новые условия [67].

Эти модели предлагают распознавание без предварительного обучения [124] и планирование на основе языка [125], расширяя возможности коллаборативных роботов. Трансформаторы зрения (ViT) и мультимодальные трансформеры еще больше улучшают восприятие, интегрируя текстовые и графические входные данные в реальном времени [47]. Этот сдвиг также создает проблемы с объяснимостью и вычислительными затратами, что побуждает к гибридным подходам, сочетающим глубокое обучение и классическое планирование [2670126].

6.3. Роль нейронных архитектур политики

Одним из наиболее значительных достижений в области коллаборативной робототехники является внедрение нейронных архитектур политики, включая глубокое обучение с подкреплением (DRL), имитационное обучение и сквозное визуально-моторное управление [127]. Эти методы позволили коллаборативным роботам изучать гибкие стратегии выполнения задач на основе опыта, а не полагаться исключительно на программирование на основе правил.

Однако подходы DRL часто требуют больших объемов данных, сложны для интерпретации и склонны к переобучению в узко определенных средах задач [128]. Разрыв между симуляцией и реальностью — когда стратегии, обученные в симуляции, не могут обобщиться в физическом мире — остается центральной проблемой [129130131]. Гибридные архитектуры [132], сочетающие символическое рассуждение, вероятностное планирование и изученные стратегии, являются многообещающим направлением, обеспечивающим большую устойчивость и обобщаемость в различных областях задач.

6.4. Алгоритмические структуры для динамических сред

Коботы, работающие в неструктурированных средах, должны планировать действия в условиях неопределенности. В современных системах применяются вероятностные модели, такие как частично наблюдаемые марковские процессы принятия решений (POMDP), и распознавание намерений посредством анализа движения для адаптации к действиям человека [133]. Например, алгоритмы обнаружения движения на основе глубокого обучения повышают точность распознавания и поддерживают гибкое поведение [30134].

Передовые подходы к семантическому сопоставлению позволяют коллаборативным роботам интерпретировать динамические среды и соответствующим образом обновлять оперативные планы [1953]. Кроме того, цифровые двойники предоставляют виртуальную испытательную площадку для предварительной проверки стратегий роботов, повышая безопасность и надежность во время реального развертывания [12135]. В таблице 5 приведено краткое изложение этого раздела.

Тема Описание Основные проблемы/Примечания
Передовые системные архитектуры [19121122] Интегрированное восприятие, планирование и управление с помощью промежуточного программного обеспечения (например, ROS-Industrial). Объединение данных с датчиков в реальном времени; задачи, чувствительные к задержке.
Эволюция парадигм ИИ [67124125126] От моделей, ориентированных на конкретные задачи, до базовых моделей и преобразователей машинного зрения. Объясняемость, вычислительные требования
Архитектуры нейронных политик [127, 128129130131, 132] DRL, имитационное обучение, сквозное зрительно-моторное управление Интенсивность данных; разрыв между симуляцией и реальностью; переобучение.
Алгоритмические структуры для динамических сред [53133134135] Вероятностное планирование (POMDP), семантическое отображение, цифровые двойники Адаптация в условиях неопределенности; безопасная предварительная проверка

8. Обсуждение

На данный момент в статье представлен всесторонний и комплексный обзор последних достижений в области интеграции компьютерного зрения и искусственного интеллекта (ИИ) в коллаборативные роботизированные системы. Систематически анализируя ключевые технологии — от обнаружения объектов, понимания сцен и оценки позы человека до обучения с подкреплением и объяснимого ИИ — мы показали, как конвергенция восприятия и познания превращает коллаборативных роботов в восприимчивых, адаптивных и контекстно-ориентированных сотрудников.

Коботы используются в определенных областях применения. Ниже перечислены три наиболее популярные области применения коботов:

  • Производство и промышленность: Коботы играют центральную роль в развитии гибких, человекоцентричных производственных линий. Объединяя базовые модели с мультимодальными датчиками, промышленные роботы выполняют сложные задачи в режиме реального времени. Акцент на безопасности, устойчивости и беспрепятственном взаимодействии человека и машины соответствует принципам Индустрии 5.0 [1481109124126  137].
  • Робототехника в здравоохранении и вспомогательные роботы: Коботы все чаще поддерживают работу больниц — от доставки и уборки до мониторинга пациентов [89133]. Учитывающие эмоции и чувствительные к доверию конструкции повышают безопасность и приемлемость. В хирургических условиях роботы с визуальным управлением повышают точность инструментов, а реабилитационные роботы используют оценку положения для адаптивной терапии [151152].
  • Образование и обучение: Образовательные роботы используют зрение и аффективные вычисления для создания адаптивных, эмоционально интеллектуальных учебных сред. Эти системы способствуют вовлечению учащихся, персонализируют обучение и помогают педагогам отслеживать когнитивные и эмоциональные состояния для улучшения результатов обучения [148].

Современные тенденции в области коллаборативной робототехники демонстрируют переход от реактивных, основанных на правилах систем к управляемым данными, проактивным роботам, способным анализировать сложную визуальную среду и предвидеть намерения человека. Архитектуры глубокого обучения значительно улучшили производительность в визуальном распознавании, а многомодальное слияние данных с датчиков обеспечивает более богатое и тонкое взаимодействие человека и робота (HRI). В следующих подразделах представлены основные тенденции в этой области.

8.1. От восприятия до понимания намерений

Интеграция компьютерного зрения и искусственного интеллекта позволила коллаборативным роботам перейти от выполнения базовых задач восприятия — таких как обнаружение объектов и оценка позы человека — к более глубокому пониманию сцен. Несмотря на это, переход от восприятия к пониманию намерений остается недостаточно разработанной областью, имеющей решающее значение для активного сотрудничества.

Для прогнозирования намерений требуется не только распознавание текущей ситуации, но и предвидение целей и будущих действий человека, что позволяет роботам оказывать помощь еще до получения явной команды. Несколько препятствий объясняют ограниченный прогресс в этой области:

  • Недостаток контекстных данных: существующие наборы данных редко содержат размеченные намерения людей во времени, что затрудняет контролируемое обучение для вывода намерений.
  • Неоднозначные визуальные сигналы: похожие жесты могут сигнализировать о разных намерениях в зависимости от контекста задачи, что затрудняет определение однозначности только по визуальной информации.
  • Ограниченная мультимодальная интеграция: аудиосигналы, взгляд, датчики силы и вербальные сигналы имеют решающее значение для определения намерений, но их надежное объединение в режиме реального времени остается сложной задачей.
  • Плохая обобщающая способность: модели часто чрезмерно подгоняются под конкретные задачи или условия, не адаптируясь к новым пользователям, макетам или культурным особенностям.
  • Ограничения, связанные с работой в реальном времени и безопасностью: прогнозирование намерений должно происходить быстро и надежно, чтобы избежать ошибок, которые ставят под угрозу доверие и безопасность.

Для решения этих задач необходимо разработать многомодальные, контекстно-ориентированные системы обучения, эффективные с точки зрения использования данных стратегии обучения и вероятностные модели, способные рассуждать в условиях неопределенности. Улучшение понимания намерений имеет решающее значение для перехода коллаборативных ботов от реактивных инструментов к проактивным, интуитивным партнерам в общих рабочих пространствах.

8.2. Адаптивное взаимодействие в общих рабочих пространствах

В динамичной среде, создаваемой человеком, адаптивность имеет первостепенное значение. SLAM на основе машинного зрения и семантическое моделирование сцен обеспечивают осведомленность об окружающей среде, но современным системам часто не хватает реактивности в реальном времени и прогнозируемого реагирования. Для достижения плавного и интуитивно понятного взаимодействия необходимо интегрировать данные датчиков с глубоким обучением с подкреплением и мультимодальным мышлением в условиях неопределенности.

8.3. Проблемы машинного обучения в реальном времени и масштабируемого машинного обучения

В реальных условиях внедрение сталкивается с различными практическими ограничениями: задержка [13158], гетерогенность данных [159160] и смещение домена [161]. Такие методы, как обучение с малым количеством примеров и непрерывное обучение, являются многообещающими, но еще незрелыми в коллаборативной робототехнике. Масштабирование архитектур машинного обучения без ущерба для безопасности или интерпретируемости является основным узким местом [162], особенно в гибридных архитектурах облако-периферия [163].

Перспективной стратегией для снижения неэффективности данных в системах машинного зрения коллаборативных роботов является использование подходов самообучения (SSL), которые уменьшают зависимость от дорогостоящих наборов данных с ручной разметкой [164]. SSL использует большие объемы необработанных, неразмеченных данных датчиков — таких как RGB-D изображения, сигналы силы-крутящего момента или траектории робота — для обучения полезным представлениям с помощью задач-претекстов [165].

Например, прогнозирование будущих кадров, реконструкция скрытых областей или выравнивание мультимодальных входных данных. Эти полученные представления затем могут быть доработаны на меньших, специализированных для конкретной задачи размеченных наборах данных, что повышает эффективность использования данных при сохранении их высокого уровня производительности. В контексте коллаборативной робототехники самообучение может обеспечить надежное обнаружение объектов, оценку позы и понимание сцены даже в динамичных, загроможденных средах с ограниченной аннотацией.

Более того, фреймворки самообучения могут способствовать непрерывному обучению в цеху, адаптируясь к новым объектам и компоновкам без дорогостоящей обработки данных. Таким образом, интеграция самообучения предлагает масштабируемый путь к более адаптивным, эффективным с точки зрения данных системам машинного зрения для безопасного и интуитивно понятного взаимодействия человека и робота.

8.4. Доверие человека, прозрачность и этичный ИИ

Доверие является основополагающим принципом сотрудничества человека и кобота. Чтобы избежать путаницы и расширения охвата, мы ограничимся обсуждением нетехнических конечных пользователей (а не разработчиков), одновременно учитывая интересы гораздо большего числа людей. Доверие определяет, чувствуют ли люди себя в безопасности, уверены ли они в себе и готовы ли делить задачи или пространство с роботами. Правильно выстроенное доверие улучшает командную работу, снижает количество ошибок и повышает производительность, в то время как недоверие или чрезмерная зависимость могут привести к несчастным случаям или неэффективному использованию. Для построения доверия необходимы объяснимый ИИ, прозрачность в циклах восприятия-действия и этичный дизайн, гарантирующий предсказуемость, интерпретируемость и соответствие поведения кобота человеческим ценностям. Объяснимость решений, принимаемых ИИ, прозрачность в циклах восприятия-действия и соблюдение этических принципов имеют важное значение. Однако в современных системах объяснимость часто рассматривается как второстепенный вопрос, а не как императив проектирования. Основываясь на принципах «Этика по умолчанию», представленных в разделе 7.3 , мы предлагаем следующую структуру для коботов с поддержкой машинного зрения:

Концепция этики на этапе проектирования для коллаборативных роботов с поддержкой машинного зрения

Для обеспечения справедливости, конфиденциальности и прозрачности в совместной робототехнике системы машинного зрения должны следовать этичному подходу на этапе проектирования, основанному на следующих практических принципах:

  • Анализ заинтересованных сторон:
    • Привлекайте операторов, дизайнеров и специалистов по этике на ранних этапах.
    • Выявите потенциальные предубеждения, уязвимости и социальные последствия.
  • Конфиденциальность и минимизация данных:
    • Собирайте только необходимые визуальные данные.
    • По возможности применяйте обработку данных на устройстве, чтобы уменьшить зависимость от облачных сервисов.
    • Анонимизировать данные о людях (например, размыть лица, удалить идентификаторы).
  • Аудит предвзятости и справедливости:
    • Проведите оценку обучающих наборов данных на предмет пробелов в представлении информации.
    • Протестируйте модели на различных группах пользователей, чтобы избежать дискриминационных результатов.
    • При появлении расхождений проведите повторное обучение с использованием сбалансированных данных.
  • Интеграция объяснимого искусственного интеллекта (XAI):
    • Обоснуйте решения, основанные на видении будущего, и приведите их в понятной для человека форме.
    • Используйте визуальные наложения или словесные подсказки, чтобы объяснить намерения робота.
  • Безопасность и согласие:
    • Внедрить механизмы добровольного включения/отключения визуального мониторинга.
    • Обеспечьте четкую сигнализацию при включении камер.
    • Предусмотреть возможность ручного отключения аварийной остановки.
  • Непрерывный мониторинг и обратная связь:
    • Отслеживайте производительность системы и соблюдение этических норм после развертывания.
    • Соберите отзывы операторов для совершенствования политики.
    • Установите линии ответственности за сбои или нарушения.

Внедрение этих этапов на всех этапах проектирования и внедрения позволяет роботам-компьютерам на основе машинного зрения укреплять доверие, защищать права пользователей и соответствовать более широким общественным ценностям.

В будущих системах необходимо внедрять этические принципы и ориентированную на пользователя прозрачность на всех уровнях принятия решений.

8.5. На пути к бесперебойному и инициативному сотрудничеству

В конечном счете, концепция коллаборативных роботов как инициативных членов команды требует бесшовной интеграции перцептивных и когнитивных возможностей. Это подразумевает синхронизированное визуальное восприятие, семантическое понимание сцены и адаптивное планирование в реальном времени — осуществляемое с определенной степенью автономности, которая остается подотчетной и прозрачной для партнеров-людей. Преодоление этих разрывов — следующая грандиозная задача в коллаборативной робототехнике.

Тем не менее, проблемы остаются: вывод в реальном времени при вычислительных ограничениях, отсутствие обобщаемости результатов на различные задачи и среды, неэффективность данных и необходимость принятия этичных и объяснимых решений — все это по-прежнему является серьезным препятствием. Некоторые из основных проблем представлены в следующих подразделах.

8.6. Проблемы совместимости и открытые роботизированные архитектуры

Взаимодействие требует прозрачной независимости между аппаратным обеспечением (кобота и системы машинного зрения) и его поведением на различных программных платформах. Современные промежуточные программные платформы взаимодействуют с различными платформами, обеспечивая схожее управление, манипулирование и понимание сцены на основе машинного зрения на разных системах. Примерами таких промежуточных программных платформ являются ROS 2, OPC UA, RobMoSys, OPIL, SmartSoft/BRIDE и ROS-Industrial.

Стандартные промежуточные программные платформы, такие как ROS 2, имеют расширенные интерфейсы управления и расширения для восприятия, ориентированные на ИИ (например, ros2_control, MoveIt 2 и стеки восприятия ROS 2). Эти расширения значительно улучшили базовое взаимодействие для систем коботов, но они остаются недостаточными для достижения истинного взаимодействия в управлении, манипулировании и понимании сцены на основе машинного зрения. Промежуточное программное обеспечение решает проблему обмена сообщениями, но не обеспечивает более глубокого семантического согласования между гетерогенными системами.

Для того чтобы коллаборативные роботы могли беспрепятственно совместно выполнять такие задачи, как совместная сборка, динамическая передача объектов или навигация по общему рабочему пространству, они должны согласовывать не только интерфейсы управления, но и представления объектов, сцен и намерений человека. Это требует стандартизации семантических моделей для понимания сцены, включая таксономии объектов, возможности взаимодействия, позы человека и определения действий, а также общих онтологий для описания задач манипулирования и ограничений.

Без такой семантической совместимости модули восприятия (например, детекторы объектов или анализаторы 3D-сцен) остаются специфичными для конкретного производителя или задачи, что ограничивает возможность повторного использования и координации между платформами. Более того, для достижения безопасного, контекстно-ориентированного управления в смешанных командах роботов необходимы согласованные протоколы для обмена намерениями, согласования планов и обеспечения соблюдения ограничений безопасности (например, пределов силы и динамического предотвращения столкновений) в режиме реального времени.

Таким образом, для повышения совместимости в коботике потребуется не только надежное промежуточное программное обеспечение для связи, но и стандартизированные абстракции для восприятия, стратегий управления и совместного планирования, что в конечном итоге позволит осуществлять модульную интеграцию разнородных роботов по принципу «подключи и работай» с общим пониманием окружающей среды и выполняемых задач.

В таблице 7 обобщены ключевые различия между контролируемыми лабораторными демонстрациями и реальными условиями эксплуатации коллаборативных роботов с поддержкой машинного зрения и искусственного интеллекта, что иллюстрирует, почему решения, проверенные в идеальных условиях, часто испытывают трудности с достижением надежной, безопасной и заслуживающей доверия работы в динамичных условиях, ориентированных на человека.

Аспект Лабораторные демонстрации Внедрение в реальных условиях Репрезентативные рекомендации
Среда Контролируемое, статичное, хорошо освещенное пространство. Динамичное, загроможденное, переменное освещение и затенение 24 , 100 , 101 ]
Распределение данных Ограниченное разнообразие; тщательно отобранные наборы данных. Разнообразные, непредсказуемые, сдвиги в предметной области. 24 , 77 , 99 , 101 ]
Определение задачи Заранее заданные, повторяющиеся, запрограммированные Непостоянные задачи, незапланированные изменения 16 , 19 , 75 , 124 ]
Состояние датчика Откалиброванный, бесшумный Деградация датчика, смещение, помехи 99 , 100 , 101 ]
Поведение человека кооперативный, предсказуемый Изменчивый, неоднозначный, культурно разнообразный 24 , 139 , 146 , 147 ]
Требования к задержке Часто предоставляется возможность обработки в автономном режиме в упрощенном порядке. Строгие ограничения по времени для обеспечения безопасности и доверия. 19 , 100 , 102 , 121 ]
Необходимость обобщения Низкий уровень (допустима настройка в зависимости от задачи) Высокий уровень (необходимо адаптироваться к новым пользователям, объектам, настройкам) 24 , 75 , 76 , 124 , 126 ]
Вопросы безопасности Имитация или использование отказоустойчивых барьеров Общее рабочее пространство с людьми; необходимо соблюдение законодательства. 84 , 90 , 91 , 138 , 140 ]
Показатели эффективности Контрольные показатели, ориентированные на точность Прочность, надежность, приемлемость для человека 77 , 99 , 126 , 137 ]
Объясняемость Часто не акцентируется внимание Крайне важен для обеспечения доверия пользователей и получения разрешений регулирующих органов. 87 , 90 , 126 , 137 ]
8.7. Ограничения в возможности развертывания в реальных условиях

Несмотря на эти инновации, между лабораторными демонстрациями и реальным применением сохраняется существенный разрыв. Распространенной проблемой является обобщаемость: модели искусственного интеллекта, использующие компьютерное зрение, часто переобучаются в контролируемых условиях и не могут поддерживать свою производительность в реальных условиях, таких как шум, изменчивость освещения, перекрытия или деградация датчиков. Кроме того, многомодальные системы слияния — хотя и многообещающие — вносят сложности в калибровку, задержку и синхронизацию данных между разнородными датчиками (например, визуальными, тактильными, силовыми и слуховыми).

Кроме того, зависимость от ресурсоемких методов глубокого обучения остается узким местом, особенно в приложениях, где аннотированные наборы данных ограничены или имеют этические ограничения (например, в сфере управления персоналом в здравоохранении). Отсутствие стандартизации в системах сравнительного анализа и оценки в различных областях усугубляет эту проблему, затрудняя перекрестную сравнительную проверку.

Для преодоления этих барьеров будущие исследования должны изучить самообучение на основе совместного опыта человека и робота, позволяющее коллаборативным роботам непрерывно обучаться в процессе своей обычной работы без необходимости в больших наборах данных. Нейросимволические системы зрения, которые сочетают обучение на основе данных с логическим рассуждением, открывают путь к объяснимому, но надежному визуальному пониманию. Еще одно перспективное направление — пространственно-временное воображение сцены — роботы, способные моделировать будущие сценарии с использованием прогностических моделей, основанных на визуальных данных, для упреждающей перестройки задач и предотвращения рисков.

Кроме того, совместное визуальное обоснование — когда люди и коботы совместно создают общие семантические карты — может улучшить взаимопонимание и согласованность задач. Наконец, внедрение аффективных вычислений в конвейеры обработки изображений и ИИ может обогатить сотрудничество за счет эмпатических реакций на человеческие эмоции и поведение. Это может сделать коботов контекстно интеллектуальными и социально адаптированными, в дополнение к их функциональным компетенциям.

9. Выводы и дальнейшие направления исследований

В данном обзоре представлен всесторонний и комплексный анализ последних достижений в области интеграции компьютерного зрения и искусственного интеллекта (ИИ) в коллаборативные роботизированные системы. Систематически изучая базовые технологии, такие как обнаружение объектов, понимание сцены, оценка позы человека, обучение с подкреплением и объяснимый ИИ, мы показали, как конвергенция восприятия и познания превращает коллаборативных роботов (коботов) в восприимчивых, адаптивных и контекстно-ориентированных партнеров.

Последние разработки указывают на явную эволюцию от реактивных, основанных на правилах систем к управляемым данными, проактивным роботам, способным интерпретировать сложную визуальную среду и предвидеть намерения человека. Глубокое обучение существенно улучшило визуальное распознавание, а многомодальное слияние данных с датчиков обогатило взаимодействие человека и робота (HRI) большей детализацией и отзывчивостью.

Однако сохраняется ряд критических проблем. Остается существенный разрыв между лабораторными показателями и реальным применением. Значительной проблемой остается обобщаемость: модели искусственного интеллекта, использующие компьютерное зрение, часто переобучаются в контролируемых условиях и демонстрируют снижение производительности в реальных условиях, таких как переменное освещение, перекрытия, деградация датчиков и окружающий шум.

Многомодальные системы слияния, хотя и многообещающие, несут в себе свои собственные проблемы, включая сложности калибровки, задержки и проблемы синхронизации между разнородными датчиками, такими как визуальные, тактильные, слуховые и датчики обратной связи по усилию. Более того, зависимость от ресурсоемких методов глубокого обучения накладывает ограничения, особенно в областях, где аннотированные данные скудны или этически ограничены, таких как здравоохранение и общественная безопасность. Отсутствие стандартизированных контрольных показателей и протоколов оценки в различных областях применения еще больше усложняет как воспроизводимость, так и сравнительную проверку. Этические проблемы, эффективность использования данных, вывод в реальном времени при аппаратных ограничениях и необходимость объяснимого принятия решений остаются актуальными вопросами.

Для преодоления этих препятствий будущие исследования должны уделить приоритетное внимание нескольким стратегическим направлениям.

9.1. Проактивное сотрудничество человека и робота

Современные системы в основном работают реактивно, реагируя на действия человека постфактум. Следующий рубеж — оснащение коллаборативных роботов возможностями проактивного взаимодействия: предвидением действий человека, прогнозированием намерений и динамической адаптацией их поведения. Это требует развития целостного понимания обстановки, временного анализа и интеграции мультимодальных данных для обеспечения прогнозного моделирования и координации в реальном времени. Для достижения этой цели мы выделяем конкретные технические направления:

  • Пространственно-временные трансформеры для прогнозирования движений и намерений человека на основе видеопоследовательностей, позволяющие осуществлять упреждающее планирование.
  • Графовые нейронные сети используются для объединения мультимодальных входных данных (зрение, сила и звук) с целью построения реляционных рассуждений о людях, объектах и ​​задачах.
  • Семантическое отображение в реальном времени в 3D с использованием нейронных неявных представлений для детального и динамического понимания рабочего пространства.
  • Прогнозирование траектории с учетом неопределенности с использованием вероятностных моделей для обеспечения безопасного и осторожного планирования с учетом присутствия людей.
  • Объяснимое обучение с подкреплением позволяет сделать стратегии роботов интерпретируемыми и заслуживающими доверия.
  • Метод обучения с малым количеством примеров и метаобучение для быстрой адаптации к новым задачам и сотрудникам при минимальном объеме данных.
  • Внедрение Edge AI обеспечивает восприятие и планирование с низкой задержкой для оперативного и безопасного взаимодействия.
Эти целенаправленные подходы позволяют реализовать потенциал проактивного, гибкого и ориентированного на человека сотрудничества в системах коллаборативных роботов следующего поколения.
9.2. Малозадачность и непрерывное обучение на периферии.

Коботы должны быть универсальными и способными работать с различными пользователями, задачами и средами, одновременно учитывая вычислительные ограничения. Критически важным будет использование методов обучения с малым количеством примеров, без примеров и непрерывного обучения, оптимизированных для периферийных устройств. Легковесные архитектуры трансформеров и эффективные сверточные нейронные сети (CNN), разработанные для обработки данных непосредственно на устройстве, могут поддерживать обучение в реальном времени и снижать риск катастрофического забывания.

9.3. Взаимодействие и открытые роботизированные архитектуры

Разрозненность аппаратного и программного обеспечения для робототехники препятствует ее масштабируемости. Разработка стандартизированных решений с открытым исходным кодом для интеграции машинного зрения и искусственного интеллекта обеспечит совместимость по принципу «подключи и работай», совместное тестирование и более широкое сотрудничество между академическими кругами и промышленностью. Модульные и открытые операционные системы для робототехники сыграют важную роль в обеспечении совместимости.

9.4. Объяснимость, безопасность и доверие людей

По мере того, как коллаборативные роботы проникают в критически важные с точки зрения безопасности области, такие как производство, здравоохранение и общественные пространства, объяснимость, безопасность и доверие человека становятся важнейшими системными требованиями [879091126137]. Без доверия пользователя коллаборативные роботы рискуют быть недоиспользованными или работать небезопасно, что подрывает их ценность в ориентированных на человека рабочих пространствах. Методы объяснимого ИИ (XAI), такие как LIME и SHAP, обеспечивают интерпретируемость, не зависящую от модели, помогая инженерам и операторам понимать прогнозы сложных моделей восприятия [126137]. В контексте робототехники картирование значимости и визуализация внимания применялись к визуально-моторным стратегиям для уточнения того, какие визуальные входные данные управляют действиями коллаборативного робота [126].

Для обеспечения безопасности такие системы, как SafeROS и VerifAI, позволяют проводить формальную проверку компонентов восприятия и планирования на соответствие требованиям безопасности [9091]. Эти инструменты помогают выявлять нарушения политики или небезопасное поведение до начала развертывания.

Международные стандарты усиливают эти потребности. ISO/TS 15066 определяет пределы безопасности и оценку рисков для взаимодействия человека и робота, а Закон ЕС об ИИ вводит основанные на рисках требования к прозрачности, контролю со стороны человека и надежности систем ИИ [90]. Серия IEEE P7000 предоставляет структурированные рекомендации по внедрению этических соображений и объяснимости на протяжении всего проектирования системы [91].

Интеграция этих инструментов и фреймворков в процессы разработки коллаборативных роботов имеет решающее значение для обеспечения того, чтобы системы были не только эффективными и адаптивными, но и безопасными, понятными и заслуживающими доверия для людей-партнеров.

Системы будущего должны включать в себя прозрачность, механизмы защиты от сбоев и этически обоснованную автономность для обеспечения безопасности, надежности и соответствия нормативным требованиям. Объясняемость должна быть тесно связана с мониторингом в реальном времени и адаптивными системами управления. Мониторинг в реальном времени, прозрачность и механизмы защиты от сбоев должны быть тесно интегрированы с процессами принятия решений.

9.5. Мультимодальное и семантическое слияние данных с датчиков

Чтобы выйти за рамки традиционного RGB-сканирования, будущие коллаборативные роботы должны использовать спектр сенсорных входных данных, включая LiDAR, тактильную обратную связь, аудио и тепловизионные изображения. Разработка семантических систем слияния данных с датчиков, которые контекстуально согласуют эти разнообразные сигналы, обогатит понимание сцены и позволит более точно моделировать намерения человека и динамику окружающей среды.

Хотя многомодальное слияние данных с датчиков обещает более богатое восприятие для коллаборативных роботов, на практике часто встречаются противоречивые или несогласованные данные между модальностями, такие как расхождения между картами глубины LiDAR и RGB под отражающими поверхностями или при плохом освещении. Для решения этих конфликтов в реальном времени требуются надежные стратегии слияния, выходящие за рамки простого усреднения.

Вероятностные методы, такие как байесовская фильтрация и фильтры Калмана или фильтры частиц, явно моделируют неопределенность в каждом датчике, что позволяет проводить перекрестную проверку и динамическое взвешивание на основе достоверности. Иерархическое принятие решений может расставлять приоритеты для датчиков или уровней точности восприятия в зависимости от критичности задачи (например, грубое картографирование против тонкой обработки) и контекста (например, LiDAR в условиях низкой освещенности).

Архитектуры слияния на основе машинного обучения дополнительно адаптивно разрешают конфликты, предлагая обучение на реалистичных вариациях. В конечном итоге, надежное слияние требует контекстно-зависимых механизмов арбитража, которые объединяют моделирование неопределенности, межсенсорную проверку и иерархии действий для обеспечения безопасного и согласованного восприятия при манипулировании в реальном времени и взаимодействии человека и робота.

9.6. Необходимость стандартизации и единых рамок оценки

В настоящее время прогресс сдерживается отсутствием единых стандартов бенчмаркинга. Это приводит к непоследовательному бенчмаркингу и разрозненным наборам данных, которые искажают оценку производительности системы и препятствуют четкому выявлению прогресса. Для решения проблемы отсутствия единых рамок оценки в этой области активно ведутся работы по стандартизации и бенчмаркингу. Такие инициативы, как проект EU RoboticsBench, направлены на определение общих задач, метрик и наборов данных для оценки взаимодействия человека и робота, включая визуальное восприятие и манипулирование в реалистичных промышленных сценариях [90].

Такие инициативы, как RoMaIn (Robotics Manipulation Intelligence Benchmark) в ETH Zurich и CLEAR Benchmark (Collaborative Learning and Adaptation in Robotics) [126], способствуют созданию общедоступных стандартизированных протоколов для оценки адаптации и обучения в динамических средах. Для модулей восприятия наборы данных, такие как EPIC-KITCHENS (для распознавания объектов и действий на реальных кухнях) и HRI-COVID (для захвата совместных жестов в условиях соблюдения дистанции), предлагают аннотированные данные, имеющие отношение к взаимодействию человека и робота [2499].

Программные платформы, включая ROS-Industrial, OpenDR и ROS 2 Quality Assurance Working Group, поддерживают стандартные интерфейсы, совместимость промежуточного программного обеспечения и методы тестирования, которые позволяют интегрировать модули восприятия, планирования и управления по принципу «подключи и работай» на гетерогенных платформах [19121].

Однако сообщество специалистов по коллаборативной робототехнике до сих пор не пришло к полному согласию относительно единых протоколов оценки, открытых сред моделирования и реальных наборов данных для коллаборативных роботов с поддержкой машинного зрения и искусственного интеллекта. Необходимо внедрить общие среды моделирования, открытые наборы данных и метрики оценки, отражающие сложность реального мира. Бенчмарки должны учитывать устойчивость, задержку, адаптивность, доверие пользователей и общую надежность системы в различных областях.

На рисунке 4 представлена ​​концептуальная карта наиболее актуальных и перспективных направлений исследований в области интеграции компьютерного зрения и искусственного интеллекта в коллаборативной робототехнике. Каждая ветвь выделяет отдельную проблему или область возможностей, решение которых поможет создать безопасные, надежные и ориентированные на человека системы коллаборативных роботов.

Рисунок 4. Краткое описание направлений будущих исследований.

Интеграция компьютерного зрения и искусственного интеллекта в коллаборативную робототехнику находится на переломном этапе. По мере того, как эти системы переходят от экспериментальных прототипов к широкому внедрению, в предстоящее десятилетие потребуется всестороннее переосмысление алгоритмических, архитектурных и этических аспектов. Благодаря целенаправленным исследованиям эффективности обучения, семантического понимания, построения доверия и практического применения, эта область готова открыть новую эру социально интеллектуальных и контекстно – ориентированных роботизированных коллабораторов.

Литература

  1. Patil, Y.H.; Patil, R.Y.; Gurale, M.A.; Karati, A. Industry 5.0: Empowering Collaboration through Advanced Technological Approaches. In Intelligent Systems and Industrial Internet of Things for Sustainable Development; Chapman and Hall/CRC: New York, NY, USA, 2024; pp. 1–23. [Google Scholar]
  2. George, A.S.; George, A.H. The cobot chronicles: Evaluating the emergence, evolution, and impact of collaborative robots in next-generation manufacturing. Partn. Univers. Int. Res. J. 20232, 89–116. [Google Scholar]
  3. Palanisamy, C.; Perumal, L.; Chin, C.W. A comprehensive review of collaborative robotics in manufacturing. Eng. Technol. Appl. Sci. Res. 202515, 21970–21975. [Google Scholar] [CrossRef]
  4. Rahman, M.M.; Khatun, F.; Jahan, I.; Devnath, R.; Bhuiyan, M.A.A. Cobotics: The Evolving Roles and Prospects of Next-Generation Collaborative Robots in Industry 5.0. J. Robot. 20242024, 2918089. [Google Scholar] [CrossRef]
  5. Weidemann, C.; Mandischer, N.; van Kerkom, F.; Corves, B.; Hüsing, M.; Kraus, T.; Garus, C. Literature review on recent trends and perspectives of collaborative robotics in work 4.0. Robotics 202312, 84. [Google Scholar] [CrossRef]
  6. De Magistris, G.; Caprari, R.; Castro, G.; Russo, S.; Iocchi, L.; Nardi, D.; Napoli, C. Vision-based holistic scene understanding for context-aware human-robot interaction. In International Conference of the Italian Association for Artificial Intelligence; Springer International Publishing: Cham, Switzerland, 2021; pp. 310–325. [Google Scholar]
  7. Borboni, A.; Reddy, K.V.V.; Elamvazuthi, I.; AL-Quraishi, M.S.; Natarajan, E.; Ali, S.S.A. The expanding role of artificial intelligence in collaborative robots for industrial applications: A systematic review of recent works. Machines 202311, 111. [Google Scholar] [CrossRef]
  8. Scheutz, C.; Law, T.; Scheutz, M. Envirobots: How human–robot interaction can facilitate sustainable behavior. Sustainability 202113, 12283. [Google Scholar] [CrossRef]
  9. Buyukgoz, S.; Grosinger, J.; Chetouani, M.; Saffiotti, A. Two ways to make your robot proactive: Reasoning about human intentions or reasoning about possible futures. Front. Robot. AI 20229, 929267. [Google Scholar] [CrossRef] [PubMed]
  10. Semeraro, F.; Griffiths, A.; Cangelosi, A. Human–robot collaboration and machine learning: A systematic review of recent research. Robot. Comput.-Integr. Manuf. 202379, 102432. [Google Scholar] [CrossRef]
  11. Mendez, E.; Ochoa, O.; Olivera-Guzman, D.; Soto-Herrera, V.H.; Luna-Sánchez, J.A.; Lucas-Dophe, C.; Lugo-del-Real, E.; Ayala-Garcia, I.N.; Alvarado Perez, M.; González, A. Integration of deep learning and collaborative robot for assembly tasks. Appl. Sci. 202414, 839. [Google Scholar] [CrossRef]
  12. Riedelbauch, D.; Höllerich, N.; Henrich, D. Benchmarking teamwork of humans and cobots—An overview of metrics, strategies, and tasks. IEEE Access 202311, 43648–43674. [Google Scholar] [CrossRef]
  13. Addula, S.R.; Tyagi, A.K. Future of Computer Vision and Industrial Robotics in Smart Manufacturing. Artif. Intell.-Enabled Digit. Twin Smart Manuf. 202422, 505–539. [Google Scholar]
  14. Soori, M.; Dastres, R.; Arezoo, B.; Jough, F.K.G. Intelligent robotic systems in Industry 4.0: A review. J. Adv. Manuf. Sci. Technol. 20244, 2024007. [Google Scholar] [CrossRef]
  15. Cohen, Y.; Shoval, S.; Faccio, M.; Minto, R. Deploying cobots in collaborative systems: Major considerations and productivity analysis. Int. J. Prod. Res. 202260, 1815–1831. [Google Scholar] [CrossRef]
  16. Faccio, M.; Cohen, Y. Intelligent cobot systems: Human-cobot collaboration in manufacturing. J. Intell. Manuf. 202435, 1905–1907. [Google Scholar] [CrossRef]
  17. Cohen, Y.; Faccio, M.; Rozenes, S. Vocal Communication Between Cobots and Humans to Enhance Productivity and Safety: Review and Discussion. Appl. Sci. 202515, 726. [Google Scholar] [CrossRef]
  18. Cohen, Y.; Gal, H.C.B. Digital, Technological and AI Skills for Smart Production Work Environment. IFAC-Pap. 202458, 545–550. [Google Scholar] [CrossRef]
  19. D’Avella, S.; Avizzano, C.A.; Tripicchio, P. ROS-Industrial based robotic cell for Industry 4.0: Eye-in-hand stereo camera and visual servoing for flexible, fast, and accurate picking and hooking in the production line. Robot. Comput.-Integr. Manuf. 202380, 102453. [Google Scholar] [CrossRef]
  20. Wang, J.; Li, L.; Xu, P. Visual sensing and depth perception for welding robots and their industrial applications. Sensors 202323, 9700. [Google Scholar] [CrossRef] [PubMed]
  21. Malhan, R.; Jomy Joseph, R.; Bhatt, P.M.; Shah, B.; Gupta, S.K. Algorithms for improving speed and accuracy of automated three-dimensional reconstruction with a depth camera mounted on an industrial robot. J. Comput. Inf. Sci. Eng. 202222, 031012. [Google Scholar] [CrossRef]
  22. Thakur, U.; Singh, S.K.; Kumar, S.; Singh, A.; Arya, V.; Chui, K.T. Multi-Modal Sensor Fusion With CRNNs for Robust Object Detection and Simultaneous Localization and Mapping (SLAM) in Agile Industrial Drones. In AI Developments for Industrial Robotics and Intelligent Drones; IGI Global Scientific Publishing: New York, NY, USA, 2025; pp. 285–304. [Google Scholar]
  23. Raj, R.; Kos, A. An Extensive Study of Convolutional Neural Networks: Applications in Computer Vision for Improved Robotics Perceptions. Sensors 202525, 1033. [Google Scholar] [CrossRef] [PubMed]
  24. Fan, J.; Zheng, P.; Li, S. Vision-based holistic scene understanding towards proactive human–robot collaboration. Robot. Comput.-Integr. Manuf. 202275, 102304. [Google Scholar] [CrossRef]
  25. Sado, F.; Loo, C.K.; Liew, W.S.; Kerzel, M.; Wermter, S. Explainable goal-driven agents and robots-a comprehensive review. ACM Comput. Surv. 202355, 1–41. [Google Scholar] [CrossRef]
  26. Milani, S.; Topin, N.; Veloso, M.; Fang, F. Explainable reinforcement learning: A survey and comparative review. ACM Comput. Surv. 202456, 1–36. [Google Scholar] [CrossRef]
  27. Brawer, J. Fusing Symbolic and Subsymbolic Approaches for Natural and Effective Human-Robot Collaboration. Ph.D. Dissertation, Yale University, New Haven, CT, USA, 2023. [Google Scholar]
  28. Baduge, S.K.; Thilakarathna, S.; Perera, J.S.; Arashpour, M.; Sharafi, P.; Teodosio, B.; Shringi, A.; Mendis, P. Artificial intelligence and smart vision for building and construction 4.0: Machine and deep learning methods and applications. Autom. Constr. 2022141, 104440. [Google Scholar] [CrossRef]
  29. Chen, H.; Li, S.; Fan, J.; Duan, A.; Yang, C.; Navarro-Alarcon, D.; Zheng, P. Human-in-the-Loop Robot Learning for Smart Manufacturing: A Human-Centric Perspective. IEEE Trans. Autom. Sci. Eng. 202522, 11062–11086. [Google Scholar] [CrossRef]
  30. Mahajan, H.B.; Uke, N.; Pise, P.; Shahade, M.; Dixit, V.G.; Bhavsar, S.; Deshpande, S.D. Automatic robot manoeuvres detection using computer vision and deep learning techniques: A perspective of Internet of Robotics Things (IoRT). Multimed. Tools Appl. 202382, 23251–23276. [Google Scholar] [CrossRef]
  31. Manakitsa, N.; Maraslidis, G.S.; Moysis, L.; Fragulis, G.F. A review of machine learning and deep learning for object detection, semantic segmentation, and human action recognition in machine and robotic vision. Technologies 202412, 15. [Google Scholar] [CrossRef]
  32. Adebayo, R.A.; Obiuto, N.C.; Olajiga, O.K.; Festus-Ikhuoria, I.C. AI-enhanced manufacturing robotics: A review of applications and trends. World J. Adv. Res. Rev. 202421, 2060–2072. [Google Scholar] [CrossRef]
  33. Angulo, C.; Chacón, A.; Ponsa, P. Towards a cognitive assistant supporting human operators in the Artificial Intelligence of Things. Internet Things 202321, 100673. [Google Scholar] [CrossRef]
  34. Jiang, N.; Liu, X.; Liu, H.; Lim, E.T.K.; Tan, C.W.; Gu, J. Beyond AI-powered context-aware services: The role of human–AI collaboration. Ind. Manag. Data Syst. 2023123, 2771–2802. [Google Scholar] [CrossRef]
  35. Gallagher, J.E.; Oughton, E.J. Surveying You Only Look Once (YOLO) Multispectral Object Detection Advancements, Applications And Challenges. IEEE Access 202513, 7366–7395. [Google Scholar] [CrossRef]
  36. Aboyomi, D.D.; Daniel, C. A Comparative Analysis of Modern Object Detection Algorithms: YOLO vs. SSD vs. Faster R-CNN. ITEJ Inf. Technol. Eng. J. 20238, 96–106. [Google Scholar] [CrossRef]
  37. Amjoud, A.B.; Amrouch, M. Object detection using deep learning, CNNs and vision transformers: A review. IEEE Access 202311, 35479–35516. [Google Scholar] [CrossRef]
  38. Shah, S.; Tembhurne, J. Object detection using convolutional neural networks and transformer-based models: A review. J. Electr. Syst. Inf. Technol. 202310, 54. [Google Scholar] [CrossRef]
  39. Liu, S.; Yao, S.; Fu, X.; Shao, H.; Tabish, R.; Yu, S.; Yun, H.; Sha, L.; Abdelzaher, T.; Bansal, A.; et al. Real-time task scheduling for machine perception in intelligent cyber-physical systems. IEEE Trans. Comput. 202171, 1770–1783. [Google Scholar] [CrossRef]
  40. Hussain, M.; Ali, N.; Hong, J.E. Vision beyond the field-of-view: A collaborative perception system to improve safety of intelligent cyber-physical systems. Sensors 202222, 6610. [Google Scholar] [CrossRef] [PubMed]
  41. Yang, B.; Li, J.; Zeng, T. A Review of Environmental Perception Technology Based on Multi-Sensor Information Fusion in Autonomous Driving. World Electr. Veh. J. 202516, 20. [Google Scholar] [CrossRef]
  42. Duan, J.; Zhuang, L.; Zhang, Q.; Zhou, Y.; Qin, J. Multimodal perception-fusion-control and human–robot collaboration in manufacturing: A review. Int. J. Adv. Manuf. Technol. 2024132, 1071–1093. [Google Scholar] [CrossRef]
  43. Zheng, C.; Wu, W.; Chen, C.; Yang, T.; Zhu, S.; Shen, J.; Kehtarnavaz, N.; Shah, M. Deep learning-based human pose estimation: A survey. ACM Comput. Surv. 202356, 1–37. [Google Scholar] [CrossRef]
  44. Dubey, S.; Dixit, M. A comprehensive survey on human pose estimation approaches. Multimed. Syst. 202329, 167–195. [Google Scholar] [CrossRef]
  45. Wang, T.; Liu, Z.; Wang, L.; Li, M.; Wang, X.V. Data-efficient multimodal human action recognition for proactive human–robot collaborative assembly: A cross-domain few-shot learning approach. Robot. Comput.-Integr. Manuf. 202489, 102785. [Google Scholar] [CrossRef]
  46. Kwon, H.; Wang, B.; Abowd, G.D.; Plötz, T. Approaching the real-world: Supporting activity recognition training with virtual imu data. Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 20215, 1–32. [Google Scholar] [CrossRef]
  47. Xu, Y.; Zhang, J.; Zhang, Q.; Tao, D. Vitpose++: Vision transformer for generic body pose estimation. IEEE Trans. Pattern Anal. Mach. Intell. 202346, 1212–1230. [Google Scholar] [CrossRef] [PubMed]
  48. Papanagiotou, D.; Senteri, G.; Manitsaris, S. Egocentric gesture recognition using 3D convolutional neural networks for the spatiotemporal adaptation of collaborative robots. Front. Neurorobot. 202115, 703545. [Google Scholar] [CrossRef] [PubMed]
  49. Matin, A.; Islam, M.R.; Wang, X.; Huo, H. Robust Multimodal Approach for Assembly Action Recognition. Procedia Comput. Sci. 2024246, 4916–4925. [Google Scholar] [CrossRef]
  50. Delitzas, A.; Takmaz, A.; Tombari, F.; Sumner, R.; Pollefeys, M.; Engelmann, F. SceneFun3D: Fine-grained functionality and affordance understanding in 3D scenes. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 16–22 June 2024; pp. 14531–14542. [Google Scholar]
  51. Hoque, S.; Arafat, M.Y.; Xu, S.; Maiti, A.; Wei, Y. A comprehensive review on 3D object detection and 6D pose estimation with deep learning. IEEE Access 20219, 143746–143770. [Google Scholar] [CrossRef]
  52. Yarovoi, A.; Cho, Y.K. Review of simultaneous localization and mapping (SLAM) for construction robotics applications. Autom. Constr. 2024162, 105344. [Google Scholar] [CrossRef]
  53. Zheng, C.; Du, Y.; Xiao, J.; Sun, T.; Wang, Z.; Eynard, B.; Zhang, Y. Semantic map construction approach for human-robot collaborative manufacturing. Robot. Comput.-Integr. Manuf. 202591, 102845. [Google Scholar] [CrossRef]
  54. Zhang, Y.; Wu, Y.; Tong, K.; Chen, H.; Yuan, Y. Review of visual simultaneous localization and mapping based on deep learning. Remote Sens. 202315, 2740. [Google Scholar] [CrossRef]
  55. Pu, H.; Luo, J.; Wang, G.; Huang, T.; Liu, H. Visual SLAM integration with semantic segmentation and deep learning: A review. IEEE Sens. J. 202323, 22119–22138. [Google Scholar] [CrossRef]
  56. Merveille, F.F.R.; Jia, B.; Xu, Z.; Fred, B. Enhancing Underwater SLAM Navigation and Perception: A Comprehensive Review of Deep Learning Integration. Sensors 202424, 7034. [Google Scholar] [CrossRef] [PubMed]
  57. Campos, C.; Elvira, R.; Rodríguez, J.J.G.; Montiel, J.M.; Tardós, J.D. Orb-slam3: An accurate open-source library for visual, visual–inertial, and multimap slam. IEEE Trans. Robot. 202137, 1874–1890. [Google Scholar] [CrossRef]
  58. Servières, M.; Renaudin, V.; Dupuis, A.; Antigny, N. Visual and Visual-Inertial SLAM: State of the Art, Classification, and Experimental Benchmarking. J. Sens. 20212021, 2054828. [Google Scholar] [CrossRef]
  59. Schmidt, F.; Blessing, C.; Enzweiler, M.; Valada, A. Visual-Inertial SLAM for Unstructured Outdoor Environments: Benchmarking the Benefits and Computational Costs of Loop Closing. J. Field Robot. 2025, 1–22. [Google Scholar] [CrossRef]
  60. Tao, Y.; Liu, X.; Spasojevic, I.; Agarwal, S.; Kumar, V. 3d active metric-semantic slam. IEEE Robot. Autom. Lett. 20249, 2989–2996. [Google Scholar] [CrossRef]
  61. Rahman, S.; DiPietro, R.; Kedarisetti, D.; Kulathumani, V. Large-scale Indoor Mapping with Failure Detection and Recovery in SLAM. In Proceedings of the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Abu Dhabi, United Arab Emirates, 14–18 October 2024; pp. 12294–12301. [Google Scholar]
  62. Peng, H.; Zhao, Z.; Wang, L. A review of dynamic object filtering in SLAM based on 3D LiDAR. Sensors 202424, 645. [Google Scholar] [CrossRef] [PubMed]
  63. Arshad, S.; Kim, G.W. Role of deep learning in loop closure detection for visual and lidar slam: A survey. Sensors 202121, 1243. [Google Scholar] [CrossRef] [PubMed]
  64. Ebadi, K.; Palieri, M.; Wood, S.; Padgett, C.; Agha-mohammadi, A.A. DARE-SLAM: Degeneracy-aware and resilient loop closing in perceptually-degraded environments. J. Intell. Robot. Syst. 2021102, 1–25. [Google Scholar] [CrossRef]
  65. Ni, J.; Chen, Y.; Tang, G.; Shi, J.; Cao, W.; Shi, P. Deep learning-based scene understanding for autonomous robots: A survey. Intell. Robot. 20233, 374–401. [Google Scholar] [CrossRef]
  66. Farkh, R.; Alhuwaimel, S.; Alzahrani, S.; Al Jaloud, K.; Quasim, M.T. Deep Learning Control for Autonomous Robot. Comput. Mater. Contin. 202272. [Google Scholar] [CrossRef]
  67. Firoozi, R.; Tucker, J.; Tian, S.; Majumdar, A.; Sun, J.; Liu, W.; Zhu, Y.; Song, S.; Kapoor, A.; Hausman, K.; et al. Foundation models in robotics: Applications, challenges, and the future. Int. J. Robot. Res. 202444, 701–739. [Google Scholar] [CrossRef]
  68. Huang, C.I.; Huang, Y.Y.; Liu, J.X.; Ko, Y.T.; Wang, H.C.; Chiang, K.H.; Yu, L.F. Fed-HANet: Federated visual grasping learning for human robot handovers. IEEE Robot. Autom. Lett. 20238, 3772–3779. [Google Scholar] [CrossRef]
  69. Zhao, X.; Wang, L.; Zhang, Y.; Han, X.; Deveci, M.; Parmar, M. A review of convolutional neural networks in computer vision. Artif. Intell. Rev. 202457, 99. [Google Scholar] [CrossRef]
  70. Wu, F.; Wu, J.; Kong, Y.; Yang, C.; Yang, G.; Shu, H.; Carrault, G.; Senhadji, L. Multiscale low-frequency memory network for improved feature extraction in convolutional neural networks. In Proceedings of the AAAI Conference on Artificial Intelligence, Vancouver, WC, Canada, 20–27 February 2024; Volume 38, pp. 5967–5975. [Google Scholar]
  71. Ma, R.; Liu, Y.; Graf, E.W.; Oyekan, J. Applying vision-guided graph neural networks for adaptive task planning in dynamic human robot collaborative scenarios. Adv. Robot. 202438, 1690–1709. [Google Scholar] [CrossRef]
  72. Ding, P.; Zhang, J.; Zhang, P.; Lv, Y. A Spatial-Temporal Graph Neural Network with Hawkes Process for Temporal Hypergraph Reasoning towards Robotic Decision-Making in Proactive Human-Robot Collaboration. In Proceedings of the 2024 IEEE 20th International Conference on Automation Science and Engineering (CASE), Bari, Italy, 28 August–1 September 2024; pp. 514–519. [Google Scholar]
  73. Ding, P.; Zhang, J.; Zhang, P.; Lv, Y.; Wang, D. A stacked graph neural network with self-exciting process for robotic cognitive strategy reasoning in proactive human-robot collaborative assembly. Adv. Eng. Inform. 202563, 102957. [Google Scholar] [CrossRef]
  74. Ding, P.; Zhang, J.; Zheng, P.; Fei, B.; Xu, Z. Dynamic scenario-enhanced diverse human motion prediction network for proactive human–robot collaboration in customized assembly tasks. J. Intell. Manuf. 2024. [Google Scholar] [CrossRef]
  75. Hou, W.; Xiong, Z.; Yue, M.; Chen, H. Human-robot collaborative assembly task planning for mobile cobots based on deep reinforcement learning. Proc. Inst. Mech. Eng. Part C J. Mech. Eng. Sci. 2024238, 11097–11114. [Google Scholar] [CrossRef]
  76. Qiu, Y.; Jin, Y.; Yu, L.; Wang, J.; Wang, Y.; Zhang, X. Improving sample efficiency of multiagent reinforcement learning with nonexpert policy for flocking control. IEEE Internet Things J. 202310, 14014–14027. [Google Scholar] [CrossRef]
  77. Salvato, E.; Fenu, G.; Medvet, E.; Pellegrino, F.A. Crossing the reality gap: A survey on sim-to-real transferability of robot controllers in reinforcement learning. IEEE Access 20219, 153171–153187. [Google Scholar] [CrossRef]
  78. Ju, H.; Juan, R.; Gomez, R.; Nakamura, K.; Li, G. Transferring policy of deep reinforcement learning from simulation to reality for robotics. Nat. Mach. Intell. 20224, 1077–1087. [Google Scholar] [CrossRef]
  79. Zhu, X.; Zheng, X.; Zhang, Q.; Chen, Z.; Liu, Y.; Liang, B. Sim-to-real transfer with action mapping and state prediction for robot motion control. In Proceedings of the 2021 6th Asia-Pacific Conference on Intelligent Robot Systems (ACIRS), Tokyo, Japan, 16–18 July 2021; pp. 1–6. [Google Scholar]
  80. Amirnia, A.; Keivanpour, S. Real-time sustainable cobotic disassembly planning using fuzzy reinforcement learning. Int. J. Prod. Res. 202563, 3798–3821. [Google Scholar] [CrossRef]
  81. Langås, E.F.; Zafar, M.H.; Sanfilippo, F. Exploring the synergy of human-robot teaming, digital twins, and machine learning in Industry 5.0: A step towards sustainable manufacturing. J. Intell. Manuf. 2025, 1–24. [Google Scholar] [CrossRef]
  82. Xu, Y.; Bao, R.; Zhang, L.; Wang, J.; Wang, S. Embodied intelligence in RO/RO logistic terminal: Autonomous intelligent transportation robot architecture. Sci. China Inf. Sci. 202568, 1–17. [Google Scholar] [CrossRef]
  83. Laukaitis, A.; Šareiko, A.; Mažeika, D. Facilitating Robot Learning in Virtual Environments: A Deep Reinforcement Learning Framework. Appl. Sci. 202515, 5016. [Google Scholar] [CrossRef]
  84. Li, C.; Zheng, P.; Zhou, P.; Yin, Y.; Lee, C.K.; Wang, L. Unleashing mixed-reality capability in Deep Reinforcement Learning-based robot motion generation towards safe human–robot collaboration. J. Manuf. Syst. 202474, 411–421. [Google Scholar] [CrossRef]
  85. Gonzalez-Santocildes, A.; Vazquez, J.I.; Eguiluz, A. Adaptive Robot Behavior Based on Human Comfort Using Reinforcement Learning. IEEE Access 202412, 122289–122299. [Google Scholar] [CrossRef]
  86. Walker, J.C.; Vértes, E.; Li, Y.; Dulac-Arnold, G.; Anand, A.; Weber, T.; Hamrick, J.B. Investigating the role of model-based learning in exploration and transfer. In Proceedings of the ICML’23: 40th International Conference on Machine Learning, Honolulu, HA, USA, 23–29 July 2023; pp. 35368–35383. [Google Scholar]
  87. Thalpage, N. Unlocking the black box: Explainable artificial intelligence (XAI) for trust and transparency in ai systems. J. Digit. Art Humanit 20234, 31–36. [Google Scholar] [CrossRef] [PubMed]
  88. Gunning, D.; Aha, D. DARPA’s explainable artificial intelligence (XAI) program. AI Mag. 201940, 44–58. [Google Scholar]
  89. Saraswat, D.; Bhattacharya, P.; Verma, A.; Prasad, V.K.; Tanwar, S.; Sharma, G.; Bokoro, P.N.; Sharma, R. Explainable AI for healthcare 5.0: Opportunities and challenges. IEEE Access 202210, 84486–84517. [Google Scholar] [CrossRef]
  90. Oviedo, J.; Rodriguez, M.; Trenta, A.; Cannas, D.; Natale, D.; Piattini, M. ISO/IEC quality standards for AI engineering. Comput. Sci. Rev. 202454, 100681. [Google Scholar] [CrossRef]
  91. Lewis, D.; Hogan, L.; Filip, D.; Wall, P.J. Global challenges in the standardization of ethics for trustworthy AI. J. ICT Stand. 20208, 123–150. [Google Scholar] [CrossRef]
  92. Ali, J.A.H.; Lezoche, M.; Panetto, H.; Naudet, Y.; Gaffinet, B. Cognitive architecture for cognitive cyber-physical systems. IFAC-Pap. 202458, 1180–1185. [Google Scholar]
  93. Ogunsina, M.; Efunniyi, C.P.; Osundare, O.S.; Folorunsho, S.O.; Akwawa, L.A. Cognitive architectures for autonomous robots: Towards human-level autonomy and beyond. Int. J. Frontline Res. Eng. Technol. 20242, 41–50. [Google Scholar] [CrossRef]
  94. Gurney, N.; Pynadath, D.V. Robots with Theory of Mind for Humans: A Survey. In Proceedings of the 2022 31st IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), Napoli, Italy, 29 August–1 September 2022. [Google Scholar]
  95. Taesi, C.; Aggogeri, F.; Pellegrini, N. COBOT applications—Recent advances and challenges. Robotics 202312, 79. [Google Scholar] [CrossRef]
  96. Liu, Y.; Caldwell, G.; Rittenbruch, M.; Belek Fialho Teixeira, M.; Burden, A.; Guertler, M. What affects human decision making in human–robot collaboration?: A scoping review. Robotics 202413, 30. [Google Scholar] [CrossRef]
  97. Sun, J.; Mao, P.; Kong, L.; Wang, J. A Review of Embodied Grasping. Sensors 202525, 852. [Google Scholar] [CrossRef] [PubMed]
  98. Karbouj, B.; Al Rashwany, K.; Alshamaa, O.; Krüger, J. Adaptive Behavior of Collaborative Robots: Review and Investigation of Human Predictive Ability. Procedia CIRP 2024130, 952–958. [Google Scholar] [CrossRef]
  99. Ebert, N.; Mangat, P.; Wasenmuller, O. Multitask network for joint object detection, semantic segmentation and human pose estimation in vehicle occupancy monitoring. In Proceedings of the 2022 IEEE Intelligent Vehicles Symposium (IV), Aachen, Germany, 4–9 June 2022; pp. 637–643. [Google Scholar]
  100. Yalcinkaya, B.; Couceiro, M.S.; Pina, L.; Soares, S.; Valente, A.; Remondino, F. Towards Enhanced Human Activity Recognition for Real-World Human-Robot Collaboration. In Proceedings of the 2024 IEEE International Conference on Robotics and Automation (ICRA), Yokohama, Japan, 13–17 May 2024; pp. 7909–7915. [Google Scholar]
  101. Carissoli, C.; Negri, L.; Bassi, M.; Storm, F.A.; Delle Fave, A. Mental workload and human-robot interaction in collaborative tasks: A scoping review. Int. J. Hum.-Comput. Interact. 202440, 6458–6477. [Google Scholar] [CrossRef]
  102. Huang, S.; Chen, Z.; Zhang, Y. An Algorithm for Standing Long Jump Distance Measurement Based on Improved YOLOv11 and Lightweight Pose Estimation. In Proceedings of the 2025 4th International Symposium on Computer Applications and Information Technology (ISCAIT), Xi’an, China, 21–23 March 2025; pp. 914–918. [Google Scholar]
  103. Salimpour, S.; Peña-Queralta, J.; Paez-Granados, D.; Heikkonen, J.; Westerlund, T. Sim-to-Real Transfer for Mobile Robots with Reinforcement Learning: From NVIDIA Isaac Sim to Gazebo and Real ROS 2 Robots. arXiv 2025, arXiv:2501.02902. [Google Scholar]
  104. Scheikl, P.M.; Tagliabue, E.; Gyenes, B.; Wagner, M.; Dall’Alba, D.; Fiorini, P.; Mathis-Ullrich, F. Sim-to-real transfer for visual reinforcement learning of deformable object manipulation for robot-assisted surgery. IEEE Robot. Autom. Lett. 20228, 560–567. [Google Scholar] [CrossRef]
  105. Véronneau, C.; Denis, J.; Lhommeau, P.; St-Jean, A.; Girard, A.; Plante, J.S.; Bigué, J.P.L. Modular magnetorheological actuator with high torque density and transparency for the collaborative robot industry. IEEE Robot. Autom. Lett. 20228, 896–903. [Google Scholar] [CrossRef]
  106. Feng, H.; Zhang, J.; Kang, L. Key Technologies of Cobots with High Payload-Reach to Weight Ratio: A Review. In International Conference on Social Robotics; Springer Nature: Singapore, 2024; pp. 29–40. [Google Scholar]
  107. Rojas, R.A.; Garcia, M.A.R.; Gualtieri, L.; Rauch, E. Combining safety and speed in collaborative assembly systems–An approach to time optimal trajectories for collaborative robots. Procedia CIRP 202197, 308–312. [Google Scholar] [CrossRef]
  108. Guida, R.; Bertolino, A.C.; De Martin, A.; Sorli, M. Comprehensive Analysis of Major Fault-to-Failure Mechanisms in Harmonic Drives. Machines 202412, 776. [Google Scholar] [CrossRef]
  109. Zafar, M.H.; Langås, E.F.; Sanfilippo, F. Exploring the synergies between collaborative robotics, digital twins, augmentation, and industry 5.0 for smart manufacturing: A state-of-the-art review. Robot. Comput.-Integr. Manuf. 202489, 102769. [Google Scholar] [CrossRef]
  110. Hua, H.; Liao, Z.; Wu, X.; Chen, Y.; Feng, C. A back-drivable linear force actuator for adaptive grasping. J. Mech. Sci. Technol. 202236, 4213–4220. [Google Scholar] [CrossRef]
  111. Pantano, M.; Blumberg, A.; Regulin, D.; Hauser, T.; Saenz, J.; Lee, D. Design of a collaborative modular end effector considering human values and safety requirements for industrial use cases. In Human-Friendly Robotics 2021: HFR: 14th International Workshop on Human-Friendly Robotics; Springer International Publishing: Cham, Switzerland, 2022; pp. 45–60. [Google Scholar]
  112. Li, S.; Xu, J. Multi-Axis Force/Torque Sensor Technologies: Design Principles and Robotic Force Control Applications: A Review. IEEE Sens. J. 202425, 4055–4069. [Google Scholar] [CrossRef]
  113. Elfferich, J.F.; Dodou, D.; Della Santina, C. Soft robotic grippers for crop handling or harvesting: A review. IEEE Access 202210, 75428–75443. [Google Scholar] [CrossRef]
  114. Zaidi, S.; Maselli, M.; Laschi, C.; Cianchetti, M. Actuation technologies for soft robot grippers and manipulators: A review. Curr. Robot. Rep. 20212, 355–369. [Google Scholar] [CrossRef]
  115. Fernandez-Vega, M.; Alfaro-Viquez, D.; Zamora-Hernandez, M.; Garcia-Rodriguez, J.; Azorin-Lopez, J. Transforming Robots into Cobots: A Sustainable Approach to Industrial Automation. Electronics 202514, 2275. [Google Scholar] [CrossRef]
  116. Chen, Y.; Zhang, X.; Huang, Y.; Wu, Y.; Ota, J. Kinematics optimization of a novel 7-DOF redundant manipulator. Robot. Auton. Syst. 2023163, 104377. [Google Scholar] [CrossRef]
  117. Zheng, P.; Wieber, P.B.; Baber, J.; Aycard, O. Human arm motion prediction for collision avoidance in a shared workspace. Sensors 202222, 6951. [Google Scholar] [CrossRef] [PubMed]
  118. Li, S.; Wang, R.; Zheng, P.; Wang, L. Towards proactive human–robot collaboration: A foreseeable cognitive manufacturing paradigm. J. Manuf. Syst. 202160, 547–552. [Google Scholar] [CrossRef]
  119. Sampieri, A.; di Melendugno, G.M.D.A.; Avogaro, A.; Cunico, F.; Setti, F.; Skenderi, G.; Cristani, M.; Galasso, F. Pose forecasting in industrial human-robot collaboration. In European Conference on Computer Vision; Springer Nature: Cham, Switzerland, 2022; pp. 51–69. [Google Scholar]
  120. Hao, Z.; Zhang, D.; Honarvar Shakibaei Asli, B. Motion Prediction and Object Detection for Image-Based Visual Servoing Systems Using Deep Learning. Electronics 202413, 3487. [Google Scholar] [CrossRef]
  121. Vosniakos, G.C.; Stathas, E. Exploring collaboration of humans with industrial robots using ROS-based simulation. Proc. Manuf. Syst. 202318, 33–38. [Google Scholar]
  122. Freire, I.T.; Guerrero-Rosado, O.; Amil, A.F.; Verschure, P.F. Socially adaptive cognitive architecture for human-robot collaboration in industrial settings. Front. Robot. AI 202411, 1248646. [Google Scholar] [CrossRef] [PubMed]
  123. Ciccarelli, M.; Forlini, M.; Papetti, A.; Palmieri, G.; Germani, M. Advancing human–robot collaboration in handcrafted manufacturing: Cobot-assisted polishing design boosted by virtual reality and human-in-the-loop. Int. J. Adv. Manuf. Technol. 2024132, 4489–4504. [Google Scholar] [CrossRef]
  124. Jabrane, K.; Bousmah, M. A new approach for training cobots from small amount of data in industry 5.0. Int. J. Adv. Comput. Sci. Appl. 202112, 634–646. [Google Scholar] [CrossRef]
  125. Ranasinghe, N.; Mohammed, W.M.; Stefanidis, K.; Lastra, J.L.M. Large Language Models in Human-Robot Collaboration with Cognitive Validation Against Context-induced Hallucinations. IEEE Access 202513, 77418–77430. [Google Scholar] [CrossRef]
  126. Trivedi, C.; Bhattacharya, P.; Prasad, V.K.; Patel, V.; Singh, A.; Tanwar, S.; Sharma, R.; Aluvala, S.; Pau, G.; Sharma, G. Explainable AI for Industry 5.0: Vision, architecture, and potential directions. IEEE Open J. Ind. Appl. 20245, 177–208. [Google Scholar] [CrossRef]
  127. Świetlicka, A. A Survey on Artificial Neural Networks in Human-Robot Interaction. Neural Comput. 202537, 1–63. [Google Scholar] [CrossRef] [PubMed]
  128. Moezzi, M. Towards Sample-Efficient Reinforcement Learning Methods for Robotic Manipulation Tasks. Master’s Thesis, University of Toronto, Toronto, ON, Canada, 2024. [Google Scholar]
  129. Liu, Y.; Xu, H.; Liu, D.; Wang, L. A digital twin-based sim-to-real transfer for deep reinforcement learning-enabled industrial robot grasping. Robot. Comput.-Integr. Manuf. 202278, 102365. [Google Scholar] [CrossRef]
  130. Trentsios, P.; Wolf, M.; Gerhard, D. Overcoming the sim-to-real gap in autonomous robots. Procedia CIRP 2022109, 287–292. [Google Scholar] [CrossRef]
  131. Rothert, J.J.; Lang, S.; Seidel, M.; Hanses, M. Sim-to-Real Transfer for a Robotics Task: Challenges and Lessons Learned. In Proceedings of the 2024 IEEE 29th International Conference on Emerging Technologies and Factory Automation (ETFA), Padova, Italy, 10–13 September 2024; pp. 1–8. [Google Scholar]
  132. Lettera, G.; Costa, D.; Callegari, M. A Hybrid Architecture for Safe Human–Robot Industrial Tasks. Appl. Sci. 202515, 1158. [Google Scholar] [CrossRef]
  133. Tulk Jesso, S.; Greene, C.; Zhang, S.; Booth, A.; DiFabio, M.; Babalola, G.; Adegbemijo, A.; Sarkar, S. On the potential for human-centered, cognitively inspired AI to bridge the gap between optimism and reality for autonomous robotics in healthcare: A respectful critique. In Proceedings of the International Symposium on Human Factors and Ergonomics in Health Care, Chicago, IL, USA, 24–27 March 2024; SAGE Publications; Sage CA: Los Angeles, CA, USA, 2024; Volume 13, pp. 106–112. [Google Scholar]
  134. Swarnkar, N.; Rawal, A.; Patel, G. A paradigm shift for computational excellence from traditional machine learning to modern deep learning-based image steganalysis. In Data Science and Innovations for Intelligent Systems; CRC Press: Boca Raton, FL, USA, 2021; pp. 209–240. [Google Scholar]
  135. Wang, S.; Zhang, J.; Wang, P.; Law, J.; Calinescu, R.; Mihaylova, L. A deep learning-enhanced Digital Twin framework for improving safety and reliability in human–robot collaborative manufacturing. Robot. Comput.-Integr. Manuf. 202485, 102608. [Google Scholar] [CrossRef]
  136. Robinson, N.; Tidd, B.; Campbell, D.; Kulić, D.; Corke, P. Robotic vision for human-robot interaction and collaboration: A survey and systematic review. ACM Trans. Hum.-Robot Interact. 202312, 1–66. [Google Scholar] [CrossRef]
  137. Gadekallu, T.R.; Maddikunta, P.K.R.; Boopathy, P.; Deepa, N.; Chengoden, R.; Victor, N.; Wang, W.; Wang, W.; Zhu, Y.; Dev, K. Xai for industry 5.0-concepts, opportunities, challenges and future directions. IEEE Open J. Commun. Soc. 20246, 2706–2729. [Google Scholar] [CrossRef]
  138. Li, J.; Cai, M.; Xiao, S. Reinforcement learning-based motion planning in partially observable environments under ethical constraints. AI Ethics 20245, 1047–1067. [Google Scholar] [CrossRef]
  139. Hostettler, D.; Mayer, S.; Albert, J.L.; Jenss, K.E.; Hildebrand, C. Real-time adaptive industrial robots: Improving safety and comfort in human-robot collaboration. In Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems, Yokohama, Japan, 26 April–1 May 2025; pp. 1–16. [Google Scholar]
  140. Conlon, N.J. Robot Competency Self-Assessments to Improve Human Decision-Making in Uncertain Environments. Ph.D. Dissertation, University of Colorado at Boulder, Boulder, CO, USA, 2024. [Google Scholar]
  141. Kluy, L.; Roesler, E. Working with industrial cobots: The influence of reliability and transparency on perception and trust. In Proceedings of the Human Factors and Ergonomics Society Annual Meeting; SAGE Publications: Los Angeles, CA, USA, 2021; Volume 65, pp. 77–81. [Google Scholar]
  142. Pinto, A.; Duarte, I.; Carvalho, C.; Rocha, L.; Santos, J. Enhancing cobot design through user experience goals: An investigation of human–robot collaboration in picking tasks. Hum. Behav. Emerg. Technol. 20242024, 7058933. [Google Scholar] [CrossRef]
  143. Hancock, P.A.; Billings, D.R.; Schaefer, K.E.; Chen, J.Y.C.; De Visser, E.J.; Parasuraman, R. A meta-analysis of factors affecting trust in human-robot interaction. Hum. Factors 201153, 517–527. [Google Scholar] [CrossRef] [PubMed]
  144. Desai, M.; Stubbs, K.; Steinfeld, A.; Yanco, H.A. Creating trustworthy robots: Lessons and inspirations from automated systems. In Proceedings of the 2013 ACM/IEEE International Conference on Human-Robot Interaction, Tokyo, Japan, 3–6 March 2013; pp. 409–416. [Google Scholar] [CrossRef]
  145. Robinette, P.; Howard, A.M.; Wagner, A.R. Timing is key for robot trust repair. In Proceedings of the Tenth Annual ACM/IEEE International Conference on Human-Robot Interaction, Portland, OR, USA, 2–5 March 2015; pp. 205–212. [Google Scholar]
  146. Gervasi, R.; Barravecchia, F.; Mastrogiacomo, L.; Franceschini, F. Applications of affective computing in human-robot interaction: State-of-art and challenges for manufacturing. Proc. Inst. Mech. Eng. Part B J. Eng. Manuf. 2023237, 815–832. [Google Scholar] [CrossRef]
  147. Toaiari, A.; Murino, V.; Cristani, M.; Beyan, C. Upper-Body pose-based gaze estimation for privacy-preserving 3D gaze target detection. In European Conference on Computer Vision; Springer: Cham, Switzerland, 2025; pp. 359–376. [Google Scholar]
  148. Pourmirzaei, M.; Montazer, G.A.; Mousavi, E. ATTENDEE: An AffecTive Tutoring system based on facial EmotioN recognition and heaD posE Estimation to personalize e-learning environment. J. Comput. Educ. 202512, 65–92. [Google Scholar] [CrossRef]
  149. Tsumura, T.; Yamada, S. Making a human’s trust repair for an agent in a series of tasks through the agent’s empathic behavior. Front. Comput. Sci. 20246, 1461131. [Google Scholar] [CrossRef]
  150. Esterwood, C.; Robert, L.P. Repairing Trust in Robots?: A Meta-analysis of HRI Trust Repair Studies with A No-Repair Condition. In Proceedings of the 2025 20th ACM/IEEE International Conference on Human-Robot Interaction (HRI), Melbourne, Australia, 4–6 March 2025; pp. 410–419. [Google Scholar]
  151. Wong, S.W.; Crowe, P. Cognitive ergonomics and robotic surgery. J. Robot. Surg. 202418, 110. [Google Scholar] [CrossRef] [PubMed]
  152. Min, Z.; Lai, J.; Ren, H. Innovating robot-assisted surgery through large vision models. Nat. Rev. Electr. Eng. 20252, 350–363. [Google Scholar] [CrossRef]
  153. Chen, H.; Alghowinem, S.; Breazeal, C.; Park, H.W. Integrating flow theory and adaptive robot roles: A conceptual model of dynamic robot role adaptation for the enhanced flow experience in long-term multi-person human-robot interactions. In Proceedings of the 2024 ACM/IEEE International Conference on Human-Robot Interaction, Boulder, CO, USA, 11–15 March 2024; pp. 116–126. [Google Scholar]
  154. Pelikan, H.; Hofstetter, E. Managing delays in human-robot interaction. ACM Trans. Comput.-Hum. Interact. 202330, 1–42. [Google Scholar] [CrossRef]
  155. Tuncer, S.; Gillet, S.; Leite, I. Robot-mediated inclusive processes in groups of children: From gaze aversion to mutual smiling gaze. Front. Robot. AI 20229, 729146. [Google Scholar] [CrossRef] [PubMed]
  156. Ricciardi Celsi, L.; Zomaya, A.Y. Perspectives on Managing AI Ethics in the Digital Age. Information 202516, 318. [Google Scholar] [CrossRef]
  157. Bourgais, A.; Ibnouhsein, I. Ethics-by-design: The next frontier of industrialization. AI Ethics 20222, 317–324. [Google Scholar] [CrossRef]
  158. Kolvig-Raun, E.S.; Hviid, J.; Kjærgaard, M.B.; Brorsen, R.; Jacob, P. Balancing Cobot Productivity and Longevity Through Pre-Runtime Developer Feedback. IEEE Robot. Autom. Lett. 202410, 1617–1624. [Google Scholar] [CrossRef]
  159. Zia, A.; Haleem, M. Bridging Research Gaps in Industry 5.0: Synergizing Federated Learning, Collaborative Robotics, and Autonomous Systems for Enhanced Operational Efficiency and Sustainability. IEEE Access 202513, 40456–40479. [Google Scholar] [CrossRef]
  160. Ramírez, T.; Mora, H.; Pujol, F.A.; Maciá-Lillo, A.; Jimeno-Morenilla, A. Management of heterogeneous AI-based industrial environments by means of federated adaptive-robot learning. Eur. J. Innov. Manag. 202528, 50–64. [Google Scholar] [CrossRef]
  161. Govi, E.; Sapienza, D.; Toscani, S.; Cotti, I.; Franchini, G.; Bertogna, M. Addressing challenges in industrial pick and place: A deep learning-based 6 Degrees-of-Freedom pose estimation solution. Comput. Ind. 2024161, 104130. [Google Scholar] [CrossRef]
  162. Pan, Z.; Zhuang, B.; Liu, J.; He, H.; Cai, J. Scalable vision transformers with hierarchical pooling. In Proceedings of the IEEE/CVF International Conference on Computer Vision, Montreal, QC, Canada, 10–17 October 2021; pp. 377–386. [Google Scholar]
  163. Liu, R.; Wang, L.; Yu, Z.; Zhang, H.; Liu, X.; Sun, B.; Huo, X.; Zhang, J. SCTNet-NAS: Efficient semantic segmentation via neural architecture search for cloud-edge collaborative perception. Complex Intell. Syst. 202511, 365. [Google Scholar] [CrossRef]
  164. Chen, Z.; Hu, B.; Chen, Z.; Zhang, J. Progress and Thinking on Self-Supervised Learning Methods in Computer Vision: A Review. IEEE Sens. J. 202424, 29524–29544. [Google Scholar] [CrossRef]
  165. Shaw, A. Self-Supervised Learning For Robust Robotic Grasping In Dynamic Environment. arXiv 2024, arXiv:2410.11229. [Google Scholar] [CrossRef]

Автор: Yuval Cohen, Amir Biton, Shraga Shoval