Внедрение технологий искусственного интеллекта (ИИ) приводит к появлению всё более распространённых инноваций, таких как складские роботы, автономные автомобили, сельскохозяйственные дроны и системы контроля качества на производствах. Ключевую роль в развитии этих технологий играет компьютерное зрение – направление ИИ, позволяющее машинам понимать и интерпретировать визуальную информацию.
Одним из основных применений компьютерного зрения является обнаружение объектов, которое позволяет идентифицировать и локализовать объекты на изображениях с помощью ограничивающих рамок. Однако, использование ограничивающих рамок имеет свои ограничения, поскольку они не могут точно отразить форму и границы объекта, что затрудняет его точную идентификацию в приложениях, требующих высокой степени детализации.
Для решения этой проблемы исследователи разработали модели сегментации, которые позволяют получать точные контуры объектов с пиксельной точностью.
Модель Mask R-CNN, предложенная в 2017 году Facebook AI Research (FAIR), является одним из примеров таких моделей. Она основана на более ранних моделях, таких как R-CNN, Fast R-CNN и Faster R-CNN, и стала важным этапом в развитии компьютерного зрения. Mask R-CNN послужила основой для создания более совершенных моделей, таких как YOLO11.
В данной статье мы рассмотрим принципы работы модели Mask R-CNN, её области применения и последующие усовершенствования, приведшие к появлению модели YOLO11.
Что такое маска R-CNN
Mask R-CNN (Mask Region-based Convolutional Neural Network) – это мощная модель глубокого обучения, разработанная для решения задач компьютерного зрения, таких как обнаружение объектов и сегментация экземпляров.
В отличие от традиционного обнаружения объектов, которое лишь определяет наличие объекта на изображении, сегментация экземпляров, реализованная в Mask R-CNN, предоставляет точное очерчивание каждого объекта. Модель присваивает каждому обнаруженному объекту уникальный идентификатор и точно фиксирует его форму на уровне пикселей.
Этот детальный подход позволяет эффективно различать перекрывающиеся объекты и обрабатывать сложные формы с высокой точностью.
Mask R-CNN базируется на архитектуре Faster R-CNN, которая способна обнаруживать и маркировать объекты, но не определяет их точные границы. Mask R-CNN расширяет функциональность Faster R-CNN за счет определения точных пикселей, составляющих каждый объект. Это открывает возможности для более глубокого и точного анализа изображений.

Рис. 1. Сравнение обнаружения объектов и сегментации экземпляров.
Взгляд на архитектуру Mask R-CNN и на то, как она работает
Архитектура Mask R-CNN реализует итеративный процесс для precisa detection and segmentation of objects. Вначале, модель извлекает характерные признаки с помощью глубокой нейронной сети, обученной на обширном наборе данных. Затем, специализированный компонент – сеть предложений областей – выявляет потенциальные зоны, в которых могут располагаться объекты. На заключительном этапе, Mask R-CNN уточняет эти области, генерируя детальные маски сегментации, точно отражающие контуры каждого объекта.
В дальнейшем мы подробно рассмотрим каждый этап данного процесса для более глубокого понимания принципов работы Mask R-CNN.

Рис. 2. Обзор архитектуры Mask R-CNN.
Начни с извлечения признаков
Первый этап архитектуры Mask R-CNN заключается в сегментации изображения на его основополагающие компоненты, что позволяет модели идентифицировать присутствующие объекты. Аналогично тому, как человек при просмотре фотографии интуитивно улавливает формы, цвета и контуры, модель использует глубокую нейронную сеть, называемую “хребтом” (часто ResNet-50 или ResNet-101), для сканирования изображения и выделения ключевых признаков.
Ввиду того, что объекты на изображении могут иметь существенные различия в размере, в Mask R-CNN применяется сеть Feature Pyramid Network. Это akin to использованию линз с различным увеличением, что позволяет модели охватывать как мелкие детали, так и общую композицию изображения, обеспечивая обнаружение объектов любого масштаба.
После извлечения этих важных признаков модель приступает к локализации потенциальных объектов на изображении, создавая основу для последующего анализа.
Предлагая потенциальные области на изображении с помощью объектов
После выделения ключевых характеристик изображения, анализ продолжается с помощью сети предложений регионов. Данный компонент модели осуществляет сканирование изображения и выявляет области, в которых с высокой вероятностью присутствуют объекты.
Для этого сеть генерирует множество потенциальных позиций объектов, называемых “якорями”. Далее производится оценка этих “якорей”, и наиболее перспективные из них отбираются для детального изучения. Таким образом, модель концентрирует свои усилия на областях с наибольшей вероятностью содержания объектов, исключая необходимость анализа каждой точки изображения.

Рис. 3. Пример сети предложения регионов.
Улучшение извлеченных признаков
После определения ключевых областей необходимо уточнить детали, извлеченные из этих зон. В предыдущих моделях для этой цели использовался метод ROI Pooling (Region of Interest Pooling), однако он иногда приводил к небольшим искажениям при изменении размеров областей, что снижало его эффективность, особенно в случае с мелкими или перекрывающимися объектами.
Модель Mask R-CNN усовершенствует этот процесс, применяя технику ROI Align (Region of Interest Align). В отличие от ROI Pooling, который округляет координаты, ROI Align использует билинейную интерполяцию для более точного определения значений пикселей. Билинейная интерполяция вычисляет новое значение пикселя путем усреднения значений его четырех ближайших соседей, что обеспечивает плавные переходы. Это позволяет сохранить корректное выравнивание характеристик по отношению к исходному изображению, повышая точность обнаружения и сегментации объектов.
Например, во время футбольного матча два близко стоящих игрока могут быть ошибочно идентифицированы как один из-за наложения их ограничивающих рамок. ROI Align помогает разграничить их, сохраняя различия в их формах.

Рис. 4. Маска R-CNN использует ROI Align.
Классифицируй предметы и предсказывай их маски
После обработки изображения оператором ROI Align, модель переходит к этапу классификации объектов и уточнения их локализации.
Для каждого выделенного региона модель определяет присутствующий в нём объект, присваивая различным категориям вероятностные оценки и выбирая наиболее подходящую. Параллельно с этим происходит корректировка ограничивающих рамок для более точного соответствия объектам. Это необходимо, поскольку исходное положение рамок может быть несовершенным.
В заключение, модель Mask R-CNN дополнительно генерирует детальную маску сегментации для каждого объекта.
Маска R-CNN и ее применение в реальном времени
Появление данной модели вызвало большой интерес в сообществе искусственного интеллекта и привело к её быстрому внедрению в различные сферы применения. Её способность к обнаружению и сегментации объектов в режиме реального времени произвела революцию в ряде отраслей.
Например, отслеживание редких животных в дикой природе является сложной задачей. Многие виды обитают в густых лесах, что затрудняет наблюдение за ними со стороны специалистов по охране природы. Хотя традиционные методы, такие как фотоловушки, дроны и спутниковые снимки, позволяют собирать данные, ручной анализ этих данных очень трудоемок. Ошибки в идентификации и пропущенные встречи могут негативно сказаться на эффективности природоохранных мероприятий.
Модель Mask R-CNN, распознавая уникальные особенности животных, такие как полосы тигра, пятна жирафа или форма ушей слона, может обнаруживать и сегментировать их на изображениях и видео с высокой точностью. Даже если животные частично скрыты растительностью или находятся близко друг к другу, модель способна выделить их и идентифицировать по отдельности, что значительно ускоряет и повышает надёжность мониторинга состояния дикой природы.

Рис. 5. Обнаружение и сегментирование животных с помощью Mask R-CNN.
Ограничения масочного R-CNN
Несмотря на свою важную роль в области обнаружения и сегментации объектов, архитектура Mask R-CNN обладает рядом существенных недостатков.
К числу проблем, присущих Mask R-CNN, относятся:
- Высокая вычислительная сложность: Модель требует значительных вычислительных ресурсов, что может привести к высоким затратам на реализацию и замедлению обработки больших объемов данных.
- Низкая скорость обработки: Многоступенчатый характер архитектуры приводит к более низкой скорости по сравнению с моделями реального времени, такими как YOLO, что может быть неприемлемым для задач, требующих высокой оперативности.
- Зависимость от качества данных: Для достижения оптимальной точности модели необходимы высококачественные, четкие и правильно помеченные изображения. Размытые или плохо освещенные изображения могут существенно снизить точность обнаружения и сегментации.
- Сложность реализации: Многоступенчатая архитектура Mask R-CNN может быть сложной в настройке и оптимизации, особенно при работе с большими наборами данных или ограниченными ресурсами.
От маски R-CNN к Ultralytics YOLO11
Модель Mask R-CNN продемонстрировала высокую эффективность в задачах сегментации изображений. Однако, многие отрасли, внедряющие технологии компьютерного зрения, ставили во главу угла скорость и производительность в режиме реального времени.
Это привело к разработке одноступенчатых моделей, способных обнаруживать объекты за один проход, что существенно повышает эффективность обработки данных. В отличие от многоступенчатого подхода Mask R-CNN, одноступенчатые модели, такие как YOLO (You Only Look Once), оптимизированы для задач компьютерного зрения в реальном времени.
Вместо разделения этапов обнаружения и сегментации, модели YOLO анализируют изображение за один проход, что делает их идеальными для приложений, требующих быстрого принятия решений, таких как автономное вождение, медицина, промышленность и робототехника.
Модель YOLOv11 представляет собой дальнейшее развитие в области одноступенчатых моделей. Она сочетает в себе высокую скорость обработки и точность. Используя на 22% меньше параметров по сравнению с YOLOv8m, YOLOv11 демонстрирует более высокую среднюю точность (mAP) на наборе данных COCO, что свидетельствует о её большей эффективности в обнаружении объектов. Увеличенная скорость обработки делает YOLOv11 оптимальным выбором для приложений реального времени, где каждая миллисекунда имеет значение.

Рис 6. Производительность YOLO11в сравнении с другими моделями.
Основные выводы
Проанализировав историю развития компьютерного зрения, можно заключить, что архитектура Mask R-CNN стала знаменательным достижением в области распознавания и сегментации объектов. Ее многоуровневый алгоритм обеспечивает высокую точность даже в сложных сценариях.
Тем не менее, эта же многослойность приводит к снижению скорости обработки по сравнению с моделями реального времени, такими как YOLO. В связи с растущим спросом на быстродействие и эффективность, во многих практических приложениях предпочтение отдается одноступенчатым моделям, например Ultralytics YOLOv11, которые гарантируют оперативное и точное обнаружение объектов.
Несмотря на важность Mask R-CNN для понимания эволюции компьютерного зрения, распространение решений реального времени свидетельствует о возрастающей потребности в более быстрых и эффективных инструментах для компьютерного зрения.


