Компьютерное зрение – это раздел искусственного интеллекта (ИИ), позволяющий машинам анализировать и интерпретировать визуальные данные, такие как изображения и видео. Эта область науки активно развивается, благодаря постоянным усилиям исследователей и разработчиков, стремящихся расширить возможности ИИ. Ключевой задачей сообщества ИИ является создание более быстрых, интеллектуальных и производительных моделей. Одним из недавних достижений стало появление YOLO12, новейшей версии в линейке моделей YOLO (You Only Look Once), представленной 18 февраля 2025 года.
YOLO12 была создана командой ученых из Университета Буффало, входящего в систему SUNY (Государственный университет штата Нью-Йорк), и Университета Китайской академии наук. В основе новой разработки лежит оригинальная концепция, в которой YOLO12 использует механизмы внимания, позволяющие модели концентрироваться на наиболее важных элементах изображения, а не на всем содержимом в равной степени.
В модели также реализованы FlashAttention – технология, оптимизирующая обработку данных с меньшим потреблением памяти, и зональное внимание, имитирующее естественный способ фокусировки человеческого взгляда на ключевых объектах.
В результате этих усовершенствований, YOLO12n демонстрирует на 2,1% более высокую точность по сравнению с YOLOv10n, а YOLO12m – на +1,0% превосходит YOLO11m. Однако, эта производительность достигается ценой некоторой потери скорости: YOLO12n работает на 9% медленнее, чем YOLOv10n, а YOLO12m – на 3% медленнее, чем YOLO11m.

В этой статье мы рассмотрим, чем отличается YOLO12, как она сравнивается с предыдущими версиями и где ее можно применить.
Дорога к выходу YOLO12
Семейство алгоритмов YOLO представляет собой ряд передовых решений в области компьютерного зрения, разработанных для оперативного распознавания объектов на изображениях и видео. С каждой новой итерацией эти модели демонстрировали прогресс в скорости работы, точности и общей производительности.
В качестве примера, YOLOv5, выпущенная в 2020 году, завоевала популярность благодаря своей простоте обучения и внедрения. Последующая версия, YOLOv8, расширила функциональность, добавив поддержку дополнительных задач, таких как сегментация и отслеживание объектов.
Недавно разработанная YOLO11 была оптимизирована для более эффективной обработки данных в режиме реального времени, сохраняя оптимальное соотношение между скоростью и точностью. Так, YOLO11m, обладая на 22% меньшим количеством параметров по сравнению с YOLOv8m, продемонстрировала превосходные результаты обнаружения объектов на COCO, общепринятом стандарте для оценки подобных моделей.
Продолжая эту тенденцию, YOLO12 совершает прорыв в анализе визуальной информации. Вместо равномерного рассмотрения всего изображения, она фокусируется на наиболее важных участках, что приводит к повышению точности распознавания. В сущности, YOLO12 использует накопленный опыт и направлена на достижение максимальной точности.
Ключевые особенности YOLO12
YOLO12 предлагает ряд усовершенствований, которые улучшают производительность задач компьютерного зрения, сохраняя скорость обработки в реальном времени. Вот краткий обзор основных характеристик YOLO12:
- Архитектура с акцентом на внимание: Вместо одинакового подхода ко всем областям изображения, YOLO12 уделяет особое внимание наиболее значимым участкам. Это повышает точность и уменьшает объём ненужных вычислений, обеспечивая более четкое и эффективное обнаружение даже на сложных изображениях.
- FlashAttention: YOLO12 ускоряет анализ изображений, потребляя меньше памяти. Благодаря FlashAttention (алгоритму оптимизации памяти) оптимизируется обработка данных, снижается нагрузка на оборудование и обеспечивается более плавная и надежная работа в реальном времени.
- Эффективные сети агрегации слоев (R-ELAN): YOLO12 более эффективно структурирует свои слои с помощью R-ELAN, что улучшает обработку и обучение модели. Это делает обучение более стабильным, распознавание объектов – более точным, а требования к вычислительным ресурсам – более низкими, что позволяет модели эффективно работать в различных условиях.
Для наглядности рассмотрим пример с торговым центром. YOLO12 может использоваться для отслеживания покупателей, распознавания элементов интерьера, таких как комнатные растения или рекламные вывески, а также для обнаружения неправильно размещенных или оставленных товаров.
Архитектура, ориентированная на внимание, позволяет модели сосредоточиться на важных деталях, а FlashAttention обеспечивает быструю обработку данных без перегрузки системы. В результате операторы торговых центров могут повысить безопасность, оптимизировать планировку магазинов и улучшить общий опыт покупателей.
Рис. 2. Обнаружение объектов в торговом центре с помощью YOLO12.
Однако YOLO12 также имеет некоторые ограничения, которые следует учитывать:
- Более медленное время обучения: Из-за своей архитектуры YOLO12 требует больше времени на обучение по сравнению с YOLO11.
- Проблемы с экспортом: Некоторые пользователи могут столкнуться с трудностями при экспорте моделей YOLO12, особенно при их интеграции в специфические среды развертывания.
Понимание эталонов производительности YOLO12
YOLO12 доступна в нескольких редакциях, созданных для разных нужд. Младшие версии (nano и small) заточены под скорость и отзывчивость, оптимальны для портативных устройств и вычислений на периферии. Средние и крупные варианты совмещают скорость и точность, а YOLO12x (extra large) разработана для задач с высокими требованиями к точности, например, в автоматизации производства, медицинской визуализации и продвинутых системах наблюдения.
Благодаря этому YOLO12 обеспечивает различный уровень производительности в зависимости от размера модели. Тесты показывают, что некоторые версии YOLO12 превосходят YOLOv10 и YOLO11 по точности, демонстрируя более высокую среднюю точность (mAP).
Однако некоторые модели, такие как YOLO12m, YOLO12l и YOLO12x, обрабатывают изображения медленнее, чем YOLO11, представляя собой компромисс между точностью и скоростью. Тем не менее, YOLO12 остаётся эффективной, требуя меньше параметров, чем большинство других моделей, хотя всё же больше, чем YOLO11. Это делает её удачным выбором для задач, где важна точность.
Рис. 3. СравнениеYOLO11 и YOLO12.
Использование YOLO12
YOLO12 легко использовать благодаря пакету Ultralytics Python, что делает его подходящим как для новичков, так и для опытных пользователей. Всего несколько строк кода позволяют загружать готовые модели, решать задачи компьютерного зрения на изображениях и видео, а также обучать YOLO12 на собственных данных. Пакет Ultralytics Python упрощает этот процесс, избавляя от необходимости сложных настроек.
Например, вот что нужно сделать, чтобы использовать YOLO12 для обнаружения объектов:
- Установка пакета Ultralytics: Для начала установите Python Ultralytics, который предоставит все необходимые инструменты для работы с YOLO12. Это гарантирует корректную установку всех зависимостей.
- Загрузка предварительно обученной модели YOLO12: Выберите подходящую версию YOLO12 (nano, small, medium, large или extra large) в зависимости от требуемой точности и скорости.
- Предоставление изображения или видео: Загрузите изображение или видеофайл для анализа. YOLO12 также может обрабатывать потоковое видео в реальном времени.
- Запуск процесса обнаружения: Модель анализирует визуальные данные, находит объекты и отмечает их ограничивающими рамками. Каждый обнаруженный объект идентифицируется с указанием класса и балла уверенности.
- Настройка параметров обнаружения: Можно изменять такие параметры, как пороги уверенности, для более точной настройки обнаружения и производительности.
- Сохранение или использование результата: Обработанное изображение или видео, теперь с обнаруженными объектами, можно сохранить или использовать в приложении для дальнейшего анализа, автоматизации или принятия решений.
Эти шаги делают YOLO12 удобным в самых разных областях, от видеонаблюдения и розничной торговли до медицинской визуализации и беспилотных транспортных средств.
Практическое применение YOLO12
YOLO12 можно использовать в различных реальных приложениях благодаря поддержке обнаружения объектов, сегментации экземпляров, классификации изображений, оценке позы и ориентированному обнаружению объектов (OBB).
Рис. 4. YOLO12 поддерживает такие задачи, как обнаружение объектов и сегментация экземпляров.
YOLO12 подходит для широкого спектра задач компьютерного зрения: обнаружение объектов, сегментация, классификация изображений, оценка поз и ориентированное обнаружение объектов (OBB).
Хотя модели YOLO12 ориентированы на точность, а не на скорость, то есть обработка изображений занимает чуть больше времени, чем в предыдущих версиях. Этот компромисс делает YOLO12 оптимальным выбором для сценариев, где важна именно высокая точность, а не скорость, например:
- Медицинская визуализация: YOLO12 можно адаптировать для обнаружения опухолей или аномалий на рентгеновских и МРТ-снимках с высокой точностью, что станет полезным инструментом для медиков, которым требуется детальный анализ изображений для диагностики.
- Контроль качества на производстве: Данная модель может выявлять дефекты продукции на стадии производства, обеспечивая выпуск только качественных изделий, а также сокращая объемы отходов и повышая общую эффективность.
- Криминалистика: Правоохранительные органы могут использовать YOLO12 для анализа записей с камер видеонаблюдения и поиска улик. В криминалистических расследованиях точность играет ключевую роль для выделения важных деталей.
- Точное земледелие: Фермеры могут применять YOLO12 для анализа состояния посевов, обнаружения болезней или вредителей, а также для мониторинга состояния почвы. Точная оценка состояния полей помогает оптимизировать стратегии ведения хозяйства, что приводит к увеличению урожайности и эффективному использованию ресурсов.
Начало работы с YOLO12
Перед тем как приступить к запуску YOLO12, стоит удостовериться, что ваша система отвечает минимальным запросам.
Фактически, YOLO12 функционирует на любом выделенном GPU (графическом процессоре). По умолчанию FlashAttention не требуется, поэтому система сможет работать на большинстве GPU без него. Но активация FlashAttention окажется полезной при обработке больших объемов данных или изображений с высоким разрешением, позволяя избежать задержек, уменьшить потребление памяти и повысить скорость обработки.
Для работы с FlashAttention требуется GPU NVIDIA одной из следующих линеек: Turing (T4, Quadro RTX), Ampere (серия RTX 30, A30, A40, A100), Ada Lovelace (серия RTX 40) или Hopper (H100, H200).
Учитывая удобство использования и доступность, пакет Ultralytics Python пока не предусматривает поддержку вывода FlashAttention, поскольку его установка технически может быть трудна. Чтобы узнать больше о запуске YOLO12 и улучшении его производительности, советуем изучить официальную документацию Ultralytics.
Выводы
По мере прогресса компьютерного зрения, модели демонстрируют рост точности и производительности. YOLO12 совершенствует задачи компьютерного зрения, такие как обнаружение объектов, сегментация и классификация изображений, используя обработку, ориентированную на внимание, и FlashAttention, что увеличивает точность и оптимизирует использование памяти.
В то же время, компьютерное зрение стало проще, чем когда-либо прежде. YOLO12 легко применять с помощью пакета Ultralytics Python, и его акцент на точность, а не на скорость, делает его идеальным для медицинской визуализации, промышленного контроля и робототехники — областей, где важна высокая точность.