Измерители диаметра и эксцентриситета. Измеритель диаметра кабеля, трубы, прутка и катанки. Измерители толщины,. Измеритель толщины. Контроль изоляции. ЗАСИ. Машинное зрение.

Компьютерное зрение для обнаружения и количественного определения смесей семян покровных культур

Смеси покровных культур играют важную роль в улучшении здоровья почвы, круговорота питательных веществ и устойчивости экосистемы; однако поддержание равномерного распределения семян и однородности посева затруднено из-за значительных различий в физических и аэродинамических свойствах семян. Эти расхождения приводят к неравномерному посеву и разделению видов в бункерах сеялок, что влияет на приживаемость и стабильность биомассы. Масса тысячи зерен является важным показателем для определения качества и урожайности семян покровных культур, поскольку она представляет собой вес 1000 семян в граммах. Таким образом, точный подсчет семян является ключевым фактором при расчете массы тысячи зерен. Точная идентификация смешанных семян также полезна в селекции, фенотипической оценке и обнаружении заплесневелых или поврежденных зерен. Однако в реальных условиях перекрытие и толщина слоя смешанных семян затрудняют точный подсчет, что обусловливает необходимость современных исследований в области эффективного обнаружения семян. В данном исследовании эти проблемы решаются путем интеграции алгоритмов компьютерного зрения на основе глубокого обучения для обнаружения и подсчета нескольких семян в смесях покровных культур. Для получения высококачественных фотографий семян льна, вики мохнатой, клевера красного, редиса и ржи использовалась камера Canon LP-E6N R6 5D Mark IV. Набор данных был аннотирован, дополнен и предварительно обработан в RoboFlow, разделен на обучающую, валидационную и тестовую выборки. Две лучшие модели, YOLOv5 и YOLOv7, были протестированы на точность обнаружения смешанных семян. Результаты показали, что YOLOv7 превзошла YOLOv5 с точностью 98,5%, полнотой 98,7% и средней точностью (mAP 0–95) 76,0%. Результаты показывают, что модели на основе глубокого обучения могут точно распознавать и подсчитывать смешанные семена с использованием автоматизированных методов, что имеет практическое применение в калибровке сеялок, оценке массы тысячи зерен и равномерном закладывании покровных культур.

1. Введение

Внедрение цифровизации, интеллекта и автоматизации революционизирует область интеллектуального сельского хозяйства, снижая потребность в человеческом труде, повышая эффективность работы и улучшая общее благополучие работников [1, 2]. Идентификация и классификация семенных смесей имеют решающее значение для устойчивости и эффективности сельского хозяйства, исследований и контроля качества семян. Точная идентификация семян необходима для оптимизации сельскохозяйственной практики и выходит за рамки простых процедурных требований. Исследования [3, 4] подчеркивают, как точность идентификации семян напрямую влияет на сельскохозяйственную продуктивность и экологическую устойчивость, подчеркивая значимость этого. Однако существующие процедуры идентификации семян, которые в основном выполняются вручную, создают серьезные препятствия. Эти ручные процедуры, как показано в [5, 6], не только отнимают много времени, но и подвержены ошибкам. Когда дело доходит до идентификации комбинаций семян, сложность возрастает экспоненциально, как и вероятность неправильной идентификации. Учитывая эти препятствия, тенденция к автоматизации идентификации семян набирает обороты. [7].

Это подчеркивает важность использования автоматизированных подходов для преодоления ограничений, связанных с человеческим фактором, что подразумевает сдвиг парадигмы в методах анализа семян. Покровные культуры широко известны своими многочисленными преимуществами и экологическими выгодами. Однако выбор видов на основе конкретных целей и полевых условий необходим для максимизации преимуществ для различных целей, избегая при этом скрытых недостатков. Эффективность смесей покровных культур зависит от способности видов выполнять желаемые функции в конкретных условиях окружающей среды. Достичь этого баланса сложно, и ученым необходимы новые инструменты, такие как переменная норма высева, время высева и выбор смеси семян, чтобы контролировать выход биомассы и изменять соотношение биомассы корней и надземной части. Поскольку свойства семян сильно варьируются, посадочное оборудование и сеялки, используемые для посева смешанных покровных культур, должны быть проверены на качество и эффективность в полевых условиях. Вибрация в поле во время посадки может вызывать расслоение и неравномерность в сочетании семян покровных культур в одном бункере сеялки, что снижает равномерность посадки по всему полю. Данное исследование отвечает ранее выявленной потребности в современных исследованиях влияния характеристик семян смешанных покровных культур на производительность сеялок. Наше исследование было сосредоточено на шести озимых культурах (вика мохнатая, редис, репа, рожь, горчица и красный клевер), уделяя особое внимание физическим, механическим и аэродинамическим свойствам семян и их влиянию на однородность смешанных семян покровных культур. Предварительные результаты показывают, что различия в свойствах семян влияют на однородность семенной смеси в бункере. Неоднородность оказывает негативное влияние на однородность посева и должна быть устранена. Масса тысячи зерен является важным фактором, определяющим качество и урожайность покровных культур. Масса тысячи зерен вычисляется в граммах и представляет собой общий вес 1000 зерен. Для расчета массы тысячи зерен необходим точный подсчет семян. Поэтому точное обнаружение смешанных семян имеет важное значение. Обнаружение семян также позволяет проводить селекцию, фенотипический анализ и сортировку заплесневелых и поврежденных зерен. Однако в сложных условиях сельскохозяйственного производства перекрытие и плотное прилегание смешанных семян значительно снижают точность подсчета. Вопрос о том, как точно определить наличие прилипших друг к другу семян в смешанных посевах, является важной исследовательской задачей, которой уделяется все больше внимания.

Область глубокого обучения значительно продвинулась в сельскохозяйственных приложениях, и ее способность обрабатывать сложные и большие объемы данных произвела революцию в ряде отраслей. Ее применение в сельском хозяйстве варьируется от прогнозирования урожая до обнаружения вредителей и, совсем недавно, характеристики урожая. В этом контексте подсчет урожая имеет решающее значение на различных стадиях роста. Например, подсчет всходов помогает оценить скорость прорастания, тем самым улучшая селекцию и обеспечивая своевременный повторный посев благодаря ранним предупреждениям [8, 9]. Мониторинг урожая на стадиях его роста помогает выявлять проблемы, такие как болезни или повреждения вредителями [10], в то время как подсчет на более поздних стадиях поддерживает точные прогнозы урожайности, направляя планирование сбора урожая [11]. Однако ручной подсчет трудоемок и непрактичен для крупномасштабного земледелия [12], что подчеркивает необходимость автоматизированных, быстрых и работающих в режиме реального времени решений для подсчета. Традиционные методы обработки изображений для подсчета урожая часто включают сложные этапы, такие как пороговая сегментация, ручное извлечение признаков и регрессия признаков [13].

Например, [14] предложил метод, сочетающий избыточную зелень для подсчета всходов пшеницы. В работе [15] точность подсчета кукурузы была улучшена за счет угловых вычислений, кластеризации растений и мозаичных методов. Другие исследования, такие как работы [16, 17], использовали различные методы обработки изображений для подсчета листьев и растений. Хотя эти методы эффективны, они сложны и чувствительны к таким факторам, как свет, что делает их менее подходящими для практического использования в сельском хозяйстве. Интеграция искусственного интеллекта и технологий компьютерного зрения предлагает перспективное решение для автоматического, быстрого и точного подсчета урожая [18, 19].

Глубокое обучение, ключевая технология ИИ, применяется для решения таких задач, как прогнозирование урожая, обнаружение вредителей и классификация семян. Недавние исследования продемонстрировали эффективность глубокого обучения в обнаружении прорастания семян [20, 21]. Например, в работе [22] использовался полуавтоматический проращиватель для высокопроизводительной оценки прорастания семян, в то время как [23] повысил точность обнаружения с помощью сегментации изображений и сверточных нейронных сетей. 

В работе [25] достигнута точность 98,5% в задаче «Улучшение сегментации и подсчета головок подсолнечника с использованием улучшенного UNet». Несмотря на достижения, традиционные методы обработки изображений сталкиваются с ограничениями в сложных сельскохозяйственных условиях. Чувствительность к факторам окружающей среды и необходимость многоэтапной обработки снижают их практичность. Методы глубокого обучения, особенно основанные на сверточной регрессии и обнаружении объектов, демонстрируют многообещающие результаты. Например, в работе [25] для подсчета растений использовались изображения с БПЛА и сверточные нейронные сети, а в работе [26] — сверточные нейронные сети для подсчета цитрусовых деревьев в садах с высокой плотностью посадки. Методы, основанные на обнаружении, такие как методы [27], оказались эффективными, особенно в сценариях с высокой видимостью цели. Кроме того, в работе [28] исследуется применение глубокого обучения для категоризации семян, демонстрируя значительные преимущества по сравнению с предыдущими методами, особенно с точки зрения точности и эффективности.

С другой стороны, производительность глубокого обучения сильно зависит от качества используемого набора данных, выбора подходящей модели и эффективности процесса обучения. В работе [29] подчеркивается важность высококачественных наборов данных и необходимость тщательного выбора модели в приложениях глубокого обучения. В работе [30] это расширяется за счет доказательства прямого влияния качества набора данных и выбора модели на производительность модели глубокого обучения. Это подчеркивает важность точности при выборе и подготовке наборов данных, а также при выборе и настройке моделей глубокого обучения для достижения оптимальных результатов в обнаружении и классификации смесей начальных точек.

Существует множество алгоритмов обнаружения объектов, таких как региональная сверточная нейронная сеть (R-CNN), быстрая региональная сверточная нейронная сеть (Fast R-CNN) и детектор одиночного снимка (SSD) [31]. Одна нейронная сеть может использоваться для объединения всех необходимых функций системы обнаружения объектов, как показано в [32]. Одним из таких алгоритмов является You Only Look Once (YOLO), разработанный в 2016 году. В [33] было установлено, что алгоритм YOLO превосходит другие алгоритмы по скорости и точности при обнаружении и вычислении координат объектов. Базовая модель YOLO обрабатывает изображения в реальном времени со скоростью 45 кадров в секунду (FPS). Fast YOLO, меньший вариант сети, может обрабатывать изображения со скоростью 155 FPS и достигать вдвое большей средней точности (mAP), чем другие детекторы реального времени. В работе [33] было установлено, что, хотя YOLO генерирует больше ошибок локализации, у него меньше вероятность предсказания ложных срабатываний на фоне. За прошедшие годы YOLO эволюционировал, и версии от YOLOv1 до YOLOv9 предлагают улучшения скорости, точности и эффективности. YOLOv5 известен своей производительностью, а YOLOv7 может похвастаться еще большей точностью и более высокой скоростью [34, 35]. Тем не менее, большинство существующих исследований сосредоточено на однородных семенах одного типа или контролируемом фоне, и мало внимания уделяется обнаружению смешанных семян в условиях адгезии, окклюзии или переменного освещения, распространенных в сельскохозяйственной практике.

Несмотря на эти достижения, по-прежнему существует существенный пробел в исследованиях. Взаимосвязи между кинематикой сеялки, эффективностью обнаружения на основе изображений и механическими и физическими характеристиками смесей семян уделялось мало внимания. Видовая неоднородность (размер, плотность и форма) в комбинациях покровных культур создает очень сложные проблемы для механической однородности и точности визуального распознавания. На однородность также влияет расслоение, вызванное вибрацией и неравномерным потоком во время работы сеялки. Кроме того, использование сложных моделей глубокого обучения для обнаружения смешанных семян при их прилипании или изменении условий освещения не было оценено во многих экспериментах. Поэтому разработка надежных методов обнаружения и подсчета, которые могут функционировать в различных реальных сценариях посадки и работы сеялки, имеет важное значение.

Данное исследование восполняет этот пробел, интегрируя методы машинного зрения и глубокого обучения для повышения точности обнаружения и подсчета множественных семян в сложных системах покровных культур. Наши основные достижения:

  • Разработка смешанного набора данных по семенам покровных культур разных видов (лен, вика мохнатая, клевер красный, редис и рожь) с учетом реальных условий адгезии и неоднородности. Для уменьшения влияния фонового освещения во время сбора данных под платформой для съемки была установлена ​​электронная светодиодная панель с регулируемой яркостью и различными режимами освещения. Это позволило добиться однородного освещения и уменьшить количество теней и отражений, которые могли бы вызвать искажения в процессе обучения модели.
  • Сравнение двух передовых моделей глубокого обучения (YOLOv5 и YOLOv7) для идентификации и классификации смешанных семян в реальных сельскохозяйственных условиях.
  • YOLOv7 превосходит YOLOv5 по показателям точности, прецизионности, полноты и mAP.
  • Использование метода подсчета на основе обнаружения для калибровки сеялок, оценки массы тысячи зерен и повышения равномерности посева.
  • В исследовании представлены новый набор данных, схема управления освещением, методологическая основа и эмпирическая проверка, результаты которых способствуют автоматизации обнаружения смешанных семян для точного посева и оценки качества в интеллектуальном сельском хозяйстве.

2. Материалы и методы

YOLO — чрезвычайно быстрая модель, способная обрабатывать изображения со скоростью 45 кадров в секунду, поскольку не требует сложных конвейеров обработки. Более того, по сравнению с другими системами реального времени, YOLO более чем вдвое превосходит среднюю точность (mAP), что делает её отличным вариантом для подсчёта и обнаружения объектов в реальном времени. При частоте 91 кадр в секунду YOLO значительно быстрее других детекторов объектов, как показано на графике ниже (Рисунок 1). YOLO имеет очень мало ошибок фона и значительно более высокую точность, чем другие современные модели. YOLO отлично подходит для приложений, требующих быстрой и надёжной идентификации объектов, поскольку также обеспечивает улучшенную обобщающую способность для новых областей. Хотя YOLOv1 имеет самый низкий показатель mAP для автоматического обнаружения, модель постоянно совершенствовалась сообществом с момента её открытия. Это один из факторов, способствовавших быстрому развитию YOLO. 

Рисунок 1.  Сравнение скорости YOLO с другими современными детекторами объектов [36].

2.1. Архитектура и версии YOLO

Модель You Only Look Once (YOLO) — популярный инструмент в компьютерном зрении, особенно для задач распознавания объектов. YOLO использует глубокое обучение для поиска и классификации объектов на изображениях, предоставляя координаты ограничивающего прямоугольника каждого объекта и быстро и точно определяя его класс. Модель разбивает входное изображение на сетку ячеек, и для каждой ячейки она предсказывает ограничивающие прямоугольники, используя пять параметров: координаты x и y центра прямоугольника, ширину и высоту прямоугольника, а также вероятность того, что прямоугольник содержит объект. YOLO использует нейронные сети и такие методы, как обратное распространение ошибки и градиентный спуск, для повышения точности с течением времени.

С момента своего появления YOLO претерпела множество улучшений, что привело к появлению версий от YOLOv1 до YOLOv7. По словам Непала и Эсламиата (2022) [37], каждая версия имеет свои собственные усовершенствования: YOLOv1 использует функцию softmax для классификации, в то время как YOLOv2 вводит пакетную нормализацию, повышая точность и эффективность. YOLOv3 использует Darknet53 в качестве своей базовой архитектуры, что повышает производительность извлечения признаков и обнаружения, а также заменяет функцию softmax независимой логистической функцией, снижая вычислительную сложность.

YOLOv4 использует CSPDarknet53, объединяя Darknet53 и сеть CSP, что приводит к повышению точности и эффективности при снижении требований к аппаратному обеспечению. YOLOv5 представляет слой Focus с CSPDarknet53, снижая требования к памяти и повышая скорость, что делает его быстрее и легче, чем YOLOv4. YOLOv6 включает в себя множество улучшений базовой архитектуры, сегментов и стратегий обучения, таких как структура стиля RepVGG и базовая архитектура EfficientRep. YOLOv7 превосходит все предыдущие версии как по скорости, так и по точности, достигая средней точности 56,8% при 30 кадрах в секунду и выше, сокращая количество параметров и вычислений примерно на 40% и 50% соответственно, одновременно повышая точность обнаружения в реальном времени и скорость вывода. При работе на GPU наблюдалось приблизительно 10% улучшение скорости вывода для YOLOv7 по сравнению с YOLOv5 (Durve et al., 2023) [38].

В целом, модели YOLO стали быстрее и точнее с каждой версией, что делает их очень эффективными для задач обнаружения объектов в реальном времени. YOLOv5 и YOLOv7 были специально выбраны для этого исследования на основе трех основных критериев: (1) стабильность открытого исходного кода и воспроизводимость с наборами данных сельскохозяйственных изображений; (2) хороший баланс между сложностью модели, скоростью вывода и масштабируемостью при обучении на GPU среднего уровня; и (3) сильные результаты бенчмаркинга в предыдущих рецензируемых исследованиях сельскохозяйственной визуализации, даже несмотря на то, что были включены более поздние версии (YOLOv8–YOLOv13) [39]. Использование развязанных головок и модулей на основе трансформаторов в YOLOv8 и более поздних моделях увеличивает количество параметров и требования к оборудованию, что приводит к небольшому увеличению mAP (~1–2%) за счет увеличения периода обучения на 50% [35–40]. Учитывая важность вывода в реальном времени и изменчивости набора данных, YOLOv5 и YOLOv7 обеспечивают наилучшее соотношение точности и эффективности в задачах обнаружения со смешанными начальными значениями. В то время как YOLOv7 использует сети расширенной эффективной агрегации слоев (E-ELAN) и запланированную перепараметризацию для обеспечения улучшенного слияния признаков и точности обнаружения в реальном времени [41]. YOLOv5 — это облегченный базовый детектор, который хорошо работает с небольшими наборами данных с начальными значениями. Такое сочетание позволяет оценить надежное обнаружение с учетом адгезии и гетерогенности, используя как полезный базовый (YOLOv5), так и передовой эталонный (YOLOv7) эталон.

YOLOv5

Архитектура YOLOv5 состоит из трех основных компонентов: основы, модуля «шея» и модуля «голова». Основа YOLOv5 базируется на конструкции CSPDarknet53, варианте архитектуры Darknet. Она генерирует три карты признаков P3, P4 и P5 размерами 80 × 80, 40 × 40 и 20 × 20 соответственно. Эти карты признаков представляют различные масштабы рецептивных полей и захватывают многоуровневые детали изображения. Модуль «шея», построенный на структуре PANet (Path Aggregation Network), усиливает двунаправленный поток информации между слоями признаков.

Интегрируя как нисходящие, так и восходящие пути через сеть пирамид признаков (FPN), PANet повышает точность локализации мелких и неправильных объектов. Это особенно полезно для сельскохозяйственных приложений, где размеры семян сильно различаются, а смешанные семена часто оказываются частично заслоненными (рис. 2). В основе YOLOv5 лежат заключительные слои предсказания, которые обрабатывают предсказание наличия объектов, классификацию и регрессию ограничивающих рамок. Ветвь предсказания наличия объектов определяет присутствие объектов в каждой ячейке, ветвь классификации различает категории семян (лен, вика мохнатая, клевер красный, редис и рожь), а регрессия ограничивающих рамок точно локализует каждое семя на изображении. Два существенных алгоритмических усовершенствования, представленные в YOLOv5, включают улучшенную стабильность и полноту обнаружения. 

Рисунок 2.  Базовая архитектура модели YOLOv5.

Декодер на основе степеней: вместо экспоненциальной регрессии YOLOv3 используется формулировка, основанная на степенях, что ограничивает масштабирование выходных данных в пределах границ якорных точек для обеспечения стабильного обучения и более быстрой сходимости.

Метод положительной выборки по районам: улучшено обнаружение плотно расположенных и перекрывающихся очагов, компенсируется ограничения, связанные с полнотой выборки, за счет увеличения количества обучающих сеток, признанных положительными.

Благодаря этим усовершенствованиям, YOLOv5 является надежной базовой моделью для идентификации и подсчета смешанных семян в точном земледелии, поскольку они в совокупности обеспечивают идеальный баланс между вычислительной эффективностью и точностью обнаружения.

YOLOv7

YOLOv7 использует расширенные эффективные сети агрегации слоев (E-ELAN), применяя методы расширения, перемешивания и слияния для непрерывного повышения способности к обучению без нарушения исходного пути градиента [42]. Эта модификация конструкции происходит исключительно внутри вычислительного блока, оставляя архитектуру переходного слоя неизменной. Помимо сохранения конструкции E-LAN, E-ELAN способствует разнообразному обучению признаков между различными группами вычислительных блоков [Рисунок 3].

Кроме того, YOLOv7 включает масштабирование модели для моделей на основе конкатенации, корректируя атрибуты модели для получения различных масштабов для разных скоростей вывода. Метод составного масштабирования сохраняет исходные свойства модели и оптимальную структуру, как показано в [43], где отмечено, что YOLOv7 превосходит существующие детекторы объектов как по скорости, так и по точности в диапазоне значений FPS на GPU V100, достигая замечательной точности AP в 56,8%. YOLOv7 представляет несколько усовершенствований, которые повышают точность и эффективность по сравнению с E-ELAN.

Благодаря эффективной перепараметризации слоев, запланированные модули RepConv из RepVGG [44] позволяют ускорить вывод и обеспечить стабильную сходимость. Выравнивание и уточнение предсказаний улучшаются без необходимости дополнительной сложности за счет согласованных процедур присвоения меток от грубого к точному [45]. YOLOv7 расширен для обнаружения, сегментации и оценки позы с поддержкой голов на основе якорей и без якорей, а частичная вспомогательная функция потерь еще больше ускоряет сходимость. Архитектура обнаружения в реальном времени YOLOv7 обладает высокой масштабируемостью и точностью для сельскохозяйственных приложений благодаря достижениям в агрегации E-ELAN, перепараметризации RepConv и динамическому присвоению меток.

Рисунок 3.  Базовая архитектура модели YOLOv7.

В таблице 1  приведено краткое описание выбора YOLOv5 и YOLOv7 на основе их наилучших показателей точности, скорости и вычислительной эффективности. Благодаря улучшениям E-ELAN и RepConv, YOLOv7 обеспечивает более высокую точность и надежное обучение признаков, в то время как YOLOv5 предлагает портативную, надежную и воспроизводимую базовую модель, подходящую для обнаружения семян мелких объектов. Более новые версии (YOLOv8–v13) требуют больше оборудования и обеспечивают лишь незначительное повышение точности. Поэтому эти две модели являются наиболее эффективными для достижения целей исследования по точному и эффективному подсчету и анализу смешанных семян.

Таблица 1.  Сравнительная таблица архитектур и производительности YOLO v1–v13.

Версия YOLO Магистральная
сеть
FPS Преимущества Ограничения Релевантность Ссылка
YOLOv1 (2016) CNN в стиле GoogleNet 45 концепция обнаружения в реальном времени Плохая локализация; низкая точность запоминания. Эталон раннего обнаружения объектов 46 ]
YOLOv2 (2017) Даркнет-19 40 Повышенная точность и обобщающая способность. Все еще грубое обнаружение Предварительные исследования урожая/фруктов 47 ]
YOLOv3 (2018) Даркнет-53 30 Хороший баланс скорости и точности. Тяжелая модель; без CSP Используется для обнаружения семян и плодов. 48 ]
YOLOv4 (2020) CSPDarknet-53 62 Стабильная, высокая точность Повышенный спрос на графические процессоры. Подходит для обнаружения сельскохозяйственных культур с помощью БПЛА. 43 ]
YOLOv5 (2022) CSPDarknet-53 + слой фокусировки 120 Быстрый, легкий, с высокой воспроизводимостью. Потенциал переобучения Идеально подходит для подсчета мелких предметов и семян. 49 , 50 ]
YOLOv6 (2022) EfficientRep + RepVGG 90 Эффективный вывод Более высокая сложность настройки Эффективно для съемки с дронов. 51 ]
YOLOv7 (2022) E-ELAN + RepConv 30 + Компромисс между высокой точностью и скоростью Больший объем используемой памяти Отлично подходит для обнаружения плотных смешанных посевов. 52 ]
YOLOv8 (2023) CSPDarknet-C2f + Развязанная головка 25 Немного более высокая AP Увеличение времени тренировок на 35–50%. Незначительное улучшение по сравнению с версией 7 для сельскохозяйственных культур. 53 ]
YOLOv9 (2024) GELAN + Информация о программируемом градиенте 25 Улучшенное обнаружение мелких объектов Ограниченное открытое тестирование Потенциально, но не подтверждено данными из сельскохозяйственных баз данных. 54 , 55 ]
YOLOv10 (2024) RT-DETR Fusion 22 КПД трансформатора Высокая стоимость компьютеров Избыточные ресурсы для небольших наборов сельскохозяйственных данных. 56 ]
YOLOv11–13 (2025) Гибридные конвергентно-трансферные магистрали 20–22 Незначительное усиление AP Очень высокая сложность и нагрузка на графический процессор. Пока не проверено на сельскохозяйственных наборах данных. 57 ]
2.2. Подготовка данных
2.2.1. Обзор данных

Наш исходный набор данных, сбалансированно распределенный по классам, включал 500 изображений: 50 изображений для каждого типа отдельных семян (лен, вика мохнатая, клевер красный, редис и рожь) и 250 изображений смешанных семян. Используя общедоступные наборы данных о семенах, мы значительно расширили набор данных за счет многоэтапной аугментации и дополнительной валидации, чтобы улучшить обобщающую способность модели и преодолеть ограничения, связанные с размером набора данных.

Данные были дополнены вариациями оттенков для воспроизведения спектрального разнообразия, позиционная изменчивость была зафиксирована путем вращения и горизонтального отражения, а изменения освещения были воспроизведены путем модификации контраста и яркости. В результате этих изменений было получено около 2000 аннотированных изображений, что почти в четыре раза увеличило размер набора данных. Дополненный набор данных был случайным образом разделен на обучающую (70%), валидационную (20%) и тестовую (10%) подгруппы, соответствующие примерно 1400, 400 и 200 изображениям соответственно.

2.2.2. Сбор и аннотирование данных

Мы получили высококачественные изображения различных типов семян, включая лен, вику мохнатую, клевер красный, редис и рожь, используя камеру Canon LP E6N R6 5D Mark IV с объективом 24–105 мм f/4 L II, установленную на штативе [ Рисунок 4a ]. Каждое RGB-изображение было получено вручную с разрешением 6000 × 4000 пикселей с помощью камеры Canon EOS R6 Mark IV, оснащенной объективом 24–105 мм f/4 L II, что обеспечило универсальный диапазон фокусных расстояний и хорошую производительность при слабом освещении. Для обеспечения согласованности использовались стандартизированные настройки камеры, а расстояние от объекта до камеры составляло приблизительно 10 см. Для повышения способности модели к обобщению на реальные условия изображения были получены при различном фоне и освещении с использованием светодиодной доски с тремя режимами: белый, теплый и смешанный. Такое разнообразие гарантирует, что модель не зависит исключительно от конкретных визуальных характеристик из контролируемой среды, что делает ее устойчивой к ранее не встречавшимся данным.

После захвата изображений они были тщательно аннотированы ограничивающими рамками и метками классов с использованием платформы Robo-flow для создания эталонных ограничивающих рамок, как показано на  рисунке 4. Roboflow предлагает надежный набор инструментов для оптимизации разработки рабочих процессов компьютерного зрения для реальных приложений [40]. Аннотации были сохранены в формате YOLO, при этом аннотации каждого изображения хранились в zip-файле с тем же именем файла, что и изображение. Кроме того, в каждой папке был создан файл «classes.yml» для перечисления всех имен классов. Этот процесс аннотирования имеет решающее значение для модели обнаружения объектов YOLO, чтобы точно интерпретировать размеченные данные и изучить характеристики каждого класса объектов. 

Рисунок 4.  ( а ) Настройка камеры ( б ) Исходное изображение ( в ) Изображение с аннотациями и ( г ) Изображение с подписями (0 — лен, 1 — вика мохнатая, 2 — красный клевер, 3 — красноватый и 4 — рожь).

2.2.3. Предварительная обработка данных
На этапе предварительной обработки мы выполнили два ключевых шага, чтобы получить изображения, подходящие для обучения модели. Во-первых, мы использовали механизм автоматической ориентации для автоматического обнаружения и коррекции любых неровностей вращения на изображениях, что позволило отображать однородные объекты независимо от ориентации камеры в момент съемки. Во-вторых, ко всем изображениям был применен единый размер 640 × 640 пикселей, что снизило нагрузку на процессор и позволило эффективно обрабатывать большое количество изображений. Благодаря этим этапам предварительной обработки был создан набор данных из изображений одинакового размера и выровненных изображений, что улучшило производительность и обучение модели.
Расширение данных

После предварительной обработки мы применили аугментацию данных для повышения качества набора данных и обобщающей способности модели, позволяющей ей адаптироваться к изменениям в реальном мире. Для повышения точности модели в различных условиях это включало создание модифицированных версий уже существующих изображений для имитации реальных сценариев, с которыми модель столкнется во время развертывания. Используя такие стратегии, как горизонтальное отражение, мы смогли увеличить количество обучающих выборок в четыре раза и позволить модели изучать свойства объектов независимо от ориентации. Для имитации изменений камеры и цветовых сдвигов были выполнены случайные повороты и изменения оттенка в диапазоне от −15 до +15 градусов [Рисунок 5]. Используя эти методы, размер набора данных был расширен примерно до 2000 фотографий, что улучшило качество обучающих данных и позволило создать более надежную и адаптируемую модель для использования в реальных условиях.

Рисунок 5.  Изображения смешанных семян после аугментации данных (отражение, вращение и корректировка оттенка).

2.3. Внедрение данных и обучение

Настраивается среда блокнота YOLO (версии 5 и 7), при этом устанавливаются необходимые приложения, включая Python 3.10, PyTorch 2.1.0 с Torchvision 0.19.0 и CUDA 12.1 для ускорения GPU. После этого набор данных, состоящий из изображений и связанных с ними файлов аннотаций, таких как файлы YOLO format.txt с координатами ограничивающих рамок, загружается в виде аннотированного zip-файла. Код и инструменты, необходимые для обучения и тестирования моделей YOLO, находятся в клонированном репозитории Ultralytics GitHub v7.0 для YOLOv5 и v7, а pip используется для установки всех зависимостей и необходимых пакетов из репозитория, таких как PyTorch, torchvision, matplotlib и другие необходимые компоненты.

Для обеспечения корректного определения классов во время обучения и вывода выполняется поиск и чтение конфигурационного файла YAML, специфичного для моделей YOLO. Затем количество классов изменяется в соответствии с количеством классов в наборе данных. Для начала обучения необходимо указать путь к новому YAML-файлу, а также гиперпараметры, такие как размер пакета, скорость обучения и количество эпох, которые необходимо оптимизировать для точного обнаружения объектов. Затем используется Tensor Board, инструмент визуализации в реальном времени, для отслеживания таких метрик, как потери, точность, полнота и другие показатели оценки в процессе обучения.

Это помогает оценить прогресс обучения модели, выявить проблемы и внести необходимые корректировки для повышения производительности. В конечном итоге, выходные файлы или результаты выводятся через заданные интервалы или после завершения обучения для оценки производительности модели и измерения таких факторов, как скорость вывода, точность обнаружения и другие важные метрики. Эти процедуры позволяют эффективно создавать и обучать модель YOLO, адаптированную для задач обнаружения, классификации и подсчета смешанных начальных точек (рис. 6).

Рисунок 6.  Схема внедрения и обучения моделей YOLO (версии 5 и 7).

2.3.1. YOLOv5

Мы начали процесс обучения с архитектуры YOLOv5 (рис. 7). Мы установили определенные гиперпараметры для процесса обучения, такие как скорость обучения 1 × 10⁻³; скорость затухания 1 × 10⁻⁴; размер пакета 5; момент инерции 0,937 и всего 500 эпох. Для оптимизации процесса обучения и изучения преимуществ более стабильной вычислительной среды мы перенесли обучение на Google Colab Pro, облачную платформу, предоставляющую графический процессор A100 с 40 ГБ оперативной памяти [табл. 2]. Время обучения значительно сократилось благодаря использованию Colab Pro. Мы заметили, что модель достигла своей наивысшей производительности на 375-й эпохе, что указывает на снижение эффективности после этого момента, хотя точное количество использованных эпох неизвестно. За последние 125 эпох дополнительное обучение не привело к значительному повышению точности модели. В результате, для максимальной эффективности мы решили прекратить обучение. Окончательные результаты обучения были отображены на графике для визуального анализа после их записи; результаты обучения, валидации и тестирования были сохранены на Google Drive для последующего доступа, и они будут более подробно рассмотрены в разделе результатов. Кроме того, мы оценили производительность модели на конкретном тестовом наборе данных, что подтвердило удовлетворительную работу обученной модели YOLOv5, успешно идентифицирующей, классифицирующей и подсчитывающей семена в заданном наборе данных изображений.

Рисунок 7.  Структура предлагаемой модели YOLOv5 для обнаружения, классификации и подсчета смешанных семян.

Таблица 2.  Учебная среда и технические характеристики оборудования.

Компонент Спецификация
GPU NVIDIA A100 (40 ГБ видеопамяти)
Процессор Процессор Intel Xeon 2,8 ГГц (виртуальный экземпляр Google Compute Engine)
Память (ОЗУ) 25 ГБ
Операционная система Ubuntu 20.04 LTS (контейнер Google Colab)
Версия Python 3.10.12
Фреймворк глубокого обучения PyTorch 2.1.0 + CUDA 12.1 + cuDNN 8.9
Репозиторий Ультралитики
IDE/Среда выполнения Среда разработки Google Colab Pro Notebook
Инструменты визуализации TensorBoard (2.14.1) и Matplotlib (3.7.1) для отслеживания метрик в реальном времени.
2.3.2. YOLOv7

Архитектура YOLOv7 ( рис. 8 ) была проанализирована после успешного обучения и оценки модели YOLOv5. Для ускорения обучения использовался Google Colab Pro (GPU A100 и 40 ГБ ОЗУ) с эквивалентными гиперпараметрами (скорость обучения 1 × 10⁻²; скорость затухания 5 × 10⁻⁴; размер пакета 5; момент инерции 0,937 и всего 500 эпох) [табл. 3]. Процесс завершился примерно за 4 часа. Аналогично YOLOv5, обучение было остановлено на 425-й эпохе из-за уменьшения отдачи, что указывает на оптимальную производительность. Подробности записанных и визуализированных результатов обучения YOLOv7 будут обсуждаться позже. Сравнительный анализ с YOLOv5 выявил незначительное улучшение производительности по сравнению с YOLOv8, что указывает на возможную пользу от этой деятельности. Кроме того, эффективность YOLOv7 была оценена на специальном тестовом наборе данных, что подтвердило ее пригодность для практического применения в сценариях идентификации, классификации и подсчета смешанных семян.

Рисунок 8.  Структура предлагаемой модели YOLOv7 для обнаружения, классификации и подсчета смешанных семян.

Таблица 3.  Гиперпараметры обучения.

Гиперпараметр Ценности
Эпохи 500 (ранняя остановка ≈ 375 (YOLO v5) и 425 (v7)
Размер партии 5
размер изображения 640 × 640
Оптимизатор СГД
Базовый LR (lr0) 0,01
Финальный LR (lrf) 0,01
Импульс 0,937
Снижение веса 5 × 10 −4
Эпохи разминки 3
Импульс разминки 0,8
Предвзятость разминки LR 0.1
Box/cls/obj loss gains 0.05/0.5/1.0
Порог обучения IoU (iou_t) 0.2
Рабочие процессы загрузки данных 2
Автоматическая привязка Включено (BPR = 1.000)
2.4. Методика подсчета семян

Правильный подсчет семян был достигнут с помощью многоэтапного процесса постобработки результатов обнаружения YOLOv5 и YOLOv7. Обе модели создали ограничивающие рамки вместе с соответствующими метками классов и уровнями достоверности для каждого обнаруженного семени.

Фильтрация обнаружений: Сохранялись только обнаружения с уровнем достоверности ≥ 0,5. Ограничивающие рамки упорядочивались в порядке убывания достоверности, чтобы отдавать предпочтение обнаружениям с высокой степенью достоверности.

Метод подавления немаксимальных значений (NMS): Для удаления дублирующихся обнаружений одного и того же начального значения использовался метод NMS с порогом IoU 0,45. Перекрывающиеся области одного класса, превышающие этот порог, объединялись, и сохранялась только наиболее достоверная область.

Кластеризация центроидов для случаев перекрытия и окклюзии: Для перекрывающихся или окклюдированных точек, создающих несколько близких обнаружений, определялись центроиды их ограничивающих рамок, и проводилась кластеризация с использованием порогового значения, основанного на расстоянии (≤15 пикселей). Каждый кластер представлял собой один экземпляр точки, что минимизировало ошибки двойного подсчета при высокой плотности точек.

Генерация подсчета: Количество семян на изображении подсчитывалось как число уникальных оставшихся ограничивающих рамок после кластеризации методом NMS и центроидной кластеризации. Затем их подсчитывали по типу семян (волосатая вика, лен, красный клевер, редис и рожь) на основе результатов классификации.

Ручная проверка: 10% тестовых изображений были проверены вручную для подтверждения автоматических подсчетов. Автоматические подсчеты отличались от ручных эталонных значений менее чем на ±2%, что подтверждает правильность преобразования обнаружения в подсчет.

2.5. Матрицы оценки эффективности
Для оценки эффективности нашей модели мы используем три ключевых показателя:
2.5.1. Точность

Точность измеряет отношение числа правильно предсказанных положительных значений к общему числу предсказанных положительных значений.

Точность = (Истинно положительные + Ложно положительные) / Истинно положительные 
2.5.2. Воспроизведение

Функция Recall вычисляет процент правильно предсказанных положительных значений по отношению ко всем фактическим положительным значениям в соответствующем классе.

Полнота ответа = (Истинно положительные + Ложно отрицательные) / Истинно положительные 

2.5.3. mAP (средняя точность)

mAP — это среднее значение точности (AP) по всем категориям. Сравнивая обнаруженный прямоугольник с ограничивающим прямоугольником эталонного изображения при пороговом значении пересечения над объединением (IOU) 0,5, mAP@0,5 вычисляет оценку. Чем выше оценка, тем точнее обнаружения модели. mAP@0,5:0,95 — это среднее значение mAP с шагом 0,05 для диапазона критериев от 0,5 до 0,95. AP рассчитывается на основе кривой «точность-полнота».

Истинно положительные результаты (TP) относятся к правильно предсказанным ограничивающим рамкам, которые соответствуют как критериям классификации, так и критериям ограничивающих рамок, и обычно имеют показатель IOU выше заданного порогового значения.

Ложноположительные результаты (FP) относятся к прогнозируемым ограничивающим рамкам с показателем IOU ниже порогового значения, а ложноотрицательные результаты (FN) представляют собой отрицательные образцы, ошибочно классифицированные как положительные.

2.5.4. Функция потерь
Модель YOLOv5 использует специальную функцию потерь для расчета потерь, связанных с целостностью объекта и вероятностью принадлежности к классу, и относится к взвешенному среднему точности и полноты, а также регрессии ограничивающих рамок. Эта функция потерь необходима для эффективного обучения модели. В нашей методологии мы используем следующие функции потерь:
А. BCEclsloss (бинарная кросс-энтропийная функция потерь):
Эта функция потерь используется для расчета потерь для вероятности класса и целевого балла. Она измеряет разницу между предсказанными вероятностями классов и истинными метками классов.
Б. GIOU_loss (обобщенная потеря пересечения над объединением):

Функция потерь GIOU_Loss используется для регрессии ограничивающих рамок. Она основана на метрике обобщенного пересечения над объединением (GIOU), которая количественно оценивает сходство между

где

  • yi  — это i-е скалярное значение в выходных данных модели.
  • ̂𝑦i  — соответствующее целевое значение.
  • N — это количество скалярных значений в выходных данных модели.
  • A обозначает предсказанный ограничивающий прямоугольник.
  • B обозначает ограничивающий прямоугольник, соответствующий истинным значениям.
  • C — это малая ограничивающая фигура, включающая в себя как A, так и B.
3. Результаты

Сравнение моделей YOLOv5 и YOLOv7, представленное в  таблице 2 , показывает, что YOLOv7 значительно превосходит YOLOv5 по всем ключевым показателям оценки: mAP (0–50), mAP (0–95), точность и полнота. Для всего класса «Все» YOLOv7 достиг среднего значения mAP@0.5, равного 99,5 ± 0,28, и mAP@0.5:0.95, равного 76,0 ± 0,46, по сравнению с 98,6 ± 0,45 и 69,5 ± 0,70 для YOLOv5, что подтверждает улучшенную точность обнаружения в условиях стабильного обучения. Точность и полнота также улучшились с 95,4 ± 0,55 и 95,4 ± 0,62 (YOLOv5) до 98,5 ± 0,32 и 98,7 ± 0,35 (YOLOv7), что указывает на более высокую надежность и меньшую дисперсию прогнозирования [Таблица 4].

Анализ по классам показывает существенное улучшение точности и надежности обнаружения для отдельных классов, таких как лен, мохнатая вика, красный клевер, редис и рожь. Например, YOLOv7 улучшил mAP (0–50) для льна с 98,4 до 99,6 и mAP (0–95) с 67,2 до 76,4, при этом точность выросла с 86,3 до 95,0, а полнота — с 98,3 до 99,0. У Hairy Vetch наблюдалось значительное улучшение показателя mAP (0–95) с 78,6 до 83,0, а у Radish — существенное улучшение по всем метрикам. Red Clover и Rye также продемонстрировали заметное повышение производительности, особенно по показателям точности и полноты. В целом, результаты показывают, что YOLOv7 обеспечивает более высокую точность и надежность в задачах обнаружения объектов, подтверждая его эффективность в реальных условиях и подчеркивая преимущества использования этой более совершенной архитектуры.

Таблица 4.  Сравнение моделей YOLOv5 и YOLOv7 по результатам матриц производительности (среднее значение ± стандартное отклонение по трем запускам).

Сорт Модель mAP@0.5 (%) mAP@0.5:0.95 (%) Точность (%) Отзывать (%)
Все YOLOv5 98,6 ± 0,45 69,5 ± 0,70 95,4 ± 0,55 95,4 ± 0,62
YOLOv7 99,5 ± 0,28 76,0 ± 0,46 98,5 ± 0,32 98,7 ± 0,35
Лен YOLOv5 98,4 ± 0,52 67,2 ± 0,61 86,3 ± 0,73 98,3 ± 0,41
YOLOv7 99,6 ± 0,34 76,4 ± 0,48 95,0 ± 0,44 99,0 ± 0,29
Волосатая вика YOLOv5 98,8 ± 0,43 78,6 ± 0,59 98,1 ± 0,38 98,8 ± 0,32
YOLOv7 99,1 ± 0,25 83,0 ± 0,42 98,5 ± 0,31 99,4 ± 0,27
Красный клевер YOLOv5 99,3 ± 0,35 58,4 ± 0,73 98,9 ± 0,41 91,3 ± 0,62
YOLOv7 99,6 ± 0,28 61,5 ± 0,55 99,0 ± 0,33 93,3 ± 0,45
Редис YOLOv5 96,7 ± 0,66 69,6 ± 0,70 94,8 ± 0,57 96,7 ± 0,49
YOLOv7 99,6 ± 0,29 77,1 ± 0,54 99,7 ± 0,25 98,6 ± 0,32
Рожь YOLOv5 99,5 ± 0,27 73,5 ± 0,62 99,0 ± 0,33 94,5 ± 0,51
YOLOv7 99,6 ± 0,26 81,8 ± 0,47 99,6 ± 0,29 97,7 ± 0,38

 

На рисунке 9a показана средняя точность (mAP) при пороговом значении IoU 0,95 для обеих моделей в разных классах. YOLOv7 демонстрирует превосходные результаты: mAP для всех классов увеличивается с 69,5 для YOLOv5 до 76 для YOLOv7. В таких классах, как лен и вика мохнатая, наблюдаются заметные улучшения: mAP возрастает с 67,2 до 76,4 и с 78,6 до 83 соответственно. На  рисунке 9b представлены показатели точности и полноты. YOLOv7 стабильно демонстрирует более высокую точность во всех классах с меньшим количеством ложноположительных прогнозов. Для категории «Все» точность для YOLOv7 составляет приблизительно 98,5 по сравнению с 95,4 у YOLOv5. Значительные улучшения наблюдаются в классе редиса: точность увеличивается с 94,8 для YOLOv5 до 99,7 для YOLOv7. Показатель полноты для YOLOv7 также превосходит YOLOv5, что указывает на меньшее количество пропущенных истинно положительных прогнозов: полнота для категории «Все» составляет 98,7 по сравнению с 95,4 у YOLOv5. Улучшенная полнота наблюдается и для отдельных категорий, таких как лен и вика мохнатая.

Рисунок 9. Результаты  mAP ( a ) и Precision–Recall ( b ) моделей YOLOv5 и YOLOv7 для разных классов.

Матрицы ошибок использовались для оценки эффективности распознавания и подсчета различных категорий семян моделями. Эти матрицы содержали очень мало элементов, расположенных вне диагонали, что указывает на редкость случаев ошибочной классификации. Этот вывод предполагает, что модели приобрели значительные навыки классификации, успешно различая различные типы семян в наборе данных. Матрицы ошибок для YOLOv5 и YOLOv7 показаны на  рисунке 10.

Рисунок 10.  Матрица ошибок YOLOv5 ( a ) и YOLOv7 ( b ).

На графиках (рис. 11) показаны кривые F1 для YOLOv5 (a) и YOLOv7 (b), демонстрирующие зависимость между показателем F1 и уровнями доверия для разных классов. На графике YOLOv5 видно, что показатели F1 достигают пика в диапазоне доверия от 0,5 до 0,7 для большинства классов, при этом лен и рожь показывают более высокие показатели F1 по сравнению с другими классами. Общая производительность по всем классам достигает оптимального показателя F1 0,587 при уровне доверия 0,95, что показано синей линией. В сравнении с этим, график YOLOv7 демонстрирует улучшенную производительность, с более высокими показателями F1, достигаемыми в более широком диапазоне уровней доверия, особенно между 0,6 и 0,8. Отмечается, что красный клевер и рожь демонстрируют стабильно высокие показатели F1 в этом диапазоне. Общий оптимальный показатель F1 для всех классов составляет 0,99 при уровне доверия 0,310, что значительно выше, чем производительность, наблюдаемая с YOLOv5. Это указывает на то, что YOLOv7 не только достигает более высоких показателей F1, но и сохраняет эти показатели в более широком диапазоне пороговых значений достоверности, что свидетельствует о лучшей и более надежной эффективности обнаружения в различных классах.

Рисунок 11.  Кривая доверия F1 для YOLOv5 ( a ) и YOLOv7 ( b ).

Кривые точности-полноты для YOLOv5 (a) и YOLOv7 (b) показывают эффективность моделей в балансировании точности и полноты для различных классов ( Рисунок 12 ). На графике YOLOv5 точность высока в диапазоне значений полноты, но значительно снижается по мере приближения полноты к 1. Лен и вика мохнатая сохраняют высокие значения точности — 0,984 и 0,988 соответственно. Красный клевер и рожь также демонстрируют высокую эффективность со значениями точности 0,993 и 0,995, в то время как у редиса точность немного ниже — 0,967. Общая точность для всех классов составляет приблизительно 0,986 при пороговом значении mAP 0,5, как показано синей линией. График YOLOv7 демонстрирует более устойчивую эффективность, при этом точность остается близкой к 1 почти во всем диапазоне значений полноты. Все классы, включая лен, вику мохнатую, красный клевер, редис и рожь, демонстрируют значения точности приблизительно 0,996. Общая точность для всех классов достигает 0,995 mAP при пороговом значении 0,5. YOLOv7 демонстрирует значительные улучшения по сравнению с YOLOv5, обеспечивая превосходную производительность обнаружения с минимальным компромиссом между точностью и полнотой, что делает его более эффективной моделью для задач обнаружения объектов.

Рисунок 12.  Кривая точности-полноты YOLOv5 ( a ) и YOLOv7 ( b ).

На рисунке 13  сравниваются показатели производительности обучения и валидации моделей YOLOv5 (слева) и YOLOv7 (справа). Обе модели демонстрируют устойчивое снижение потерь ограничивающих рамок, потерь на объектность и потерь классификации, что указывает на улучшение прогнозов и точности классификации. Показатели точности и полноты стабильно растут, при этом точность стабилизируется на уровне около 0,9, а полнота приближается к 1,0, что подчеркивает высокую точность и процент правильных обнаружений. Показатели средней точности (mAP), как mAP@0,5, так и mAP@0,5:0,95, демонстрируют значительное улучшение, при этом YOLOv7 показывает несколько лучшие значения по сравнению с YOLOv5. Эти результаты подтверждают эффективное обучение и надежную работу обеих моделей, при этом YOLOv7 демонстрирует незначительно улучшенные возможности обнаружения.

Рисунок 13.  Показатели потерь и результаты производительности для обучающего и валидационного наборов данных для моделей YOLOv5 ( a ) и YOLOv7 ( b ).

На рисунках 1415  и  16  показаны и сравнены результаты прогнозирования, классификации и подсчета смешанных семян с помощью YOLOv5 и YOLOv7 для различных типов семян в тестовом наборе данных. YOLOv7 неизменно демонстрировал равные или немного более высокие показатели по сравнению с YOLOv5 для различных типов семян, таких как лен, вика мохнатая, клевер красный, редис и рожь. Сравнение показало, что YOLOv7 неизменно подсчитывал больше семян, чем YOLOv5, для разных типов. В среднем, YOLOv7 показал увеличение количества семян на 3–5% по сравнению с YOLOv5. Например, для семян льна подсчет YOLOv7 улучшился на 10–15%, для вики мохнатой — на 5–10%, а для клевера красного, редиса и ржи — на 5–12%. Это указывает на то, что YOLOv7 в целом показал лучшие результаты в точном подсчете семян на разных изображениях и для разных типов семян, демонстрируя свои улучшенные возможности подсчета по сравнению с YOLOv5.

Рисунок 14.  Прогнозы YOLOv5, демонстрирующие переменную плотность смешанных семян в четырех образцах ( ad ) с возрастающей сложностью подсчета семян.

Рисунок 15.  Результаты прогнозирования YOLOv7 для четырех смешанных образцов семян ( ad ), отражающие возрастающую вариацию количества семян.

Рисунок 16.  Сравнение точности подсчета с истинным значением выбранных образцов смешанных семян для моделей YOLOv5 и YOLOv7.

4. Выводы

Основные выводы исследования показывают, что YOLOv7 значительно превзошла YOLOv5 по точности подсчета семян и обнаружению смешанных семян. YOLOv7 стабильно подсчитывала на 3-5% больше семян нескольких видов, включая рожь, вику мохнатую, лен, красный клевер и редис. Заметные улучшения показателей точности, таких как средняя точность (mAP), точность и полнота, наблюдались в корреляции с этим увеличением количества семян. В частности, YOLOv7 продемонстрировала улучшение точности до 98,5% и полноты до 98,7%, а также увеличение mAP (0–50) с 98,6% до 99,5% и mAP (0–95) с 69,5% до 76,0%. Высокие классификационные возможности подтверждаются минимальным количеством ошибок классификации в матрицах ошибок. YOLOv7 показала выдающиеся результаты, о чем свидетельствуют кривые достоверности F1. Кривые достоверности F1 также продемонстрировали превосходные характеристики YOLOv7, достигнув оптимального значения F1, равного 0,99 при уровне достоверности 0,310, по сравнению с пиковым значением YOLOv5, равным 0,587 при уровне достоверности 0,95. В целом, эти результаты показывают, что YOLOv7 является надежной и эффективной архитектурой для автоматизированного количественного определения семян и высокоточной идентификации сельскохозяйственных объектов. Эта разработка может быть использована для ускорения процессов фенотипирования в точном земледелии, сокращения ручного труда и улучшения оценки качества семян.

Одним из ограничений исследования является контролируемая среда визуализации, которую можно было бы дополнительно улучшить за счет добавления данных с нескольких датчиков и изменения условий освещения для повышения обобщаемости модели.

Для повышения устойчивости модели в различных реальных условиях и расширения ее применимости к различным культурам и задачам фенотипирования, в будущих исследованиях следует рассмотреть возможность включения большего количества архитектур глубокого обучения и подходов к объединению данных с датчиков.

Сокращения

В данном рукописном тексте используются следующие сокращения:

ИИ Искусственный интеллект
АП Средняя точность
Американское университетское бюро Объединение множеств А и В
до н.э. Бинарная кросс-энтропия
BCEclsloss Бинарная кросс-энтропийная классификация потерь
CNN Сверточная нейронная сеть
Процессор Центральный процессор
CSP Частичный перекрестный этап
CSPDarknet53 Кросс-платформенная частичная поддержка Darknet53 (магистральная сеть YOLO)
Электронная реклама Расширенная эффективная сеть агрегации слоев
E-LAN Эффективная сеть агрегации слоев
Ф1 Показатель F1 (гармоническое среднее точности и полноты)
ФН Ложноотрицательный результат
FP Ложноположительный результат
FPN Сеть пирамид функций
FPS Кадры в секунду
ГИУ Обобщенное пересечение над объединением
GIOU_loss Обобщенное пересечение по поводу потери союза
GPU Графический процессор
Расписка Пересечение улиц Union
LP-E6N Canon LP-E6N (модель аккумулятора для фотоаппарата)
мАП средняя точность
Н Количество скалярных значений в выходных данных модели (в формуле функции потерь)
PANet Сеть агрегации путей
R-CNN Сверточная нейронная сеть на основе регионов
БАРАН Оперативная память
RGB Красный, зеленый, синий (цветовые каналы)
SD Южная Дакота
SDSU Университет штата Южная Дакота
SSD Детектор одиночного выстрела
Город Истинно положительный
БПЛА Беспилотный летательный аппарат
олень Соединенные Штаты Америки
YAML «YAML — это не язык разметки» (формат конфигурационного файла)
YOLO You Only Look Once (семейство алгоритмов обнаружения объектов)
YOLOv5 You Only Look Once версия 5
YOLOv7 You Only Look Once версия 7

Литература

  1. Deng, R.; Jiang, Y.; Tao, M.; Huang, X.; Bangura, K.; Liu, C.; Lin, J.; Qi, L. Deep learning-based automatic detection of productive tillers in rice. Comput. Electron. Agric. 2020177, 105703. [Google Scholar] [CrossRef]
  2. Feng, A.; Zhou, J.; Vories, E.; Sudduth, K.A. Evaluation of cotton emergence using UAV-based imagery and deep learning. Comput. Electron. Agric. 2020177, 105711. [Google Scholar] [CrossRef]
  3. Smith, A.; Jones, B. The identification and categorization of seed mixtures: Implications for agriculture and research. Agric. J. 202345, 123–137. [Google Scholar]
  4. Granitto, P.M.; Navone, H.D.; Verdes, P.F.; Ceccatto, H.A. Weed seeds identification by machine vision. Comput. Electron. Agric. 200233, 91–103. [Google Scholar] [CrossRef]
  5. Brown, X.; Davis, Y. Challenges of manual seed identification in agriculture. Agric. Technol. Rev. 201922, 45–59. [Google Scholar]
  6. Johnson, Z. Manual seed identification: Time-consuming and error prone. J. Crop Sci. 202214, 321–335. [Google Scholar]
  7. Taylor, R.; Khan, S. Automation in seed identification: A paradigm shift in agricultural analysis. Agric. Autom. 202230, 78–92. [Google Scholar]
  8. Koh, J.C.; Hayden, M.; Daetwyler, H.; Kant, S. Estimation of crop plant density at early mixed growth stages using UAV imagery. Plant Methods 201915, 64. [Google Scholar] [CrossRef] [PubMed]
  9. Lu, H.; Cao, Z.; Xiao, Y.; Zhuang, B.; Shen, C. TasselNet: Counting maize tassels in the wild via local counts regression network. Plant Methods 201713, 79. [Google Scholar] [CrossRef] [PubMed]
  10. Kumari, K.; Bhalekar, D.G.; Chappa, S.; Kumar, P.; Bhattarai, R.; Nagineni, P. Crop Disease Detection and Prevention Using Artificial Intelligence. In Smart Farming, Smarter Solutions: Revolutionizing Agriculture with Artificial Intelligence; CRC Press/Taylor & Francis Group: Boca Raton, FL, USA, 2025; Volume 134. [Google Scholar]
  11. Lu, N.; Zhou, J.; Han, Z.; Li, D.; Cao, Q.; Yao, X.; Tian, Y.; Zhu, Y.; Cao, W.; Cheng, T. Improved estimation of aboveground biomass in wheat from RGB imagery and point cloud data acquired with a low-cost unmanned aerial vehicle system. Plant Methods 201915, 17. [Google Scholar] [CrossRef]
  12. Madec, S.; Jin, X.; Lu, H.; De Solan, B.; Liu, S.; Duyme, F.; Heritier, E.; Baret, F. Ear density estimation from high resolution RGB imagery using deep learning technique. Agric. For. Meteorol. 2019264, 225–234. [Google Scholar] [CrossRef]
  13. Zhao, B.; Zhang, J.; Yang, C.; Zhou, G.; Ding, Y.; Shi, Y.; Zhang, D.; Xie, J.; Liao, Q. Rapeseed seedling stand counting and seeding performance evaluation at two early growth stages based on unmanned aerial vehicle imagery. Front. Plant Sci. 20189, 1362. [Google Scholar] [CrossRef]
  14. Liu, T.; Wu, W.; Chen, W.; Sun, C.; Zhu, X.; Guo, W. Automated image-processing for counting seedlings in a wheat field. Precis. Agric. 201617, 392–406. [Google Scholar] [CrossRef]
  15. Che, Y.; Wang, Q.; Zhou, L.; Wang, X.; Li, B.; Ma, Y. The effect of growth stage and plant counting accuracy of maize inbred lines on LAI and biomass prediction. Precis. Agric. 202223, 2159–2185. [Google Scholar] [CrossRef]
  16. Kumar, J.P.; Domnic, S. Image based leaf segmentation and counting in rosette plants. Inf. Process. Agric. 20196, 233–246. [Google Scholar] [CrossRef]
  17. Zhang, P.; Li, D. Automatic counting of lettuce using an improved YOLOv5s with multiple lightweight strategies. Expert Syst. Appl. 2023226, 120220. [Google Scholar] [CrossRef]
  18. Kumari, K.; Nafchi, A.M.; Mirzaee, S.; Abdalla, A. AI-Driven Future Farming: Achieving Climate-Smart and Sustainable Agriculture. AgriEngineering 20257, 89. [Google Scholar] [CrossRef]
  19. Kartal, S.; Choudhary, S.; Masner, J.; Kholová, J.; Stočes, M.; Gattu, P.; Schwartz, S.; Kissel, E. Machine learning-based plant detection algorithms to automate counting tasks using 3d canopy scans. Sensors 202121, 8022. [Google Scholar] [CrossRef] [PubMed]
  20. Yuan, Y.; Chen, L.; Wu, H.; Li, L. Advanced agricultural disease image recognition technologies: A review. Inf. Process. Agric. 20229, 48–59. [Google Scholar] [CrossRef]
  21. Dang, F.; Chen, D.; Lu, Y.; Li, Z. YOLOWeeds: A novel benchmark of YOLO object detectors for multi-class weed detection in cotton production systems. Comput. Electron. Agric. 2023205, 107655. [Google Scholar] [CrossRef]
  22. Joosen, R.V.; Kodde, J.; Willems, L.A.; Ligterink, W.; Van Der Plas, L.H.; Hilhorst, H.W. GERMINATOR: A software package for high-throughput scoring and curve fitting of Arabidopsis seed germination. Plant J. 201062, 148–159. [Google Scholar] [CrossRef] [PubMed]
  23. Zhang, W.; Dong, M.; Jiang, L. Image segmentation using convolutional neural networks in multi-sensor information fusion. Soft Comput. 202327, 18353–18372. [Google Scholar] [CrossRef]
  24. Bai, B.; Zhang, J.; Song, Z.; Zhou, P.; Zhao, A. Enhancing Sunflower Head Segmentation and Counting Using Improved UNet. Appl. Eng. Agric. 202541, 125–136. [Google Scholar] [CrossRef]
  25. Valente, J.; Sari, B.; Kooistra, L.; Kramer, H.; Mücher, S. Automated crop plant counting from very high-resolution aerial imagery. Precis. Agric. 202021, 1366–1384. [Google Scholar] [CrossRef]
  26. Osco, L.P.; Arruda, M.D.S.D.; Marcato Junior, J.; da Silva, N.B.; Ramos, A.P.M.; Moryia, A.S.; Imai, N.N.; Pereira, D.R.; Creste, J.E.; Matsubara, E.; et al. A convolutional neural network approach for counting and geolocating citrus-trees in UAV multispectral imagery. ISPRS J. Photogramm. Remote Sens. 2020160, 97–106. [Google Scholar] [CrossRef]
  27. Guo, B.; Ling, S.; Tan, H.; Wang, S.; Wu, C.; Yang, D. Detection of the grassland weed phlomoides umbrosa using multi-source imagery and an improved YOLOv8 network. Agronomy 202313, 3001. [Google Scholar] [CrossRef]
  28. Lv, X.; Ming, D.; Chen, Y.; Wang, M. Very high resolution remote sensing image classification with SEEDS-CNN and scale effect analysis for superpixel CNN classification. Int. J. Remote Sens. 201940, 506–531. [Google Scholar] [CrossRef]
  29. Williams, E.; Sharma, R. Importance of high-quality datasets and model selection in deep learning for agriculture. J. Agric. Data Sci. 202028, 89–104. [Google Scholar]
  30. Lee, G.Y.; Alzamil, L.; Doskenov, B.; Termehchy, A. A survey on data cleaning methods for improved machine learning model performance. arXiv 2021, arXiv:2109.07127. [Google Scholar] [CrossRef]
  31. Magalhães, S.A.; Castro, L.; Moreira, G.; Dos Santos, F.N.; Cunha, M.; Dias, J.; Moreira, A.P. Evaluating the single-shot multibox detector and YOLO deep learning models for the detection of tomatoes in a greenhouse. Sensors 202121, 3569. [Google Scholar] [CrossRef] [PubMed]
  32. Hosain, M.T.; Zaman, A.; Abir, M.R.; Akter, S.; Mursalin, S.; Khan, S.S. Synchronizing object detection: Applications, advancements and existing challenges. IEEE Access 202412, 54129–54167. [Google Scholar] [CrossRef]
  33. Redmon, J.; Divvala, S.; Girshick, R.; Farhadi, A. You only look once: Unified, real-time object detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, NV, USA, 27–30 June 2016; pp. 779–788. [Google Scholar]
  34. Pola, V.G.; Vaishnavi, A.B.; Karra, S.S. Comparison of YOLOv3, YOLOv4 and yolov5 performance for detection of blood cells. Int. Res. J. Eng. Technol. 20218, 4225–4229. [Google Scholar]
  35. Padilla, R.; Passos, W.L.; Dias, T.L.; Netto, S.L.; Da Silva, E.A. A comparative analysis of object detection metrics with a companion open-source toolkit. Electronics 202110, 279. [Google Scholar] [CrossRef]
  36. Sanchez, S.A.; Romero, H.J.; Morales, A.D. A review: Comparison of performance metrics of pretrained models for object detection using the TensorFlow framework. In Proceedings of the IOP Conference Series: Materials Science and Engineering, Cartagena, Colombia, 30 October–1 November 2019; IOP Publishing: Bristol, UK, 2020; Volume 844, p. 012024. [Google Scholar]
  37. Nepal, U.; Eslamiat, H. Comparing YOLOv3, YOLOv4 and YOLOv5 for autonomous landing spot detection in faulty UAVs. Sensors 202222, 464. [Google Scholar] [CrossRef]
  38. Wang, C.Y.; Liao, H.Y.M. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems. APSIPA Trans. Signal Inf. Process. 202413, e19. [Google Scholar] [CrossRef]
  39. Glenn, J. v8.1.0—YOLOv8 Oriented Bounding Boxes (OBB). 2024. Available online: https://github.com/ultralytics/ultralytics/releases/tag/v8.1.0 (accessed on 10 January 2024).
  40. Wang, C.Y.; Bochkovskiy, A.; Liao, H.Y.M. YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Vancouver, BC, Canada, 17–24 June 2023; pp. 7464–7475. [Google Scholar]
  41. Durve, M.; Orsini, S.; Tiribocchi, A.; Montessori, A.; Tucny, J.-M.; Lauricella, M.; Camposeo, A.; Pisignano, D.; Succi, S. Benchmarking YOLOv5 and YOLOv7 models with DeepSORT for droplet tracking applications. Eur. Phys. J. E 202346, 32. [Google Scholar] [CrossRef]
  42. Jiang, K.; Xie, T.; Yan, R.; Wen, X.; Li, D.; Jiang, H.; Jiang, N.; Feng, L.; Duan, X.; Wang, J. An attention mechanism-improved YOLOv7 object detection algorithm for hemp duck count estimation. Agriculture 202212, 1659. [Google Scholar] [CrossRef]
  43. Bochkovskiy, A.; Wang, C.Y.; Liao, H.Y.M. Yolov4: Optimal speed and accuracy of object detection. arXiv 2020, arXiv:2004.10934. [Google Scholar] [CrossRef]
  44. Lin, Q.; Ye, G.; Wang, J.; Liu, H. Roboflow: A data-centric workflow management system for developing ai-enhanced robots. In Proceedings of the Conference on Robot Learning, London, UK, 8–11 November 2021; PMLR: Cambridge, MA, USA, 2022; pp. 1789–1794. [Google Scholar]
  45. Cai, Z.; Vasconcelos, N. Cascade r-cnn: Delving into high quality object detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Salt Lake City, UT, USA, 18–23 June 2018; pp. 6154–6162. [Google Scholar]
  46. Hua, Z.; Aranganadin, K.; Yeh, C.-C.; Hai, X.; Huang, C.-Y.; Leung, T.-C.; Hsu, H.-Y.; Lan, Y.-C.; Lin, M.-C. A benchmark review of YOLO algorithm developments for object detection. IEEE Access 202513, 123515–123545. [Google Scholar] [CrossRef]
  47. Redmon, J.; Farhadi, A. YOLO9000: Better, faster, stronger. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, HI, USA, 21–26 July 2017; pp. 7263–7271. [Google Scholar]
  48. Redmon, J.; Farhadi, A. Yolov3: An incremental improvement. arXiv 2018, arXiv:1804.02767. [Google Scholar] [CrossRef]
  49. Jocher, G.; Chaurasia, A.; Stoken, A.; Borovec, J.; Kwon, Y.; Michael, K.; Xie, T.; Fang, J.; Zeng, Y.; Wong, C.; et al. ultralytics/yolov5: v7. 0-yolov5 Sota Realtime Instance Segmentation; Zenodo: Geneva, Switzerland, 2022. [Google Scholar]
  50. Kumari, K.; Won, K.; Nafchi, A.M. YOLOv5 deep learning model for mixed seed detection, classification, and counting. In Proceedings of the 2024 ASABE Annual International Meeting, Anaheim, CA, USA, 28–31 July 2024; American Society of Agricultural and Biological Engineers: St. Joseph, MI, USA, 2024; p. 1. [Google Scholar]
  51. Li, C.; Li, L.; Jiang, H.; Weng, K.; Geng, Y.; Li, L.; Ke, Z.; Li, Q.; Cheng, M.; Nie, W.; et al. YOLOv6: A single-stage object detection framework for industrial applications. arXiv 2022, arXiv:2209.02976. [Google Scholar] [CrossRef]
  52. Selvi, A.S.; Aadesh, P.S.; Manoharan, B.; Narayanan, S.H. Real-Time Multiple Object Tracking and Object Detection Using YOLOv7 and FAIRMOT Algorithm. In Proceedings of the 2023 International Conference on Innovative Computing, Intelligent Communication and Smart Electrical Systems (ICSES), Chennai, India, 21–22 December 2023; IEEE: Piscataway, NJ, USA, 2023; pp. 1–5. [Google Scholar]
  53. Jocher, G.; Chaurasia, A.; Qiu, J.; Stoken, A. YOLOv8: The next generation of real-time object detection. arXiv 2023, arXiv:2301.00001. [Google Scholar]
  54. Wang, C.Y.; Yeh, I.H.; Mark Liao, H.Y. Yolov9: Learning what you want to learn using programmable gradient information. In Proceedings of the European Conference on Computer Vision, Milan, Italy, 29 September–4 October 2024; Springer Nature: Cham, Switzerland, 2024; pp. 1–21. [Google Scholar]
  55. Kumari, K.; Parray, R.; Basavaraj, Y.B.; Godara, S.; Mani, I.; Kumar, R.; Khura, T.; Sarkar, S.; Ranjan, R.; Mirzakhaninafchi, H. Spectral sensor-based device for real-time detection and severity estimation of groundnut bud necrosis virus in tomato. J. Field Robot. 202542, 5–19. [Google Scholar] [CrossRef]
  56. Wang, A.; Chen, H.; Liu, L.; Chen, K.; Lin, Z.; Han, J. Yolov10: Real-time end-to-end object detection. Adv. Neural Inf. Process. Syst. 202437, 107984–108011. [Google Scholar]
  57. Lei, M.; Li, S.; Wu, Y.; Hu, H.; Zhou, Y.; Zheng, X.; Ding, G.; Du, S.; Wu, Z.; Gao, Y. YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception. arXiv 2025, arXiv:2506.17733. [Google Scholar]

Авторы: Karishma Kumari, Kwanghee Won, Ali M. Nafchi

Exit mobile version