Алгоритмы машинного зрения для обнаружения косточек вишни на основе гиперспектральных данных

26
views

В данной работе была проведена оценка пригодности метода гиперспектральной трансмиссионной визуализации для обнаружения внутренних дефектов (косточек и их фрагментов) в вишне.

В данном исследовании были получены гиперспектральные трансмиссионные изображения в видимом и ближнем инфракрасном диапазоне (450–1000 нм) от вишни без косточек и с неповрежденными плодами трех популярных сортов: «Лутовка», «Панды 103» и «Грониаста», различающихся содержанием растворимых сухих веществ. Данные гиперспектральной трансмиссионной визуализации свежей вишни были использованы для определения влияния различного содержания растворимых сухих веществ в тканях плодов на эффективность обнаружения косточек.

Также были разработаны модели для прогнозирования содержания растворимых сухих веществ в вишне. Для построения моделей контролируемой классификации использовались анализ главных компонентов и предварительная обработка гиперспектральных данных с помощью второй производной. В данном исследовании были протестированы пять классификаторов для обнаружения косточек.

Из всех изученных классификаторов наилучшая точность прогнозирования для обнаружения косточек целиком или их фрагментов была получена с помощью модели нейронных сетей с обратным распространением ошибки (87,6% абсолютно правильно классифицированных случаев для обучающего/тестового набора и 81,4% для валидационного набора).

Точность различения просверленных и целых вишен составила около 96%. Эти результаты показали, что метод гиперспектральной визуализации пропускания является осуществимым и полезным для неразрушающего обнаружения косточек в вишне.

Кислые вишни (Prunus cerasus) высоко ценятся потребителями за свой вкус и питательные свойства. Европейский Союз является крупнейшим мировым производителем кислых вишен, общий объем производства в сезоне 2016 года составил 655 000 тонн (FAOSTAT, 2016). Большая часть произведенных вишен перерабатывается и продается в замороженном или консервированном виде, причем большинство из них без косточек (USDA, 2016).

Классификация качества фруктов в настоящее время основана на оценке поверхностных свойств плодов, включая цвет , форму и дефекты. Однако при переработке вишни существует множество внутренних особенностей, таких как наличие косточек, гниение и повреждения насекомыми, которые могут влиять как на качество, так и на безопасность этих продуктов (Donis-González et al., 2015; Xing et al., 2008).

Эффективное удаление этих нежелательных особенностей во время обработки и переработки является основополагающим вопросом, определяющим качество конечного продукта. Поэтому для обнаружения внешних и внутренних неоднородностей в тканях плодов тестируются новые методы, включая компьютерную томографию (КТ), рентгеновскую визуализацию или спектроскопию ближнего инфракрасного диапазона (Kawano, 2016; Nicolaï et al ., 2014).

Для обнаружения косточек и их фрагментов в косточковых фруктах (Allen et al., 1996), а также в других продуктах с косточками, таких как оливки (Zion et al., 1997) и сушеные сливы (Haff et al., 2005), были описаны различные методы. Более того, значительные успехи были достигнуты в попытках обнаружения косточек и их фрагментов в вишне (Haff et al ., 2013).

Тимм и др. (1991) исследовали различные методы, включая передачу микроволнового излучения, отражение ультразвука, прерывание светового луча, передачу светового луча и машинное зрение, для обнаружения косточек. Они продемонстрировали  что передача света в сочетании с машинным зрением и анализом изображений позволяет обнаружить 95% вишни с косточками. Еще лучшие результаты (точность классификации вишни с косточками и без косточек 97%) были получены с использованием ядерного магнитного резонанса (ЯМР) Зионом и др . (1994).

ЯМР-спектроскопия также использовалась для идентификации косточек в оливках (Zion et al., 1997). Точность этого метода составила 97%. Однако он дорогостоящий и вряд ли будет внедрен в промышленности.

Haff et al(2013) использовали  одномерную матрица рентгеновских детекторов для обнаружения косточек в вишне. Было установлено, что этот метод обеспечивает точность 97,3% при классификации вишни без косточек и 94% при классификации плодов без косточек. К сожалению, метод рентгеновской визуализации также дорог и требует надежного источника электроэнергии (Haff и Toyofuku, 2008). В последние годы компьютерная томография (КТ) также тестировалась для обнаружения косточек и их фрагментов в фруктах.

Для этой цели Донис-Гонсалес и др. (2015) разработали агарозные фантомы. Авторы продемонстрировали, что рассматриваемая методика позволяет различать косточки и их фрагменты с высокой точностью (R = 0,99). Тем не менее, из – за экономической стоимости и низкой скорости, КТ – визуализация оказалась непрактичной для внедрения в качестве технологии контроля качества пищевых продуктов в режиме реального времени.

В сельском хозяйстве системы гиперспектральной визуализации (ГСИ) с использованием соответствующих схем освещения, таких как отражение, пропускание и взаимодействие (Pan et al., 2017; Szuvandzsiev et al., 2014), успешно продемонстрировали достаточную точность для рутинного контроля внутренних параметров качества пищевых продуктов (Lu et al., 2017).

В последнее время эта технология также широко используется для оценки содержания растворимых сухих веществ (SSC), титруемой кислотности (TA), pH и твердости в дынях хами (Sun et al., 2016) и хурме (Munera et al., 2017). Кроме того, ряд исследований продемонстрировал возможность применения ГСИ для обнаружения дефектов в фруктах и ​​овощах (Baranowski et al., 2013; Pu et al., 2015).

Song et al. В исследовании (2016 г.) была проведена попытка обнаружить черную сердцевину у белой редьки. На основе 4 выбранных длин волн и с использованием линейного дискриминантного анализа Фишера (FLDA) была получена точность распознавания дефектной редьки 98,4%. Кроме того, повреждения от холода у персиков были успешно обнаружены с помощью гиперспектрального анализа (HSI) и модели искусственной нейронной сети (ANN) (Sun et al., 2017). Общая точность классификации повреждений от холода составила 95,8% .

Таким образом, целью данного исследования было изучение применимости гиперспектральной визуализации в видимом и ближнем инфракрасном (VNIR) диапазоне длин волн для обнаружения косточек в свежей вишне трех выбранных сортов.

Конкретные цели данного исследования заключались в следующем: (1) оценить применимость гиперспектральной визуализации пропускания в спектральном диапазоне 400-1000 нм для обнаружения косточек и фрагментов косточек в свежей кислой вишне; (2) определить оптимальные длины волн для обнаружения косточек и фрагментов косточек; (3) разработать модели классификации на основе выбранных длин волн и сравнить эффективность классификации между различными классификаторами; (4) исследовать возможность использования данных гиперспектрального пропускания VNIR для прогнозирования содержания растворимых сухих веществ в различных сортах вишни.

МАТЕРИАЛЫ И МЕТОДЫ

Для целей исследования были приобретены 540 плодов черешни трех сортов (Cerasus vulgaris Mill): «Łutówka», «Pandy 103» и «Groniasta» на местном предприятии по хранению фруктов и овощей в холодильных камерах (Fructosad, Ратошин, Польша). Сорта были отобраны на основе различий в их физических свойствах, особенно в содержании растворимых сухих веществ (Войдыло и др., 2014).

Образцы имели схожие размеры и формы и не имели внешних дефектов (ушибов, трещин или признаков заболеваний) по результатам визуального осмотра. Значительных различий в цвете внутри каждого сорта не наблюдалось.

Предполагалось, что различия в размере черешни могут сильно влиять на обнаружение косточки (Цинь и Лу, 2005). Поэтому в каждом варианте эксперимента использовались черешни с широким диапазоном размеров (диаметр от 15 до 22 мм), что составляет 99% от всех доступных черешни. Вишни каждого сорта были разделены на три группы по 60 штук в каждой: вишни с целой косточкой, вишни с фрагментами косточки и вишни без косточки. Удаление косточек производилось с помощью коммерческого ручного устройства для удаления косточек из вишни с диаметром поршня 3 мм.

Для создания варианта с фрагментами косточки, удаленные из вишен косточки измельчали ​​молотком. Площади фрагментов косточки и их максимальная длина определялись путем усреднения трех измерений их размеров штангенциркулем . Такие измерения калибровались для выбранных фрагментов косточки на основе 3D-сканирования с помощью микротомографа GE Nanotom 180 (GE Sensing and Inspection Technologies GmbH, Вунсторф, Германия). Для 3D-анализа площади одной стороны использовалось программное обеспечение VG Studio MAX 2.1.

Анализировались только фрагменты с площадью одной стороны (внешней поверхности) от 4 мм² до 8 мм². Были выбраны фрагменты косточки размером 2 мм². Другим критерием отбора фрагментов косточки было расстояние между двумя наиболее удаленными точками на поверхности фрагмента косточки, не превышающее 3 мм. В исследовании была выбрана наименьшая площадь внешней поверхности фрагмента косточки – 4 мм², поскольку такие фрагменты легко обнаруживались гиперспектральной системой. В один просверленный плод вишни был помещен один фрагмент косточки. Во время эксперимента свежие образцы хранились при температуре 5ºC и извлекались из холодильника примерно за два часа до гиперспектральной съемки, чтобы они достигли комнатной температуры .

В данном исследовании использовалась гиперспектральная система визуализации пропускания, состоящая из линейного гиперспектрального сканера, включающего VNIR-камеру и спектрограф ImSpector V10E для спектрального диапазона 400–1000 нм. Устройство было изготовлено компанией SPECIM, Финляндия. Блок освещения пропускания состоял из двух линейных галогенных ламп мощностью 100 Вт каждая. Лампы размещались в алюминиевом корпусе, установленном под столом и расположенном на ленте. Образцы фруктов размещались в два ряда на позиционирующем столе с шестью отверстиями диаметром 15 мм каждое. Источник света освещал вишню снизу в вертикальном направлении к детектору.

Для всех вишен, относящихся к девяти вариантам, были получены гиперспектральные изображения в проходящем свете. Время экспозиции было установлено на 16 мс для получения изображений хорошего качества без насыщения. Пространственные размеры всех изображений, полученных в данной работе, составляли 696 x 519 пикселей; всего было собрано 519 изображений в спектральном диапазоне 450-1000 нм после

Выполнялись операции биннинга 2 x 2 в пространственном и спектральном направлениях. Измерения проводились в темной комнате, чтобы исключить влияние внешнего освещения.

Для оценки влияния внутренних качеств плода на спектры пропускания определяли содержание растворимых сухих веществ (SSC) с помощью традиционных разрушающих тестов. После получения изображения каждую вишню разрезали пополам. Из обеих половинок черешни извлекали сок, и содержание SSC (%) измеряли с помощью карманного рефрактометра PAL – BX/RI производства компании Atago Co., Ltd., Токио, Япония.

Для анализа гиперспектральных изображений была получена информация о спектральных свойствах плодов как с косточками, так и без них, с целью оптимизации обнаружения косточек и их фрагментов, выбора эффективных длин волн и применения соответствующей классификации. После получения изображений в гиперспектральном кубе были идентифицированы области, содержащие регионы интереса (ROI), т.е. области, включающие площадь целого плода вишни с косточкой, фрагментом косточки или без косточки.

Для различения областей ROI был написан скрипт с использованием программного обеспечения ImageJ. Процедура сегментации представляла собой модификацию процедуры, предложенной ранее Барановским и др. (2013). На первом этапе было выбрано одно изображение для создания бинарной маски плода (здесь использовалось изображение с длиной волны 762 нм из-за высокого контраста между поверхностью плода и фоном).

Эта бинарная маска поверхности плода впоследствии применялась ко всем изображениям в гиперспектральном кубе для удаления фона. Каждая выбранная область ROI состояла примерно из 15 000 пикселей. Средний спектр пропускания из области интереса (ROI) вишни без косточек и с неповрежденными плодами вычислялся путем усреднения спектральных значений всех пикселей в ROI для каждого сегментированного изображения вишни.

Таким образом, для каждого образца вишни был получен один средний спектр. Средние спектры пропускания, рассчитанные из ROI плодов с косточками, сравнивались с тем же плодом после удаления косточки (плод без косточки ) и с вариантом, содержащим косточку. фрагменты. Предварительная обработка спектральных характеристик была выполнена с использованием программы Unscrambler X версии 10.1, CAMO Software, произведенной в Осло, Норвегия. Перед моделированием предварительная обработка средних спектральных данных состояла из применения автоматической коррекции базовой линии и вычисления второй производной с использованием метода Савицкого-Голея.

Автоматическая коррекция базовой линии была выбрана для удаления эффектов базовой линии из спектров, возникших во время сбора спектральных данных. Обработка производной эффективно уменьшила артефакты изображения, вызванные неравномерным освещением, а также устранила фоновый сигнал.

Эффективность этого метода предварительной обработки была подтверждена Siedliska et al. (2014) и Baranowski et al. (2015). Для уменьшения избыточности и коллинеарности в собранных гиперспектральных данных, а также для повышения эффективности обнаружения косточек и соответствия требуемой в промышленности скорости контроля, выбор длины волны был критически важным шагом.

В данном исследовании для выбора ключевых длин волн использовались два разных метода. В первом методе соответствующие данные выбирались в качестве атрибутов из пиков на кривых спектральных характеристик второй производной. Пики, встречающиеся на кривой второй производной, показывают кривизну исходного спектра. Наиболее характерной особенностью второй производной является отрицательная полоса с минимумом на той же длине волны, что и максимум в полосе нулевого порядка.

Также имеются две дополнительные положительные полосы по обе стороны от отрицательного пика (Becker et al., 2005). На основе этого метода в качестве атрибутов из пиков на кривой спектральных характеристик второй производной было выбрано 27 длин волн. Затем эти данные использовались для построения моделей контролируемой классификации. Вторым методом уменьшения количества признаков данных в спектральных данных был анализ главных компонентов (PCA), используемый для сглаженных спектров после предварительной обработки второй производной.

Метод основан на том факте, что соседние полосы гиперспектральных изображений сильно коррелированы и часто передают одну и ту же информацию об объекте. В этом методе исходные данные преобразуются для устранения корреляции между полосами. Этот процесс основан на определении оптимальной линейной комбинации исходных полос, учитывающей вариацию значений пикселей в любом конкретном изображении. Эта многомерная статистическая методика , используемая для всего куба спектральных данных, позволила уменьшить большое количество потенциальных длин волн до нескольких некоррелированных главных компонентов (ПК).

Аналогичная методология, используемая в качестве метода предварительной обработки перед контролируемой классификацией, была протестирована другими авторами (Liaghat et al., 2014). Рекомендуется выбирать количество главных компонент (спектральных характеристик) таким образом, чтобы они представляли более 90% изменчивости в исходных данных. В данном исследовании первые компоненты PCA использовались в качестве независимых переменных в моделях классификации обнаружения косточек.

Они покрывали 97,2% всей изменчивости в данных. Затем был проведен анализ и классификация данных гиперспектральных данных пропускания образцов фруктов. В данном исследовании для методов контролируемой классификации образцы вишни были случайным образом отобраны в обучающую и тестовую выборки, состоящие соответственно из 90 и 10% всей тестовой популяции. Обучающая выборка использовалась для построения модели классификации, а тестовая выборка — для проверки ее способности классифицировать новые образцы.

Процедура обучения и тестирования повторялась десять раз. Для каждого нового запуска выборка образцов в качестве обучающей и тестовой выборок менялась (метод перекрестной проверки). Метод стратифицированной 10-кратной перекрестной проверки зарекомендовал себя как стандартный метод оценки в случаях , когда Доступны лишь ограниченные данные. Этот метод также считается наиболее строгим (Виттен и Франк, 2005).

В данном исследовании для проверки алгоритма классификации был использован подход контролируемого обучения. Все алгоритмы классификации были реализованы с помощью комплексного программного обеспечения под названием Waikato Environment for Knowledge Analysis, или Weka. Это программное обеспечение содержит инструменты для предварительной и постобработки данных, а также для оценки результатов схем обучения. Предварительная обработка гиперспектральных данных.

Таблица 1. Выбранные характеристики классификаторов, использованных в исследовании.​

Название библиотеки классификатора Описание алгоритма Акроним Выбранные параметры классификатора​
Наивный Байес Классификатор наивного Байеса, использующий классы оценок.Значения точности числовой оценки выбираются на основе анализа обучающих данных. НБ Использовать контролируемую дискретизацию: true, Отладка: false, Использовать оценщик ядра: false
LibSVM Класс – обертка для инструментов libsvm. Позволяет пользователям экспериментировать с одноклассовым SVM, регрессионным SVM и nu-SVM, поддерживаемыми инструментом LibSVM . SVM Тип SVM : nu-SVC, Тип ядра: линейное; Ny: 0.5, Нормализация: true, Вероятностные оценки: верно
Логистика Строит линейную логистическую модель регрессионные модели ЛЛР Debug: false, MaxIts : -1, Ridge: 1.0E- 8
Многослойный перцептрон Использует нейронные сети с обратным распространением ошибки для классификации экземпляров. БНН AutoBuild : true, Скорость обучения : 0,3, Импульс: 0,2, Время тренировки : 500 Скрытые слои = ( атрибуты + классы) / 2
Случайные леса Классификатор для построения леса из случайных деревьев. РЧ Debug: false, MaxDepth : 0,Количество объектов : 0, Количество деревьев: 10, Начальное значение: 1

 

Метод заключался в выборе из всего спектрального диапазона того диапазона, где спектральные характеристики сигнала были достаточно выраженными. Поскольку пропускание образцов вишни на длине волны 600 нм или ниже оказалось относительно низким по сравнению с образцами в диапазоне 600 – 1000 нм, для анализа использовался только диапазон длин волн от 600 до 1000 нм. Из различных классификаторов, доступных в Weka, для сравнения были выбраны пять с наилучшей точностью прогнозирования. Эти классификаторы представлены в таблице 1 вместе с общим описанием и фактическими параметрами, определенными в данном исследовании.

Модели прогнозирования содержания растворимых сухих веществ (SSC) для трех изученных сортов вишни были созданы с использованием интерфейса Weka Knowledge Flow . Это программное обеспечение использовалось для разработки моделей нейронных сетей обратного распространения (BNN) и нейронных сетей обратного распространения с анализом главных компонентов (PCA-BNN). Модель BNN была создана с использованием длин волн, полученных в качестве атрибутов из пиков во второй производной спектральных характеристик вишни без косточек, принадлежащей к трем изученным сортам. Для модели PCA-BNN метод главных компонентов (PCA) использовался для извлечения информации из всего спектрального диапазона.

Все пять главных компонентов использовались в качестве нейронов входных слоев сети для построения BNN. Качество моделей оценивалось с помощью коэффициента детерминации (R²), среднеквадратичной ошибки корреляции (RMSEC) и среднеквадратичной ошибки прогнозирования  (RMSEP). Как правило, рекомендуется, чтобы хорошая модель характеризовалась высоким R², низкими значениями RMSEC и RMSEP, а также небольшой разницей между RMSEC и RMSEP. В некоторых публикациях вместо среднеквадратичной ошибки прогнозирования (RMSEP) указывается стандартная ошибка прогнозирования (SEP). Разница между RMSEP и SEP была объяснена Голиком и Уолшем (2006).

РЕЗУЛЬТАТЫ И ОБСУЖДЕНИЕ

Гиперспектральное сканирование вишни в режиме пропускания позволило визуализировать наличие косточки в исследуемых плодах. Однако точность обнаружения косточки зависела от размера косточки / фрагментов косточки и анализируемой длины волны . Области косточки отражались на изображениях пропускания как области с меньшей интенсивностью пропускаемого света. Для лучшей визуализации наличия или отсутствия косточки в вишне были созданы многополосные композиционные изображения. Пример репрезентативного трехполосного (650, 736 и 815 нм) гиперспектрального композиционного изображения пропускания целых и очищенных от косточки вишен трех исследуемых сортов представлен на рис. 1. На этих изображениях можно заметить, что при наличии косточки или фрагментов косточки в середине изображения пропускания плода появляется более темная область, интенсивность которой различается для разных сортов и конкретных вариантов эксперимента (целая косточка, фрагмент косточки). Появление более темных участков на изображениях вишни с косточкой/фрагментами косточки является результатом более высокой оптической плотности косточки по сравнению с плодом.

Рис. 1. Типичные гиперспектральные RGB- изображения пропускания целых и очищенных от косточек вишен трех исследованных сортов (R: 650 нм, G: 736 нм и B: 815 нм).

Размер этой тени может зависеть от размера косточки, а также от ее ориентации относительно камеры (Xing et al., 2008). Кроме того, размер плода также влияет на качество изображений, полученных методом пропускания света.

Хотя трехполосная композиция изображений на основе исходных спектральных данных позволила во многих случаях обнаружить вишни без косточек (рис. 1), классические методы сегментации, применяемые к таким изображениям, оказались недостаточными для различения вишен с косточками и без них с удовлетворительной точностью.

Поэтому был проведен многофакторный анализ. Для более четкого представления характерных пиков и впадин к исходным данным пропускания всех исследуемых переменных были применены процедура сглаживания скользящим средним и производная второго порядка Савицкого-Голея. Эта процедура улучшила характеристики спектров, выделив пики перекрывающихся полос и вызвав шумовую фильтрацию спектральных данных.

В производных спектрах наблюдаются несколько интересных особенностей, которые были незаметны в исходных спектрах. Интересно, что наибольшие изменения кривизны наблюдались в диапазоне 680-780 нм, в то время как незначительные изменения оставались постоянными по всему спектру. Главной задачей исследования было различение вишен с косточками и фрагментами косточек от вишен без косточек.

На рис. 2 представлены различия между средними спектрами вишни без косточек и вишни с косточкой / фрагментами косточки , обработанной второй производной , для трех изученных сортов. На этих графиках наблюдаются значительные различия в спектрах пропускания, особенно в пиках и впадинах. На основе преобразования исходных спектров с помощью второй производной были выбраны 27 полос, расположенных в максимумах или минимумах, и отмечены пунктирными вертикальными линиями на рис. 2.

Эти длины волн использовались в контролируемом исследовании . Классификация позволяет различать целые и неповрежденные вишни. Все выбранные длины волн относятся к инфракрасной области спектра (VNIR). Это связано с колебаниями и комбинационными обертонами связей CH, OH и NH в органических молекулах. Пики в диапазоне 660-1000 нм были идентифицированы как спектральные полосы антоциановых пигментов, представляющих красный цвет вишни. Пик поглощения приблизительно на 740 нм можно отнести к третьему обертону функциональной группы O – H в воде и к четвертому обертону связи CH.

Пики поглощения приблизительно на 830 нм и 918 нм, вероятно, относятся к третьему обертону колебаний растяжения CH в сахаре (Baiano et al., 2012) . Уильямс и Норрис (2001) обнаружили полосы поглощения сахара приблизительно на 888 нм и 913 нм, а пик, наблюдаемый примерно на 980 нм, был отнесен к эффекту поглощения воды и соответствовал второму обертону колебаний O-H. Поскольку длины волн, выбранные для используемой процедуры классификации, сильно коррелируют с содержанием растворимых сухих веществ (SSC) в фруктах, можно предположить, что SSC может влиять на точность обнаружения косточек/фрагментов косточек.

Рис. 2. Дифференциальные спектры второй производной трех исследованных сортов. Пунктирная вертикальная линия представляет 27 выбранных спектральных полос, расположенных в максимумах или минимумах.

Рис. 3. Диаграммы распределения первой и третьей главных компонент спектров пропускания целых и очищенных от косточек вишен трех изученных сортов. Спектры были предварительно обработаны с использованием преобразования второй производной с помощью алгоритма Савицкого-Голея.

Во втором методе уменьшение размерности было выполнено путем преобразования переменных длины волны в главные компоненты. Затем к сглаженным спектральным данным после предварительной обработки второй производной был применен метод главных компонент (PCA). На рисунке 3 представлен график результатов PCA (PC1 и PC3), примененный к набору данных, включающему вишневые плоды без косточек и целые плоды.

Первая и третья главные компоненты показали наибольшую вариацию в данных. График результатов PCA для сорта «Грониаста» показывает, что образцы «Грониасты» можно сгруппировать в три класса (вишни без косточки, с фрагментами косточки и с целой косточкой) с некоторым перекрытием (рис. 3а). Для сорта «Лутувка» (рис. 3б) график результатов показал четкое разделение вишни без косточки от других групп . Однако дифференциация между классами для сорта « Панди 103 » была не столь четкой (рис. 3с). Тем не менее, в этом случае можно было выделить два класса: вишни без косточки и вишни с целой косточкой.

В таблице 2 представлены окончательные результаты сравнения моделей классификации, используемых для различения вишни без косточек, вишни с целыми плодами и вишни с фрагментами косточек, на основе 27 длин волн. Среди всех изученных алгоритмов классификации наилучшую точность прогнозирования показала нейронная сеть БНН (BNN) (87% всех правильно классифицированных экземпляров как для обучающей, так и для валидационной выборки).

Однако большинство протестированных моделей имели точность прогнозирования, близкую к 75% всех правильно классифицированных экземпляров для обучающей выборки. Из всех изученных моделей наихудшим классификатором оказалась модель наивного Байеса (NB) – с 58% всех правильно классифицированных экземпляров. Таким образом, модели БНН и РЧ (RF) могут быть выбраны в качестве подходящих классификаторов для различения конкретных сортов вишни.

Второй эксперимент по классификации был проведен для различения вишни без косточек, вишни с целыми плодами и вишни с фрагментами косточек на основе данных второй производной, с учетом пяти первых компонентов PCA. Результаты классификации суммированы в таблице 3.

Из всех классификаторов, представленных в таблице 1, наилучший общий результат был получен для модели случайных лесов (RF) (85% всех правильно классифицированных экземпляров для обучающего/тестового набора и 91% для валидационного набора). Аналогичные показатели точности – 88% и 83% всех правильно классифицированных экземпляров для обучающего/тестового набора – были получены для моделей BNN и Support Vector Machines (SVM) соответственно.

Таблица 2. Результаты классификационных моделей для свежих вишен без косточек, целых вишен и вишен с фрагментами косточек. Модели были созданы на основе длин волн, выбранных в качестве атрибутов из пиков во второй производной спектральных характеристик.

Класси-фикация модель* Обучающий / тестовый набор Набор проверок
Правильно класси-фици-рованные случаи (%) Статистика Каппа Среднее ариф-метическое квадра-тичная ошибка Правильно класси-фицирован-ные случаи (%) Статистика Каппа Среднее ариф-метическое квадра-тичная ошибка
БНН 87.65 0,81 0,25 81.48 0,72 0,29
РЧ 85.88 0,79 0,26 90.74 0,86 0,24
SVM 82.74 0,74 0,34 88.89 0,83 0,27
ЛЛР 79.22 0,69 0,32 85.19 0,78 0,29
НБ 68.63 0,53 0,38 57.41 0,36 0,45

*Классификационная модель для различения вишни с косточками и без косточек.

Таблица 3. Результаты классификационных моделей для свежих вишен без косточек, целых вишен и вишен с фрагментами косточек. Модели были созданы на основе данных второй производной с учетом 5 первых компонентов метода главных компонент (PCA).

Класси-фикация модель* Обучающий/тестовый набор Набор проверок
Правильно класси-фици-рованные случаи (%) Статистика Каппа Среднее ариф-метическое квадра-тичная ошибка Правильно класси-фициро-ванные случаи (%) Статистика Каппа Среднее ариф-метическое квадра-тичная ошибка
БНН 87.25 0,81 0,26 87.04 0,81 0,26
РЧ 75.49 0,63 0,34 70.37 0,55 0.30
SVM 72.94 0,59 0,36 72.22 0,58 0,35
ЛЛР 74.31 0,61 0,34 75.92 0,64 0,32
НБ 58.23 0,37 0,50 53.70 0,31 0,54

*Классификационная модель для различения вишни с косточками и без косточек .

Таблица 4. Матрицы ошибок, полученные с помощью 10-кратной перекрестной проверки для модели BNN-PCA (a) и для модели BNN (b) на основе 27 выбранных длин волн, для исследуемых вариантов в качестве независимой переменной. Каждый сорт имеет специфическое цветовое представление, а ячейки по диагонали показывают правильную классификацию.

С косточкой С фрагментами косточки Без косточки
Лутовка Грониаста Панда Лутовка Грониаста Панда Лутовка Грониаста Панда
модель BNN-PCA
С косточкой 58 59 45 2 1 15 0 0 0
96,7% 98,3% 75% 3,3% 1,7% 25% 0% 0% 0%
С фраг-ментами косточки 1 0 7 57 59 53 1 1 0
1,6% 0% 11,7% 95% 98,3% 88,3% 1,6% 1,6% 0%
Без косточки 0 0 1 0 2 1 60 58 58
0% 0% 1,6% 0% 12,5% 1,6% 100% 96% 96,7%
модель BNN
С косточкой 59 59 44 1 1 16 0 0 0
98,3% 98,3% 73,3% 1,7% 1,7% 26,7% 0% 0% 0%
С фраг-ментами косточки 2 0 7 58 60 53 0 0 0
3,3% 0% 11,7% 96,7% 100% 88,3% 0% 0% 0%
Без косточки 1 0 1 0 0 0 59 60 59
1,7% 0% 1,7% 0% 0% 0% 98,3% 100% 98,3%

 

Из всех рассмотренных моделей модель классификации BNN показала наивысшую точность прогнозирования обнаружения косточек в вишне. Для иллюстрации того, как эта модель классифицировала случаи, относящиеся к различным классам, в таблице 4 представлены матрицы ошибок с разграничением трех изученных сортов.

В матрицах ошибок диагональные ячейки показывают количество позиций остатков, которые были правильно классифицированы для каждого структурного класса, а недиагональные ячейки представляют количество позиций остатков , которые были классифицированы неправильно.

Результаты, полученные для моделей PCA-BNN и BNN (таблица 4) на основе 27 выбранных длин волн, были схожими. В обеих моделях наименьшее количество ошибок классификации наблюдалось для сортов «Groniasta » и «Łutówka». Вишню с фрагментами косточек чаще всего путали с гиперспектральными измерениями. Статистические данные по содержанию растворимых сухих веществ (SSC) в образцах вишни всех трех изученных сортов приведены в таблице 5. Измерения SSC 180 образцов, принадлежащих к трем сортам вишни (по 60 образцов каждого), имели достаточно нормальное распределение вокруг среднего значения (13,5, 12,6 и 10,6%) со стандартным отклонением 0,88, 1,01 и 10,6% соответственно. 1,66 для сортов «Панди 103», «Грониаста» и «Лутовка» соответственно). Нормальность распределения содержания растворимых сухих веществ (SSC) затем оценивалась с помощью теста Шапиро-Уилка на уровне значимости 0,05.

Для трех изученных сортов значения W варьировались от 0,983 до 0,987. Учитывая, что критическое значение для 60 образцов для этого теста равно 0,954 (меньше всех полученных значений W), нулевая гипотеза о нормальном распределении генеральной совокупности не может быть отклонена. Ожидалось, что различия в содержании растворимых сухих веществ между сортами повлияют на спектральные характеристики пропускания вишни. Как видно из таблицы 4, сорт с самым высоким значением SSC («Панди 103») характеризовался самой низкой точностью классификации по сравнению с другими изученными сортами. Высокое значение SSC влияет на оптическую плотность ткани и, в конечном итоге, на способность обнаружения косточек.

Рис. 4. Диаграммы рассеяния прогнозов BNN содержания растворимых твердых веществ (SSC) в зависимости от рефрактометрических измерений для вишни сортов «Pandy 103», «Groniasta» и «Łutówka». Прогнозы SSC были получены с использованием 5 первых главных компонент (а) и 27 выбранных длин волн на основе вторых производных средних спектров пропускания (б).

Вишни с целой косточкой. Эти результаты показывают, что общая точность различения вишен без косточки и целых вишен была очень высокой ( более 96%) и сопоставима с точностью классификации ( 96,5%) обнаружения целых косточек , полученной Цинь и Лу (2005). Она также была лучше, чем результаты (84,6% правильно классифицированных случаев), полученные Син и др. (2008) для обнаружения внутреннего заражения насекомыми кислых вишен.

Более того, наши результаты близки к результатам, полученным Хаффом и др. (2013). Они достигли показателей распознавания 97,3% для вишен без косточки и 94% для вишен без косточки, используя одномерный массив рентгеновских детекторов. Следует отметить, что те же авторы сообщили, что рентгеновское оборудование дорогое и громоздкое , а его внедрение на технологической линии затруднительно .

Поскольку сорта были отобраны таким образом, чтобы охватить широкий диапазон вариаций содержания растворимых сухих веществ (SSC), были проведены стандартные деструктивные испытания для проверки пригодности плодового материала для моделирования значений SSC на основе …

 Для прогнозирования содержания растворимых сухих веществ (SSC) на основе обработанных данных гиперспектрального пропускания было выполнено моделирование с использованием методов мягких вычислений с помощью моделей PCA-BNN и BNN. Моделирование проводилось с использованием спектров вторых производных в диапазоне длин волн 600-1000 нм. В данном исследовании 180 образцов (60 образцов для каждого сорта) были разделены на калибровочный и прогностический наборы (160:20), которые были одинаковыми для обеих моделей BNN и PCA-BNN.

Результаты, полученные в ходе моделирования, впоследствии сравнивались с измеренными значениями SSC, полученными в результате деструктивных испытаний. Для разработки надежной модели диапазон наборов данных, используемых для создания и проверки модели, должен быть независимым. Еще одно требование заключается в том, что диапазон значений должен быть относительно большим в обоих наборах. В данном исследовании диапазон вариации набора данных, используемого для создания модели , составлял от 8,0 до 15,6 % , а диапазон вариации проверочного набора – от 8,4 до 14,9%.

На рисунках 4a и 4b показаны зависимости между измеренными и прогнозируемыми значениями содержания растворимых сухих веществ (SSC, %), включая данные по трем исследованным сортам вишни, полученные с помощью моделей PCA-BNN и BNN соответственно. Сплошные линии представляют собой линии регрессии, соответствующие идеальной корреляции между измеренными и прогнозируемыми значениями. Как видно, прогнозируемые значения сгруппированы в двух областях, соответствующих сортам «Łutówka» и «Pandy 103» / «Groniasta». Таким образом, между этими двумя группами данных существует значительная разница в содержании SSC. Более того, незначительные различия в содержании SSC между «Pandy 103» и «Groniasta» привели к ситуации, когда прогнозируемые значения для этих двух сортов не могут быть разделены.

Таблица 5. Статистика содержания растворимых сухих веществ в образцах вишни (количество образцов 60) .

Сорт SSC (%) Стандартное отклонение (%) CV Кутрозис Асимметрия В
Пэнди 103 13.5 ±0,88 6.54 – 0,49 – 0,006 0,985
Грониаста 12.6 ±1,66 13.12 – 0,05 – 0,317 0,983
 Łutówka 10.6 ±1,01 9.51 – 0,04 0,045 0,987

 

Результаты прогнозирования показали, что обе рассматриваемые модели могут быть полезны для оценки SSC. Результаты прогнозирования для модели PCA -BNN характеризуются коэффициентом детерминации R² = 0,636 и среднеквадратичной ошибкой прогнозирования RMSEP = 0,933%. Лучшие результаты прогнозирования (R² = 0,789 и RMSEP = 0,775%) были получены с помощью модели BNN с 27 выбранными длинами волн.

Результаты, полученные в данном исследовании , сопоставимы и во многих случаях превосходят предыдущие попытки прогнозирования содержания растворимых сухих веществ (SSC) в фруктах на основе гиперспектральной съемки. Точность прогнозирования SSC, полученная в данном исследовании, лучше, чем точность, полученная Leive-Valenzuela et al. (2014) для черники с использованием изображений пропускания (R² = 0,52 и RMSEP = 1,39%) и Lu (2007) для яблок на основе метода гиперспектрального рассеяния (R² = 0,76 и SEP = 0,72%).

Более того, обработка спектров пропускания с помощью второй производной дала лучшие результаты классификации (R² = 0,789 и RMSEP = 0,775 %), чем спектры без производной, полученные Herrera et al. (2003) для прогнозирования SSC винограда сорта Шардоне (R² = 0,777 и RMSEP = 1,16%). Тем не менее, сложно сравнивать точность прогнозирования при изучении разных видов и использовании разных методологий. Например, Сунь и др. (2009) получили высокую точность прогнозирования содержания растворимых сухих веществ (SSC) для груш (R² = 0,92 и RMSEP = 0,53 %), а Фан и др. (2009) — для яблок (R² = 0,953 и SEP = 0,384 %).

Аналогично, Лю и др. (2010) получили многообещающие результаты прогнозирования SSC (R² = 0,9 и RMSEP = 0,68% Brix) для мандаринов Наньфэн и апельсинов Навел, используя комбинированный метод PCA-BNN с мультипликативной коррекцией рассеяния (MSC) для предварительной обработки спектра. Вишня была изучена Карлини и др . ( 2000 ), и точность прогнозирования SSC оказалась очень высокой (R² = 0,9) . R² = 0,97 и SEP = 0,49%).

Предыдущие исследования показали, что точность прогнозирования содержания растворимых сухих веществ (SSC) может зависеть от режима измерения (пропускание, отражение и взаимодействие). Шааре и Фрейзер (2000) предположили, что спектры в режиме взаимодействия обеспечивают очень хорошее прогнозирование внутренних свойств фруктов. Например, содержание растворимых сухих веществ в киви в режиме взаимодействия было спрогнозировано с R² = 0,93 и SEP = 0,8% Brix, тогда как в режиме пропускания R² = 0,89 и SEP = 1,01% Brix.

ВЫВОДЫ

  1. На основании представленных результатов можно заключить, что предлагаемое применение гиперспектральной визуализации пропускания повышает потенциал обнаружения косточек или фрагментов косточек в свежей вишне. Два метода обработки спектральных данных, а именно анализ максимумов и минимумов на предварительно обработанных вторых производных спектров или метод главных компонент (PCA), а также методы контролируемой классификации, позволили получить очень высокую точность классификации (более 96 %) по сравнению с более ранними исследованиями.
  2. Примененная методология анализа гиперспектральных изображений обеспечила высокую точность обнаружения целых косточек и фрагментов косточек в вишнях для всех вариантов эксперимента, охватывающих широкий диапазон размеров вишни и содержания растворимых сухих веществ (ССВ). Однако эта точность оказалась отрицательно коррелирована с содержанием растворимых сухих веществ.
  3. Несомненным преимуществом представленного решения является то, что рассматриваемые алгоритмы основаны на ограниченном количестве диапазонов длин волн из VNIR-спектра (27 длин волн). Это значительно увеличивает скорость анализа . Эффективной альтернативой является использование 5 компонентов PCA, полученных из спектрального куба, являющегося входными данными для моделей классификации.
  4. Специфическиеспектральные характеристики в режиме пропускания вишни отражали дифференциацию содержания в ней растворимых сухих веществ. Это было подтверждено с помощью моделей нейронных сетей обратного распространения, благодаря высоким коэффициентам корреляции (до 0,79) между измеренными и прогнозируемыми значениями.
  5. С учетом технологического развития современных гиперспектральных датчиков, проявляющегося в увеличении скорости регистрации и обработки изображений, можно ожидать, что адаптация представленного решения к сортировочным линиям будет вполне реалистичной.

Литература

  1. Allen K.M., Vandyke L.H., and Brunsbach R.L., 1966. Apparatus for detecting seeds in fruit. U.S. Patent No. 3, 275-136.
  2. Baiano A., Terracone C., Peri G., and Romaniello R., 2012. Application of hyperspectral imaging for prediction of physico-chemical and sensory characteristics of table grapes. Computers Electronics Agric., 87, 142-151.
  3. Baranowski P., Jedryczka M., Mazurek W., Babula-Skowronska D., Siedliska A., and Kaczmarek J., 2015. Hyperspectral and thermal imaging of oilseed rape (Brassica napus) response to fungal species of the genus Alternaria. PloS one, 10(3), e0122913.
  4. Baranowski P., Mazurek W., and Pastuszka-Woźniak J., 2013. Supervised classification of bruised apples with respect to the time after bruising on the basis of hyperspectral imaging data. Postharvest Biol. Technol., 86, 249-258.
  5. Becker B.L., Lusch D.P., and Qi J., 2005. Identifying optimal spectral bands from in situ
    measurements of Great Lakes coastal wetlands using second-derivative analysis. Remote Sensing Environ., 97, 238-248.
  6. Carlini P., Massantini R., and Mencarelli F., 2000. Vis-NIR measurement of soluble solids in cherry and apricot by PLS regression and wavelength selection. J. Agric. Food
    Chemistry, 48, 5236-5242.
  7. Donis-González I.R., Guyer D.E., Kavdir I., Shahriari D., and Pease A., 2015. Development and applicability of an aga- rose-based tart cherry phantom for computer tomography imaging. J. Food Measurement Characterization, 9(3), 290-298.
  8. Fan G., Zha J., Du R., and Gao L., 2009. Determination of solu- ble solids and firmness of apples by Vis/NIR transmittance. J. Food Eng., 93 (4), 416-420.
  9. Fan S., Huang W., Guo Z., Zhang B., and Zhao C., 2005. Prediction of soluble solids content and firmness of pears using hyper- spectral reflectance imaging. Food Anal. Method, 8, 1936-1946.
  10. Golic M. and Walsh K.B., 2006. Robustness of calibration mod- els based on near infrared spectroscopy for the in-line grading of stone fruit for total soluble solids content. Analytica Chimica Acta, 555(2), 286-291.
  11. Haff R.P., Jackson E.S., and Pearson T.C., 2005. Non- destructive detection of pits in dried plums. Small, 175, 6-6.
  12. Haff R., Pearson T., and Jackson E., 2013. One dimensional linescan x-ray detection of pits in fresh cherries. American J. Agric. Sci. Technol., 1, 18-26.
  13. Haff R.P. and Toyofuku N., 2008. X-ray detection of defects and contaminants in the food industry. Sensing Instrumentation for Food Quality and Safety, 2 (4), 262-273.
  14. Herrera J., Guesalaga A., and Agosin E., 2003. Shortwave-near infrared spectroscopy for non-destructive determination of maturity of wine grapes. Measurement Sci. Technol., 14(5), 689.
  15. Kawano S., 2016. Past, present and future near infrared spectros- copy applications for fruit and vegetables. NIR news, 27(1), 7-9.
  16. Leiva-Valenzuela G.A, Lu R., and Aguilera J.M., 2014. Assessment of internal quality of blueberries using hyper- spectral transmittance and reflectance images with whole spectra or selected wavelengths. Innovative Food Sci. Emerg. Technol., 24, 2-13.
  17. Liaghat S., Ehsani R., Manso S., Shafr H.Z., Meon S., Sankaran S., and Azam S.H., 2014. Early detection of basal stem rot disease (Ganoderma) in oil palms based on hyperspectral reflectance data using pattern recognition algorithms. Int. J. Remote Sensing, 35(10), 3427-3439.
  18. Liu Y., Sun X., and Aiguo O., 2010. Nondestructive measure- ment of soluble solid content of navel orange fruit by visible-NIR spectrometric technique with PLSR and PCA- BPNN. LWT-Food Sci. Technol., 44 (4), 602-607.
  19. Lu R., 2007. Nondestructive measurement of firmness and solu- ble solids content for apple fruit using hyperspectral scattering images. Sensing and Instrumentation for Food Quality and Safety, 1(1), 19.
  20. Lu Y., Huang Y., and Lu R., 2017. Innovative hyperspectral imaging-based techniques for quality evaluation of fruits and vegetables: A Review. Applied Sci., 7(2), 189.
  21. Munera S., Besada C., Aleixos N., Talens P., Salvador A., Sun D.W., Cubero S., and Blasco J., 2017. Non-destructive assessment of the internal quality of intact persimmon using colour and VIS/NIR hyperspectral imaging. LWT-Food Sci. Technol., 77, 241-248.
  22. Nicolaï B.M., Defraeye T., De Ketelaere B., Herremans E., Hertog M.L., Saeys W., Toricelli A., Vandendriessche T. and Verboven P., 2014. Nondestructive measurement of fruit and vegetable quality. Annual Review Food Sci. Technol., 5, 285-312.
  23. Pan L., Sun Y., Xiao H., Gu X., Hu P., Wei Y., and Tu K., 2017. Hyperspectral imaging with different illumination patterns for the hollowness classification of white radish. Postharvest Biology Technol., 126, 40-49.
  24. Pu Y.Y., Feng Y.Z., and Sun D.W., 2015. Recent progress of hyperspectral imaging on quality and safety inspection of fruits and vegetables: a review. Comprehensive Reviews in Food Sci. Food Safety, 14(2), 176-188.
  25. Qin J. and Lu R., 2005. Detection of pits in tart cherries by hyperspectral transmission imaging. Trans. ASAE, 48 (5),1700-1963.
  26. Schaare P.N. and Fraser D.G., 2000. Comparison of reflectance, interactance and transmission modes of visible-near infra- red spectroscopy for measuring internal properties of kiwifruit (Actinidiachinensis). Postharvest Biol. Technol., 20(2),175-184.
    Siedliska A., Baranowski P., and Mazurek W., 2014. Classification models of bruise and cultivar detection on the basis of hyperspectral imaging data. Computers Electronics Agric.,106, 66-74.
  27. Song D., Song L., Sun Y., Hu P., Tu K., Pan L., Yang H., and Huang M., 2016. Black Heart Detection in White Radish by Hyperspectral Transmittance Imaging Combined with Chemometric Analysis and a Successive Projections Algorithm. Applied Sci., 6(9), 249.
  28. Sun J., Ma B., Dong J., Zhu R., Zhang R., and Jiang W., 2016. Detection of internal qualities of hami melons using hyper- spectral imaging technology based on variable selection algorithms. J. Food Process Eng., 40, doi: 10.1111/ jfpe.12496
  29. Sun T., Lin H., Xu H., and Ying Y., 2009. Effect of fruit moving speed on predicting soluble solids content of ‘Cuiguan’ pears (Pomaceaepyrifolia Nakai cv. Cuiguan) using PLS and LS-SVM regression. Postharvest Biol. Technol., 51(1), 86-90.
  30. Sun Y., Gu X., Sun K., Hu H., Xu M., Wang Z., Kang T., and Pan L., 2017. Hyperspectral reflectance imaging combined with chemometrics and successive projections algorithm for chilling injury classification in peaches. LWT-Food Sci. Technol., 75, 557-564.
  31. Szuvandzsiev P., Helyes L., Lugasi A., Szántó C., Baranowski P., and Pék Z., 2014. Estimation of antioxidant components of tomato using VIS-NIR reflectance data by handheld porta- ble spectrometer. Int. Agrophys., 28(4), 521-527.
  32. Timm E.J., Gilliland P.V., Brown G.K., and Affeldt H.A., 1991. Potential methods for detecting pits in tart cherries. Applied Eng. Agric., 7(1), 103-109.
  33. USDA foreign agricultural service – EU-28, 2016. Stone Fruit Annual, ссылка
  34. Wang N.N., Sun D.W., Yang Y.C., Pu H., and Zhu Z., 2016. Recent Advances in the Application of Hyperspectral Imaging for Evaluating Fruit Quality. Food Analytical Methods, 9(1), 178-191.
  35. Williams P. and Norris K. (Eds), 2001. Near-Infrared Techno- logy in the Agricultural and Food Industries. American Association of Cereal Chemists, St. Paul, MIN, USA.
  36. Witten I.H. and Frank E., 2005. Data mining. Practical machine learning tools and techniques. Morgan Kaufmann.
  37. Wojdyło A., Nowicka P., Laskowski P., and Oszmiański J., 2014. Evaluation of sour cherry (Prunuscerasus L.) fruits for their polyphenol content, antioxidant properties, and nutri- tional components. J. Agric. Food Chemistry, 62(51), 12332-12345.
  38. Xing J., Guyer D., Ariana D., and Lu R., 2008. Determining optimal wavebands using genetic algorithm for detection of internal insect infestation in tart cherry. Sensing and Instrumentation for Food Quality and Safety, 2(3), 161-167.
  39. Zion B., Kim S.M., McCarthy M.J., and Chen P., 1997. Detection of pits in olives under motion by nuclear mag- netic resonance. J. Sci. Food Agric., 75(4), 496-502.
  40. Zion B., McCarthy M.J., and Chen P., 1994. Real-time detec- tion of pits in processed cherries by magnetic resonance projections. LWT-Food Sci. Technol., 27(5), 457-462.

Авторы: Anna Siedliska, Monika Zubik, Piotr Baranowski, Wojciech Mazurek