В данной статье представлена методология на основе компьютерного зрения для автоматической классификации изображений, включающая 2042 обучающих изображения и 284 ранее не встречавшихся (тестовых) изображения, разделенных на 68 категорий драгоценных камней. Для классификации использовался ряд методов извлечения признаков (33, включая цветовые гистограммы в пространствах RGB, HSV и CIELAB, локальный бинарный шаблон, текстуру Харалика и свойства матрицы совместной встречаемости уровней серого) в сочетании с различными алгоритмами машинного обучения (логистическая регрессия, линейный дискриминантный анализ, метод k-ближайших соседей, дерево решений, случайный лес, наивный байесовский классификатор и метод опорных векторов).
Также исследовалась классификация с использованием глубокого обучения с помощью ResNet-18 и ResNet-50. Оптимальная комбинация была получена с помощью алгоритма случайного леса с восьмибинарной цветовой гистограммой RGB и локальным бинарным шаблоном, обеспечив точность 69,4% на ранее не встречавшихся изображениях; алгоритмам потребовалось 0,0165 с для обработки 284 тестовых изображений. Полученные результаты были сопоставлены с результатами трех экспертов-геммологов с опытом работы в области идентификации драгоценных камней не менее 5 лет, которые показали точность от 42,6% до 66,9% и потратили от 42 до 175 минут на классификацию тестовых изображений.
Как и ожидалось, экспертам потребовалось гораздо больше времени, чем алгоритмам компьютерного зрения, которые, хотя и незначительно, обеспечили более высокую точность. Несмотря на то, что в этих экспериментах использовалось относительно небольшое количество изображений, превосходство компьютерного зрения над человеком соответствует результатам, полученным в других областях исследований, и обнадеживает дальнейшее изучение его применения в геммологии и смежных областях.
1. Введение
Точная классификация драгоценных камней имеет решающее значение для торговли драгоценными камнями и ювелирными изделиями, поскольку идентификация является важным первым шагом в оценке любого драгоценного камня [1]. В настоящее время идентичность драгоценного камня определяется с помощью сочетания визуального наблюдения и спектрохимического анализа [2]. Путем тщательного наблюдения драгоценных камней невооруженным глазом и под увеличением геммологи обнаруживают визуальные характеристики, такие как цвет, прозрачность, блеск, трещины, спайность, включения, плеохроизм, феномен и двойное лучепреломление, что облегчает разделение драгоценных камней [3].
Это сложный процесс, поскольку многие драгоценные камни имеют одинаковый цвет и характеристики, как показано на рисунке 1, где представлена выборка из 500 драгоценных камней, распределенных по 87 различным категориям. Идентификация и классификация часто сопровождаются использованием геммологических инструментов, включая рефрактометры [4], полярископы и коноскопы [5], портативные спектроскопы [6], дихроскопы [7] и ультрафиолетовое излучение [8] для исследования оптических свойств драгоценных камней. Измерение физических свойств, таких как удельный вес [9] (также известный как относительная плотность), предоставляет дополнительную информацию, связанную с идентичностью драгоценного камня.
С появлением новых синтетических драгоценных камней и методов обработки в геммологические лаборатории были внедрены все более сложные приборы с мощными спектроскопическими, флуоресцентными или химическими аналитическими возможностями [2]. К таким приборам относятся инфракрасные спектрометры [10], спектрометры комбинационного рассеяния и люминесценции [11, 12, 13], ультрафиолетово-видимые спектрометры [14], катодолюминесценция [15], энергодисперсионные рентгенофлуоресцентные спектрометры [4, 16], лазерно-абляционные масс-спектрометры с индуктивно связанной плазмой [17] и флуоресцентные спектрометры [18].

Рисунок 1. Пятьсот изображений драгоценных камней, отобранных из восьмидесяти семи различных категорий, от альмандина до цоизита. Изображения расположены по оттенкам, чтобы проиллюстрировать сложность визуальной идентификации камней.
Тем не менее, идентификация по-прежнему сложна и трудоемка, и не все лаборатории имеют доступ к этим сложным приборам; таким образом, идентификация с помощью автоматических методов, основанных исключительно на изображениях, является привлекательной. В последние годы компьютеры и алгоритмы значительно развились, и задачи обработки изображений и компьютерного зрения стали обычным явлением во многих областях, таких как медицинская визуализация, производство и безопасность. В геологических науках были разработаны алгоритмы компьютерного зрения для классификации минеральных зерен [19, 20, 21, 22, 23, 24] и горных пород [25, 26, 27, 28, 29].
Томпсон и др. [9] сегментировали микроскопические тонкие срезы с помощью обнаружения краев и достигли точности тестирования до 93,53% при классификации 10 различных минералов с помощью искусственной нейронной сети, обученной на извлеченных цветовых и текстурных признаках. Заявленная точность, вероятно, была завышена, поскольку для обучения и тестирования использовались одни и те же примеры биотита.
Байкан и Йылмаз [20] разработали искусственную нейронную сеть для разделения пяти минералов, используя значения RGB (красный-зеленый-синий) пикселей в вручную сегментированных тонких срезах в качестве входных данных, и достигли точности 89,53%. Изади и др. [21] сегментировали тонкие срезы с помощью инкрементальной кластеризации и выполнили классификацию минералов с использованием каскадного подхода. Искусственная нейронная сеть сначала использовалась для различения 23 типов минералов и стекла на основе цветов пикселей, и только те минералы, которые демонстрировали схожие цвета как в плоскополяризованном, так и в скрещеннополяризованном свете, были переданы во вторую искусственную нейронную сеть для одновременного анализа цвета и текстуры. Это привело к общей точности 93,81%.
Борхес и де Агиар [22] продемонстрировали, что простые алгоритмы машинного обучения — метод k-ближайших соседей и дерево решений — способны классифицировать минералы в микроскопических тонких срезах на основе цвета и текстуры со средней точностью 94,11–97,71% с использованием двух наборов данных с четырьмя и семнадцатью типами минералов.
Мэтр и др. [23] сегментировали микроскопические изображения, содержащие восемь типов минералов и фон, с помощью простой линейной итеративной кластеризации и классифицировали их с использованием трех алгоритмов машинного обучения, а именно метода k-ближайших соседей, случайного леса и дерева решений, на основе цветовых характеристик в пространстве RGB, Hue–Saturation–Value (HSV) и CIELAB.
Алгоритм случайного леса показал наивысшую точность 82%. Чжан и др. [24]] исследовали классификацию четырех минералов с помощью шести различных алгоритмов, а именно логистической регрессии, машины опорных векторов, случайного леса, метода k-ближайших соседей, многослойного персептрона и наивного байесовского классификатора, используя признаки, извлеченные из микроскопических изображений с помощью Inception-v3. Машина опорных векторов была определена как единственный алгоритм, обеспечивающий наивысшую точность (90,6%).
Объединение моделей машины опорных векторов, логистической регрессии и многослойного персептрона дополнительно повысило точность на 0,3%. Несмотря на надежность систем компьютерного зрения в распознавании минералов, до настоящего времени, насколько известно авторам, было опубликовано только одно исследование по автоматической идентификации изображений драгоценных камней [30].
Была достигнута точность классификации каждого класса 75–100% для классификации ранее не встречавшихся изображений рубина, синего сапфира и изумруда на основе канала оттенка цветового пространства HSV с использованием искусственной нейронной сети. Следует отметить, что рубины, синие сапфиры и изумруды имеют очень характерные цвета и поэтому их относительно легко отличить друг от друга, гораздо легче, чем драгоценные камни схожих цветов, такие как топаз и аквамарин.
Другие исследования в области компьютерного зрения в контексте геммологии в основном были сосредоточены на оценке драгоценных камней [31, 32, 33] и их распознавании [34, 35]. Были разработаны надежные системы компьютерного зрения для оценки цвета янтаря [36], жадеита [37], опала [38] и жемчуга [39]. Чжан и Го [37] предложили систему, которую можно разработать в качестве инструмента для измерения цвета драгоценных камней.
2. Материалы и методы
2.1. Материалы
В общей сложности 2326 изображений драгоценных камней были получены с Kaggle [40] (доступ осуществлен 27 апреля 2021 г.) и проанализированы в данной работе. Пример из них показан на рисунке 2. Изображения были сгруппированы по категориям, и для данной работы для анализа были отобраны следующие 68 классов: александрит, альмандин, амазонит, янтарь, аметист, аметрин, андрадит, аквамарин, зеленый авантюрин, желтый авантюрин, бенитоит, золотистый берилл, биксбит, гематит, голубой кружевной агат, карнеол, халцедон, синий халцедон, диопсид хрома, хризоберилл, хризоколла, хризопраз, цитрин, коралл, алмаз, диаспор, дюмортьерит, изумруд, флюорит, гессонит, иолит, яшма, кунцит, кианит, лазурит, малахит, черный оникс, зеленый оникс, красный оникс, перидот, пренит, пирит, пироп, пивной кварц, лимонный кварц, рутиловый кварц, дымчатый кварц.
Родохрозит, родолит, родонит, рубин, синий сапфир, розовый сапфир, фиолетовый сапфир, желтый сапфир, серпентин, содалит, спессартит, сфен, солнечный камень, танзанит, тигровый глаз, топаз, турмалин, цаворит, бирюза, циркон и цоизит . Изображения были получены в совершенно разных условиях освещения и цвета фона, как видно на рисунке 1. Размеры варьировались в широком диапазоне: высота от 93 до 3055 пикселей, ширина от 89 до 3947 пикселей.
К некоторым изображениям могла быть применена постобработка, например, обрезка или обработка в Photoshop, но эти подробности недоступны. Всего для обучения было использовано 2042 изображения, а для тестирования — 284 изображения. Для каждого класса было доступно 24–44 обучающих изображения и 4–5 тестовых изображений. Исходный набор данных Kaggle состоит из 3219 изображений, распределенных по 87 классам, но некоторые из них были отброшены в соответствии с критериями, описанными в Приложении А.

Рисунок 2. Двенадцать репрезентативных изображений драгоценных камней, представленных в этой работе. Можно заметить, что некоторые камни, такие как малахит и красный оникс, легко узнать по их уникальным цветам, в то время как отличить изумруд от цаворита будет сложно.
2.2. Методы
Данная методика включала сбор данных, сегментацию фона, извлечение признаков, построение классификаторов машинного обучения и оценку (рис. 3).

Рисунок 3. Использованная в данной работе структура компьютерного зрения: сбор данных, сегментация фона, извлечение признаков, построение классификаторов машинного обучения и оценка.
Все алгоритмы, использованные в этой работе, были написаны на Python 3.7.9 и находятся в свободном доступе на GitHub ( https://github.com/hybchow/gems, дата обращения: 31 декабря 2021 г.). За исключением трансферного обучения, скрипты выполнялись на MacBook Pro, оснащенном процессором Intel Core i5 с частотой 2,3 ГГц. Трансферное обучение было реализовано на виртуальном графическом процессоре NVIDIA Tesla K80 (GPU) с двумя рабочими узлами в Google Colaboratory. Результаты экспериментов были визуализированы с помощью Python и Tableau.
2.2.1. Сегментация фона
Мы использовали пороговую обработку Оцу [ 41 ] для автоматического извлечения драгоценных камней из фона. Пороговая обработка Оцу — это непараметрический метод сегментации без учителя, который работает путем максимизации дисперсии между интенсивностью фона и переднего плана. Бинарные маски, созданные путем применения пороговой обработки Оцу либо к интенсивности серого, либо к каналу насыщенности пространства HSV, сравнивались визуально (рис. 4). Изображение считалось хорошо сегментированным, если удовлетворяло следующим критериям: (1) фон был полностью удален, и (2) большая часть драгоценного камня была извлечена. Подход, дающий больше хорошо сегментированных обучающих изображений для класса драгоценных камней, был принят для сегментации тестовых изображений в том же классе. Все тестовые изображения были сохранены независимо от качества сегментации.

Рисунок 4. Иллюстрация сегментации фона для двух репрезентативных изображений александрита (верхний ряд) и амазонита (нижний ряд). (a, d) Исходные изображения. (b, e) Маска, полученная с помощью пороговой обработки Оцу на основе интенсивности. (c, f) Маска, полученная с помощью пороговой обработки Оцу на основе канала насыщенности пространства HSV. Следует отметить, что маска, полученная исключительно на основе интенсивности, менее точна, чем маска, полученная на основе насыщенности.
Процесс получения фона с помощью пороговой обработки Оцу на основе интенсивности выглядел следующим образом: 1. Преобразование изображений в оттенки серого; 2. Применение гауссова сглаживания с сигмой, равной 2, к изображению в оттенках серого; 3. Применение пороговой обработки Оцу к интенсивности уровней серого для создания бинарной маски; 4. Инвертирование маски, если средняя интенсивность20×205.
Заполнены области в каждом углу изображения, интенсивность которых выше среднего значения по всему изображению, то есть фон имел более высокую интенсивность, чем драгоценный камень, поэтому был выделен драгоценный камень, а не фон; 6. Применено бинарное закрытие к маске с использованием дискообразного структурирующего элемента радиусом 8 пикселей; 7. Удалены объекты размером менее 301 пикселя; 8. Заполнены отверстия в маске; 9. Применено бинарное сглаживание к маске с использованием квадратного структурирующего элемента 2×2px; 10. Заполнены отверстия в маске; 11. Применена маска к исходному изображению путем установки нулевого значения для пикселей, идентифицированных как фон.
Процесс получения фона с помощью пороговой обработки Оцу для канала насыщенности был очень похожим: 1. Преобразование изображения из пространства RGB в пространство HSV и извлечение канала насыщенности HSV; 2. Применение гауссова сглаживания с сигмой 5 к каналу насыщенности HSV; 3. Применение пороговой обработки Оцу к каналу насыщенности HSV для создания бинарной маски; 4. Инвертирование маски, если средняя насыщенность20×205.
Заполнены области в каждом углу изображения, имеющие более высокую насыщенность, чем в среднем по всему изображению, то есть фон имел более высокую насыщенность, чем драгоценный камень, поэтому был выделен драгоценный камень, а не фон; 6. Применено бинарное закрытие к маске с использованием дискообразного структурирующего элемента радиусом 9 пикселей; 7. Удалены объекты размером менее 301 пикселя; 8. Заполнены отверстия в маске; 9. Применено бинарное сглаживание к маске с использованием квадратного структурирующего элемента.2×2px; 10. Заполнены отверстия в маске; 11. Применена маска к исходному изображению путем установки нулевого значения для пикселей, идентифицированных как фон.
2.2.2. Извлечение признаков
Извлечение признаков — один из важнейших процессов компьютерного зрения и задач обработки изображений [42]. Извлечение признаков можно понимать по-разному: низкоуровневое извлечение, которое фокусируется на краях, цветах, текстурах, формах, областях и других характеристиках изображения, иногда извлекаемых с помощью преобразований, таких как преобразование Фурье или дискретное косинусное преобразование [43, 44, 45]; высокоуровневое извлечение, которое переходит к пониманию поведения [46], а также к уменьшению размерности, что иногда достигается путем выбора уменьшенного набора признаков или измерений из данных [47].
Для последующей классификации из замаскированных изображений было извлечено в общей сложности 33 признака, основанных на цвете и текстуре. Эти характеристики включали: цвет нефонового кластера K-средних в пространстве RGB, HSV или CIELAB, 4- и/или 8-битные гистограммы в пространстве RGB, HSV или CIELAB, комбинацию 4- или 8-битных гистограмм RGB или HSV и текстуры Харалика, комбинацию 8-битных гистограмм RGB и одной матрицы совместной встречаемости уровней серого (GLCM), свойства которой определялись по корреляции, несходству, энергии, угловому второму моменту (ASM), контрасту или однородности, комбинацию 4- или 8-битных гистограмм RGB или HSV и локального бинарного шаблона (LBP) с 8 точками радиусом 1, комбинацию 8-битных гистограмм RGB и LBP с 8 точками радиусом 3, комбинацию 8-битных гистограмм RGB и LBP с 16 или 24 точками радиусом 1 или 3, комбинацию 4- и 8-биновые гистограммы и LBP с 8 точками на радиусе 1 , а также комбинация 4- и 8-биновых RGB-гистограмм и LBP с 8 точками на радиусе 1 и 24 точками на радиусе 3.
Извлечение цветовых признаков проводилось в трех цветовых пространствах: RGB, HSV и CIELAB. Пространство RGB основано на трехцветном человеческом зрении и описывает цвета путем аддитивной комбинации ортогональных красных, зеленых и синих компонентов [48]. HSV основано на человеческой интуиции [49], тесно связано с художественными представлениями о оттенке и полутонах [50] и обеспечивает превосходную дифференциацию для сильно насыщенных областей [51, 52].
HSV представлен гексаконом, где насыщенность — горизонтальная ось, оттенок может быть либо углом окружности, либо значением по горизонтальной оси, а значение — вертикальной осью [53]. CIELAB предназначен для представления перцептивной однородности (разница в цвете соответствует той, которую воспринимают люди) [49]. В отличие от пространств RGB и HSV, CIELAB не зависит от устройства [49]. На рисунке 5 показаны три цветовых пространства для всех изображений обучающих данных, а на рисунке 6 показаны медианные значения оттенка и насыщенности для каждого драгоценного камня.

Рисунок 5. Иллюстрация центральных цветовых характеристик для всех изображений обучающих данных, представленных в трех цветовых пространствах. (a) Красно-зелено-синий (RGB). (b) Оттенок-Насыщенность-Значение (HSV). (c) CIELAB. Следует отметить, что визуально HSV обеспечивает лучшую различимость, поскольку цвета ранжируются, в данном случае, вдоль горизонтальной оси. HSV также можно отображать на полярных диаграммах, поскольку оттенок является круговым свойством.

Рисунок 6. Распределение медианных значений оттенка и насыщенности изображений драгоценных камней, сгруппированных по классам и представленных в виде полярных диаграмм рассеяния. Следует отметить, что распределение нескольких драгоценных камней очень похоже, например, изумруда и цаворита.
Для извлечения цвета из драгоценных камней использовались кластеризация методом K-средних и цветовые гистограммы (рис. 7). Кластеризация методом K-средних выполнялась для разделения пикселей в каждом изображении на группы по цвету таким образом, чтобы разница между группами была максимальной, а вариация внутри каждой группы — минимальной [54].
Для простоты мы предположили, что каждое изображение состоит только из двух цветов, представляющих драгоценный камень и фон, и что центр кластера цвета фона имеет меньшую сумму значений красного, зеленого и синего в RGB, меньшую сумму компонентов оттенка и насыщенности в HSV или меньшую яркость в CIELAB, чем эквивалент кластера цвета драгоценного камня.
Цветовые гистограммы представляют собой трехмерные массивы, отображающие количество пикселей в каждом компоненте цветового пространства в отдельных изображениях [55, 56]. Мы исследовали использование 4-биновых, 8-биновых или комбинации 4- и 8-биновых цветовых гистограмм. При построении цветовых гистограмм фоновые пиксели, имеющие нулевое значение на маскированных изображениях, игнорировались.

Рисунок 7. Иллюстрация цветовых и текстурных характеристик, извлеченных из репрезентативного изображения. (a) Замаскированное изображение александрита. (b) Диаграмма рассеяния значений RGB всех пикселей. (c) Цвет RGB центра кластера K-средних без фона. (d) Матрица GLCM со смещением 1 и углом 0. (e) Гистограмма RGB. (f) Гистограмма HSV. (g) Гистограмма CIELAB. ( h ) Гистограмма LBP.
Текстурные признаки, извлеченные из изображений, широко применялись в прошлом [57, 58, 59, 60, 61] в таких областях, как кристаллография [62], стратиграфия [63], индустрия природного камня [64] и медицинская визуализация [65, 66, 67]. Помимо хроматических характеристик, текстура представляется одним из наиболее привлекательных признаков для различения драгоценных камней, например, камни на рисунке 2 d,f,k,l имеют схожие оттенки, но разную текстуру.
Текстурные признаки извлекались с использованием либо LBP, текстуры Харалика, либо выбранного свойства GLCM. LBP, предложенный Оялой и др. [68], представляет собой метод извлечения текстуры, инвариантный к шкале серого, который бинаризует уровни серого соседних пикселей относительно центрального эталонного пикселя. В данной работе исследовались только LBP с 8, 16 или 24 точками на радиусе 1 или 3.
Харалик [57] разработал GLCM для описания пространственной зависимости уровней серого соседних пикселей и вывел из GLCM 14 свойств, которые позже стали известны как текстура Харалика. Были исследованы только шесть отдельных свойств, а именно корреляция, энергия, несходство, однородность, контраст и ASM, для GLCM со смещением 1 и углом 0. При вычислении текстуры Харалика и GLCM фоновые пиксели игнорировались. Однако фоновые пиксели явно не игнорировались при извлечении LBP. При небольших изменениях интенсивности фон будет вносить вклад только в самые низкие значения LBP, что, как ожидалось, окажет незначительное влияние на классификацию изображения.
После извлечения признаков была применена техника синтетической передискретизации меньшинства (SMOTE) с четырьмя ближайшими соседями (k = 4) для выравнивания пропорций классов. SMOTE — это техника, которая генерирует «синтетические» обучающие данные для не-мажорных классов путем интерполяции [69].
2.2.3. Алгоритмы машинного обучения
Логистическая регрессия
Линейный дискриминантный анализ
K-Ближайший сосед
Дерево решений
Случайный лес
Наивный Байес
Метод опорных векторов
Оптимизация параметров
Для поиска оптимальных параметров был выполнен пятикратный перекрестно-проверенный поиск по сетке [78] с использованием отрицательной кросс-энтропийной потери в качестве метрики оценки. Диапазоны параметров, заданных для поиска по сетке, приведены в таблице 1.
Таблица 1. Приведены параметры, заданные для пятикратной перекрестной проверки методом поиска по сетке для семи алгоритмов машинного обучения и для ResNet. Обратите внимание, что для алгоритма наивного Байеса было присвоено одно значение параметра, тогда как для алгоритмов дерева решений, случайного леса и машины опорных векторов были оптимизированы три гиперпараметра.
| Алгоритм | Диапазон параметров |
|---|---|
| Логистическая регрессия | “C”: [0.001,0.01,0.1,1,10] |
| Линейный дискриминантный анализ | “solver”: “lsqr”; “shrinkage”: [0,0.5,1] |
| K-Ближайший сосед | “n_neighbors”: [3,5,7,9] |
| Дерево решений | “max_depth”: [10,None]; “max_features”: [3,5,7,9]; “min_samples_leaf”: [3,5,7,9] |
| Случайный лес | “n_estimators”: [50,100]; “max_depth”: [3,5,7,9]; “min_samples_leaf”: [3,5,7,9] |
| Наивный Байес | «var_smoothing»: 1×10 −9 |
| Метод опорных векторов | “estimator__kernel”: [“linear”, “poly”, “rbf”, “sigmoid”]; “estimator__C”: [1,10,100]; “estimator__gamma”: [0.1,0.01] |
| ResNet | Number of layers: 18 or 50; Training images: RandomResizedCrop (224), RandomHorizontalFlip, RandomVerticalFlip and Normalize; Test images: Resize (256), CenterCrop (224) and Normalize; “batch_size”:16; “max_epochs”: 25; “criterion”: torch.nn.CrossEntropyLoss; “lr”: 0.001; “optimizer”: torch.optim.SGD; “optimizer__momentum”: 0.9; “iterator_train__num_workers”: 2; “iterator_valid__num_workers”: 2; “iterator_train__shuffle”: True; “callbacks”: LRScheduler(policy = “StepLR”, step_size = 7,gamma = 0.1), Checkpoint (monitor = “valid_acc_best”), Freezer (lambda x: not x.startswith (“model.fc”)) |
2.2.4. Сверточные нейронные сети и трансферное обучение
Последние годы были отмечены достижениями в области глубокого обучения [79]. Глубокое обучение можно рассматривать как раздел машинного обучения, где большие объемы входных данных и соответствующие им метки предоставляются модели, также известной как архитектура или сеть, которая затем будет изучать характеристики или представления, присущие данным, чтобы классифицировать или регрессировать данные [80]. Эти архитектуры имеют большое количество слоев, поэтому считаются глубокими, и очень большое количество параметров между этими слоями. Глубокое обучение дало невероятные результаты, возможно, наиболее значимым из которых является результат, связанный с конкурсом ImageNet Large Scale Visual Recognition Challenge (ILSVRC) [81].
Одним из ограничений глубокого обучения является необходимость большого объема входных данных, который можно минимизировать путем обучения архитектуры на данных из другого контекста, а затем последующей тонкой настройки. Перенос обучения [82] — популярный и эффективный подход к классификации изображений [83, 84, 85], при котором модель применяет знания, полученные в одной задаче, к другой.
В данной работе для анализа была выбрана остаточная сеть Microsoft (ResNet) [86], победитель ILSVRC 2015 года. ResNet характеризуется глубокой архитектурой с короткими соединениями между несмежными сверточными слоями. В данной работе для классификации драгоценных камней были применены 18- и 50-слойные ResNet, предварительно обученные на наборе данных ImageNet. Для совместимости с ResNet изображения драгоценных камней были обрезаны и изменены в размере.224×224Размер каждой партии из 16 изображений был нормализован с использованием среднего значения и стандартного отклонения набора данных ImageNet.
Для обработки обучающих и тестовых изображений использовались несколько различающиеся подходы. Для обучающих изображений случайный фрагмент был вырезан и изменен в размере.224×224Было применено расширение пикселей и данных в виде случайного горизонтального или вертикального отражения. Для исключения влияния дисбаланса классов при группировке обучающих изображений в пакеты применялась взвешенная случайная выборка. Тестовые изображения сначала были изменены в размере до 256×256пикселей, а центральная часть была обрезана для получения изображений 224×224При обучении моделей ResNet веса нейронов в сверточных слоях были заморожены, и адаптировались только веса нейронов в последнем полносвязном слое.
Начальная скорость обучения была установлена на уровне 0,001 и планировалось уменьшать её на коэффициент 0,1 каждые семь эпох. В качестве оптимизатора был выбран стохастический градиентный спуск (SGD) с моментом 0,9 и функция потерь кросс-энтропии. При подаче пакетов обучающих изображений моделям применялось перемешивание. В течение максимум 25 эпох модель с наивысшей точностью 5-кратной стратифицированной кросс-валидации считалась финальной моделью.
2.2.5. Оценка
Алгоритмы оценивались и сравнивались по следующим параметрам: точность, точность топ-5, время обучения и время вычислений на тестовых изображениях. Точность [87] — это доля правильных предсказаний (истинно отрицательных и истинно положительных) от всех предсказаний (ложноположительных, ложноотрицательных, истинноположительных и истинноотрицательных).
Точность топ-k [88] аналогична точности, разница лишь в том, что каждому алгоритму разрешено несколько предположений вместо одного для каждого предсказания, и предсказание считается правильным, когда одно из предположений совпадает с истинной меткой. Время, необходимое классификатору машинного обучения для выполнения поиска по сетке наиболее важных параметров для оптимизации алгоритма [89], или время, необходимое ResNet для завершения 25 эпох обучения, считается временем вычислений на обучении.
Общее время, необходимое классификатору для выполнения предсказаний на всех 284 тестовых изображениях, было зафиксировано как время вычислений на тестовых изображениях. Время вычислений как для обучения, так и для тестирования классификаторов машинного обучения измерялось с помощью MacBook Pro, оснащенного процессором Intel Core i5 с частотой 2,3 ГГц, тогда как для ResNets использовался виртуальный графический процессор NVIDIA Tesla K80, предоставленный Google Colaboratory.
2.2.6. Экспертная группа
3. Результаты
3.1. Сегментация фона
Сегментация фона оценивалась визуально. Пороговая обработка по методу Оцу, основанная на насыщенности, обеспечила лучшие результаты сегментации для обучающих изображений 52 классов, тогда как пороговая обработка по методу Оцу, основанная на уровнях серого, дала лучшие результаты сегментации для изображений 16 классов. 52 класса, сегментированные с использованием пороговой обработки Оцу на основе насыщенности, включали: амазонит, янтарь, аметист, аметрин, андрадит, зеленый авантюрин, желтый авантюрин, бенитоит, золотистый берилл, биксбит, карнеол, халцедон, синий халцедон, хризоберилл, хризоколла, хризопраз, цитрин, коралл, диаспор, дюмортьерит, изумруд, гессонит, иолит, яшма, кунцит, кианит, лазурит, малахит, зеленый оникс, красный оникс, перидот, пренит, пирит, лимонный кварц, дымчатый кварц, родокрозит, рубин, розовый сапфир, фиолетовый сапфир, желтый сапфир, серпентин, спессартит, сфен, солнечный камень, танзанит, тигровый глаз, топаз, турмалин. Цаворит, бирюза, циркон и цоизит . Остальные 16 классов, сегментированные с помощью пороговой обработки Оцу по уровням серого, включали: александрит, альмандин, аквамарин, кровавик, голубой кружевной агат, хромовый диопсид, алмаз, флюорит, черный оникс, пироп, кварцевое пиво, рутилированный кварц, родолит, родонит, синий сапфир и содалит . Было подсчитано, что пороговая обработка Оцу на основе насыщенности дала в среднем 77% хорошо сегментированных тестовых изображений на класс, тогда как пороговая обработка Оцу по уровням серого дала в среднем 76% хорошо сегментированных тестовых изображений на класс.
3.2. Сравнение характеристик и алгоритмов
Было проведено сравнение семи различных алгоритмов машинного обучения, каждый из которых использовал 33 различных метода извлечения признаков, что в общей сложности дало следующие результаты:7×33=231Были исследованы различные комбинации. Также была проведена классификация с использованием глубокого обучения на основе ResNet-18 и ResNet-50. Алгоритм, обеспечивший наивысшую точность на ранее не встречавшихся изображениях, был основан на алгоритме Random Forest с использованием восьмибинной цветовой гистограммы RGB и локального бинарного шаблона с восемью точками радиусом один, с точностью 69,4% и временем тестирования 0,0165 с. Эта точность оказалась выше, чем у группы экспертов, которая достигла точности 42,6–66,9% за 42–175 мин.
В таблице 2 представлены результаты для каждого алгоритма машинного обучения. Точность тестирования и временные затраты каждого геммолога из экспертной группы указаны в таблице 3. Результаты для наиболее точного алгоритма для каждого метода извлечения признаков представлены в таблице 4. На рисунке 8 показана точность тестирования всех комбинаций, сгруппированных по алгоритмам по горизонтальной оси. Каждая комбинация показана в виде закрашенного круга, цвет которого соответствует методу извлечения признаков.
Кроме того, распределение результатов по алгоритмам представлено в виде диаграммы размаха с черными горизонтальными линиями, соответствующими максимальным/минимальным значениям, серым прямоугольником между 25-м и 75-м процентилями и изменением оттенка серого на медиане распределения. В некоторых случаях (например, дерево решений) некоторые значения считаются выбросами и выходят за пределы диаграмм размаха. Сплошная горизонтальная линия на уровне точности тестирования 66,9% указывает на эффективность наиболее точного геммолога.
Таблица 2. Точность, точность топ-5, время обучения и тестирования наиболее точного классификатора для каждого алгоритма машинного обучения. Метод опорных векторов потребовал значительно больше времени на обучение и тестирование, чем другие алгоритмы. Следует отметить, что в отличие от других алгоритмов, ResNet обучались и тестировались на графическом процессоре (GPU), а не на центральном процессоре (CPU).
| Алгоритм | Точность | Топ-5 показателей точности | Время тренировки в секундах | Время тестирования в секундах |
|---|---|---|---|---|
| Случайный лес | 69,4% | 94,4% | 39.81 | 0,0165 |
| Логистическая регрессия | 68,7% | 92,6% | 17.79 | 0,0008 |
| Метод опорных векторов | 66,9% | 86,3% | 1881.36 | 0,5459 |
| ResNet50 | 63,4% | 91,5% | 449.09 | 4.5244 |
| Наивный Байес | 62,7% | 77,8% | 0,54 | 0,0281 |
| ResNet18 | 62,0% | 89,4% | 293.05 | 2.2119 |
| Линейный дискриминантный анализ | 59,9% | 94,0% | 3.71 | 0,0007 |
| K-Ближайший сосед | 54,6% | 85,9% | 1.09 | 0,0479 |
| Дерево решений | 46,5% | 73,9% | 0,56 | 0,0002 |
Таблица 3. Точность и время тестирования трех экспертов-геммологов, классифицировавших 284 ранее не виденных изображения, значительно различались.
| Эксперт | Точность | Время испытаний |
|---|---|---|
| Геммолог 1 | 66,9% | 175 мин или 10 500 с |
| Геммолог 2 | 46,8% | 97 мин или 5820 с |
| Геммолог 3 | 42,6% | 42 мин или 2520 с |
Таблица 4. Точность, точность Top-5, время обучения и тестирования наиболее точного классификатора для каждого метода извлечения признаков. Система, основанная на 8-биновой RGB-гистограмме и LBP с 8 точками радиусом 1, показала наивысшую точность 69,4%. Наивысшая точность Top-5 96,5% была достигнута системой, использующей 4-биновые и 8-биновые RGB-гистограммы и LBP с 8 точками радиусом 1. Следует отметить, что в отличие от других алгоритмов, ResNet обучались и тестировались на графическом процессоре (GPU), а не на центральном процессоре (CPU).
| Метод | Точность | Топ-5 показателей точности | Тренинг (и) |
Тест (ы) |
|---|---|---|---|---|
| RGB-изображение с 8-битной гистограммой и LBP-изображение, 8 точек, радиус 1. | 69,4% | 94,4% | 39.81 | 0,0165 |
| RGB-изображение с 4-битной гистограммой и LBP, 8 точек, радиус 1. | 69,0% | 93,7% | 33.78 | 0,0164 |
| RGB 4/8-биновая гистограмма и LBP, 8 точек, радиус 1 | 68,7% | 96,5% | 60.73 | 0,0181 |
| RGB-изображение с 8-битной гистограммой и LBP, 16 точек, радиус 1. | 68,7% | 95,4% | 43.33 | 0,0168 |
| RGB 4/8-биновая гистограмма и LBP, 8 точек, радиус 1 и 24 точки, радиус 3 |
68,7% | 92,6% | 17.79 | 0,0008 |
| Корреляция RGB-изображений в 8-битном формате и GLCM | 67,6% | 94,4% | 38.42 | 0,0162 |
| RGB-изображение с 8-битной гистограммой и LBP-изображение, 8 точек, радиус 3. | 67,6% | 94,4% | 78.96 | 0,0176 |
| 8-биновая гистограмма RGB и несходство GLCM | 67,3% | 94,0% | 43.60 | 0,0190 |
| RGB-изображение с 8-битной гистограммой и LBP-изображение, 24 точки, радиус 3. | 66,9% | 94,7% | 66.56 | 0,0169 |
| RGB-изображение с 8-битной гистограммой и LBP, 24 точки, радиус 1. | 66,9% | 86,3% | 1881.36 | 0,5459 |
| 8-биновая гистограмма RGB и энергетическая модель GLCM. | 66,5% | 96,1% | 37.92 | 0,0164 |
| HSV 8-биновая гистограмма и LBP, 8 точек, радиус 1 | 66,5% | 93,3% | 82.35 | 0,0484 |
| 8-биновая RGB-история и GLCM ASM | 66,2% | 94,7% | 39.65 | 0,0164 |
| RGB-изображение с 8-битной гистограммой и LBP-изображение, 16 точек, радиус 3. | 65,8% | 92,6% | 14.97 | 0,0008 |
| 8-битная гистограмма RGB и контрастность GLCM | 65,5% | 96,1% | 48.90 | 0,0164 |
| RGB-гистограмма с 4-битной цветовой шкалой и текстура Харалика. | 65,5% | 95,1% | 77.00 | 0,0262 |
| HSV 8-биновая гистограмма и текстура Харалика | 65,5% | 93,7% | 55.76 | 0,0100 |
| 8-биновая RGB-история и текстура Харалика. | 65,5% | 93,7% | 69.33 | 0,0176 |
| RGB 8-бинная история. и гомоген GLCM. | 65,1% | 95,1% | 38.59 | 0,0165 |
| RGB 4- и 8-биновая гистограмма. | 65,1% | 94,0% | 45.88 | 0,0163 |
| RGB 4-биновая гистограмма. | 64,8% | 95,4% | 26.42 | 0,0164 |
| HSV 4 и 8-биновый hist. | 64,4% | 93,3% | 57.64 | 0,0166 |
| CIELAB 4 и 8-биновая гистограмма. | 64,1% | 94,0% | 31.49 | 0,0196 |
| CIELAB 8-биновая гистограмма. | 64,1% | 93,7% | 26.91 | 0,0165 |
| HSV 8-bin hist. | 63,4% | 95,1% | 52.25 | 0,0165 |
| ResNet50 | 63,4% | 91,5% | 449.09 | 4.5244 |
| RGB 8-биновая гистограмма. | 62,7% | 87,0% | 1387.63 | 0.4420 |
| ResNet18 | 62,0% | 89,4% | 293.05 | 2.2119 |
| HSV 4-биновая гистограмма и LBP, 8 точек, радиус 1 | 60,9% | 91,2% | 46.68 | 0,0176 |
| HSV 4-биновая гистограмма и текстура Харалика | 57,7% | 87,3% | 580.56 | 0.3129 |
| HSV 4-bin hist. | 57,0% | 88,7% | 32.88 | 0,0167 |
| CIELAB 4-биновая гистограмма. | 56,7% | 91,5% | 21.12 | 0,0163 |
| Центр кластера K-средних без фонового шума CIELAB | 47,9% | 87,7% | 20.95 | 0,0180 |
| Центр кластера K-средних без фонового RGB | 44,0% | 86,3% | 0,17 | 0,0002 |
| Центр кластера K-средних без фонового сигнала HSV | 43,0% | 81,3% | 17.57 | 0,0165 |

Рисунок 8. Результаты всех комбинаций алгоритмов и методов извлечения признаков, сгруппированные по алгоритмам. Каждая комбинация представлена цветным кругом, а сводка распределения по алгоритмам отображается в виде статистической диаграммы размаха (подробнее см. в тексте). Наиболее точные результаты показали алгоритмы Random Forest и Logistic Regression, оба из которых превзошли результаты лучшего геммолога в группе экспертов.
Матрицы ошибок наиболее точного алгоритма и лучшего геммолога представлены на рисунках 9 и 10.

Рисунок 9. Матрица ошибок наиболее точной комбинации, т.е. алгоритма случайного леса с 8-бинарной цветовой гистограммой RGB и локальным бинарным шаблоном с 8 точками радиусом 1. Следует отметить сложность различения между яшмой и дымчатым кварцем, а также между альмандином и пиропом.

Рисунок 10. Матрица ошибок лучшего геммолога, демонстрирующая наихудшую способность различать драгоценные камни схожего цвета, а именно: сапфир пурпурный и аметист; гессонит и спессартит; кварцевый бер и гессонит.
4. Обсуждение
Результаты сегментации фона показали, что пороговая обработка Оцу на основе насыщенности была более эффективна для отделения ярко окрашенных драгоценных камней от нейронного фона и теней, тогда как пороговая обработка Оцу на основе уровней серого дала лучшие результаты для многоцветных или низконасыщенных драгоценных камней. Сложность заключалась в отделении некоторых прозрачных светлых драгоценных камней, таких как аквамарин, от фона, поскольку цвет фона просвечивал сквозь камень.
Одним из возможных решений, при наличии инфракрасных изображений, было бы одновременное выполнение сегментации с использованием изображений с камеры и инфракрасных изображений, поскольку ожидается, что драгоценный камень и его фон будут обладать различными характеристиками пропускания [91].
Выбор метода извлечения признаков и алгоритма машинного обучения в значительной степени способствовал надежности полученных результатов, как показано на рисунке 8 и в таблице 4. Наиболее точная комбинация была основана на алгоритме Random Forest, восьмибитной RGB-гистограмме и алгоритме LBP с восемью точками радиусом один, что обеспечило точность 69,4% в течение 0,0165 с.
Еще одной особенностью результатов Random Forest было то, что распределение было более компактным, чем у логистической регрессии и SVM, даже с учетом трех результатов, рассматриваемых как выбросы. Это оказалось более надежным, чем у самого точного геммолога в экспертной группе (точность теста до 66,9% за 175 мин или 10 500 с) для классификации 68 категорий изображений драгоценных камней как по точности, так и по времени.
Превосходство по времени было ожидаемым, поскольку алгоритмы обрабатывают данные очень быстро, в то время как людям требуется время, чтобы рассмотреть изображения, оценить их характеристики и затем определить категорию драгоценного камня, к которой они относятся. Превосходные результаты в классификации, хотя и с небольшим отрывом (69,4% против 66,9%), оказались интересными и видны на матрицах ошибок, показанных на рисунках 9 и 10. В обеих матрицах диагональ, соответствующая правильным прогнозам, содержит большинство прогнозов, в то время как ошибки показаны за пределами диагонали.
Некоторые из неверных прогнозов были общими как для эксперта, так и для алгоритма (например, номер 2 внизу слева, соответствующий циркону и аквамарину), но другие не были общими и были неверно предсказаны только одним из них (например, оба случая внизу слева: янтарь/спессартит или амазонит/бирюза). При дальнейшем сравнении наиболее точной комбинации ( рис. 9 ) с экспертным ( рис. 10 ) было обнаружено, что алгоритм обладает большей способностью разделять драгоценные камни схожих цветов.
Тем не менее, геммологи легко распознавали драгоценные камни с уникальными цветовыми узорами, такими как зеленые полосы на малахите, которые алгоритмы не различали. Изучение альтернативных методов извлечения цветовых и текстурных признаков, таких как дескрипторы преобразования признаков, инвариантные к цветовой шкале [ 92 ], может повысить точность. Кроме того, следует отметить значительную разницу между тремя экспертами, причем результаты двух последних были ближе к худшим результатам большинства алгоритмов. Тем не менее, лучший геммолог потратил гораздо больше времени, чем двое других. Следует также отметить, что базовый результат, то есть случайный выбор класса для любого заданного изображения, составил бы 1/68 = 1,47%.
Наивысшая точность (96,5%), входящая в пятерку лучших, была достигнута моделью случайного леса с использованием четырех- и восьмибинных RGB-гистограмм и локального бинарного шаблона (LBP) с восемью точками радиусом один. Цветовые гистограммы оказались значительно эффективнее кластеризации методом K-средних при извлечении цветовых признаков. В целом, RGB-пространство показало более высокую точность, чем HSV или CIELAB. Более низкая точность для HSV может быть связана с циклическим характером канала оттенка. Наблюдалась несогласованность в извлечении цветовых признаков для некоторых красных драгоценных камней, таких как оникс красный, поскольку оттенок некоторых пикселей был близок к нулю, а других — к единице.
Включение текстурных признаков, в частности локального бинарного шаблона, повысило способность алгоритмов различать драгоценные камни схожих цветов. Время обучения было наименьшим для систем, использующих нефоновые цвета кластеризации методом K-средних, за ними следовали системы, использующие четырехбинные цветовые гистограммы, тогда как системы, основанные на восьмибинных цветовых гистограммах, требовали наибольшего времени обучения.
Добавление текстурных признаков или одновременное использование четырех- и восьмидиапазонных цветовых гистограмм не привело к значительному увеличению времени обучения. Среди всех алгоритмов машинного обучения алгоритм Random Forest показал наивысшую точность. Время обучения и тестирования оказалось значительно больше для алгоритма Support Vector Machine (до 1943,02 с и 0,5918 с соответственно), чем для других алгоритмов (до 83,26 с и 0,1215 с соответственно). Тем не менее, время тестирования было значительно короче, чем требовалось геммологам (минимум 42 мин или 2520 с).
Одним из неожиданных результатов стало более низкое качество работы обеих архитектур ResNet по сравнению с алгоритмами Random Forest, Logistic Regression и Support Vector Machine. Более низкая производительность может быть обусловлена ограниченным количеством использованных обучающих изображений. Кроме того, следует отметить, что сравнение не совсем корректно, поскольку ResNet обучались непосредственно на изображениях, а другие алгоритмы машинного обучения — на извлеченных признаках. Это может означать, что изображения сложнее различать, чем извлеченные признаки. Более того, ResNet были предварительно обучены на наборе данных ImageNet, и только последний полносвязный слой был адаптирован для классификации изображений драгоценных камней, в то время как классификаторы машинного обучения были специально разработаны для этой задачи.
Одним из главных ограничений является невозможность идентификации драгоценных камней, не относящихся к предопределенным категориям. Ожидается, что система будет неспособна отделить природные драгоценные камни от синтетических, имеющих одинаковые оптические свойства. Для выполнения более сложного анализа драгоценных камней необходимо включить дополнительные данные, такие как показатель преломления, удельный вес и спектроскопические, флуоресцентные или химические данные лабораторных приборов [2]. В связи с постоянным появлением новых методов обработки драгоценных камней цветом, необходимо периодически обновлять систему для практического применения.
Несмотря на то, что в исследование был включен ограниченный набор драгоценных камней, полученные результаты убедительно доказали возможность применения компьютерного зрения для классификации драгоценных камней.
5. Выводы
Насколько известно авторам, это было первое исследование, в котором сравнивалась эффективность методологии, основанной на компьютерном зрении, с результатами работы опытных геммологов при классификации 68 классов драгоценных камней на основе изображений. Количество классов имеет важное значение, поскольку следует учитывать, что случайное предположение обеспечило бы точность 1/68 или 1,47%. В свою очередь, эксперт-человек показал точность 66,9%, что было превзойдено лучшим подходом компьютерного зрения с результатом 69,4%. Хотя разница в точности относительно невелика, разница во времени была на несколько порядков, как и следовало ожидать. Таким образом, было продемонстрировано, что подходы компьютерного зрения могут быть успешно применены для классификации драгоценных камней на основе изображений. Хотя один из экспертов показал высокую точность, два других эксперта сообщили о гораздо более низких уровнях точности (42,6%, 46,8%), которые были значительно ниже медианных значений всех алгоритмов, за исключением дерева решений.
Помимо превосходных результатов компьютерного зрения с точки зрения точности и времени, этот подход не требует подготовки образцов или разрушения материалов, что иногда делают геммологи при идентификации драгоценных камней.
В дальнейших исследованиях следует рассмотреть: (а) включение более широкого спектра драгоценных камней, возможно, с добавлением тех, которые были отброшены в данном исследовании, а также других; это может снизить точность, поскольку некоторые камни могут иметь общие характеристики; (б) рассмотрение большего количества изображений для обучения, проверки и тестирования; это повлияет на обучение архитектуры ResNet и потенциально может улучшить ее производительность; (в) рассмотрение других архитектур глубокого обучения; (г) рассмотрение, помимо экспертов-геммологов, людей, которых можно обучить распознаванию меньшего спектра драгоценных камней, например, различению изумрудов и цаворитов; (д) в качестве заключительного этапа можно рассмотреть применение методов компьютерного зрения, аналогичных разработанным в данной работе, для исследования возможности различения высококачественных драгоценных камней, камней низкого качества и даже подделок.
Литература
- Hurrell, K.; Johnson, M.L. Gemstones: A Complete Color Reference for Precious and Semiprecious Stones of the World; Chartwell Books: New York, NY, USA, 2016; p. 305. [Google Scholar]
- Breeding, C. Developments in Gemstone Analysis Techniques and Instrumentation During the 2000s. Gems Gemol. 2010, 46, 241–257. [Google Scholar] [CrossRef]
- Liddicoat, R.T. Developing the Powers of Observation in Gem Testing. Gems Gemol. 1962, 10, 291–319. [Google Scholar]
- Sturman, D.B. A new approach to the teaching and use of the refractometer. J. Gemmol. 2010, 32, 74–89. [Google Scholar] [CrossRef]
- Devouard, B.; Notari, F. The Identification of Faceted Gemstones: From the Naked Eye to Laboratory Techniques. Elements 2009, 5, 163–168. [Google Scholar] [CrossRef]
- Anderson, B.W.; Payne, J. The Spectroscope and Gemmology; Mitchell, R.K., Ed.; GemStone Press: Nashville, TN, USA, 1999. [Google Scholar]
- Thibault, N.W. A simple dichroscope. Am. Mineral. 1940, 25, 88–90. [Google Scholar]
- Karampelas, S.; Kiefert, L.; Bersani, D.; Vandenabeele, P. Gem Analysis. In Gems and Gemmology; Springer: Cham, Switzerland, 2020; pp. 39–66. [Google Scholar]
- Church, A.H. Notes on the Specific Gravity of Precious Stones. Geol. Mag. 1875, 2, 320–328. [Google Scholar] [CrossRef]
- Fritsch, E.; Stockton, C.M. Infrared Spectroscopy in Gem Identification. Gems Gemol. 1987, 23, 18–26. [Google Scholar] [CrossRef]
- Jenkins, A.L.; Larsen, R.A. Gemstone Identification Using Raman Spectroscopy. Spectroscopy 2004, 19, 20–25. [Google Scholar]
- Bersani, D.; Lottici, P.P. Applications of Raman spectroscopy to gemology. Anal. Bioanal. Chem. 2010, 397, 2631–2646. [Google Scholar] [CrossRef]
- Kiefert, L.; Karampelas, S. Use of the Raman spectrometer in gemmological laboratories: Review. Spectrochim. Acta Part A 2011, 80, 119–124. [Google Scholar] [CrossRef]
- He, T. The Applications of Ultraviolet Visible Absorption Spectrum Detection Technology in Gemstone Identification. In Proceedings of the 5th International Conference on Materials Engineering for Advanced Technologies (ICMEAT 2016), Quebec, QC, Canada, 5–6 August 2016; DEStech Publications: Lancaster, PA, USA, 2016; pp. 106–109. [Google Scholar]
- Ponahlo, J. Cathodoluminescence as a Tool in Gemstone Identification. In Cathodoluminescence in Geosciences; Springer: Berlin, Germany, 2000; pp. 479–500. [Google Scholar]
- Hänni, H.A. Advancements in gemmological instrumentation over the last 30 years. J. Gemmol. Assoc. Hong Kong 2009, 30, 14–16. [Google Scholar]
- Abduriyim, A.; Kitawaki, H. Applications of Laser Ablation–Inductively Coupled Plasma–Mass Spectrometry (LA-ICP-MS) To Gemology. Gems Gemol. 2006, 42, 98–118. [Google Scholar] [CrossRef]
- Tsai, T.-H.; D’Haenens-Johansson, U.F.S. Rapid gemstone screening and identification using fluorescence spectroscopy. Appl. Opt. 2021, 60, 3412–3421. [Google Scholar] [CrossRef] [PubMed]
- Thompson, S.; Fueten, F.; Bockus, D. Mineral identification using artificial neural networks and the rotating polarizer stage. Comput. Geosci. 2001, 27, 1081–1089. [Google Scholar] [CrossRef]
- Baykan, N.A.; Yilmaz, N. Mineral identification using color spaces and artificial neural networks. Comput. Geosci. 2010, 36, 91–97. [Google Scholar] [CrossRef]
- Izadi, H.; Sadri, J.; Bayati, M. An intelligent system for mineral identification in thin sections based on a cascade approach. Comput. Geosci. 2017, 99, 37–49. [Google Scholar] [CrossRef]
- Borges, H.P.; de Aguiar, M.S. Mineral Classification Using Machine Learning and Images of Microscopic Rock Thin Section. In Proceedings of the 18th Mexican Conference on Artificial Intelligence, MICAI 2019, Xalapa, Mexico, 28 October–1 November 2019; IEEE: New York, NY, USA, 2019; pp. 63–76. [Google Scholar]
- Maitre, J.; Bouchard, K.; Bédard, P. Mineral grains recognition using computer vision and machine learning. Comput. Geosci. 2019, 130, 84–93. [Google Scholar] [CrossRef]
- Zhang, Y.; Li, M.; Han, S.; Ren, Q.; Shi, J. Intelligent Identification for Rock-Mineral Microscopic Images Using Ensemble Machine Learning Algorithms. Sensors 2019, 19, 3914. [Google Scholar] [CrossRef]
- Ślipek, B.; Młynarczuk, M. Application of pattern recognition methods to automatic identification of microscopic images of rocks registered under different polarization and lighting conditions. Geol. Geophys. Environ. 2013, 39, 373–384. [Google Scholar] [CrossRef][Green Version]
- Chatterjee, S. Vision-based rock-type classification of limestone using multi-class support vector machine. Appl. Intell. 2013, 39, 14–27. [Google Scholar] [CrossRef]
- Młynarczuk, M.; Górszczyk, A.; Ślipek, B. The application of pattern recognition in the automatic classification of microscopic rock images. Comput. Geosci. 2013, 60, 126–133. [Google Scholar] [CrossRef]
- Perez, C.A.; Saravia, J.A.; Navarro, C.F.; Schulz, D.A.; Aravena, C.M.; Galdames, F.J. Rock lithological classification using multi-scale Gabor features from sub-images, and voting with rock contour information. Int. J. Miner. Process. 2015, 144, 56–64. [Google Scholar] [CrossRef]
- Xu, Z.; Ma, W.; Lin, P.; Shi, H.; Pan, D.; Liu, T. Deep learning of rock images for intelligent lithology identification. Comput. Geosci. 2021, 154, 104799. [Google Scholar] [CrossRef]
- Maula, I.; Amrizal, V.; Setianingrum, H.; Hakiem, N. Development of a Gemstone Type Identification System Based on HSV Space Colour Using an Artificial Neural Network Back Propagation Algorithm. In Advances in Intelligent Systems Research, Proceedings of the International Conference on Science and Technology (ICOSAT 2017), Jakarta, Indonesia, 10 August 2017; Atlantis Press: Dordrecht, The Netherlands, 2017; pp. 104–109. [Google Scholar]
- Ostreika, A.; Pivoras, M.; Misevičius, A.; Skersys, T.; Paulauskas, L. Classification of Objects by Shape Applied to Amber Gemstone Classification. Appl. Sci. 2021, 11, 1024. [Google Scholar] [CrossRef]
- Ostreika, A.; Pivoras, M.; Misevičius, A.; Skersys, T.; Paulauskas, L. Classification of Amber Gemstone Objects by Shape. Preprints 2020, 2020080336. [Google Scholar] [CrossRef]
- Rios, C.; Saito, R. Researching of the Deep Neural Network for Amber Gemstone Classification. Master’s Thesis, Universitat Politècnica de Catalunya, Barcelona, Spain, 2018. [Google Scholar]
- Sinkevičius, S.; Lipnickas, A.; Rimkus, K. Multiclass amber gemstones classification with various segmentation and committee strategies. In Proceedings of the 2013 IEEE 7th International Conference on Intelligent Data Acquisition and Advanced Computing Systems (IDAACS), Berlin, Germany, 12–14 September 2013; IEEE: New York, NY, USA, 2013; pp. 304–308. [Google Scholar]
- Liu, X.; Mao, J. Research on Key Technology of Diamond Particle Detection Based on Machine Vision. In Proceedings of the 2018 2nd International Conference on Electronic Information Technology and Computer Engineering (EITCE 2018), Shanghai, China, 12–14 October 2018; EDP Sciences: Les Ulis, France, 2018; Volume 232, p. 02059. [Google Scholar]
- Sinkevičius, S.; Lipnickas, A.; Rimkus, K. Amber Gemstones Sorting By Colour. Elektron. Ir Elektrotechnika 2017, 23, 10–14. [Google Scholar] [CrossRef]
- Zhang, S.; Guo, Y. Measurement of Gem Colour Using a Computer Vision System: A Case Study with Jadeite-Jade. Minerals 2021, 11, 791. [Google Scholar] [CrossRef]
- Wang, D.; Bischof, L.; Lagerstrom, R.; Hilsenstein, V.; Hornabrook, A.; Hornabrook, G. Automated Opal Grading by Imaging and Statistical Learning. IEEE Trans. Syst. Man Cybern. Syst. 2016, 46, 185–201. [Google Scholar] [CrossRef]
- Loesdau, M. Towards a Computer Vision Based Quality Assessment of Tahitian Pearls. Ph.D. Thesis, Université de la Polynésie Française, Puna’auia, French Polynesia, 2017. [Google Scholar]
- Gemstones Images. Available online: https://www.kaggle.com/lsind18/gemstones-images (accessed on 27 April 2021).
- Otsu, N. A Threshold Selection Method from Gray-Level Histograms. IEEE Trans. Syst. Man Cybern. 1979, 9, 62–66. [Google Scholar] [CrossRef]
- Nixon, M.S.; Aguado, A.S. (Eds.) Feature Extraction & Image Processing for Computer Vision, 3rd ed.; Academic Press: Oxford, UK, 2013. [Google Scholar]
- Liu, Y.; Zhou, X.; Ma, W.-Y. Extracting Texture Features from Arbitrary-Shaped Regions for Image Retrieval. In Proceedings of the 2004 IEEE International Conference on Multimedia and Expo (ICME), Taipei, Taiwan, 27–30 June 2004; Volume 3, pp. 1891–1894. [Google Scholar]
- Bianconi, F.; Fernández, A.; González, E.; Ribas, F. Texture Classification Through Combination of Sequential Colour Texture Classifiers. In Progress in Pattern Recognition, Image Analysis and Applications; Rueda, L., Mery, D., Kittler, J., Eds.; Springer: Berlin/Heidelberg, Germany, 2007; pp. 231–240. [Google Scholar]
- Belalia, A.; Belloulata, K.; Kpalma, K. Region-Based Image Retrieval Using Shape-Adaptive DCT. Int. J. Multimed. Inf. Retr. 2015, 4, 261–276. [Google Scholar] [CrossRef]
- Feizi, A. High-Level Feature Extraction for Classification and Person Re-Identification. IEEE Sens. J. 2017, 17, 7064–7073. [Google Scholar] [CrossRef]
- Kittler, J. Feature Selection and Extraction; Academic Press: New York, NY, USA, 1986; Chapter 3; pp. 59–83. [Google Scholar]
- Cheng, H.D.; Jiang, X.H.; Sun, Y.; Wang, J. Color image segmentation: Advances and prospects. Pattern Recognit. 2001, 34, 2259–2281. [Google Scholar] [CrossRef]
- Gevers, T.; Gijsenij, A.; van der Weijer, J.; Geusebroek, J.-M. Color Image Formation. In Color in Computer Vision; Kriss, M.A., MacDonald, L.W., Eds.; Wiley: Hoboken, NJ, USA, 2012; pp. 26–45. [Google Scholar]
- Gonzalez, R.C.; Woods, R.E. Digital Image Processing; Pearson Prentice Hall: Upper Saddle River, NJ, USA, 2008. [Google Scholar]
- Angulo, J. Morphological color image simplification by Saturation-controlled regional levelings. Int. J. Pattern Recognit. Artif. Intell. 2006, 20, 1207–1223. [Google Scholar] [CrossRef]
- Reyes-Aldasoro, C.C.; Björndahl, M.A.; Akerman, S.; Ibrahim, J.; Griffiths, M.K.; Tozer, G.M. Online chromatic and scale-space microvessel-tracing analysis for transmitted light optical images. Microvasc. Res. 2012, 84, 330–339. [Google Scholar] [CrossRef] [PubMed][Green Version]
- Smith, A.R. Color gamut transform pairs. ACM SIGGRAPH 1978, 12, 12–19. [Google Scholar] [CrossRef]
- Hartigan, J.A.; Wong, M.A. A K-Means Clustering Algorithm. Appl. Stat. 1979, 28, 100–108. [Google Scholar] [CrossRef]
- Funt, B.V.; Finlayson, G.D. Color Constant Color Indexing. IEEE Trans. Pattern Anal. Mach. Intell. 1995, 17, 522–529. [Google Scholar] [CrossRef]
- Reyes-Aldasoro, C.C. Biomedical Image Analysis Recipes in MATLAB: For Life Scientists and Engineers; Wiley-Blackwell: Chichester, UK, 2015. [Google Scholar]
- Haralick, R.M.; Shanmugam, K.; Dinstein, I. Textural Features for Image Classification. IEEE Trans. Syst. Man Cybern. 1973, 3, 610–621. [Google Scholar] [CrossRef]
- Bigun, J. Multidimensional Orientation Estimation with Applications to Texture Analysis and Optical Flow. IEEE Trans. Pattern Anal. Mach. Intell. 1991, 13, 775–790. [Google Scholar] [CrossRef]
- Bovik, A.C.; Clark, M.; Geisler, W.S. Multichannel Texture Analysis Using Localized Spatial Filters. IEEE Trans. Pattern Anal. Mach. Intell. 1990, 12, 55–73. [Google Scholar] [CrossRef]
- Cross, G.R.; Jain, A.K. Markov Random Field Texture Models. IEEE Trans. Pattern Anal. Mach. Intell. 1983, 5, 25–39. [Google Scholar] [CrossRef]
- Reyes-Aldasoro, C.C.; Bhalerao, A. The Bhattacharyya Space for Feature Selection and Its Application to Texture Segmentation. Pattern Recogn. 2006, 39, 812–826. [Google Scholar] [CrossRef]
- Tai, C.; Baba-Kishi, K. Microtexture Studies of PST and PZT Ceramics and PZT Thin Film by Electron Backscatter Diffraction Patterns. Textures Microstruct. 2002, 35, 71–86. [Google Scholar] [CrossRef]
- Carrillat, A.; Randen, T.; Sonneland, L.; Elvebakk, G. Seismic Stratigraphic Mapping of Carbonate Mounds using 3D Texture Attributes. In Proceedings of the 64th EAGE Conference & Exhibition, Florence, Italy, 27–30 May 2002; European Association of Geoscientists and Engineers: Houten, The Netherlands, 2002. [Google Scholar]
- Bianconi, F.; González, E.; Fernández, A.; Saetta, S.A. Automatic Classification of Granite Tiles Through Colour and Texture Features. Expert Syst. Appl. 2012, 39, 11212–11218. [Google Scholar] [CrossRef]
- Reyes Aldasoro, C.C.; Bhalerao, A. Volumetric Texture Segmentation by Discriminant Feature Selection and Multiresolution Classification. IEEE Trans. Med. Imaging 2007, 26, 1–14. [Google Scholar] [CrossRef] [PubMed]
- Kovalev, V.A.; Petrou, M.; Bondar, Y.S. Texture Anisotropy in 3D Images. IEEE Trans. Image Process. 1999, 8, 346–360. [Google Scholar] [CrossRef] [PubMed]
- Kather, J.N.; Weis, C.A.; Bianconi, F.; Melchers, S.M.; Schad, L.R.; Gaiser, T.; Marx, A.; Zollner, F. Multi-class Texture Analysis in Colorectal Cancer Histology. Sci. Rep. 2016, 6, 27988. [Google Scholar] [CrossRef] [PubMed]
- Ojala, T.; Pietikäinen, M.; Harwood, D. A comparative study of texture measures with classification based on featured distributions. Pattern Recognit. 1996, 29, 51–59. [Google Scholar] [CrossRef]
- Chawla, N.V.; Bowyer, K.W.; Hall, L.O.; Kegelmeyer, W.P. SMOTE: Synthetic Minority Over-sampling Technique. J. Artif. Intell. Res. 2002, 16, 321–357. [Google Scholar] [CrossRef]
- Bishop, C.M. Linear models for classification. In Pattern Recognition and Machine Learning; Jordan, M., Kleinberg, J., Schölkopf, B., Eds.; Springer: New York, NY, USA, 2006; pp. 179–224. [Google Scholar]
- Li, T.; Zhu, S.; Ogihara, M. Using discriminant analysis for multi-class classification: An experimental investigation. Knowl. Inf. Syst. 2006, 10, 453–472. [Google Scholar] [CrossRef]
- Cover, T.M.; Hart, P.E. Nearest Neighbor Pattern Classification. Knowl. Inf. Syst. 1967, 13, 21–27. [Google Scholar] [CrossRef]
- Breiman, L.; Friedman, J.H.; Olshen, R.A.; Stone, C.J. Review of Classification and Regression Trees. Biometrics 1984, 40, 874. [Google Scholar]
- Breiman, L. Random Forests. Mach. Learn. 2001, 45, 5–32. [Google Scholar] [CrossRef]
- Criminisi, A.; Shotton, J. Decision Forests for Computer Vision and Medical Image Analysis; Springer: Cham, Switzerland, 2013; 366p. [Google Scholar]
- Taheri, S.; Mammadov, M. Learning the Naive Bayes Classifier with Optimization Models. Rocznik 2013, 23, 787–795. [Google Scholar] [CrossRef]
- Crammer, K.; Singer, Y. On the Algorithmic Implementation of Multiclass Kernel-based Vector Machines. J. Mach. Learn. Res. 2001, 2, 265–292. [Google Scholar]
- Feurer, M.; Hutter, F. Hyperparameter Optimization. In Automated Machine Learning; Springer: Cham, Switzerland, 2019; pp. 3–33. [Google Scholar]
- Goodfellow, I.; Bengio, Y.; Courville, A. Deep Learning; MIT Press: Cambridge, MA, USA, 2016; Available online: http://www.deeplearningbook.org (accessed on 31 December 2021).
- LeCun, Y.; Bengio, Y.; Hinton, G. Deep Learning. Nature 2015, 521, 436–444. [Google Scholar] [CrossRef]
- Russakovsky, O.; Deng, J.; Su, H.; Krause, J.; Satheesh, S.; Ma, S.; Huang, Z.; Karpathy, A.; Khosla, A.; Bernstein, M.; et al. ImageNet Large Scale Visual Recognition Challenge. Int. J. Comput. Vis. 2015, 115, 211–252. [Google Scholar] [CrossRef]
- Shao, L.; Zhu, F.; Li, X. Transfer Learning for Visual Categorization: A Survey. IEEE Trans. Neural Netw. Learn. Syst. 2005, 26, 1019–1034. [Google Scholar] [CrossRef]
- Rezende, E.; Ruppert, G.; Carvalho, T.; Ramos, F.; de Geus, P. Malicious Software Classification Using Transfer Learning of ResNet-50 Deep Neural Network. In Proceedings of the 2017 16th IEEE International Conference on Machine Learning and Applications (ICMLA), Cancun, Mexico, 18–21 December 2017; IEEE: New York, NY, USA, 2017; pp. 1011–1014. [Google Scholar]
- Reddy, A.S.B.; Juliet, D.S. Transfer Learning with ResNet-50 for Malaria Cell-Image Classification. In Proceedings of the 2019 International Conference on Communication and Signal Processing (ICCSP), Chennai, India, 4–6 April 2019; IEEE: New York, NY, USA, 2019; pp. 945–949. [Google Scholar]
- Miglani, V.; Bhatia, M. Skin Lesion Classification: A Transfer Learning Approach Using EfficientNets. In Proceedings of the 2020 International Conference on Advanced Machine Learning Technologies and Applications (AMLTA), Jaipur, India, 13–15 February 2019; Springer: Singapore, 2020; pp. 315–324. [Google Scholar]
- He, K.; Zhang, X.; Ren, S.; Sun, J. Deep Residual Learning for Image Recognition. In Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 30 June 2016; IEEE: New York, NY, USA, 2016; pp. 770–778. [Google Scholar]
- Hossin, M.; Sulaiman, M.N. A Review of Evaluation Metrics For Data Classification Evaluations. Int. J. Data Min. Knowl. Manag. Process 2015, 5, 1–11. [Google Scholar]
- Lapin, M.; Hein, M.; Schiele, B. Top-k Multiclass SVM. arXiv 2015, arXiv:1511.06683. [Google Scholar]
- Reif, M.; Shafait, F.; Dengel, A. Prediction of Classifier Training Time Including Parameter Optimization. In KI 2011: Advances in Artificial Intelligence; Springer: Berlin, Germany, 2011; pp. 260–271. [Google Scholar]
- Tharwat, A. Classification assessment methods. Appl. Comput. Inform. 2020, 17, 168–192. [Google Scholar] [CrossRef]
- Okazawa, A.; Takahada, T.; Harada, T. Simultaneous Transparent and Non-Transparent Object Segmentation With Multispectral Scenes. In Proceedings of the 2019 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Macau, China, 3–8 November 2019; IEEE: New York, NY, USA, 2019; pp. 4977–4984. [Google Scholar]
- Verma, A.; Banerji, S.; Liu, C. A New Color SIFT Descriptor and Methods for Image Category Classification. In Proceedings of the 2010 IRAST International Congress on Computer Applications and Computational Science (CACS 2010), Singapore, 4–6 December 2010; International Research Alliance for Science and Technology: Singapore, 2010; pp. 819–822. [Google Scholar]
Авторы: Bona Hiu Yan Chow, Constantino Carlos Reyes-Aldasoro



