В случае, если у Вас имеется общее представление о функционировании компьютерного зрения, но Вы желаете получить более углублённые сведения, данная статья будет Вам полезна.

Распознавание объектов нейросетью на системах Nvidia
Статья посвящена детальному рассмотрению принципов функционирования нейронных сетей, типов алгоритмов, используемых в системах компьютерного зрения, и прогрессу, достигнутому в области распознавания за последние годы.
Будут рассмотрены сферы применения этих технологий, охватывающие медицину, геологию, транспорт, строительство и безопасность.
Статья основана на выступлении Евгения Бурнаева, кандидата физико-математических наук, доцента центра Сколтеха по научным и инженерным вычислительным технологиям для задач с большими массивами данных.
В тексте разъясняется, что искусственный интеллект представляет собой набор технологий, основанных на математике, аппаратном и программном обеспечении, призванных автоматизировать решение рутинных задач.
Происхождение ассоциации нейронных сетей с математическим подходом восходит к 40-м годам XX века, когда Питтс и Мак-Каллок предложили простейшую математическую модель нейрона. Этот период сопровождался появлением простого алгоритма обучения, что привело к фантазиям о создании человекоподобных роботов. Однако отсутствие необходимых технических возможностей привело к так называемой “первой зиме искусственного интеллекта” – сокращению финансирования и снижению интереса к этой области.
В 90-х годах интерес к искусственному интеллекту возродился благодаря появлению новых вычислительных мощностей и эффективных математических алгоритмов, позволяющих решать задачи распознавания и прогнозирования. В 2014 году технологии распознавания получили новый импульс, когда ученые научились решать подобные задачи с гораздо большей точностью.
Несмотря на значительный прогресс, системы распознавания по-прежнему сталкиваются с множеством проблем. Требуется дальнейшая доработка алгоритмов для повышения эффективности работы. В этой области есть большой потенциал для инженеров и ученых.
Компьютерное зрение
Компьютерное зрение является областью прикладной информатики, тесно связанной с искусственным интеллектом.
Его цель – воспроизвести человеческую способность распознавания объектов на изображениях, то есть понимать, где расположен текст, лицо или здание.
Анализ комбинации этих элементов позволяет человеку сделать выводы о контексте ситуации. Например, увидев голубое небо и неподвижные флаги, человек может заключить, что нет ветра и погода солнечная.
Задача систем компьютерного зрения – достичь подобного уровня понимания изображения. Критерием успеха в этой области может служить прохождение “теста Тьюринга” для компьютерного зрения: система должна быть способна отвечать на любые вопросы о изображении, на которые способен ответить человек.

Пример обнаружения объектов на фото

…и идентификации
Первые алгоритмы компьютерного зрения появились давно. Типичный пример — один из самых простых детекторов лиц Виолы — Джонса, который отмечает положение людей в кадре.


Работа алгоритма обнаружения лиц в фотокамерах
Этот алгоритм в некотором смысле необучаем (на обучаемости остановимся чуть позже). Ну а в данный момент мы наблюдаем бум алгоритмов, которые основаны на более сложных принципах.
Как устроены системы компьютерного зрения
Цифровое изображение представляет собой дискретную структуру, состоящую из элементов, называемых пикселями. Каждый пиксель характеризуется числовым значением, которое определяет его яркость или цвет.
Пиксели растрового изображения и их яркость в однобайтной кодировке
В черно-белых изображениях это значение лежит в диапазоне от 0 до 255, где 0 соответствует черному цвету, а 255 – белому. Цветные изображения обычно формируются путем комбинации трех основных цветов: красного, зеленого и синего. Этот принцип восходит к ранним методам цветной фотографии, когда изображение снималось одновременно тремя камерами с различными светофильтрами. Полученные кадры затем объединялись для создания полноцветного снимка.

Построение цветного изображения на заре фотографии

Построение цветного изображения из пикселей красного, синего и зеленого цветов
Поговорим о том, как работать с изображениями, чтобы они лучше воспринимались машиной.
Задача категоризации
Компьютерное зрение открывает возможности для решения задач распознавания, которые по сути сводятся к базовой задаче категоризации. Это означает установление меток для изображений из заранее определённого набора категорий.

Как выглядит базовая задача категоризации изображения
Данная задача может быть представлена в двух форматах: бинарной (например, присутствует ли на изображении человек) и более сложной, требующей определения нескольких типов объектов (например, классификация видов планктона на изображении).
Важно отметить, что порой классификация объекта должна сопровождаться определением его местоположения на изображении.

Виды задачи классификации
Имитируем распознавание
Допустим, имеется изображение. Инженер, занимающийся задачей распознавания, применил бы следующий подход: он начал бы с анализа содержания изображения, например, выявляя объекты овальной формы. Для этого он выбрал бы определенные признаки, значения которых были бы высоки для объектов данной формы.
Это упрощенный пример, иллюстрирующий общий принцип работы. После вычисления указанных признаков они поступают на вход классификатора. Если среди них присутствуют признаки с высокими значениями, делается вывод о наличии соответствующих объектов на изображении и определении их локализации.

Условная схема решения задачи классификации
Типичный пример классификатора — то, что называется деревом решений. Самые простые деревья мы строим в обычной жизни:

Пример простейшего дерева решений
Модели деревьев решений могут быть использованы для решения более сложных задач, например, при оценке кредитной истории заёмщика. В таких случаях количество узлов ветвления в дереве будет существенно больше.
На практике часто используется ансамбль из множества деревьев решений. Каждый из них анализирует входные данные и выдает свой результат. Затем полученные ответы агрегируются с помощью процедур, подобных голосованию.
Этот подход применим и для задач компьютерного зрения, например, для определения наличия людей на фотографии. Алгоритм будет анализировать визуальные признаки изображения и использовать дерево решений для получения окончательного ответа.

Примеры признаков, которые можно использовать для категоризации фото
Признаки и их расчет
Какие признаки могут быть использованы при анализе изображений?
В практическом анализе изображений часто применяется метод разбиения изображения на более мелкие сегменты, на которых проводится локальный анализ. К числу таких методов анализа относятся:
- Определение направлений наибольшего изменения градиентов: Данный метод позволяет выявить области с резкими перепадами яркости, что может указывать на наличие краев объектов.
- Расчет среднего значения пикселей: Среднее значение пикселей в сегменте может служить признаком для классификации объектов или фона.
- Выделение контуров объектов: Применение алгоритмов обнаружения контуров позволяет определить границы объектов на изображении.
Для реализации этих методов анализа можно использовать специальные фильтры – матрицы коэффициентов, которые «прикладываются» к изображению. При этом значения коэффициентов в матрице умножаются на значения пикселей в соответствующем сегменте изображения, а результаты умножений суммируются.
Конструкция фильтра определяет его функцию. Например, фильтр, предназначенный для выделения краев, будет генерировать новое изображение, где границы объектов будут более заметными.

Другой пример — фильтр, увеличивающий высокие частоты (резкость):

А если я возьму такую матрицу чисел, изображение, наоборот, будет размытым:

Традиционный метод создания фильтров предполагает ручную разработку на основе математических и инженерных принципов. Эксперт, опираясь на свой опыт, подбирает и комбинирует группы фильтров для решения конкретной задачи. Однако, выяснилось, что эти фильтры могут быть обучены с использованием данных.
Вместо фиксированных значений коэффициенты фильтров изначально остаются неопределенными. Применяя такие фильтры к изображению, мы объединяем процесс фильтрации и классификации в единую процедуру. Суть метода заключается в оптимизации коэффициентов фильтров для конкретной задачи на основе большой выборки данных. Цель – достижение максимального качества решения задачи, например, распознавания объектов.

Решение задачи классификации при помощи нейросети
Для настройки коэффициентов требуются: большая выборка данных, много слоев и специальное вычислительное оборудование. Поговорим о каждом из компонентов.
Большая выборка
В области компьютерного зрения произошел значительный прорыв в 2010 году с появлением датасета ImageNet, включающего 10 миллионов изображений. Создание этого датасета потребовало колоссальных усилий: каждому изображению была вручную присвоена категория объекта, представленного на нем.
В настоящее время ImageNet не является единственным доступным ресурсом размеченных изображений.

Примеры баз размеченных изображений
Наличие огромных баз данных, на которых можно обучать коэффициенты фильтров, дало старт развитию систем распознавания.
Многослойность
Рассмотрим архитектуру сверточной нейронной сети. Представим исходное изображение, к которому последовательно применяется набор фильтров первого слоя. Результатом этого шага становится преобразованная картинка. Далее к полученному изображению применяется нелинейная функция активации (Transfer Function). Последующие слои повторяют этот процесс: применение фильтров и нелинейного преобразования. Каждый такой цикл представляет собой отдельный слой нейронной сети.

Пример последовательного применения фильтров к изображению
В результате многоступенчатой нели neyной фильтрации сеть выделяет характерные признаки изображения. На выходе процесса получается набор коэффициентов, значения которых варьируются в зависимости от типа объекта на изображении. Эти коэффициенты-признаки используются в качестве входных данных для стандартного классификатора.
Создание первых систем, обученных на обширных базах данных, привело к многократному росту точности распознавания. В определенный момент точность сравнялась с человеческой и даже её превзошла. Нейросети данного типа содержат 60 миллионов параметров – это число подлежит настройке параметров фильтров.
Ниже приведена гистограмма, демонстрирующая эволюцию точности распознавания с 2010 по 2015 год. На графике также указано количество слоев в нейронной сети, необходимое для достижения определенного уровня точности.

Изменение точности и сложности нейросетей с 2010-го по 2015 год (справа — налево)
Достигнутая точность классификации в 3–3,5% превосходит показатели человеческого восприятия (4–5%). При оценке точности необходимо учитывать специфику решаемой задачи, поскольку сужение области применения может привести к повышению точности.
Качественные показатели систем распознавания зависят не только от архитектуры нейронной сети, но и от методики ее обучения. Недостаточная тщательность в обучении модели создателем может привести к значительному снижению точности распознавания. Для оценки качества обучения можно использовать методы, такие как кросс-валидация, которая позволяет моделировать ситуацию получения новых данных путем выделения части обучающей выборки для тестирования.
Аппаратное обеспечение
Для определения большого числа коэффициентов необходимы специализированные вычислительные системы, способные выполнять подобные задачи параллельно. Обычные центральные процессоры (CPU) решают их последовательно, что значительно увеличивает время обработки.
Несколько лет назад компания Nvidia, занимающаяся производством графических процессоров, заказала создателям популярного научно-популярного шоу MythBusters рекламный ролик, демонстрирующий преимущества параллельных вычислений.
В основе этого подхода лежат графические процессоры (GPU), изначально разрабатывавшиеся для ресурсоемких компьютерных игр. Их архитектура была адаптирована для быстрого выполнения матричных операций. Нейронные сети, в свою очередь, в значительной степени основаны на матричных вычислениях, то есть умножении одной таблицы чисел на другую.
Какие задачи мы можем решить?
Имитируя человека, мы можем на фотографии указать, где находится предмет, и отделить его от окружающих объектов.

Можем ответить на вопрос, какая у человека позиция относительно других тел, и даже спрогнозировать по двумерной фотографии положение частей тела человека в 3D.

Можем отыскать лицо человека.

Обнаружение лица, идентификация, оценка позы, распознавание эмоций
Имея априорные знания о движении, можем по позе человека на фотографии предположить, в каком направлении он бежит, или спрогнозировать, куда он будет двигаться далее.

Сопровождение объектов, распознавание действий, оптический поток
Где сейчас используют нейросети
Важно отметить, что перечисленные задачи могут быть решены и другими методами.
Нейросети представляют собой лишь один из актуальных и эффективных подходов к решению задач данного типа. В будущем возможны появления более совершенных архитектур, превосходящих “классические” нейросети в эффективности для конкретных приложений.
Кроме того, существует множество инженерных задач, где традиционные методы, основанные на аналогичных дескрипторах, могут демонстрировать более высокие результаты по сравнению с нейросетями, которым требуется обширный обучающий набор данных.
Поиск по картинкам
Современные поисковые системы, такие как Яндекс и Google, широко используют функцию поиска объектов на изображениях. Пользователь загружает фотографию, и нейросетевая модель, посредством специальных фильтров, анализирует ее семантическое содержание, выделяя характерные признаки. Эти признаки затем сравниваются с аналогичными признаками, предварительно вычисленными и сохраненными в векторном представлении для множества изображений, доступных в интернете. Изображения, демонстрирующие схожие признаки, считаются семантически близкими.

Примеры поисковой выдачи по заданным фото
Распознавание лиц
Системы детектирования и идентификации лиц функционируют по аналогичным принципам. Их применение имеет существенное значение для обеспечения безопасности, в том числе в банковской сфере.

Определите, в каком из шести случаев изображен один и тот же человек
В качестве иллюстрации можно привести пример из презентации одной из компаний. Представьте себе две фотографии с незначительным изменением ракурса или освещения. Сравните людей на этих фотографиях: сможет ли человек с уверенностью определить, что это один и тот же индивидуум? Такая задача часто вызывает затруднения у человека, что приводит к ошибкам и создает благоприятные условия для мошеннических действий.

Правильный ответ
В отличие от человека, корректно обученные системы компьютерного зрения способны безошибочно идентифицировать лица даже в сложных условиях, например, при недостаточной освещенности. Их точность распознавания достигает 99%. В настоящее время подобные технологии активно используются на Западе для контроля доступа и учета рабочего времени.
Социальный протест
Использование нейросетей, связанное с распознаванием лиц, вызывает у обывателей опасения. Вот один из таких заголовков:

Заголовок одного из изданий: «Судя по сканирующим мозг каскам, Китай не заинтересован в тайне частной жизни рабочих»
В последнее время распространились сообщения о внедрении сенсоров в рабочие шлемы для отслеживания уровня погруженности сотрудников в работу и их эмоционального состояния. Несмотря на то, что реализация такой технологии в настоящий момент невозможна, подобные публикации, связывающие ее с искусственным интеллектом, вызывают определенные опасения.
Более реалистичным примером применения подобных технологий является использование камер в учебных классах для оценки уровня вовлеченности студентов в учебный процесс. Данный метод может косвенно определить эффективность обучения.


Система оценки вовлеченности обучающихся
Говоря об опасениях, нельзя не вспомнить знаменитую серию публикаций о наличии в Китае системы соцрейтинга, которая мониторит людей и оценивает, насколько они подчиняются правилам.

Фантазии на тему китайского соцрейтинга
Что касается опыта Китая в области применения технологий распознавания лиц и отслеживания людей, существуют различные точки зрения.
Лично мне не приходилось жить в Китае, поэтому я не могу дать объективную оценку сложившейся там ситуации. Однако стоит отметить, что на Западе внедрение подобных систем часто вызывает общественное недовольство. В качестве примера можно привести протесты работников компании Amazon против строгих правил учета рабочего времени, установленных новой системой мониторинга.
Вследствие этих протестов ряд компаний, а также правоохранительные органы в американских городах либо прекращают использование, либо ограничивают функциональность систем, связанных с отслеживанием местоположения людей и распознаванием лиц.
Таким образом, можно сделать вывод, что действующее законодательство о защите конфиденциальности и персональных данных эффективно, и опасения по поводу использования нейросетевых технологий могут быть сняты посредством правового регулирования.
Модификация фотографий
С помощью подобных нейросетевых моделей можно манипулировать изображениями — к примеру, стилизовать фото.

Нейросеть добавляет налет абстракционизма
Нейросетевые модели могут анимировать фотографию или картину, используя видео эмоций другого человека. Лицо с фотографии будет изменять выражение вслед за человеком на видео.

Повторение мимики и жестов при помощи нейросети
А эту анимацию делали коллеги из дружественной нам группы Сколтеха.

Анимирование картины при помощи нейросети
Подобные методы используют при создании фильмов и рекламы.
Физическая безопасность и обучение
Компьютерное зрение находит широкое применение в сфере обеспечения безопасности. Оно используется для мониторинга объектов, таких как пустые квартиры, и контроля условий труда, например, проверки соблюдения правил техники безопасности сотрудниками. Кроме того, нейросетевые модели могут быть задействованы в системах контроля дорожного движения для определения превышения скорости.

Система отмечает, что на объекте находятся люди без каски или перчаток

Для распознавания госномеров нейросеть не нужна. Но определить тип и модель транспортного средства без нее уже сложно
Компьютерное зрение также служит важным элементом более сложных систем, например, систем дополненной реальности. Использование компьютерного зрения в дополненной реальности особенно эффективно при обучении персонала работе в экстремальных условиях, требующих быстрой реакции. В таких случаях физические тренажеры с реалистичным имитированием обстановки могут быть либо недоступны, либо не обладать необходимой функциональностью. Системы дополненной реальности позволяют эффективно решить эту проблему.
Строительство и городское планирование
Оценку прогресса строительства на масштабных объектах традиционно осуществляют визуально. Однако такой метод затруднителен из-за обширности территории. Для повышения эффективности контроля можно использовать технологии дистанционного зондирования, например, съемку с дрона и данные лидара (лазерного дальномера). Обработка полученной информации с помощью компьютерного зрения позволяет автоматизировать оценку объема выполненных работ.

Контроль строительства с помощью нейросети
Аналогичный подход применяется в различных сферах, таких как мониторинг окружающей среды и градостроительство. Сравнение снимков со спутника, сделанных в разные периоды времени, помогает выявлять незаконные свалки, оценивать последствия стихийных бедствий (ураганов, пожаров, землетрясений), а также определять количество пострадавших зданий и прогнозировать страховые выплаты.

Пример обработки данных дистанционного зондирования, в результате которой выделены новые объекты (в данном случае — постройки)
В сфере городского планирования данные дистанционного зондирования используются для оценки плотности населения, типа застройки и количества этажей в зданиях. Эта информация необходима для эффективного размещения торговых точек, определения людских потоков и планирования инфраструктуры.
Анализ крыши здания позволяет определить его тип (жилой дом, офисное здание, производственная площадка). Высота и количество этажей оцениваются по тени, отбрасываемой зданием, и данным о времени съемки. Оценка количества проживающих в доме производится на основе типа здания и его размеров. Для большинства территорий с типичной плотностью населения такие оценки демонстрируют высокую точность.
Данные, полученные с помощью технологий дистанционного зондирования, являются ценным ресурсом для компаний, занимающихся строительством и развитием торговых сетей.

Пример анализа жилых объектов при помощи нейросети
Ещё одним примером применения подобных технологий может служить сканирование объектов инфраструктуры. Часто встречается ситуация, когда для промышленных зданий отсутствуют исходные чертежи. Тем не менее, при проведении ремонтных или реконструкционных работ без них не обойтись. Данную проблему можно решить с помощью автоматизированной обработки данных, полученных посредством лидарного сканирования. При этом сканирование может производиться как изнутри здания, так и снаружи. По результатам сканирования создается полная цифровая модель объекта, которая позволяет выполнять широкий спектр действий, в том числе планировать ремонтные работы и внесение изменений в конструкцию здания.


3D-модель промышленного объекта, созданная по результатам сканирования при помощи нейросети. Объем модели нереально огромен: 12 млрд точек. С помощью модели намного проще проектировать ремонт и реконструкцию
Геология
В нефтегазовой отрасли остро стоит задача оценки проницаемости нефтяных пластов – способности нефти проходить сквозь породу. Это необходимо для определения рентабельности промышленного извлечения нефти. Для решения этой задачи прибегают к бурению разведочных скважин, из которых извлекаются образцы породы (керн). Subsequently, путем томографического сканирования керна создается цифровая модель геологической структуры, позволяющая визуализировать расположение пор и твердых включений в породе.

Восстановление цифровой модели породы при помощи нейросетей
От того, насколько эта порода пористая и как через нее распространяется вязкая жидкость, зависит, насколько трудно будет извлечь нефть.

Анализ прохождения вязкой жидкости через породу
Медицина
В сфере медицины существует множество задач, связанных с анализом изображений, которые требуют значительного времени от медицинских специалистов. К примеру, определение объема сердца и предсердий по снимкам или выявление изменений в глазном дне, связанных с диабетом, являются трудоемкими процессами. Ручная обработка подобных данных занимает много времени и подвержена ошибкам из-за человеческого фактора, такого как усталость.

Пример расчета объема сердца по снимку при помощи нейросети
Для минимизации этих рисков нейронные сети могут выполнять роль помощника в анализе медицинских изображений. Подобное программное обеспечение уже получило одобрение от министерств здравоохранения многих стран, что свидетельствует о формировании значимого рынка. Методы компьютерного зрения позволяют ускорить работу врачей и повысить точность анализа.
На иллюстрации представлен совместный проект с коллегами из Национального медицинского исследовательского центра нейрохирургии имени академика Н.Н. Бурденко, посвященный предоперационному картированию. Целью проекта является определение 위치рования речевого и моторного центров в мозге пациента для предотвращения их повреждения при удалении опухоли.


Подготовка к удалению опухоли мозга — локализация речевого и зрительного центров — помогает улучшить планирование операции и сократить время на локализацию этих центров во время процедуры
В стандартной практике пациента будят во время операции и используют электрический щуп для стимуляции различных участков коры головного мозга, проверяя сохранение речи, двигательных функций и других когнитивных способностей. Несмотря на необходимость этой процедуры, стремление минимизировать время ее проведения является актуальной задачей. Для решения этой проблемы используется функциональная магнитно-резонансная томография (fMRI), которая позволяет получить последовательность трехмерных изображений мозга, демонстрируя активность в разных его областях. Обработка данных fMRI с высокой точностью определяет расположение речевого и моторного центров, что позволяет хирургу спланировать оптимальный путь удаления опухоли.
Ритейл
Технология автоматического распознавания товаров открывает новые возможности в сфере розничной торговли. Магазины, подобные Amazon Go, где отсутствует персонал, используют эту технологию для расчета стоимости покупки без участия кассира. Посетитель магазина берет нужные товары, а система автоматически определяет их стоимость и списывает деньги с банковского счета при выходе.

Самый первый магазин Amazon Go в Сиэтле (фото: SounderBruce, CC BY-SA 4.0)

Распознавание выкладки товаров по фото
Аналогичные системы автоматизации применяются и в области мерчандайзинга. Специальные приложения, работающие на смартфонах, позволяют оценивать выкладку товаров на полках: определять количество упаковок, их тип и расположение. Разработка и внедрение таких приложений активно ведется как на Западе, так и в России. В Москве уже был проведен тестовый запуск магазина без продавцов.
Автономный транспорт
В области компьютерного зрения часто ставится задача предсказания положения объектов в трёхмерном пространстве на основе данных с камер. Нейронные сети успешно справляются с вычислением координат центра объекта, а также углов его поворота.

Позиционирование в 3D при помощи нейросети, помогающее автономному автомобилю перемещаться в пространстве
Кроме того, благодаря обработке видеозаписи окружающей среды, транспортное средство может определить, посещало ли оно данное место ранее во время других поездок. Данная возможность позволяет реализовать визуальную навигацию для роботизированных систем, что в свою очередь способствует ориентации автономного транспорта в пространстве на основе анализа текущей ситуации.

Визуальная навигация при помощи нейросетей, позволяющая автономному автомобилю точно определить расстояние до окружающих предметов
Расширение задачи
Изначально компьютерное зрение позиционировалось как способность отвечать на любые вопросы, связанные с изображением. В стремлении к более глубокой имитации человеческих возможностей, возникает необходимость в создании множества нейронных сетей, обученных на обширных наборах изображений различных объектов. Однако этот подход сталкивается с ограничениями. Например, база данных ImageNet содержит порядка 10 тысяч классов объектов.
Объединение нескольких нейронных сетей, специализирующихся на конкретных задачах, частично реализуется в некоторых инженерных системах. Тем не менее, полное воспроизведение человеческого описания изображения пока остаётся недостижимой целью.
Ошибки и обман систем распознавания
Разработка систем распознавания с использованием современных нейронных сетей является разрешимой инженерной задачей. В её базовой реализации не требуется глубоких научных исследований. Однако, объем научной работы, стоящей перед нами, весьма значителен, поскольку такие системы пока что далеки от совершенства.
Во-первых, системы распознавания лиц относительно легко поддаются обману. В качестве иллюстрации можно привести примеры фотографий человека в гриме. В определенных обстоятельствах такой грим способен дезориентировать систему распознавания.

Это объясняется тем, что нейронные сети обучаются на обширных выборках изображений людей с различными параметрами освещения, в очках и без них. Однако, в данных выборках отсутствуют фотографии лиц с подобным гримом. Вследствие этого система интерпретирует его как аномалию, не относящуюся к человеческому лицу.
В случае необходимости предотвратить обман или ошибки, разработчики рано или поздно проанализируют ситуацию и внедрят соответствующие защитные меры.
Во-вторых, нейронные сети данного типа уязвимы к взлому. Существует известный пример, когда к изображению добавляется шум с незначительной амплитудой. Для человеческого глаза картинка практически не изменяется, но нейросеть перестает её распознавать.

Взлом нейросети. Пример смешивания изображений, в результате которого сверточная нейросеть выдает ошибочный результат (источник: spectrum.ieee.org)
Аналогичные вещи можно делать и с физическими объектами, например, добавить посторонние элементы к знакам дорожного движения.

Даже небольшие «помехи» сбивают с толку алгоритм распознавания (подробности: spectrum.ieee.org)
Система демонстрирует неточности при распознавании знаков, иногда вовсе не удаваясь их идентифицировать. Аналогичные трудности наблюдаются и в области распознавания других модальностей, таких как речевое общение.
Несмотря на это, наблюдается постепенное улучшение ситуации. В качестве примера можно привести системы разблокировки смартфонов с использованием технологии распознавания лиц. Первоначальные реализации оказались уязвимыми: для обхода защиты достаточно было использовать распечатанную фотографию. В настоящее время для обмана системы требуется создание объемной модели.


Для обмана используют напечатанную на 3D-принтере основу, которую оклеивают фотографиями
Как я говорил выше, точность повышают, расширяя набор обучающих данных и повышая число рассчитываемых признаков.
Вопрос сохранения рабочих мест в контексте нейросетевых технологий
Отдельным вопросом является проблема сохранения рабочих мест в условиях внедрения нейросетей. Возникает опасение, что автоматизация может привести к массовым увольнениям. Однако, следует отметить, что ситуация не столь драматична. Нейросети, безусловно, сокращают потребность в некоторых профессиях, но одновременно создают новые рабочие места, связанные с разработкой, обслуживанием и обучением этих систем.
Кроме того, нейросетевые технологии открывают новые рынки и возможности, требующие разработки и обслуживания соответствующей инфраструктуры. Таким образом, можно ожидать, что внедрение нейросетей приведет к трансформации рынка труда, а не к его сокращению.



