Синтетические данные для обучения ИИ: почему важно качество

Как синтетические данные помогают обучать модели, где они уже применяются и почему плохие документы или случайные примеры не дают надежного результата.

Синтетические данные для обучения ИИ: почему важно качество

Почему плохой регламент нельзя просто «скормить нейросети»

Чтобы обучаться, нейросетям нужны данные. Но реальные данные не всегда легко получить: они дорого стоят, доступ к ним ограничен законом, они могут содержать персональную информацию или просто встречаются слишком редко. Поэтому исследователи всё чаще используют синтетические данные — специально созданные примеры, на которых обучают системы искусственного интеллекта.

В солнечный день в конце 1987 года фургон Chevrolet ехал по извилистой лесной дороге в кампусе Университета Карнеги — Меллона в Питтсбурге. Машина называлась Navlab. Она не была ни красивой, ни быстрой, но для своего времени была необычной: это был экспериментальный беспилотный автомобиль, которым управляли четыре мощных компьютера, установленные в грузовом отсеке.

Сначала инженеры пытались управлять Navlab с помощью навигационного алгоритма. Но, как и многие исследователи до них, быстро столкнулись с проблемой: одним набором инструкций невозможно описать все ситуации на дороге. Тогда они попробовали другой подход — машинное обучение. Фургон должен был не следовать заранее заданным правилам, а научиться ездить сам.

Аспирант Дин Померлоу построил искусственную нейросеть из небольших логических блоков, которые имитировали работу клеток мозга. Для обучения системе нужны были изображения дорог в разных условиях. Но небольшой команде было трудно собрать достаточно фотографий, чтобы охватить множество возможных ситуаций. Поэтому Померлоу создал на компьютере 1 200 синтетических изображений дорог и использовал их для обучения.

Самообучающаяся машина ехала не хуже других решений, которые исследователи смогли придумать на тот момент. Navlab не стал прямым шагом к прорыву в беспилотном транспорте, но показал важное: искусственно созданные данные можно использовать для обучения систем ИИ.

С развитием машинного обучения потребность в обучающих данных только росла. Но получить такие данные часто сложно: они могут быть дорогими, закрытыми, конфиденциальными или редкими. Поэтому исследователи всё чаще используют синтетические данные вместе с реальными, а иногда и вместо них.

«Машинное обучение давно сталкивается с проблемой данных», — говорит Сергей Николенко, директор по ИИ в компании Synthesis AI, которая создаёт синтетические данные для обучения моделей. По его словам, синтетические данные — один из самых перспективных способов решить эту проблему.

Но важно не то, что данные искусственные, а насколько они качественные. Нельзя просто дать нейросети плохой регламент, неразмеченный набор документов или случайно сгенерированные примеры и ждать, что она сама во всём разберётся. Система учится на том, что ей показывают. Если данные неполные, противоречивые или плохо описывают реальную задачу, результат будет таким же ненадёжным. Синтетические данные работают только тогда, когда их создают осмысленно и они отражают нужные ситуации.

Одна из сфер, где синтетические данные уже помогают, — распознавание лиц. Многие такие системы обучают на больших массивах реальных фотографий. Это вызывает вопросы о приватности людей, чьи лица попали в наборы данных. Есть и другая проблема: одни группы населения встречаются в таких массивах слишком часто, другие — слишком редко.

Исследователи из Microsoft Mixed Reality & AI Lab попытались решить эти проблемы и выпустили набор из 100 000 синтетических лиц для обучения систем ИИ. Их создали на основе данных 500 человек, которые дали согласие на сканирование. Система брала отдельные элементы из исходного набора, комбинировала их в новые уникальные лица, а затем добавляла визуальные детали — например, прическу или макияж.

Исследователи утверждают, что их набор данных охватывает широкий спектр этнических групп, возрастов и стилей. «В человеческом разнообразии всегда есть множество редких вариантов. Мы считаем и надеемся, что смогли охватить значительную их часть», — говорит Тадас Балтрушайтис, исследователь Microsoft, участвовавший в проекте.

У синтетических лиц есть еще одно преимущество: компьютер может точно указать, где находится каждая часть лица. Такая разметка помогает нейросети быстрее обучаться. Реальные фотографии приходится размечать вручную: на это уходит больше времени, а результат почти всегда менее точен и менее единообразен.

Такие изображения не выглядят полностью фотореалистичными: лица немного похожи на персонажей анимационного фильма. Но Microsoft использовала их для обучения систем распознавания лиц, и по точности они приблизились к моделям, обученным на миллионах реальных фотографий.

Компьютеры стали заметно лучше создавать полезные синтетические данные, в том числе благодаря более мощным графическим процессорам. Это специализированные чипы, которые изначально разрабатывались для обработки графики и помогают создавать более реалистичные изображения.

Исследователь Эррол Вуд, который работал с синтетическими лицами, использовал графические процессоры в проекте по отслеживанию взгляда. Для компьютера это сложная задача: нужно распознавать едва заметные движения глаз при разном освещении, с разных углов, а иногда и тогда, когда глазное яблоко почти не видно.

Обычно для обучения такой системы нужны тысячи фотографий человеческих глаз. Получить их сложно и дорого. Команда Вуда показала, что компьютер с графическим процессором и программой Unity, которую используют для создания видеоигр, может создавать такие изображения самостоятельно. В этих изображениях учитывались даже детальные отражения цифровых объектов на влажной изогнутой поверхности человеческого глаза.

На создание одного изображения у системы уходило 23 миллисекунды. Из них 3,6 миллисекунды занимала сама генерация, остальное — сохранение файла. Исследователи создали 1 миллион изображений глаз и обучили на них нейросеть. Она работала не хуже такой же сети, обученной на реальных фотографиях человеческих глаз, но обучение обошлось дешевле и заняло меньше времени.

Как и в случае с синтетическими лицами Microsoft, важную роль сыграла точная разметка. Компьютер мог автоматически указать, что находится в каждом пикселе изображения. Для обучения нейросети это критично: модель получает не просто картинку, а пример с корректным описанием.

Сейчас исследователи используют современные модели ИИ, чтобы получать данные для обучения других ИИ-систем. Например, в медицине давно пытаются создать нейросеть, которая анализировала бы рентгеновские снимки и компьютерные томограммы не хуже врача-рентгенолога. Но собрать данные для обучения сложно: снимки реальных пациентов относятся к медицинской тайне. Чтобы получить доступ к тысячам или миллионам изображений, без которых точную модель не обучить, нужны большие усилия.

Хазрат Али, специалист по компьютерным наукам из пакистанского Университета COMSATS, описал первые эксперименты с DALL·E 2 — популярной диффузионной моделью. Ее использовали для создания реалистичных рентгеновских снимков и компьютерных томограмм легких. В том числе модель генерировала изображения с признаками конкретных заболеваний. Такие данные можно использовать для обучения нейросетей, которые ищут опухоли и другие отклонения.

Али ожидает, что в ближайшее время диффузионные модели станут новым стандартом для ИИ-инструментов в радиологии. По его словам, возможность создавать более реалистичные снимки МРТ, КТ и, возможно, УЗИ ускорит исследования и внедрение таких решений в клиническую практику без рисков для конфиденциальности пациентов и сложностей с обменом медицинскими данными.

Когда Navlab медленно ехал по кампусу Университета Карнеги — Меллона, наблюдатели вряд ли понимали, что видят зарождение важного направления в искусственном интеллекте. Но этот эксперимент помог показать ценность синтетических данных. Сегодня они играют заметную роль в развитии ИИ, а в будущем могут стать еще важнее.

«Синтетические данные пришли надолго», — говорит Марина Ивашич-Кос, исследователь машинного обучения из Риекского университета в Хорватии. По ее словам, в конечном счете реальные данные будут заменять синтетическими везде, где это возможно и оправданно.

Материал был полезен? Можно отметить статью лайком.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *