Выпускник ТГУ «научил» компьютеры экономить на хранении
Ежесекундно в мире генерируются горы информации: фотографии, видео, сканы договоров, презентации, аудиозаписи совещаний. Всё это называют «неструктурированными данными», которые сегодня составляют до 80% корпоративного информационного мусора. Именно с ними возникает больше всего проблем: файлы теряются, поиск занимает часы, а хранение всего подряд на быстрых, но дорогих дисках опустошает бюджеты.
Проблему постарался решить Даниил Данилов, завершивший в этом году обучение в магистратуре института цифровых технологий (ИЦТ) ТГУ. Под научным руководством кандидата педагогических наук и директора института Оксаны Гущиной он разработал систему, которая структурирует и упорядочивает этот «цифровой хаос».
Так называемый «умный менеджер» не просто копирует файлы в хранилище – сначала он анализирует их с помощью гибридного подхода, сочетающего детерминированные, то есть, жёсткие правила и алгоритмы машинного обучения.
Например, по расширению файла система может сразу определить примерную категорию. Если речь идёт о текстовом документе, подключается классификатор на основе искусственного интеллекта: изучает содержимое, определяет тематику и присваивает файлу такие характеристики, как категория, оценка важности и уровень конфиденциальности.
– Задача была сделать так, чтобы компании перестали переплачивать за хранение данных и тратить время на их поиск в корпоративных архивах, – комментирует Даниил Данилов. – Для текстов используются современные методы анализа, а для изображений и сканов – нейросетевые алгоритмы, что позволяет системе одинаково эффективно работать с самыми разными типами файлов.
Главным преимуществом разработки стал алгоритм интеллектуального распределения данных – именно он принимает решение о том, где хранить каждый конкретный файл. Система поддерживает три типа хранилищ: высокоскоростные SSD-диски для критически важных, конфиденциальных и/или часто запрашиваемых документов, экономичные HDD-накопители для файлов средней важности, а большие архивы и редко используемые данные отправляются в дешёвое облачное хранилище.
– Только за счёт этого компании могут экономить миллионы рублей в год, – говорит Даниил.
Прототип был протестирован на выборке из 50 файлов разных типов и размеров. Система показала снижение затрат на хранение на 28,4% по сравнению с традиционным подходом, при котором все файлы размещаются на дорогом SSD без учёта их реальной ценности.
– Но файлов может быть намного больше, ограничений по количеству нет. Система адаптивна, её можно масштабировать под любые объёмы данных без потери эффективности, – подчёркивает автор.
Решает разработка и другие важные задачи корпоративного управления данными. Например, она разграничивает права администратора, модератора и рядового пользователя, таким образом, каждый сотрудник видит только те файлы, к которым у него есть допуск. Поиск осуществляется не только по имени файла, но и по категории, расширению и другим метаданным, которые система присваивает автоматически, ранжируя результаты по степени важности.
– Мы предложили решение, которое автоматизирует рутинные операции и позволяет сосредоточиться на действительно важных задачах, – отмечает разработчик. – Кроме того, система собирает детальную статистику о времени загрузки, точности классификации и распределении файлов по хранилищам – это позволяет администратору отслеживать эффективность её работы и при необходимости корректировать пороговые значения алгоритмов.
Разработка будет полезна компаниям, у которых есть проблемы хранения и поиска больших объёмов данных – юридическим и бухгалтерским фирмам, производственным холдингам, образовательным учреждениям и др. Прототип написан на языке Python с использованием библиотек для машинного обучения и визуализации, что делает его гибким и готовым к дальнейшему развитию.
Даниил Данилов намерен доработать систему: добавить более мощные нейросетевые модели для классификации, интегрировать технологии блокчейн, чтобы обеспечить неизменяемость и отслеживаемость операций с критически важными документами.
54
просмотра