Выпускник ТГУ «научил» компьютеры экономить на хранении

Даниил Данилов из Тольяттинского государственного университета (ТГУ) создал прототип системы, которая автоматически сортирует, распределяет и защищает неструктурированные данные компании, почти на треть сокращая затраты на их хранение. Этот проект стал темой его выпускной магистерской диссертации, которую он защитил на отлично.
Выпускник ТГУ «научил» компьютеры экономить на хранении
Источник: magnific.com

Ежесекундно в мире генерируются горы информации: фотографии, видео, сканы договоров, презентации, аудиозаписи совещаний. Всё это называют «неструктурированными данными», которые сегодня составляют до 80% корпоративного информационного мусора. Именно с ними возникает больше всего проблем: файлы теряются, поиск занимает часы, а хранение всего подряд на быстрых, но дорогих дисках опустошает бюджеты.

Проблему постарался решить Даниил Данилов, завершивший в этом году обучение в магистратуре института цифровых технологий (ИЦТ) ТГУ. Под научным руководством кандидата педагогических наук и директора института Оксаны Гущиной он разработал систему, которая структурирует и упорядочивает этот «цифровой хаос».

Так называемый «умный менеджер» не просто копирует файлы в хранилище – сначала он анализирует их с помощью гибридного подхода, сочетающего детерминированные, то есть, жёсткие правила и алгоритмы машинного обучения.

Например, по расширению файла система может сразу определить примерную категорию. Если речь идёт о текстовом документе, подключается классификатор на основе искусственного интеллекта: изучает содержимое, определяет тематику и присваивает файлу такие характеристики, как категория, оценка важности и уровень конфиденциальности.

– Задача была сделать так, чтобы компании перестали переплачивать за хранение данных и тратить время на их поиск в корпоративных архивах, – комментирует Даниил Данилов. – Для текстов используются современные методы анализа, а для изображений и сканов – нейросетевые алгоритмы, что позволяет системе одинаково эффективно работать с самыми разными типами файлов.

Главным преимуществом разработки стал алгоритм интеллектуального распределения данных – именно он принимает решение о том, где хранить каждый конкретный файл. Система поддерживает три типа хранилищ: высокоскоростные SSD-диски для критически важных, конфиденциальных и/или часто запрашиваемых документов, экономичные HDD-накопители для файлов средней важности, а большие архивы и редко используемые данные отправляются в дешёвое облачное хранилище.

– Только за счёт этого компании могут экономить миллионы рублей в год, – говорит Даниил.

Прототип был протестирован на выборке из 50 файлов разных типов и размеров. Система показала снижение затрат на хранение на 28,4% по сравнению с традиционным подходом, при котором все файлы размещаются на дорогом SSD без учёта их реальной ценности.

– Но файлов может быть намного больше, ограничений по количеству нет. Система адаптивна, её можно масштабировать под любые объёмы данных без потери эффективности, – подчёркивает автор.

Решает разработка и другие важные задачи корпоративного управления данными. Например, она разграничивает права администратора, модератора и рядового пользователя, таким образом, каждый сотрудник видит только те файлы, к которым у него есть допуск. Поиск осуществляется не только по имени файла, но и по категории, расширению и другим метаданным, которые система присваивает автоматически, ранжируя результаты по степени важности.

– Мы предложили решение, которое автоматизирует рутинные операции и позволяет сосредоточиться на действительно важных задачах, – отмечает разработчик. – Кроме того, система собирает детальную статистику о времени загрузки, точности классификации и распределении файлов по хранилищам – это позволяет администратору отслеживать эффективность её работы и при необходимости корректировать пороговые значения алгоритмов.

Разработка будет полезна компаниям, у которых есть проблемы хранения и поиска больших объёмов данных – юридическим и бухгалтерским фирмам, производственным холдингам, образовательным учреждениям и др. Прототип написан на языке Python с использованием библиотек для машинного обучения и визуализации, что делает его гибким и готовым к дальнейшему развитию.

Даниил Данилов намерен доработать систему: добавить более мощные нейросетевые модели для классификации, интегрировать технологии блокчейн, чтобы обеспечить неизменяемость и отслеживаемость операций с критически важными документами.

54

просмотра

Читайте также

все

«Куда пойти» больше не проблема

Выпускник Тольяттинского государственного университета Николай Горохов разработал сервис, который по...

Вячеслав Федорищев поощрил начинающих исследователей ТГУ

Студенты Тольяттинского государственного университета вошли в число 108 стипендиатов губернатора Сам...

ТГУ показал школьникам современную IT-экосистему

В институте цифровых технологий Тольяттинского государственного университета (ИЦТ ТГУ) прошёл день о...

Студенты ТГУ «взломали» секреты IT-карьеры

В Тольяттинском государственном университете (ТГУ) прошёл интерактивный IT/Digital лекторий Workshop...

ТГУ и Китай стирают границы в IT-образовании

Институт цифровых технологий Тольяттинского государственного университета (ИЦТ ТГУ) продолжает укреп...

ТГУ – лучший в математической олимпиаде

Студенты Института цифровых технологий Тольяттинского государственного университета (ИЦТ ТГУ) стали...

445020, Самарская область, Тольятти, Белорусская ул.,14

+7 (8482) 44-94-24,
44-94-44

Пн-пт: 8:15-17:00 (перерыв: 12:30-13:15)

office@tltsu.ru