ИИ в управлении данными: мифы и реальность

Что в самом деле сможет обеспечить искусственный интеллект, если его применить для управления данными.
Николай Смирнов
главный редактор OSP.ru
Искусственный интеллект играет все большую роль во всех областях, и сфера управления данными — не исключение. Способен ли ИИ полностью заменить человека в задачах управления данными, взять на себя организационные задачи? И какие ощутимые результаты может получить организация от его применения в Data Governance? Мы опросили экспертов в преддверии XI ежегодного форума «Управление данными. Основы цифровой экономики», который состоится 24 сентября.

Человек пока незаменим

Николай Шевцов
«ОТП-Банк»
«Главный миф — что ИИ “наведет порядок в данных” вместо людей: каталог заполнится сам, качество данных вырастет, дата-стюарды станут не нужны», — подчеркивает Николай Шевцов, CDO ОТП Банка. На практике ИИ ничего не создает из пустоты: если нет доменов с описаниями, владельцев и глоссария, модель выдаст правдоподобные, но неверные описания данных. По мнению Шевцова, реальность скромнее и полезнее — ИИ хорошо работает как ускоритель черновиков и разборщик больших объемов однотипных объектов: он может предложить описание таблицы, связать атрибут с термином, восстановить Data Lineage из унаследованных SQL-витрин. Но ответственность при этом не делегируется: за результат отвечает перед регулятором и правлением человек, поэтому ИИ меняет не модель управления данными, а ее себестоимость и скорость.
Александр Юрасов
TData
Александр Юрасов, директор по разработке инструментов управления данными TData, также считает неоправданными ожидания того, что ИИ полностью устранит такие роли, как дата-стюарды и владельцы данных. Это вовсе не «волшебная кнопка» — скорее, он автоматизирует рутину (профилирование, разметка, поиск аномалий), но не подменяет ответственность за бизнес-смысл данных. Например, владелец данных принимает решения о качестве данных и доступе к ним, исходя из стратегии и рисков. А вот ИИ не понимает контекста сделок или регуляторных нюансов. Он — мощный ассистент, но конечная ответственность остается за человеком.
Евгений Обелов
Arenadata Harmony MDM
«Организационные задачи, такие как определение владельцев данных, разработка регламентов, распределение ролей и полномочий, останутся за человеком», — уверен Евгений Обелов, технический директор Arenadata Harmony MDM. Заменить дата-стюарда ИИ тоже не может, но зато способен заметно сократить объем рутины и сместить фокус его работы на разрешение конфликтных ситуаций.
Марат Сабуров
DATAREON
«Ключевой принцип — синергия: ИИ масштабирует обработку данных, но не заменяет стратегические решения и политики», — согласен Марат Сабуров, менеджер по развитию бизнеса DATAREON. Реальность же состоит в автоматизации рутины: классификации данных, поиска дублей, профайлинга, построения Data Lineage и т.п.
Олег Гиацинтов
DIS Group
«ИИ для корректной работы нужны качественные и своевременные данные, а также возможность оценить результат своей работы. Поэтому, прежде всего, сама функция Data Governance таким образом должна расширяться и начать охватывать, помимо стандартных запросов, запросы со стороны ИИ», — говорит Олег Гиацинтов, технический директор DIS Group. Запросам ИИ свойственна высокая степень изменчивости — примерно как запросам от дата-сайентистов, которые пробуют гипотезы на одном наборе данных, потом на другом и т.д. Data Governance должно стать важной частью процесса работы с ИИ, предоставляя возможность быстро поставлять нужные данные, причем с пониманием сути запроса на данные. Если же каталог данных и бизнес-глоссарий рассматриваются только с точки зрения описания существующих данных и не используются для их проектирования, то результат работы ИИ на полученных данных будет плохим.
Анастасия Грибанова
Cloud.ru
Как признает Анастасия Грибанова, директор по разработке Evolution Data Platform компании Cloud.ru, российский рынок переживает этап, когда ИИ кажется универсальным решением для многих задач, и особенно это актуально для области работы с данными. При этом уровень зрелости рынка для полноценного внедрения Data Governance традиционно невысок. «Может складываться ложное впечатление, что ИИ способен полностью заменить процессы управления данными, однако это не соответствует реальности», — считает Грибанова. Стоит фокусироваться не на том, что Data Governance можно автоматизировать, хотя это звучит как более рабочий сценарий, а на том, что ИИ становится ключевым элементом в архитектуре AI Ready Data Platform, так как является источником знаний о данных для агентов.

Между пользой и экономикой

Так где же применение ИИ полезно и где — экономически оправданно?
Павел Егоров
«Инфосистемы Джет»
«В компаниях далеко не всегда есть условия для эффективной работы ИИ. По нашим наблюдениям, одна из ключевых проблем — не сама по себе технология или модели, а готовность данных, процессов и инфраструктуры», — делится Павел Егоров, руководитель направления Big Data компании «Инфосистемы Джет». Во-первых, во многих организациях значительная часть информации до сих пор не описана полностью, так как дата-специалисты перегружены. Во-вторых, некоторые данные вообще не собираются и не хранятся, так как часть процессов компаний происходят вне корпоративных систем и не оставляют цифровой след. В таких условиях внедрение ИИ в регулярные процессы вряд ли даст заметный экономический эффект. Однако там, где система управления данными уже выстроена или компания последовательно ее создает, есть несколько сценариев использования ИИ. Один из них — автоматическое описание данных с помощью больших языковых моделей. В пилотных проектах это ускоряло внедрение каталога данных в два-три раза и давало другим ИИ-инструментам контекст, где искать нужные данные. Кроме того, большие языковые модели могут генерировать технические проверки и часть бизнес-проверок качества данных, чтобы заранее выявлять ошибки в отчетах и метриках.
Олег Гиацинтов
DIS Group
«В процессах управлении данными есть много рутинных операций и всяческих согласований, которые можно существенно ускорить, — напоминает Гиацинтов. — Получается довольно емкая тема для работы ИИ». Например, есть задачи, касающиеся логического и структурного проектирования, а также проектирования потоков, задачи поиска источников данных и постановки связей между физической моделью источников и логической терминологией. Когда процессы становятся медленными и неэффективными — время заняться внедрением ИИ в управление данными.
Марат Сабуров
DATAREON
По мнению Сабурова, ИИ вполне оправдывает себя при масштабировании рутинных задач — например, автоматической классификации больших массивов данных или поиска дублей в мастер-справочниках. Его полезно применять для профайлинга и построения Data Lineage: это сокращает ручной труд и ускоряет понимание происхождения данных. Однако для стратегических решений (политики, назначение владельцев) ИИ не используют — здесь слишком критичен человеческий контроль. Такой выборочный подход снижает затраты и повышает качество данных без избыточной автоматизации.
Игорь Моисеев
DataCatalog
«Управление данными — ресурсоемкие процессы, их невозможно один раз настроить и оставить без контроля. Необходимо определять роли, формировать правила, описывать данные, следить за их качеством и постоянно актуализировать информацию», — отмечает Игорь Моисеев, директор по развитию бизнеса DataCatalog (входит в Группу Arenadata). ИИ способен значительно облегчить рутинные операции, которые сегодня выполняют дата-стюарды, инженеры по данным и другие специалисты. Новое перспективное направление — автоматизированное построение Data Lineage, когда ИИ анализирует связи между системами и подсказывает владельцам данных и архитекторам, как информация перемещается и преобразуется внутри инфраструктуры компании. Еще один сценарий — управление качеством данных. Экономический эффект возникает не только за счет сокращения объема ручной работы и ускорения внедрения процессов управления данными, но и за счет возможности выполнять часть операций непрерывно, в том числе в фоновом режиме.
Александр Учаев
Александр Учаев, менеджер по продукту «1С:MDM Управление нормативно-справочной информацией» фирмы «1С», добавляет, что применение ИИ в управлении данными приносит максимальную экономическую пользу там, где необходимо автоматизировать такие рутинные операции, как сопоставление атрибутивного состава и поиск взаимосвязей, контроль качества НСИ и анализ аномалий в консолидированной отчетности. Использование интеллектуальных ассистентов для анализа данных и выдачи рекомендаций экономически оправдано для крупных компаний, где цена ошибки в мастер-данных критически высока и ведет к прямым финансовым потерям.
Евгений Обелов
Arenadata Harmony MDM
Обелов также приводит в пример нормализацию данных: здесь активно используются алгоритмы машинного обучения, значительно снижающие долю ручного труда. Кроме того, ИИ эффективен при формировании маппинга между эталонной моделью данных MDM и системами-источниками, а также при автоматической генерации правил Data Quality на основе профилирования данных. В последнем случае модель предлагает набор правил, а дата-стюард лишь проверяет и утверждает их.
Анастасия Грибанова
Cloud.ru
«Data Governance — прежде всего про ответственность, политики доступа, требования безопасности и регуляторики, а эти решения по-прежнему остаются за человеком», — говорит Грибанова. Но есть целый перечень сценариев, в которых использование ИИ позволит упростить и оптимизировать процессы управления данными. Автоматическая генерация описаний данных — это базовый сценарий, который уже сейчас может подхватывать ИИ-агент. В инструменты по работе с данными активно внедряется новый функционал для поиска данных на естественном языке. При этом важно не впадать в иллюзию, что внедрение ИИ в Data Governance позволит полностью отказаться от роли дата-стюарда или эксперта по данным. На практике наибольшую ценность приносит модель совместной работы — ИИ станет не заменой эксперта, а его помощником.
Алексей Масич
«ТриниДата»
«ИИ экономически оправдан там, где организация уже несет значительные затраты на поиск, классификацию, сверку и проверку данных, а правила принятия решений можно формализовать и проверить», — уверен Алексей Масич, директор компании «ТриниДата». Наиболее перспективны интеллектуальный поиск по корпоративной информации, извлечение атрибутов из документов, сопоставление и классификация объектов, выявление дубликатов и аномалий, а также первичная проверка данных на соответствие шаблонам, стандартам и бизнес-правилам. При этом ИИ не должен подменять управление данными. Если в компании нет согласованной модели предметной области, ответственных за данные, единых справочников и прозрачных правил качества, то ИИ лишь быстрее распространит существующие ошибки.
Александр Юрасов
TData
Юрасов рекомендует смотреть в сторону повторяемых с высокой частотой рутинных операций с измеримым эффектом. Он выделяет несколько ключевых направлений: автоматическое профилирование и каталогизация, где время инженера на «разведку» сокращается с недель до минут; классификация чувствительных данных; мониторинг качества в реальном времени. Сомнительна окупаемость в таких направлениях, как генерация сложных политик доступа, этические дилеммы и управление мастер-данными с сильной ручной экспертизой. «Инвестируйте в ИИ там, где успех можно измерить в сокращении человеко-часов. Для стратегических решений оставьте ИИ роль советника, серьезное решение должно приниматься человеком», — резюмирует Юрасов.
Николай Шевцов
«ОТП-Банк»
«Экономика считается просто: выгода — там, где велико произведение объема объектов, повторяемости и стоимости ручного труда. Поэтому оправданы первичное наполнение каталога и разметка десятков тысяч таблиц, автоматическая классификация персональных данных и банковской тайны, восстановление Data Lineage из ETL-кода, генерация кандидатов на DQ-проверки и диалоговый поиск по каталогу», — делится Шевцов. Не оправдано применение ИИ там, где объектов мало, а цена ошибки высока: назначение владельца данных, критичные бизнес-правила, трактовка регуляторных показателей.

Пишем «автономность», подразумеваем «ответственность»

Полностью автономные процессы Governance & Management, управляемые и исполняемые ИИ-агентами — насколько это реально? Эксперты сходятся в том, что пока это крайне преждевременно, и ключевая проблема заключается в ответственности.
Александр Учаев
«Концепция полностью автономных процессов Data Governance, где ИИ-агенты самостоятельно и без участия человека управляют жизненным циклом данных, выглядит крайне привлекательной для бизнеса», — признает Учаев. В экосистеме «1С» уже работают прикладные ИИ-ассистенты, которые автоматически распознают ключевые атрибуты мастер-данных из загруженных данных и готовят проекты записей для внесения в базу. Однако финальное утверждение изменений требует контроля со стороны дата-стюардов. Только такой гибридный подход гарантирует безопасность и соответствие корпоративным стандартам.
Николай Шевцов
«ОТП-Банк»
«Полностью автономный контур сегодня нереалистичен, и дело не в зрелости моделей, а в конструкции ответственности: решения об изменении глоссария, критичности атрибута или прав доступа имеют регуляторные последствия и подписываются человеком», — полагает Шевцов. Что реально работает — агенты в режиме human-in-the-loop: регистрация и первичная классификация инцидентов качества, маршрутизация на владельца домена, черновики описаний объектов при миграции, сверка изменений в источнике с моделью. Ключевое ограничение автономии — предсказуемость и обратимость: действие можно доверить агенту только там, где определен «радиус поражения» при ошибке и предусмотрен откат. На горизонте двух-трех лет можно ожидать «автономию в песочнице», а измеряться она будет долей решений без вмешательства человека при отсутствии ухудшения контрольных метрик.
Марат Сабуров
DATAREON
«Полностью автономные процессы, где ИИ-агенты единолично принимают стратегические решения, пока недостижимы», — поддерживает Сабуров. ИИ действительно помогает автоматизировать рутину: классифицирует данные, ищет дубли в мастер-справочниках, проводит профайлинг и помогает строить Data Lineage. Однако ключевые элементы — определение политик, назначение владельцев данных, разрешение неоднозначных случаев — остаются за человеком. Такой гибридный подход позволяет масштабировать эффективность без потери контроля.
Павел Егоров
«Инфосистемы Джет»
Егоров также считает, что полностью автономный Data Governance на текущем этапе развития технологий пока не выглядит целесообразным. Агент способен предложить правило, сформировать проверку или подготовить новую метрику, однако оценить достоверность и принять ответственность за изменение должен владелец процесса. Кроме того, многие проверки качества данных невозможно вывести только из структуры таблиц или SQL-запросов. Например, в банке резкое снижение числа заявок на кредит может быть связано с завершением рекламной кампании, изменением скоринговой модели или технической ошибкой интеграции. Без дополнительного контекста система видит лишь отклонение показателя, и только эксперт может определить, допустимо ли изменение или оно требует вмешательства. Поэтому в ближайшей перспективе ИИ, скорее всего, будет выступать как система поддержки принятия решений, а не заменять людей в контуре управления. Однако роль ИИ-агентов с высокой вероятностью будет расти.
Алексей Масич
«ТриниДата»
«Полностью автономное управление данными в критичных корпоративных контурах пока преждевременно. Особенно в промышленности, где неверно присвоенный атрибут, некорректная связь между объектами или ошибочно принятое изменение могут повлечь значимые риски для проекта и эксплуатации», — резюмирует Масич. Практическую ценность имеют управляемые сценарии: агент собирает информацию из нескольких систем, выявляет несоответствия, предлагает классификацию или исправление, формирует отчет и направляет задачу ответственному специалисту. Решение по существенному изменению данных остается за человеком либо принимается по заранее утвержденному правилу.
Движение к автономности должно быть поэтапным: сначала — помощник специалиста, затем — агент с правом готовить предложения, далее — выполнение ограниченных низкорисковых операций в рамках заданных правил. Ключевое условие здесь не «умность» агента, а наличие формальной модели данных, разграничения прав, журнала действий, проверяемых правил и возможности отменить ошибочное действие.
Материалы на другие темы

Мы используем cookie, чтобы сделать наш сайт удобнее для вас. Оставаясь на сайте, вы даете свое согласие на использование cookie. Подробнее см. Политику обработки персональных данных