Workspace Digital Awards — приём заявок открыт! Успейте номинироваться по самой низкой цене. Повышение цен с 1 октября.
LP Agency
Как мы создали on-premise AI-решение для автоматического обезличивания документов
LP Agency
#Разработка сайтов под ключ#Фирменный стиль

Как мы создали on-premise AI-решение для автоматического обезличивания документов

12 
LP Agency Беларусь, Минск
Поделиться: 0 0 0
Как мы создали on-premise AI-решение для автоматического обезличивания документов
Сфера

Образование, наука, работа

Тип сайта

Порталы и сервисы

Сдано

Август 2022

Задача

Требовалось создать самостоятельный B2B-продукт для компаний, которые работают с большим объёмом документов, содержащих персональные или конфиденциальные данные, — и автоматизировать процесс их обезличивания перед передачей, хранением или использованием в других бизнес-процессах. Вместо ручного поиска сотрудником ФИО, номеров документов, ИНН, названий организаций и другой чувствительной информации система должна была самостоятельно анализировать содержимое, находить нужные данные и заменять их на специальные маркеры — при этом сохраняя возможность восстановить оригинал при наличии соответствующего доступа.

Продукт изначально проектировался как коробочное решение для установки внутри инфраструктуры заказчика, поскольку многие компании из соображений безопасности не могут передавать документы во внешние облачные сервисы.

Контекст задачи подчёркивал её актуальность: в России более 438 000 компаний являются операторами персональных данных, большинство хранит документы на серверах без полноценного обезличивания, ручная обработка занимает примерно в 18 раз больше времени, чем могла бы занимать автоматизированная, а основным источником утечек остаётся человеческий фактор. Конкретно система должна была:

автоматически находить чувствительные данные в документах произвольного формата;

обезличивать найденную информацию, присваивая документу уникальный код;

сохранять защищённую версию документа с возможностью восстановления данных;

работать полностью автономно, без подключения к интернету.

Ключевая сложность заключалась не в простом маскировании текста, а в контекстном анализе документа: система должна была распознавать чувствительные данные на разных языках, в разных форматах Microsoft Office и аналогах, работать с изображениями, символами, цифрами и QR-кодами — и всё это в изолированной от интернета среде.

Решение

В основе продукта — AI-ядро, для которого разработали два отдельных прототипа: обезличивание текстовых документов и обезличивание данных на изображениях. Система анализирует документ, определяет чувствительные поля по контексту, заменяет их на маркеры, присваивает документу уникальный идентификатор и сохраняет защищённую копию — весь цикл обработки занимает до 3 секунд на документ.

Настройку сделали гибкой: компания сама выбирает, какие типы данных скрывать — ФИО, номера документов, ИНН, QR-коды, латиницу, цифры, названия организаций, — задаёт правила обезличивания и определяет форматы обрабатываемых файлов под свои внутренние процессы.

Архитектурно продукт спроектировали как полностью автономное on-premise решение, не требующее подключения к интернету и устанавливаемое внутри инфраструктуры заказчика — принципиальное требование для компаний, которые не могут передавать документы во внешние облачные сервисы. Восстановление исходных данных защитили цифровой подписью, а отдельно реализовали механизмы защиты от несанкционированного фотографирования обработанных материалов.

Продукт с самого начала задумывался не как демонстрация возможностей AI, а как основа коробочного решения для корпоративного рынка — с моделью монетизации, где цена зависит от количества обработанных документов и масштабируется по лицензиям, и заделом на дальнейшее развитие в сторону DLP-интеграций, API для корпоративных систем, SaaS-версии, AI-модели прогнозирования рисков и интеграции с системами электронного документооборота.

Результат

В рамках проекта создали рабочий MVP коробочного B2B-продукта, а не отдельный демонстрационный AI-модуль. На выходе получили два направления автоматического обезличивания — для документов и для изображений, — с контекстным анализом чувствительных данных различных типов, скоростью обработки до 3 секунд на документ и полностью автономной архитектурой без передачи материалов во внешние облачные сервисы.

Реализовали механизм безопасного восстановления исходных данных при наличии соответствующего доступа, гибкую настройку правил обезличивания под нужды конкретной компании и on-premise формат установки, совместимый с требованиями корпоративной инфраструктуры к безопасности.

По расчётам, если ручное обезличивание документа занимает у сотрудника около 15 минут, система выполняет ту же задачу за 3 секунды — это в 300 раз быстрее в теории, и, по консервативным данным пилота, минимум в 18 раз быстрее на практике. Даже в случае взлома сервера злоумышленник получает уже обезличенные данные, что снижает риски утечки, штрафов от регуляторов и репутационных потерь.

Таким образом, технология была подготовлена не только как демонстрация возможностей AI, но и как полноценная основа для дальнейшего развития коробочного продукта на корпоративном рынке — с понятной моделью монетизации и потенциалом расширения в сторону DLP-интеграций, SaaS-версии и интеграций с системами электронного документооборота.


Оцените кейс
Спасибо за оценку
Выскажите мнение
Авторизуйтесь, чтобы добавить свой комментарий.
оставить заявку

Хотите заказать похожий проект?

LP Agency с удовольствием обсудит вашу задачу

Оставить заявку