Потребительские товары
Май 2025
Сотрудники крупной региональной ритейл-сети анализируют цены у конкурентов. Для этого они собирают информацию с ценников на товары и передают в систему учета. Каждый день сотрудники могут делать до 20 000 фотографий ценников.
Чтобы ускорить обработку данных, компания сделала собственное AI-решение распознавания текста по фото. Точность модели клиента составляла около 36%, часто встречались ошибки, и поэтому приходилось тратить время на дополнительную проверку и внесение недостающих данных.
Нашей задачей стало улучшение показателя точности распознавания до 75%.
Изначальная задача была в доработке существующей модели с 36% точности до 75%. Мы изучили исходную модель и нашли ряд ограничений к ее улучшению. Последовательная обработка приводила к снижению качества из-за ошибок на предыдущих этапах, многочисленные компоненты требовали отдельной настройки, оптимизации и поддержки, усложняя разработку, к списку добавлялись и прочие причины — в итоге пришли к выводу, что разработка новой AI-модели под задачу клиента будет экономически эффективнее.
В качестве решения R&D-отдел Riverstart использовал визуально-языковую модель. С помощью Computer Vision сотрудники клиента смогут получать текстовые данные, не перепечатывая информацию с ценника вручную, и не тратя много времени на проверку данных, которые выдала старая модель с точностью 36%.
Мы проанализировали процесс работы сотрудников-аналитиков и поняли, какие сложности могут возникнуть для качественного распознавания текста. Как мы их решили:
Сотруднику удобнее отправлять фото массово, сразу из галереи снимков. Решение — отправка через приложение на смартфоне. Альтернативный вариант — загрузка в систему вручную.
Сотрудники делают множество фото и не все они могут быть качественными. Решение — доработка AI-модели для улучшения качества снимков для последующей обработки.
В итоге процесс такой: система получает фото от сотрудников, анализирует их, вытаскивает нужные данные и уже проверенные структурированные данные передает в ERP или внутреннюю базу клиента. Дальше бизнес может использовать их для отчетности, контроля цен и управленческих решений.

Первичное тестирование на 917 реальных фотографиях показало точность распознавания 93,5%. Это уже было выше, чем поставленный клиентом порог в 75%.
Тем не менее, модель показывала ряд повторяющихся ошибок:
Некорректное определение цены (рубли, копейки);
Лишние или ошибочные буквы;
Неполное название товара;
Отсутствие размера или объема.
Для повышения точности модели R&D-отдел Riverstart использовал пайплайн предобработки изображений: конвертацию в grayscale с последующей автоматической коррекцией резкости, контраста и яркости.
Таким образом получилось довести модель до стабильной работы и точности 95% в условиях реальной съемки: при плохом освещении в магазине, при бликах на ценнике, отклонении угла съемки и небольшой смазанности.
Даже если ценник был частично засвечен, но данные можно было определить, модель справлялась и выдавала корректный результат.
После того, как мы доработали точность распознавания AI-модели, тестирование показало 95%.

В результате Riverstar предоставили готовую AI-модель распознавания текста на фотографиях, которая показывала точность 95%, что было выше исходной модели с точностью 36% и также выше указанного клиентом минимального требования в 75%.
Модель позволила уменьшить количество ошибок при распознавании цен и наименований товаров — аналитики получили возможность снизить трудозатраты по анализу цен у конкурентов в разы.