Workspace Digital Awards — приём заявок открыт! Успейте номинироваться по самой низкой цене. Повышение цен с 1 октября.
KTS
За 4 месяца Альфа-Банк и KTS запустили RAG-решение, которое ускорило ответы контакт-центра
KTS
WDA
2027
#Разработка программного обеспечения#ИИ и нейросети

За 4 месяца Альфа-Банк и KTS запустили RAG-решение, которое ускорило ответы контакт-центра

42 
KTS Россия, Москва
Поделиться: 0 0 0
За 4 месяца Альфа-Банк и KTS запустили RAG-решение, которое ускорило ответы контакт-центра
Сфера

Финансы, страхование, инвестиции

Сдано

Сентябрь 2026

Задача

Альфа-Банк — крупнейший частный банк России, входит в топ-5 системно значимых кредитных организаций. Обслуживает более 40 млн частных и 2 млн корпоративных клиентов.

Команда Альфа-Банка проанализировала работу операторов и выдвинула гипотезу: внедрение AI-решения ускорит ответ клиенту на 30-40 секунд. В среднем обработка запроса занимала 5 минут: оператор вручную искал нужную статью в базе знаний, при необходимости заходил в первоисточники и формулировал ответ.

Решение

Выбрали RAG-технологию — это архитектурный подход, в котором система извлекает релевантную информацию из внешних источников знаний, а затем передаёт её языковой модели для генерации ответа. Платформа автоматически учитывает изменения в базе данных. Это позволяет работать с актуальной информацией и повысить точность ответов.

Для RAG-платформы зафиксировали технические требования. Вот некоторые из них:

  • развёртывание системы внутри контура банка;

  • запуск на двух GPU NVIDIA H100, чтобы уложиться в экономику проекта;

  • SLA по времени ответа: не более 5 секунд;

  • RPS (количество запросов в секунду): 7.

Дополнительной метрикой контроля определили обратную связь от операторов — им должно быть удобно пользоваться AI-инструментом.

После определения целевых показателей MLOps-команда начала разработку. RAG-платформу внедряли поэтапно: сначала запустили пилот на 100 операторов и постепенно увеличивали количество пользователей. Всего за 4 месяца мы вывели проект в production.

Как устроена RAG-платформа

Вместе с командой Альфа-Банка мы реализовали классический RAG-пайплайн на модели Gemma 3.

Запрос оператора поступает в оркестратор и преобразуется в векторный формат. Затем система подбирает наиболее релевантные фрагменты текста и передаёт их в LLM. Модель суммаризирует информацию и генерирует ответ.

Параллельно с основным процессом идёт непрерывное обновление векторного хранилища. Для финансовой сферы критически важно, чтобы операторы отвечали по актуальным данным. Если клиент получит нерелевантную информацию о кредитной ставке или условиях вклада, это может привести к финансовым потерям и репутационным рискам для банка.

Чтобы избежать ошибок, мы настроили автоматическое обновление векторного индекса: когда редакторы Альфа-Банка добавляют новые статьи или актуализируют текущие, эти изменения автоматически подтягиваются в систему.

Как и планировалось, RAG-платформа выдерживает нагрузку на двух видеокартах H100 и имеет запас по производительности.

Ускорили время ответа модели в 2 раза и настроили кеш с учётом прав доступа

Платформа должна была выдерживать 7 RPS на двух GPU NVIDIA H100 и обрабатывать запрос не дольше чем за 5 секунд.

На первых нагрузочных тестах p90 составлял около 8 секунд: девять из десяти запросов система обрабатывала за это время, а каждый десятый мог занимать больше.

Чтобы уложиться в SLA, мы разработали методологию автоматического подбора параметров инференса. Система сама ищет баланс между скоростью и качеством ответа. После оптимизации p90 снизился до 4 секунд.

Также мы настроили кеширование: платформа обрабатывает запрос один раз и сохраняет результат. Когда приходит аналогичное обращение, система сразу возвращает ответ. Это позволяет снизить нагрузку на GPU и повышает скорость отклика.

В финальном нагрузочном тесте платформа выдержала 8 запросов в секунду и превысила целевой показатель 7 RPS.

В кешировании важно было учитывать уровни доступа операторов к статьям в базе знаний. Для этого настроили проверку:

  1. Система идентифицирует сотрудника.

  2. Отбирает доступные ему статьи по ID.

  3. Рассчитывает для них хеши.

  4. Сохраняет результат в кеш.

Это позволяет возвращать корректный ответ для каждого пользователя с учётом уровня доступа, даже при одинаковых запросах

Результат

Сократили время поиска в 20 раз и получили 93% положительных оценок.

RAG-платформа ускоряет и упрощает работу более 12 000 операторов контакт-центра Альфа-Банка:

  • среднее время обработки запроса уменьшилось на 13%;

  • время на поиск информации сократилось в 20 раз.

AI-решение масштабировали на всех сотрудников Альфа-Банка. В ближайших планах улучшение качества ответов, эксперименты с новыми LLM и реализация поиска не только по тексту статей, но и по вложенным файлам.


Оцените кейс
Спасибо за оценку
Выскажите мнение
Авторизуйтесь, чтобы добавить свой комментарий.
оставить заявку

Хотите заказать похожий проект?

KTS с удовольствием обсудит вашу задачу

Оставить заявку