И здесь я бы выделил еще один важный вектор — возможности, которые дают современные агенты на базе передовых моделей. С их помощью можно быстро и просто создавать корпоративные приложения, автоматизирующие множество функций. Это, с одной стороны, позволяет быстро закрывать текущие задачи. С другой — они способны вытеснять большие корпоративные системы. Например, у нас в GlowByte буквально за несколько недель была разработана новая, более удобная система актуализации резюме сотрудников, интегрированная с системой учета рабочего времени. Это в том числе позволило нам оперативно видеть, в каких проектах участвовал сотрудник, но которые еще не отражены в его резюме. Иными словами, разработка таких систем сегодня стала более простой и быстрой.
— В каких сценариях заказчики уже видят практическую пользу от генеративного ИИ?Приведу несколько примеров задач из реальной практики проектов GlowByte:
- Автоматизация проверки договоров на предмет соответствия нормативным требованиям валютного контроля в финансовом секторе (в 100 раз сократилось время обработки одного контракта).
- Автоматизация документооборота при обработке заявок на корпоративное перестрахование в страховом секторе (в 5 раз сократилось время обработки одной заявки).
- Ассистент технической поддержки с поиском по документации и автоматическим заведением заявок в систему технической поддержки (в 10 раз сократилось количество обращений в службу поддержки).
- Агент по модерации текстов рекламных сообщений на предмет соответствия законодательству и внутренним регламентам компании (в 2 раза сократилось количество итераций модерации).
- Работа с корпоративными знаниями: используете ли RAG/поиск по базе знаний/ассистентов? Какие сложности чаще всего возникают?RAG — это основная архитектура для работы с корпоративными знаниями сегодня. Строить ассистентов на одной лишь предобученной модели (LLM) бессмысленно, так как она не знает ваших внутренних регламентов, номенклатуры или специфики продукта. Поэтому мы всегда используем подход, при котором модель ищет ответ в актуальной корпоративной базе знаний.
Основная сложность, с которой мы сталкиваемся на проектах с RAG, заключается в качестве и структуре самих данных. RAG работает ровно настолько хорошо, насколько хороша база знаний. Если документы противоречивы, неактуальны, не структурированы или содержат «воду», ИИ будет генерировать путаные или неверные ответы. Часто проект начинается не с написания кода, а с наведения порядка в документах.
Другой особенностью RAG-систем является производительность и стоимость. Инференс RAG-системы включает два этапа: поиск в векторной базе и генерацию ответа. Оба требуют ресурсов, и при масштабировании на тысячи запросов в день стоимость может стать сюрпризом.
Однако RAG — это зарекомендовавшая себя технология для таких задач, как:
- интеллектуальный поиск по внутренней документации и регламентам;
- чат-боты технической поддержки, в частности поиск решений по базе инцидентов, поиск ответов на типовые запросы и т. п.;
- помощники в анализе больших документов и отчетов (например, помощник юриста по проверке обязательных требований в договоре, проверка назначений на предмет соответствия клиническим рекомендациям).
- Как вы решаете вопросы качества в промышленной эксплуатации?MLOps/LLMOps (практики управления жизненным циклом моделей машинного обучения и больших языковых моделей) являются одним из ключевых направлений GlowByte.
Ключевые аспекты нашего подхода при построении MLOps/LLMOps-платформ:
- Централизованная платформа. Мы строим для заказчиков выделенную MLOps-платформу, которая стандартизирует процессы CI/CD (непрерывной интеграции и доставки) для пайплайнов данных и самих моделей.
- Управление версиями. Модель, как и код, должна быть версионирована вместе с данными, на которых она обучалась. Это единственный способ откатиться назад, если обновление прошло неудачно.
- Мониторинг качества. Мы обязательно внедряем системы мониторинга метрик качества модели в проде. Отслеживанию подлежат не только технические метрики модели, но также связанные с ней бизнес-метрики и метрики качества данных.
- LLMOps-специфика. Для языковых моделей мы добавляем мониторинг затрат на токены (единицы текста, которые обрабатывает модель), а также средства обеспечения безопасности, в частности Guardrails-контроли (фильтры безопасности для моделей).
- Вычисления и стоимость владения: что помогает снижать стоимость эксплуатации?Стоимость инференса — один из главных барьеров для масштабирования. Как справедливо отмечают многие эксперты, основные затраты связаны не с разработкой, а с эксплуатацией. Мы в GlowByte помогаем клиентам снижать совокупную стоимость владения двумя основными способами.
Первый — дистилляция и квантование моделей. Переход с огромной LLM на сжатую, дистиллированную модель, которая на конкретной задаче работает почти так же хорошо, но требует в разы меньше GPU-часов (часы использования графических процессоров). В ряде случаев можно добиваться снижения потребления GPU на 40−70% без значимой потери качества.
Второй — переход на гибридную инфраструктуру. Обработку критичных корпоративных данных следует реализовывать в локальном контуре. Помимо безопасности, это позволяет уйти от постоянной оплаты за токены в публичном облаке. Покупка сервера под инференс окупается за 1−2 года при постоянных высоких нагрузках. Тем не менее некритичные и менее предсказуемые по потреблению задачи генерации разумно отдавать облачным моделям через API (интерфейс для программного взаимодействия). Такой подход позволяет держать стоимость владения в оптимальных рамках.