Во внутренних документах компании часто хранится большое количество ценной информации: рабочие процедуры, шаблоны договоров, описания продуктов, технические инструкции, ценовая политика, правила обслуживания клиентов и материалы для обучения сотрудников.
Проблема возникает, когда сотруднику приходится искать нужный ответ в десятках папок, приложениях к электронным письмам и различных версиях одного документа. Поиск занимает время, а найденная информация не всегда оказывается актуальной.
Корпоративный ИИ-ассистент позволяет сотруднику задать вопрос на естественном языке и получить ответ, подготовленный на основе внутренних документов компании.
Например:
- Каков порядок согласования расходов?
- Какой шаблон договора нужно использовать для этого клиента?
- Что делать, если клиент хочет отменить заказ?
- Какие документы нужны при приёме нового сотрудника?
- Каков гарантийный срок конкретного продукта?
Однако подключение внутренних документов к ИИ-системе создаёт и серьёзные риски. Неправильно разработанный ассистент может показать конфиденциальную информацию пользователю без соответствующих прав, использовать устаревшую версию документа или уверенно сформировать ответ, которого нет в источниках.
Поэтому создание безопасного ИИ-ассистента следует начинать не с загрузки документов, а с понятной архитектуры, модели доступа и правил управления рисками.
Что такое корпоративный ИИ-ассистент?
Корпоративный ИИ-ассистент — это система, которая использует языковую модель, чтобы помогать сотрудникам находить, обобщать и понимать информацию организации.
В простейшем варианте ассистент:
- получает вопрос сотрудника;
- находит подходящие фрагменты во внутренних документах;
- передаёт найденные фрагменты языковой модели;
- формирует ответ;
- показывает использованные источники.
Такой подход часто называют retrieval-augmented generation, или RAG. Языковая модель не полагается только на свои общие знания, а получает конкретные фрагменты корпоративных документов для подготовки ответа.
RAG хорошо подходит для внутренней базы знаний, поскольку документы можно обновлять и дополнять без переобучения всей языковой модели.
Однако RAG сам по себе не является механизмом безопасности. Один лишь поиск документов не предотвращает prompt injection, несанкционированный доступ или утечку конфиденциальной информации.
1. Начните с одного конкретного сценария использования
Первая версия ассистента не должна пытаться отвечать на все вопросы компании.
Безопаснее выбрать один чётко ограниченный сценарий, например:
- объяснение кадровых процедур;
- поиск внутренних IT-инструкций;
- помощник по документации продуктов;
- база знаний для службы поддержки;
- поиск документов системы менеджмента качества;
- продуктовый помощник для отдела продаж.
Для каждого сценария необходимо определить:
- кто может использовать ассистента;
- к каким документам он имеет доступ;
- на какие вопросы он может отвечать;
- какие данные он не должен обрабатывать;
- можно ли использовать ответ без проверки человеком;
- как будет измеряться качество ответов.
Если границы проекта не определены, объём документов, права доступа и требования безопасности могут быстро стать неконтролируемыми.
2. Проведите инвентаризацию и классификацию документов
До подключения документов к ИИ-ассистенту необходимо составить перечень источников данных.
Документы желательно разделить как минимум на три категории.
Публичная информация
Материалы, которые компания могла бы разместить и на своём сайте:
- описания продуктов;
- публичные инструкции;
- часто задаваемые вопросы;
- маркетинговые материалы.
Информация для внутреннего использования
Документы, предназначенные для сотрудников, но раскрытие которых обычно не привело бы к критическому ущербу:
- рабочие процедуры;
- внутренние инструкции;
- учебные материалы;
- шаблоны для работы над проектами.
Конфиденциальная информация
Документы, требующие строгого контроля доступа:
- данные клиентов;
- договоры;
- модели ценообразования;
- финансовая информация;
- кадровые документы;
- коммерческие тайны;
- процедуры безопасности.
В первоначальном пилотном проекте желательно использовать только первые две категории.
Особые категории персональных данных, чувствительную кадровую информацию и критические инструкции по доступу не следует добавлять без оценки специалистов по защите данных и информационной безопасности.
GDPR предусматривает принципы ограничения цели, минимизации данных, ограничения срока хранения, целостности и конфиденциальности. Это означает, что компания должна уметь обосновать, почему конкретные персональные данные нужны ИИ-ассистенту и как долго они будут храниться.
3. Не используйте языковую модель как хранилище документов
В безопасной архитектуре документы обычно не загружаются в языковую модель на неопределённый срок.
Вместо этого они хранятся в контролируемом корпоративном хранилище, системе управления документами или поисковой инфраструктуре.
Когда пользователь задаёт вопрос, система находит лишь несколько наиболее релевантных фрагментов и передаёт их модели для подготовки ответа.
Типичная архитектура включает:
- источники документов;
- процесс обработки и индексации;
- метаданные прав доступа;
- поисковую или векторную базу данных;
- языковую модель;
- ссылки на источники в ответах;
- журналы аудита.
Такой подход позволяет удалять, заменять или обновлять документы без перестройки всей системы.
Он также помогает контролировать, какая информация передаётся внешнему поставщику языковой модели.
4. Сохраняйте исходные права доступа к документам
Одна из наиболее серьёзных ошибок — размещение всех документов в общей базе знаний без ограничений доступа.
Если сотрудник не имеет права открыть документ в файловой системе компании, он не должен получать его содержание и через ИИ-ассистента.
Для каждого документа следует сохранять такие метаданные, как:
- подразделение;
- владелец документа;
- уровень конфиденциальности;
- разрешённые группы пользователей;
- страна или юридическое лицо;
- срок действия документа;
- номер версии.
До начала поиска система должна идентифицировать пользователя и отфильтровать документы в соответствии с его правами.
Фильтрация должна выполняться до передачи фрагментов языковой модели, а не только после формирования ответа.
Подход zero trust, или нулевого доверия, основан на защите конкретных ресурсов и проверке каждого запроса доступа. Пользователь не считается доверенным только потому, что подключён к корпоративной сети.
На практике безопасное решение может использовать:
- единый вход;
- многофакторную аутентификацию;
- ролевой или атрибутивный контроль доступа;
- принцип минимально необходимых прав;
- регулярную проверку прав пользователей;
- немедленное закрытие доступа после окончания трудовых отношений.
5. Контролируйте процесс добавления документов
Сам документ также может стать источником атаки.
Вредоносный или небрежно подготовленный файл может содержать инструкции, пытающиеся изменить поведение ИИ-ассистента. Например, в документе может быть скрыто указание игнорировать системные правила, раскрыть содержание других файлов или выполнить неразрешённое действие.
Такой риск называется косвенной prompt injection.
В процессе добавления документов следует:
- разрешать только утверждённые форматы файлов;
- проверять файлы на вредоносное программное обеспечение;
- ограничивать максимальный размер файла;
- регистрировать пользователя, загрузившего документ;
- проверять владельца документа;
- контролировать внешние ссылки;
- сохранять происхождение документа;
- запрещать автоматический импорт недоверенных внешних файлов;
- отделять пользовательские загрузки от утверждённой базы знаний.
Особенно важно точно определить, какие сотрудники имеют право добавлять документы, которые автоматически станут доступны другим пользователям.
6. Управляйте версиями и актуальностью документов
Ответ ИИ-ассистента может быть технически правильным, но бесполезным для бизнеса, если он основан на устаревшем документе.
Для каждого источника желательно хранить:
- дату создания;
- дату последнего изменения;
- дату вступления в силу;
- ответственное лицо;
- статус документа;
- ссылку на заменяющий документ;
- срок следующего пересмотра.
По умолчанию система должна использовать последнюю утверждённую версию.
Архивные документы можно сохранять для юридических или исторических целей, но они не должны автоматически участвовать в подготовке повседневных ответов.
В ответе пользователю желательно показывать не только название документа, но и его версию и дату.
7. Требуйте источники для каждого важного ответа
Безопасный корпоративный ИИ-ассистент не должен создавать впечатление, что он всегда знает единственно правильный ответ.
В ответе желательно указывать:
- название использованного документа;
- конкретный раздел;
- версию документа;
- ссылку на оригинальный источник;
- предупреждение, если информации недостаточно.
В системных инструкциях следует установить, что ассистент:
- отвечает только на основе разрешённых источников;
- не выдумывает недостающую информацию;
- ясно сообщает о неопределённости;
- рекомендует обратиться к ответственному лицу, если источники противоречат друг другу;
- отказывается отвечать, если у пользователя нет доступа к необходимому документу.
Отображение источников не устраняет все ошибки, но позволяет сотруднику быстро проверить точность и актуальность ответа.
8. Изучите условия поставщика модели и сервиса
Перед передачей корпоративных документов внешнему ИИ-сервису необходимо выяснить:
- используются ли введённые данные для обучения модели;
- как долго хранятся запросы и ответы;
- в каком регионе обрабатываются данные;
- какие субподрядчики участвуют в обработке;
- доступно ли соглашение об обработке данных;
- можно ли настроить срок хранения;
- как выполняется удаление данных;
- шифруются ли данные при передаче и хранении;
- доступны ли подтверждения аудита безопасности;
- как сообщается об инцидентах безопасности.
Эти условия необходимо проверять в договоре и технической документации, а не предполагать на основании рекламных материалов.
Использование персональных данных при разработке и внедрении ИИ-решений следует оценивать отдельно для каждого конкретного случая.
9. Начните с режима только для чтения
Первой версии ассистента для внутренних документов желательно разрешить только:
- искать;
- обобщать;
- сравнивать;
- объяснять;
- готовить черновики.
Ассистент не должен автоматически:
- изменять документы;
- отправлять электронные письма;
- подтверждать платежи;
- изменять данные клиентов;
- подписывать договоры;
- удалять файлы;
- создавать учётные записи пользователей.
Если позднее ассистент получит доступ к корпоративным инструментам, каждое действие должно быть чётко ограничено, зарегистрировано и доступно для проверки.
Для высокорисковых действий необходимо подтверждение человека.
Чрезмерная автономность возникает тогда, когда ИИ-системе предоставляют более широкие права или функции, чем требуется для её конкретной задачи.
10. Проведите тестирование до запуска
До передачи ассистента сотрудникам необходимо провести тесты качества и безопасности.
Тесты качества ответов
Подготовьте 50–100 реальных вопросов и проверьте:
- найден ли правильный документ;
- соответствует ли ответ источнику;
- указана ли правильная версия;
- не добавлена ли выдуманная информация;
- понятен ли ответ пользователю.
Тесты контроля доступа
Создайте пользователей с разными ролями и проверьте:
- не может ли сотрудник отдела продаж найти кадровые документы;
- не видит ли внешний подрядчик внутренние финансовые данные;
- закрывается ли доступ бывшего сотрудника;
- скрывается ли название документа от пользователя без разрешения;
- не попадает ли фрагмент закрытого документа в ответ.
Тесты атак
Попробуйте намеренно ввести систему в заблуждение:
- попросите её игнорировать правила безопасности;
- запросите информацию, предназначенную другому пользователю;
- загрузите документ со скрытыми инструкциями;
- задайте вопрос, ответа на который нет в документах;
- попытайтесь добиться раскрытия внутренних системных инструкций.
Риски генеративного ИИ необходимо контролировать на протяжении всего жизненного цикла системы, включая управление, измерение, тестирование и регулярный пересмотр рисков.
Практический план внедрения
Этап 1: определите цель
Выберите одно подразделение, одну группу документов и один конкретный сценарий использования.
Этап 2: приведите документы в порядок
Удалите дубликаты, архивируйте устаревшие версии и назначьте владельца каждому документу.
Этап 3: создайте модель доступа
Определите, какие группы пользователей могут выполнять поиск в каждой категории документов.
Этап 4: разработайте пилотную версию
Начните с режима только для чтения, ограниченного количества пользователей и документов с низким уровнем риска.
Этап 5: протестируйте
Проверьте точность ответов, риски утечки данных, prompt injection и контроль доступа.
Этап 6: внедрите мониторинг
Регистрируйте ошибки, отзывы пользователей, использованные источники и инциденты безопасности.
Этап 7: расширяйте постепенно
Если пилотный проект успешен, добавьте следующую группу документов или подразделение и повторно проведите оценку рисков.
Распространённые ошибки
Одновременное добавление всех документов
Это увеличивает риск утечки данных, использования устаревшей информации и ошибок доступа.
Надежда только на системную инструкцию
Текстовое указание «не раскрывай конфиденциальную информацию» не может заменить технический контроль доступа.
Потеря прав документов во время индексации
Если в поисковой базе не сохраняются исходные разрешения, ассистент может обойти ограничения корпоративной файловой системы.
Отсутствие ссылок на источники
Без ссылки на документ сотрудник не может проверить правильность и актуальность ответа.
Предоставление слишком широких прав
Ассистент не должен получать возможность изменять корпоративные системы только потому, что это технически возможно.
Контрольный список безопасного ИИ-ассистента
Перед запуском проверьте:
- Определён ли один конкретный сценарий использования?
- Создан ли перечень документов и источников данных?
- Присвоены ли документам уровни конфиденциальности?
- Используются ли персональные данные только в обоснованном объёме?
- Сохраняются ли исходные права доступа?
- Проходят ли пользователи безопасную аутентификацию?
- Фильтруются ли результаты до передачи информации модели?
- Есть ли у документов владельцы и контроль версий?
- Показываются ли источники в ответах?
- Способен ли ассистент отказаться от неподтверждённого ответа?
- Не имеет ли первая версия ненужных прав на выполнение действий?
- Проверены ли условия поставщика по использованию данных?
- Выполнены ли тесты доступа и prompt injection?
- Ведутся ли журналы аудита?
- Определён ли порядок сообщения об ошибках и инцидентах?
Заключение
Безопасный корпоративный ИИ-ассистент — это не просто окно чата с подключёнными документами.
Это полноценная информационная система с проверкой личности пользователя, классификацией документов, контролем доступа, управлением версиями, журналами аудита и регулярным тестированием.
Наиболее безопасный подход:
- начать с одного конкретного сценария;
- использовать упорядоченные документы с низким уровнем риска;
- сохранять исходные права доступа;
- извлекать только информацию, разрешённую конкретному пользователю;
- показывать источник для каждого важного ответа;
- не предоставлять ассистенту ненужную автономию;
- проверять обоснование обработки персональных данных;
- проводить тесты качества и безопасности;
- расширять систему постепенно.
Ценность ИИ-ассистента заключается не только в более быстром поиске документов.
Правильно разработанная система помогает сохранять знания компании, стандартизировать выполнение рабочих процессов и сокращать время, которое сотрудники тратят на поиск информации.