Безопасность данных при работе с искусственным интеллектом
С 15 сентября 2025 года провайдеры больших языковых моделей начали резко сокращать сроки хранения запросов: логи обращений к API теперь удаляются автоматически через семь дней вместо прежних тридцати. Одновременно Казахстан ужесточил собственные правила: изменения в Закон «О персональных данных и их защите», введённые в действие с 18 января 2026 года, подняли штрафы за утечку до 10 000 МРП, а это при ставке МРП 2026 года в 4 325 тенге даёт около 43 миллионов тенге для юридического лица. Плюс появилось требование уведомлять регулятора об инциденте в течение 72 часов. Два этих факта — короткое хранение у вендора и большая ответственность у бизнеса — задают всю рамку разговора о безопасности данных при работе с ИИ.
В нашей практике в West Star Ltd мы почти каждый месяц сталкиваемся с одной и той же ситуацией: компания хочет подключить ИИ к своим процессам, но не понимает, куда именно уходят данные, кто их видит и что говорит по этому поводу казахстанский закон. Тема кажется технической, но на деле это в первую очередь вопрос дисциплины и правильно выстроенного контура. Ниже я разберу, где данные утекают на самом деле, что провайдеры моделей делают с вашими запросами, как всё это пересекается с требованиями РК и какие меры реально работают, а не создают видимость защиты.
ГДЕ ИМЕННО УТЕКАЮТ ДАННЫЕ
Первое заблуждение — считать, что главная угроза это «злой» провайдер модели, который украдёт ваши секреты. На практике крупные вендоры как раз довольно строго относятся к данным бизнес-клиентов, а основные утечки происходят внутри самой компании и по вине процессов, а не алгоритмов.
Самый частый канал — сотрудники, которые вставляют в публичный чат-бот куски рабочих документов: договоры, выгрузки с персональными данными клиентов, исходный код, финансовые отчёты. Человек хочет быстро получить резюме или найти ошибку, а по факту отправляет конфиденциальный текст на внешний сервис. Известный случай 2023 года, когда инженеры Samsung несколько раз загрузили внутренний код в публичный чат-бот, показал, что даже в технологической компании культура важнее любых политик на бумаге.
Второй канал — интеграции без разграничения прав. Когда ИИ-агента подключают к базе данных или к учётной системе «одним ключом с полным доступом», модель получает возможность прочитать гораздо больше, чем нужно для конкретной задачи. Если запрос сформулирован неудачно или в систему попал вредоносный текст, агент может вытащить лишнее.
Третий канал — журналы и промежуточные хранилища. Данные оседают не только у провайдера модели, но и в ваших собственных логах, в мониторинге, в кэше, в переписке между сервисами. Часто именно эти незаметные копии и становятся источником утечки, потому что за ними никто не следит так же строго, как за основной базой.
ЧТО ПРОВАЙДЕРЫ AI ДЕЛАЮТ С ВАШИМИ ДАННЫМИ
Здесь важно различать два принципиально разных режима работы, потому что их постоянно путают.
Первый режим — публичные потребительские чаты по бесплатной или личной подписке. С осени 2025 года у ряда крупных провайдеров переписка в таких тарифах по умолчанию используется для обучения будущих моделей, если пользователь сам не отключит эту опцию в настройках приватности. Для личных задач это допустимо, но для рабочих данных категорически нет: вы фактически отдаёте текст на неопределённый срок и теряете над ним контроль.
Второй режим — обращения через программный интерфейс и корпоративные тарифы. Здесь правила другие. Данные, переданные через API, не используются для обучения моделей, а сроки их хранения минимальны — у одного из ведущих вендоров логи API удаляются через семь дней и служат только для контроля злоупотреблений. Корпоративные и бизнес-договоры отдельно фиксируют, что содержимое запросов не идёт в тренировку.
Практический вывод простой: рабочие процессы нужно строить только на программном интерфейсе или корпоративных тарифах с подписанными условиями, а публичные бесплатные чаты держать подальше от любых чувствительных данных. Разница между этими двумя режимами и есть та граница, которую большинство компаний не проводит, а потом удивляется вопросам от проверяющих.
ЛОКАЛИЗАЦИЯ И ЗАКОН РК
Отдельный пласт, который в Казахстане нельзя игнорировать, — требование локализации. Закон прямо обязывает хранить персональные данные граждан Казахстана в базах, физически расположенных на территории страны. Это касается сайтов, CRM, клиентских баз, рассылок и облачных решений, и требование не исчезает от того, что доступ к серверу организован удалённо.
Возникает очевидное противоречие: большинство мощных языковых моделей работают за пределами Казахстана, на зарубежных дата-центрах. Означает ли это, что использовать их вообще нельзя? Нет, но означает, что архитектуру нужно продумывать заранее. Ключевая идея — разделять хранение и обработку. Сама база с персональными данными остаётся в казахстанском контуре, как того требует закон, а на внешнюю модель отправляется только то, что необходимо для конкретной задачи, и по возможности в обезличенном виде.
На практике это выглядит так: перед отправкой запроса из текста удаляются или заменяются прямые идентификаторы — ФИО, ИИН, номера телефонов, адреса. Модель работает с обезличенным фрагментом и возвращает результат, который уже внутри защищённого контура снова связывается с конкретной записью. Так вы получаете пользу от сильной модели, но не выносите наружу сам массив персональных данных. Плюс не забываем про обязанность уведомить регулятора об утечке в течение 72 часов — это значит, что мониторинг и журналирование должны быть настроены заранее, а не собираться в панике после инцидента.
КАК МЫ СТРОИМ БЕЗОПАСНЫЙ КОНТУР
За несколько лет внедрений у нас сложился набор мер, который мы считаем разумным минимумом, а не идеалом.
Первое — принцип минимальных прав. ИИ-агент получает доступ только к тем данным и функциям, которые нужны для его задачи, и никогда — ключ с полным доступом ко всей системе. Отдельная роль, отдельный ключ, ограниченный набор операций.
Второе — обезличивание на входе. Мы стараемся не отправлять во внешнюю модель то, что можно заменить условным идентификатором. Чем меньше чувствительного текста уходит наружу, тем меньше площадь риска.
Третье — контроль каналов. Сотрудникам объясняем и технически ограничиваем, какие сервисы допустимы для рабочих данных, а какие нет. Публичные бесплатные чаты для конфиденциальных материалов закрыты.
Четвёртое — журналирование и хранение под контролем. Мы фиксируем, какие запросы и куда уходили, но при этом сами следим за сроками хранения своих логов, чтобы не создавать второй, никем не охраняемый склад персональных данных.
Пятое — разделение хранения и обработки. Персональные данные граждан РК остаются в казахстанском контуре, а внешние модели используются только для вычислений над обезличенными фрагментами.
Ни одна из этих мер не является магией. Они работают только вместе и только при живой дисциплине команды.
ОГРАНИЧЕНИЯ И СЛАБЫЕ МЕСТА
Честно назову то, о чём в рекламных материалах обычно молчат.
Первое — обезличивание не абсолютно. По совокупности косвенных признаков человека иногда можно повторно идентифицировать даже без прямых идентификаторов. Стопроцентной анонимизации в общем случае не существует, и это надо принимать как данность.
Второе — политики провайдеров меняются. Сегодня данные API не используются для обучения и хранятся семь дней, но условия пересматриваются, и то, что верно на момент написания этой статьи, стоит перепроверять перед каждым серьёзным внедрением. Мы сами относимся к любым заявлениям вендоров как к тому, что нужно фиксировать в договоре, а не принимать на веру.
Третье — локализация усложняет и удорожает архитектуру. Разделять хранение и обработку, держать базу в РК и гонять обезличенные фрагменты наружу — это дополнительная инженерия, а значит время и деньги. Дешёвого способа быть одновременно быстрым и полностью соответствующим требованиям обычно нет.
Четвёртое — человеческий фактор побеждает технику. Можно выстроить идеальный контур, но один сотрудник, вставивший договор в личный чат-бот с телефона, обнуляет часть усилий. Обучение и культура здесь важнее любых настроек.
Пятое — ИИ добавляет новые типы атак. Внедрение вредоносных инструкций в текст, который читает агент, — это реальный класс угроз, которого не было в обычных системах. Полностью закрыть его пока не умеет никто, можно лишь снижать риск ограничением прав.
Шестое — соответствие закону это процесс, а не галочка. Требования РК обновляются, штрафы растут, появляются новые обязанности вроде уведомления за 72 часа. Один раз «сделать безопасно» не получится, за этим придётся следить постоянно.
ПРАКТИЧЕСКИЙ ВЫВОД
Специалисту, который непосредственно работает с ИИ: используйте только программный интерфейс или корпоративные тарифы, никогда не вставляйте рабочие данные в личные бесплатные чаты и приучите себя обезличивать текст до отправки. Это три привычки, которые закрывают большую часть бытовых рисков.
Руководителю отдела или проекта: пропишите понятную политику — какие сервисы разрешены, кто имеет доступ, как выдаются ключи по принципу минимальных прав. Настройте журналирование и заранее продумайте, кто и как уведомляет регулятора при инциденте, чтобы уложиться в 72 часа.
Собственнику бизнеса: воспринимайте безопасность данных при работе с ИИ не как разовый проект, а как постоянную статью расходов и зону ответственности. Требование локализации, растущие штрафы и меняющиеся политики провайдеров означают, что экономия на архитектуре сегодня может обернуться миллионами тенге штрафа завтра. Выгоднее заложить безопасный контур сразу, чем переделывать под давлением проверки.
ЧАСТЫЕ ВОПРОСЫ
Можно ли вообще законно использовать зарубежные ИИ-модели в Казахстане?
Да, если правильно построить архитектуру. Персональные данные граждан РК должны храниться в базе на территории страны, а внешней модели можно передавать обезличенные фрагменты для обработки. Само по себе использование зарубежной модели закон не запрещает — запрещает выносить наружу и хранить там персональные данные граждан.
Провайдер модели точно не обучается на наших данных?
Для обращений через программный интерфейс и корпоративные тарифы ведущие вендоры прямо заявляют, что данные не используются для обучения, а сроки хранения минимальны. Для бесплатных личных чатов это, как правило, не так — там переписка по умолчанию может идти в обучение. Поэтому рабочие процессы строят только на первом варианте, а условия фиксируют в договоре.
Что грозит за утечку персональных данных?
С 2026 года штрафы для юридических лиц за грубые нарушения выросли до 10 000 МРП, это около 43 миллионов тенге при ставке 2026 года. Дополнительно закон обязывает уведомить уполномоченный орган об утечке в течение 72 часов. Возможна и уголовная ответственность в тяжёлых случаях.
С чего начать, если мы только внедряем ИИ?
С трёх шагов: закрыть публичные бесплатные чаты для рабочих данных, перевести всё на программный интерфейс с подписанными условиями и настроить обезличивание плюс минимальные права доступа. Это даёт максимальный эффект при минимальных вложениях, а более тонкую архитектуру с разделением хранения и обработки можно достраивать дальше.