ITIF Technology Explainer: What Are Privacy Enhancing Technologies?

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Добрый день, дорогие читатели!

Теплого вам августовского дня и приятного отпуска тем, кто отдыхает.

Вот и я в отпуске прочла новость от 3 августа про то, что участники Ассоциации Больших данных (АБД), куда входят крупные отечественные компании, разрабатывающие системы ИИ, попросили разрешить Минцифры обрабатывать большие персональные данные без согласия граждан для разработки, обучения и использования ИИ.

Мотивация АБД следующая: «Сейчас такие данные продолжают считаться персональными даже после обезличивания, что может тормозить развитие ИИ в РФ. Участники рынка считают, что сейчас рынок данных в России развит слабо, а большинство датасетов остается внутри крупных экосистем».

Защиту данных АБД обещает обеспечить через так называемые «технологии повышения приватности». Я задумалась, насколько такой подход опасен с точки зрения защиты информации и существуют ли действительно методы гарантированной деперсонализации данных?

Технологии повышения приватности (Privacy Enhancing Technologies — PETs) — это набор математических и программных методов защиты личных данных, позволяющих обрабатывать, передавать и хранить информацию без риска ее утечки или раскрытия. В российском законодательстве понятие PETs отсутствует.

РЕТs включают в себя несколько способов деперсонализации данных. Интересующихся первоисточниками отсылаю сюда (https://itif.org/publications/2025/09/02/itif-technology-explainer-privacy-enhancing-technologies/) и сюда (https://martinfowler.com/articles/intro-pet.html).

Коротко говоря, существует 6 основных способов деперсонализации, которые я приведу ниже, и прокомментирую.

1. «Замыливание» персональных данных путём добавления к ним статистического шума и разных нерелевантных данных. В принципе, работающий инструмент, но он требует аккуратного подбора соответствующего «шума», чтобы его было сложно снять программным способом и вычленить-таки исходные данные.

2. Государственный обмен данными — это когда некоторая группа исследовательских или медицинских учреждений обменивается данными (например, о болезнях и симптомах), не разглашая персональных данных. В целом, этот метод рабочий и уже широко используется в нашей стране. Хотя, строго говоря, анамнез пациента за несколько лет абсолютно уникален — то есть отстоит далеко от других анамнезов в пространстве данных. Его практически нельзя эффективно обезличить. Стоит участнику «обмена данными» добавить к анамнезу обогащение имеющимися у него данными — например, сведениями о поездках на такси в клиники за последние 10 лет, или данными о заказах в аптеках, или запросами о лекарствах в поисковиках, или данными о страховых возмещениях по ОМС — как тут же сличением векторов однозначно восстанавливается ФИО пациента. Изнутри системы риск утечки данных существует и безо всякого обмена, просто через сотрудников этих самых учреждений.

3. Безопасные многосторонние вычисления — когда университеты, например, обмениваются уже между собой вычисленными данными (сигнатурами, «векторами», «хэшами») об объектах исследования, не передавая персональную информацию вообще. Но для этого способы вычисление «хэшей» и знания об их структуре должны быть общими, что снижает надёжность обезличивания.

4. Гомоморфное шифрование — это сложный математический алгоритм, который даёт возможность делать произвольные вычисления на зашифрованных данных без их расшифровки. Лет 10 назад это стало прорывом в области шифрования. Примеры использования — осуществление поиска по запросу без знания самого запроса; фильтрация спама без чтения содержимого писем; подсчёт голосов без вскрытия конвертов; тесты ДНК без чтения самих ДНК, и многое другое. Это, наверное, самый надёжный способ деперсонализации данных. Правда, я не уверена, что шифрованные данные можно применять для обучения нейросетей.

5. Псевдоанонимизация — когда каждому лицу присваивается идентификатор вместо имени, а потом эти идентификаторы ещё и шифруются. Это довольно дешёвый способ, но не очень надёжный. Потому что идентификацию человека можно провести не по его идентификатору, а по набору его уникальных признаков, например, по лицу или географии перемещений (по «четырём точкам» в городе).

6. Есть ещё метод синтетических данных, который, например, используем мы в ИнфоВотч для тестирования своих продуктов. Он означает генерацию реалистично выглядящих персональных данных в большом количестве. Способ стопроцентно гарантирует безопасность личных данных реальных людей, поскольку не использует их вообще. Но, к сожалению, он практически непригоден для обучения ИИ-моделей, так как последним нужны именно реальные данные.

Резюмирую вышесказанное: методы обезличивания действительно существуют и вроде как даже довольно эффективные, по заверениям разработчиков.

Но, во-первых, даже на первый взгляд перечисленные методы плохо подходят для обучения нейросетей.

Во-вторых, чем надёжнее скрыты (зашумлены, зашифрованы) данные, тем сложнее и дороже их использование для обучения ИИ. А если же компании получат право самостоятельно обезличивать данные, то какой метод они выберут — самый надёжный или самый дешёвый?

В-третьих, проверка и сертификация анонимизации — это технически довольно сложная задача. Кто будет этим заниматься? Или дело ограничится собственными добровольными декларациями компаний в духе «мамой клянусь, что надёжно»?

Ну, и наконец, есть виды данных, обезличивание на которых вообще не работает. Например, распознавание лиц. Обезличивай – не обезличивай, а лицо всё равно привязано к конкретному человеку.

Ну и основной вопрос: а зачем вообще АБД нужны персональные данные?

Чему на самом деле можно обучать ИИ-модели на личных данных граждан и зачем? Показу ещё более таргетированной рекламы для стимуляции ещё большего числа импульсных покупок? Построению индивидуальных образовательных траекторий, ценность которых не просто сомнительная, а прямо нарушает право на личную жизнь и судьбу? Построению социального рейтинга?

Точно ли стоит ради этих сомнительных или прямо вредных целей отменять или ослаблять ФЗ-152 о защите персональных данных, который в ноябре 2024 года был усилен законодателями при активном сопротивлении цифрового бизнеса и АБД (помните — были введены оборотные штрафы, уголовная ответственность руководства компаний и госорганов за утечку ПДн)?

Роскомнадзор, кстати, внимательно следит за выполнением этого закона, защищая права граждан на частную жизнь. Поэтому я всё-таки надеюсь, что данная антиконституционная и антиобщественная инициатива АБД реализована не будет.


Телеграм: t.me/ainewsline

Источник: itif.org

Комментарии: