ITIF Technology Explainer: What Are Privacy Enhancing Technologies? |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-12 12:07 Добрый день, дорогие читатели! Теплого вам августовского дня и приятного отпуска тем, кто отдыхает. Вот и я в отпуске прочла новость от 3 августа про то, что участники Ассоциации Больших данных (АБД), куда входят крупные отечественные компании, разрабатывающие системы ИИ, попросили разрешить Минцифры обрабатывать большие персональные данные без согласия граждан для разработки, обучения и использования ИИ. Мотивация АБД следующая: «Сейчас такие данные продолжают считаться персональными даже после обезличивания, что может тормозить развитие ИИ в РФ. Участники рынка считают, что сейчас рынок данных в России развит слабо, а большинство датасетов остается внутри крупных экосистем». Защиту данных АБД обещает обеспечить через так называемые «технологии повышения приватности». Я задумалась, насколько такой подход опасен с точки зрения защиты информации и существуют ли действительно методы гарантированной деперсонализации данных? Технологии повышения приватности (Privacy Enhancing Technologies — PETs) — это набор математических и программных методов защиты личных данных, позволяющих обрабатывать, передавать и хранить информацию без риска ее утечки или раскрытия. В российском законодательстве понятие PETs отсутствует. РЕТs включают в себя несколько способов деперсонализации данных. Интересующихся первоисточниками отсылаю сюда (https://itif.org/publications/2025/09/02/itif-technology-explainer-privacy-enhancing-technologies/) и сюда (https://martinfowler.com/articles/intro-pet.html). Коротко говоря, существует 6 основных способов деперсонализации, которые я приведу ниже, и прокомментирую. 1. «Замыливание» персональных данных путём добавления к ним статистического шума и разных нерелевантных данных. В принципе, работающий инструмент, но он требует аккуратного подбора соответствующего «шума», чтобы его было сложно снять программным способом и вычленить-таки исходные данные. 2. Государственный обмен данными — это когда некоторая группа исследовательских или медицинских учреждений обменивается данными (например, о болезнях и симптомах), не разглашая персональных данных. В целом, этот метод рабочий и уже широко используется в нашей стране. Хотя, строго говоря, анамнез пациента за несколько лет абсолютно уникален — то есть отстоит далеко от других анамнезов в пространстве данных. Его практически нельзя эффективно обезличить. Стоит участнику «обмена данными» добавить к анамнезу обогащение имеющимися у него данными — например, сведениями о поездках на такси в клиники за последние 10 лет, или данными о заказах в аптеках, или запросами о лекарствах в поисковиках, или данными о страховых возмещениях по ОМС — как тут же сличением векторов однозначно восстанавливается ФИО пациента. Изнутри системы риск утечки данных существует и безо всякого обмена, просто через сотрудников этих самых учреждений. 3. Безопасные многосторонние вычисления — когда университеты, например, обмениваются уже между собой вычисленными данными (сигнатурами, «векторами», «хэшами») об объектах исследования, не передавая персональную информацию вообще. Но для этого способы вычисление «хэшей» и знания об их структуре должны быть общими, что снижает надёжность обезличивания. 4. Гомоморфное шифрование — это сложный математический алгоритм, который даёт возможность делать произвольные вычисления на зашифрованных данных без их расшифровки. Лет 10 назад это стало прорывом в области шифрования. Примеры использования — осуществление поиска по запросу без знания самого запроса; фильтрация спама без чтения содержимого писем; подсчёт голосов без вскрытия конвертов; тесты ДНК без чтения самих ДНК, и многое другое. Это, наверное, самый надёжный способ деперсонализации данных. Правда, я не уверена, что шифрованные данные можно применять для обучения нейросетей. 5. Псевдоанонимизация — когда каждому лицу присваивается идентификатор вместо имени, а потом эти идентификаторы ещё и шифруются. Это довольно дешёвый способ, но не очень надёжный. Потому что идентификацию человека можно провести не по его идентификатору, а по набору его уникальных признаков, например, по лицу или географии перемещений (по «четырём точкам» в городе). 6. Есть ещё метод синтетических данных, который, например, используем мы в ИнфоВотч для тестирования своих продуктов. Он означает генерацию реалистично выглядящих персональных данных в большом количестве. Способ стопроцентно гарантирует безопасность личных данных реальных людей, поскольку не использует их вообще. Но, к сожалению, он практически непригоден для обучения ИИ-моделей, так как последним нужны именно реальные данные. Резюмирую вышесказанное: методы обезличивания действительно существуют и вроде как даже довольно эффективные, по заверениям разработчиков. Но, во-первых, даже на первый взгляд перечисленные методы плохо подходят для обучения нейросетей. Во-вторых, чем надёжнее скрыты (зашумлены, зашифрованы) данные, тем сложнее и дороже их использование для обучения ИИ. А если же компании получат право самостоятельно обезличивать данные, то какой метод они выберут — самый надёжный или самый дешёвый? В-третьих, проверка и сертификация анонимизации — это технически довольно сложная задача. Кто будет этим заниматься? Или дело ограничится собственными добровольными декларациями компаний в духе «мамой клянусь, что надёжно»? Ну, и наконец, есть виды данных, обезличивание на которых вообще не работает. Например, распознавание лиц. Обезличивай – не обезличивай, а лицо всё равно привязано к конкретному человеку. Ну и основной вопрос: а зачем вообще АБД нужны персональные данные? Чему на самом деле можно обучать ИИ-модели на личных данных граждан и зачем? Показу ещё более таргетированной рекламы для стимуляции ещё большего числа импульсных покупок? Построению индивидуальных образовательных траекторий, ценность которых не просто сомнительная, а прямо нарушает право на личную жизнь и судьбу? Построению социального рейтинга? Точно ли стоит ради этих сомнительных или прямо вредных целей отменять или ослаблять ФЗ-152 о защите персональных данных, который в ноябре 2024 года был усилен законодателями при активном сопротивлении цифрового бизнеса и АБД (помните — были введены оборотные штрафы, уголовная ответственность руководства компаний и госорганов за утечку ПДн)? Роскомнадзор, кстати, внимательно следит за выполнением этого закона, защищая права граждан на частную жизнь. Поэтому я всё-таки надеюсь, что данная антиконституционная и антиобщественная инициатива АБД реализована не будет. Телеграм: t.me/ainewsline Источник: itif.org Комментарии: |
|