Минцифры сделало критерии «суверенного ИИ» под GigaChat, т.к. требует наличия инфраструктуры обучения модели.

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Минцифры сделало критерии «суверенного ИИ» под GigaChat, т.к. требует наличия инфраструктуры обучения модели. Правда, в текущей редакции ФЗ «О развитии искусственного интеллекта» для «суверенных ИИ» оставили почти церемониальные права. С одной стороны есть право на господдержку, но она не гарантируется и с учётом текущего астрономического дефицита бюджета маловероятна в значительном объёме. ФЗ предполагает «суверенникам» участие в неких консультативных органах по ИИ при Правительстве, но те, что есть, на деле для всех участников рынка.

Отдельно ФЗ оговаривает, что суверенные модели могут потенциально, но не гарантированно применяться при обработке госданных. Тут GigaChat может найти нишу, но ему будет мешать то, что быть суверенным недостаточно. Доступ к госданным определяется отдельной регламентацией, которой ещё нет. Также госкомпании очевидно будут оказывать сильное сопротивление, т.к. их бюджеты ограничены, а GigaChat при таком же IQ, как у Qwen или DeepSeek, и лишь по ряду параметров требует затрат на оборудование в 10 раз больше. Поэтому госкомпаниям выгоднее придумывать варианты через подрядчиков с различным обезличиванием и суммаризацией данных.

Однако одна тема есть для GigaChat и для других LLM, которые обучают в России. Как я уже писал, ФЗ сделал суверенные ИИ «пиратами в законе», т.е. можно обучать на данных, закрытых copyright, свои LLM — нет никаких проблем даже для почти точного цитирования. Это потенциально позволяет ограбить владельцев различных справочников, прав и патентов. Не факт, что даже GigaChat первым впишется в эту тему, т.к. для этого нужно качество управления проектом выше, чем банальная смекалка. Однако какая-то крупная компания в России тут может разгуляться не детским образом. Просто не нужно пытаться делать конкурента DeepSeek или Qwen с их RL-обучением. Нужно просто действовать по методичкам Rutracker и загнать в pretraining кучу ценного copyright-контента, потом ещё придумать SFT для ответов на вопросы по нему. Модель должна быть, правда, большой (от 600B параметров), чтобы очень точно помнить все ворованные тексты. Однако количество краденой интеллектуальной собственности внутри такой модели может достигать миллиардов не рублей, а долларов. Очень многие покупатели прав на контент банально подключатся к такому «справочнику» и откажутся платить правообладателям.

Поэтому ещё раз отмечу — закрывайте репозитории, прячьте статьи с описанием технологий. Грядут времена неслыханного суверенного ИИ-грабежа.


Телеграм: t.me/ainewsline

Источник: kod.ru

Комментарии: