ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-07-30 12:38 В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают. Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста. Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей. Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни. Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались. Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов. Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным. Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить. Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен. Проблема начинается там, где встречаются редкие, давно вышедшие из печати, почти уникальные издания. Антиквары в Германии и Нидерландах уже бьют тревогу: уходят книги, которыми годами никто не интересовался, включая узкоспециализированные и региональные работы. Для коллекционера или историка такой экземпляр настоящий артефакт: бумага, переплёт, владельческие пометки, особенности издания. Уничтожив его, мы теряем часть материальной истории. Мы наблюдаем классический ресурсный голод. Открытое веб пространство уже изучено от и до. Синтетические данные помогают, но не полностью решают проблему качества и разнообразия. Книги — один из последних крупных резервуаров донейросетевого текста. Компании действуют рационально с точки зрения инженерии и конкуренции. Проблема в том, что рациональность инженера и ценность культурного объекта плохо совместимы без дополнительных правил. Пока схема выглядит как «купить — извлечь нужные данные — уничтожить — ничего не отдать», люди буду реагировать крайне бурно, это мы сейчас наблюдает в зарубежном буктоке. Возможный компромисс довольно очевиден, на мой взгляд: массовые издания — сканировать любым удобным способом; редкие и коллекционные — только неразрушающими методами; действительно уникальные экземпляры — не трогать; извлекая данные из книг, которые могут быть частью культурного наследия, компании стоило бы возвращать людям полученную ценность. Хотя бы финансировать оцифровку публичных фондов, публиковать часть отсканированного корпуса или поддерживать реставрацию. Пока этого почти не происходит. Книга для модели и компании на данный момент всего лишь расходный материал. Для обычного человека она часто остаётся чем-то большим. И пока эти две оптики не научатся договариваться, история со скупкой и уничтожением старых книг будет продолжать вызывать ровно ту реакцию, которую мы наблюдаем сейчас со всевозможными сравнениями ситуации с известной книгой Брэдбери. Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|