ИИ в архиве: как сэкономить время, превратив фотографии в структурированные метаданные

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Мы все с этим сталкивались: проводишь неделю в архиве, делая сотни, если не тысячи, фотографий документов. Это отличная поездка: там столько полезного материала для вашего исследования, и, пока вы делали пометки на ходу, вам придется погрузиться в изучение фотографий, чтобы найти все необходимое. Но сначала нужно вернуться к доработке статьи, которую вам вернули рецензенты, или закончить проверку выпускных работ. Спустя несколько недель, когда вы наконец готовы погрузиться в свои архивы, вы обнаруживаете, что смотрите на папку с 1000 файлов в формате JPEG, а в животе у вас образуется пустота от тревоги.

Существует множество инструментов, которые помогают справиться с этой проблемой. Некоторые историки обрабатывают каждый документ по мере поступления в архив, хотя у многих из нас нет столько времени. Другие используют Tropy, приложение с открытым исходным кодом, разработанное специально для систематизации исследовательских фотографий. Но в Tropy нет встроенного оптического распознавания символов, и вам все равно придется вручную группировать фотографии многостраничных документов и добавлять важные метаданные, такие как авторство и год. Я начал свою диссертацию, используя модифицированную версию рабочего процесса Zotero Елены Разлоговой для архива, который позволяет мне добавлять сканы напечатанных архивных документов, отредактированные с помощью распознавания текста, которые можно легко помечать, организовывать и цитировать вместе с моей библиотекой вторичных источников. Но работа с этим документом по одному за раз, будь то дома или в архиве по ходу дела, отнимает много времени. Хотел бы я быть штатным профессором из Лиги плюща с ассистентом, который мог бы выполнять всю эту рутинную работу: группировать фотографии по документам и сохранять каждый документ в базе данных с указанием названия, автора, даты, типа и информации о цитировании, чтобы я мог приступить к самому интересному: чтению документов и пониманию того, что они привносят в мой проект.

Что ж, я все еще скромный аспирант, но я нашел научного ассистента, который может выполнять всю эту работу за меня за поразительно низкую цену — 20 долларов в месяц. Его зовут Клод.

Мой рабочий процесс с использованием искусственного интеллекта

Как показал этот сабсток, большие языковые модели не могут заменить такие важнейшие функции историка, как внимательное чтение, критический анализ и написание текстов. Но для извлечения структурированных данных из изображений они стали весьма эффективными и недорогими инструментами. Мой рабочий процесс в архиве, схема которого представлена ниже, основан на таком разделении труда:

Я расскажу об этом рабочем процессе шаг за шагом, но сначала несколько оговорок: этот процесс разработан специально для меня, и вам, скорее всего, захочется адаптировать его под свои нужды (особенно если, например, архивные материалы, с которыми вы работаете, — это в основном изображения или рукописные документы). Вам также не обязательно использовать те же приложения, что и я, и вы даже можете настроить ИИ так, чтобы он просто брал необработанные фотографии с вашего телефона и импортировал их в Zotero. А если вы хотите узнать, как я настроил Claude для работы только с искусственным интеллектом, переходите к шагу 5.

Шаги 1 и 2: сканирование документов + оптическое распознавание символов

Я в архиве штата Нью-Йорк, просматриваю серию тематических файлов Контролера. Я открыл ящик 64 и достал папку 1. Здесь много полезного материала для моей главы о пенсионных фондах и прямых инвестициях. Пора приступать к сканированию.

Я сканирую документы с помощью приложения для iPhone/Android vFlat: за 4 доллара в месяц оно автоматически корректирует цвет, тени и даже кривизну страниц (что важно, когда я работаю с переплетенными журналами), поддерживает режим сканирования одной или двух страниц и имеет встроенную функцию оптического распознавания символов. Но вы с тем же успехом можете использовать Adobe Scan или приложение «Камера». Оптическое распознавание символов на этом этапе также необязательно — вы можете сделать это на своем ноутбуке, в Zotero с помощью расширения или даже поручить это искусственному интеллекту на пятом этапе.

После сканирования всей папки я выбираю все изображения в vFlat и нажимаю «Экспортировать в PDF». Я перекидываю файл на свой ноутбук. Опять же, на этом этапе вам даже не нужно преобразовывать изображения в PDF. Вы можете просто скопировать файлы в формате JPEG в папку на своем компьютере.

Шаг 3. Создайте элемент Zotero для сканирования папок

В своей библиотеке Zotero (у меня есть отдельная папка для каждого дня в каждом архиве, которая называется «подколлекция») я создаю элемент типа «рукопись» (элемент — это запись в базе данных Zotero, к которой могут быть прикреплены PDF-файл и заметки) и указываю в скобках название папки и номер коробки (скобки облегчают задачу для ИИ). «Рукопись» — это, по сути, тип элемента по умолчанию в Zotero для архивных документов. Затем я добавляю номер папки и ящика в поле “Loc. in Archive” и аббревиатуру архива (в данном случае это означает “Тематические файлы контролера штата Нью-Йорк, архивы штата Нью-Йорк"). Это важно: именно так я смогу позже процитировать все эти документы! Сейчас вам не нужно добавлять папку в Zotero, но я хотел бы сделать это просто в качестве дополнительного шага, чтобы убедиться, что ничего не потеряется в процессе анализа с помощью искусственного интеллекта. Просто не забудьте подписать PDF-файл или папку со сканированными изображениями папок, коробок и архивов информацией о цитировании.

Наконец, мне нравится использовать теги для организации материалов в Zotero. Когда я просматривала эту папку, то увидела, что все в ней связано с пенсионными фондами штата Нью-Йорк и корпоративными поглощениями, поэтому я добавила эти теги к папке. Когда ИИ извлечет отдельные документы, он автоматически скопирует эти теги на каждый из них. Это основная причина, по которой стоит использовать такую базу данных, как Zotero: через год, если я захочу переработать черновик своей главы и добавить больше информации о Нью-Йорке, я смогу мгновенно найти все архивные документы, журнальные и газетные статьи в Proquest и т. д. по тегу «пенсия в Нью-Йорке», а затем отсортировать их по дате, автору, другим тегам и т. д. Я могу забыть об источнике, но Zotero его не забудет.

В общем, вот как это выглядит после того, как я добавил в Zotero папку 1, поле 64:

Шаг 4

Повторяю это для каждой папки в каждой коробке, которая мне нужна. А потом, когда я вернусь домой…

Шаг 5. Запустите мой ИИ-навык «Zotero-split-scans»

Вот тут-то и начинается волшебство. С помощью Claude Code я создал «навык» — по сути, набор готовых подсказок и скриптов, — который позволяет Claude взять PDF-файл со сканами целой папки и превратить его в отдельные PDF-файлы и элементы Zotero для каждого документа. Для этого понадобилась подписка на Claude Pro за 20 долларов в месяц и немного времени, чтобы объяснить Claude Code, что я хочу, чтобы навык делал. Вот как это работает:

  1. Скачайте мой навык zotero-split-scans с Github и следуйте инструкциям по его установке в Claude Code или ChatGPT Codex). Вам понадобится Python, установленный на вашем компьютере (хотя писать код вам не придется), а также сгенерированный API-ключ для Zotero, который по сути является паролем, позволяющим Claude работать с вашей библиотекой Zotero. Вы также можете использовать агента-кодировщика на основе искусственного интеллекта, чтобы адаптировать этот навык к своему рабочему процессу, чтобы он мог взаимодействовать, скажем, с Obsidian, Tropy или DevonTHINK. Этот навык представляет собой всего лишь несколько скриптов на Python и инструкции для Claude о том, как их использовать.

  2. Запустите Claude Code и попросите его применить навык zotero-split-scans к элементу Zotero, созданному на шаге 3:

  1. Клод приступает к работе. Сначала он находит в Zotero запись «Папка 1, ящик 64» (подколлекция «NYSA: 2026-06-30»). Затем он извлекает изображения из PDF и определяет, какие страницы относятся к одному документу.

  1. После этого Claude создает краткое описание того, как он планирует сегментировать папку.

Этот навык позволяет классифицировать документы как газетные или журнальные статьи, письма (тип элемента Zotero для любой формы переписки) или рукописи (все остальное). Это основано на типах документов, которые обычно хранятся в моих архивах.

Я также настроил этот навык так, чтобы Claude распознавал рукописный текст и добавлял в качестве примечания в Zotero собственную расшифровку. Оптическое распознавание символов практически бесполезно при работе с рукописным текстом, и хотя большие языковые модели не дают стопроцентной гарантии, при проверке рукописного текста очень полезно иметь под рукой расшифровку, выполненную с максимальной точностью.

  1. Claude создает новые PDF-файлы и элементы в Zotero, добавляя соответствующие метаданные (в том числе копируя архивные теги, которые я вручную добавил при сканировании папки на шаге 3). Программа выполняет самопроверку, чтобы убедиться, что ни одна страница не была пропущена, и создает файл, в котором я могу проверить, как она сегментировала папку. Теперь моя коллекция в Zotero выглядит так:

Исходная папка со сканированными документами все еще здесь, но помечена как «ЗАВЕРШЕНО». Теперь все отсканированные документы снабжены метаданными, которые я могу искать в Zotero в любое время.

Вот попытка Клода расшифровать какой-то корявый почерк. Не особо полезно, но лучше, чем ничего!

Я пока не обнаружил ошибок в этой системе, но даже если они есть, метаданные легко обновить. Важно, чтобы я с самого начала немного упорядочил все. Даже если документ сейчас мне не нужен, его будет легко найти позже, если я захочу к нему вернуться. Например, если через несколько лет я захочу написать отдельную статью о Генри Кауфмане, я смогу мгновенно найти все необходимые источники, не тратя время на просмотр разрозненных заметок или фотографий.

А поскольку все документы были распознаны с помощью оптического распознавания символов, я могу использовать Zotero для поиска по полному тексту всех материалов в моей библиотеке по определенной фразе, даже если она не указана в метаданных или тегах:

Шаг 6. Станьте историком

Теперь, когда с текучкой покончено, мне нужно написать диссертацию!


Телеграм: t.me/ainewsline

Источник: computationalhistory.substack.com

Комментарии: