ЗАДАЧА:
Есть библиотека из PDF-книг, которые содержат руководства по ремонту автомобилей. Качество источников «типографское» (это не постраничное ручное сканирование с бумажных мануалов). Общий объем до 100 книг / суммарно около 30 000 страниц.
На нашей стороне будет проведена OCR-обработка всех PDF-книг по согласованию и требованиям подрядчика по данной задаче.
Нужно написать систему, которая автоматически вытащит (распарсит) из этих книг все разделы, проведет их тематическую классификацию и адресно разложит их в базу данных.
ИЗ ЧЕГО СОСТОИТ РАБОТА СИСТЕМЫ:
1. Парсер PDF
Читает книгу, находит все разделы, извлекает текст в правильном порядке и вытаскивает все изображения и таблицы. Главная сложность — каждая страница сверстана в три колонки, текст и картинки перемешаны. Стандартное построчное чтение PDF даст мусор, нужна работа с координатами блоков.
2. Проверка качества через Claude API
После парсинга каждый раздел отправляется в Claude API. Claude читает текст и выносит вердикт: всё ок — раздел уходит в базу; есть проблемы (текст смешался из двух колонок, смысловой разрыв по тексту и т.д.) — раздел автоматически перепарсируется ещё раз, до трёх попыток. В случае неудачи Claude указывает причины остановки.
3. Интерфейс администратора
Простой интерфейс для управления системой: добавить новую книгу, запустить парсинг, посмотреть статистику, разобраться с разделами, которые так и не смогли распарситься после трёх попыток, и посмотреть логи ошибок. Платформа — веб-браузер.
ЧТО ДОЛЖНО ПОЛУЧИТЬСЯ В ИТОГЕ:
Запускаешь команду с указанием книги — система сама всё парсит, проверяет через Claude и раскладывает по базе.
Каждый раздел в базе: чистый текст + привязанные к тексту фотографии (PNG)
Рабочий интерфейс администратора с дашбордом, логами и управлением очередью
README на русском
Важно перед откликом! Покажите примеры работы с координатным извлечением текста из PDF или работой с многоколоночной вёрсткой. Приветствуется опыт с LLM API. Расренное ТЗ вышлем после первого контакта.