• Проекты 16
  • Оценка 5.0
  • Рейтинг 3 183

Бюджет: 15000 UAH Срок: 10 дней

Добрый день.
Для задачи с трехколоночной версткой и извлечением блоков текста вместе с картинками можно написать кастомный координатный парсер, но как более надежную альтернативу предлагаю рассмотреть специализированные API вроде AWS Textract или Google Document AI. Они нативно распознают сложный многоколоночный лейаут и отдают готовую структуру, что значительно снизит количество ошибок перед отправкой текста на проверку.

Всю серверную логику с маршрутизацией, валидацией через Claude API в три попытки и сохранением результатов реализую на Node.js с Typescript. Интерфейс администратора для управления очередью книг, вывода статистики и просмотра логов по проблемным разделам соберем на Next.js.

В личных сообщениях покажу примеры скриптов извлечения данных из документов со сложной структурой и интеграции с LLM API. Буду рад изучить расширенное техническое задание.

  • Проекты 1 302
  • Оценка 5.0
  • Рейтинг 105 072

Бюджет: 27000 UAH Срок: 7 дней

Здравствуйте. Работаю с React/Node.js более 8 лет. Готов к сотрудничеству. Обращайтесь.

  • Проекты -
  • Оценка -
  • Рейтинг 247

Бюджет: 2000 UAH Срок: 2 дня

Добрый день! Готов выполнить вашу задачу за умеренную цену в обмен на хорошую оценку работы.

  • Проекты 12
  • Оценка 5.0
  • Рейтинг 1 356

Бюджет: 15000 UAH Срок: 7 дней

Здравствуйте,
У меня есть опыт работы с библиотекой Tesseract и с блоками в частности. Реализую сервер с функционалом на Node.js/Python/Go (в зависимости от ваших предпочтений), фронт-энд на Vue или React. С LLM тоже работал, могу сделать универсальный интерфейс для замены агентов по необходимости.

Буду рад сотрудничеству!

  • Проекты 5
  • Оценка 5.0
  • Рейтинг 2 046

Бюджет: 1000 UAH Срок: 1 день

Здравствуйте, у меня есть опыт в создании систем и сервисов для парсинга данных. Готов быстро и качественно разработать для вас парсер с учетом всех требований. Предлагаю обсудить детали в личных сообщениях.

  • Проекты -
  • Оценка -
  • Рейтинг 358

Бюджет: 3999 UAH Срок: 7 дней

Добрый день!

Задача понятна. Есть релевантный опыт: разрабатывал систему автоматической загрузки и обработки PDF-счетов через API (проект есть на GitHub). Система включала GUI-интерфейс, выбор диапазона дат, автозагрузку и автообработку файлов.

По вашему проекту реализую:
PDF парсинг с работой по координатам блоков (pymupdf/pdfplumber) для корректного чтения трёхколоночной вёрстки
Pроверка качества через Claude API с автоперепарсингом
Celery + Redis для очереди задач (30 000 страниц — нужна стабильная очередь)
Админпанель с дашбордом и логами
PostgreSQL для хранения разделов + PNG

  • Проекты 53
  • Оценка 5.0
  • Рейтинг 6 979

Бюджет: 4000 UAH Срок: 1 день

Понимаю задачу по разработке надежного решения для парсинга PDF-руководств по ремонту автомобилей, с извлечением текста и изображений из большого объема типографских источников. Имею глубокий опыт создания сложных систем для извлечения структурированных данных из неструктурированных источников, включая техническую документацию и масштабные библиотеки документов. Для такого объема и специфики данных критична архитектура, обеспечивающая точность извлечения, обработку ошибок и дальнейшее масштабирование для аналитики или отображения. Уточните, пожалуйста, какова конечная цель использования извлеченных данных: для формирования поисковой базы, интерактивной документации или чего-то еще? Буду рад обсудить это детально, чтобы предложить оптимальное решение и оценить сроки с бюджетом.

  • Проекты 14
  • Оценка 5.0
  • Рейтинг 1 506

Бюджет: 2000 UAH Срок: 1 день

Здравствуйте! Смогу реализовать. Напишите в личку, чтобы обсудить все детали. Буду рад сотрудничеству!

  • Проекты -
  • Оценка -
  • Рейтинг 387

Бюджет: 10000 UAH Срок: 2 дня

Здравствуйте.

В вашем ТЗ ключевая сложность — не OCR, а корректная реконструкция структуры: 3-колоночная верстка + смешанный текст/изображения. Если читать PDF “как есть”, получите перемешанный текст и потерю логики разделов.

Я предлагаю другой подход:

1. Парсинг через координаты (layout-aware)
Разбиваю страницу на блоки → кластеризую колонки → восстанавливаю порядок чтения. Это убирает смешивание текста между колонками.

2. Привязка контента

  • Проекты -
  • Оценка -
  • Рейтинг 163

Бюджет: 15000 UAH Срок: 10 дней

Владимир, здравствуйте!

Отличная и нетривиальная задача. Парсинг многоколоночных PDF — это всегда боль, но ваш подход с валидацией смысловых разрывов через Claude API делает систему очень умной и отказоустойчивой.

Плюс, тема мануалов мне лично очень близка: сам обслуживаю свои автомобили (от ВАЗ 2105 до Mercedes), поэтому прекрасно понимаю специфику ремонтных руководств. Я сразу увижу на тестах, если парсер перепутает порядок сборки узла из соседних колонок.

Как я предлагаю технически реализовать пайплайн:

Парсер (Координаты): Использовать библиотеку PyMuPDF (fitz) или pdfplumber. Они позволяют вытягивать bounding boxes (точные координаты x,y). Мы напишем эвристику, которая будет читать блоки строго по колонкам (сверху-вниз, слева-направо), вырезать колонтитулы и отдельно сохранять PNG-схемы с привязкой к абзацу.

  • Проекты -
  • Оценка -
  • Рейтинг 97

Бюджет: 4000 UAH Срок: 1 день

Здравствуйте! Готов выполнить данный проект есть большой опыт разработки различных приложений

  • Проекты 17
  • Оценка 5.0
  • Рейтинг 3 550

Бюджет: 15000 UAH Срок: 14 дней

Добрый день.

Готов реализовать такую систему под ключ: парсинг PDF с координатным разбором многоколонной верстки, тематическая классификация разделов, сохранение в БД и веб-админка для управления очередью, логами и проблемными кейсами.

Используемый стек:

Backend: Python, FastAPI / Django, Celery, PostgreSQL
Интеграции: PyMuPDF / pdfplumber, Claude API, OCR pipeline
Frontend: Django Admin или отдельная web-admin панель
Инфраструктура: Docker, Redis

  • Проекты -
  • Оценка -
  • Рейтинг 816

Бюджет: 10000 UAH Срок: 10 дней

Добрый день!

Задача понятна. Проблему с многоколонной версткой решаю через координатное извлечение (PyMuPDF): алгоритм считывает X/Y координаты блоков и собирает текст с картинками строго вертикально внутри каждой зоны, а не слева направо. Валидация через Claude API — отличное решение.

Для управления всем конвейером подниму отдельный веб-сервер (FastAPI или Flask). Сделаю удобную админку в браузере, где вы сможете загружать новые PDF, видеть дашборд с логами Claude и разбирать отклоненные разделы.

Жду расширенное ТЗ, готов обсудить детали.

  • Проекты 21
  • Оценка -
  • Рейтинг 612

Бюджет: 10000 UAH Срок: 10 дней

Здравствуйте. Могу сделать ваш проект. Опыт есть. Пишите договоримся.

  • Проекты -
  • Оценка -
  • Рейтинг 332

Бюджет: 7000 UAH Срок: 9 дней

Добрый день Владимир. Есть опыт работы с парсерами pdf вытаскивают даже кривые сканы. Также есть опыт работы с api нейросетей и их интеграцией в боты. Если проект ещё актуален. Предлагаю обсудить детали сотрудничества.

  • Проекты 43
  • Оценка 4.6
  • Рейтинг 4 921

Бюджет: 1000 UAH Срок: 3 дня

Добрый день!

Готов разработать систему для парсинга и классификации разделов из ваших PDF-книг. Имею обширный опыт работы с координатным извлечением текста из PDF и многоколоночной вёрсткой, а также интеграцией LLM API для контроля качества и тематической классификации.

Напишите мне для обсуждения деталей и получения расширенного ТЗ.

  • Проекты 79
  • Оценка 4.8
  • Рейтинг 3 064

Бюджет: 6000 UAH Срок: 2 дня

Добрый день! Могу реализовать такую систему в виде веб-приложения!!! Обращайтесь!!!

  • Проекты 20
  • Оценка 5.0
  • Рейтинг 2 430

Бюджет: 15000 UAH Срок: 5 дней

Добрый день, готов выполнить ваше задание быстро и качественн, имею большой опыт в разработке различных парсеров. Напишите в личные сообщения обсудим детали. С радостью помогу)

  • Проекты 20
  • Оценка 5.0
  • Рейтинг 9 264

Бюджет: 10000 UAH Срок: 3 дня

Добрый день. Оглянув задачу, могу реализовать координатный парсинг PDF, проверку качества через Claude API, повторные попытки парсинга и веб-интерфейс для управления книгами, логами и проблемными разделами.

Есть опыт работы с парсингом PDF и проверкой данных (https://freelancehunt.com/project/parser-pdf-bankivskih-vipisok/1578814.html), также работал с Azure OCR, поэтому понимаю нюансы сложной верстки и многоколонного текста.

Хотел бы посмотреть примеры книг, особенно сложные по структуре, чтобы точнее оценить подход и сроки. Также интересно, есть ли требования по скорости обработки.

Готов обсудить детали.

  • Проекты 36
  • Оценка 5.0
  • Рейтинг 1 329

Бюджет: 5000 UAH Срок: 3 дня

Здравствуйте. Есть опыт работы с пдф, понимаю о чем идёт речь и понимаю сложности. Обращайтесь, обсудим детали и бюджет.

  • Проекты -
  • Оценка -
  • Рейтинг 496

Бюджет: 10000 UAH Срок: 1 день

✋ Здравствуйте! Мы IT-компания dZENcode.

Мы реализуем Python‑сервис парсинга PDF с координатным разбором вёрстки, извлечением текста и изображений, классификацией разделов, валидацией через Claude API и веб‑админкой, опираясь на опыт команды, лучшие практики и собственные наработки.

Какая структура разделов и правила тематической классификации?
Будут координаты текстовых блоков после OCR?

Подробную информацию о наших услугах и ставках вы найдёте на сайте: Freelancehunt
Посмотрите – дальше обсудим детали работы, пишите, как будете готовы.

Сервис аренды автомобилей
  • Проекты -
  • Оценка -
  • Рейтинг 390

Бюджет: 5000 UAH Срок: 5 дней

Добрый день! 👋

Задача понятна — это не просто парсинг PDF, а построение полноценного пайплайна обработки данных с контролем качества через LLM. Как раз имею релевантный опыт в таких системах.

Опыт в подобных проектах

Работал над:

— парсингом сложных PDF (многостолбцовые, таблицы, смешанные блоки)
— извлечением текста через координаты (pdfplumber / PyMuPDF)

  • Проекты 146
  • Оценка 5.0
  • Рейтинг 6 223

Бюджет: 10000 UAH Срок: 10 дней

Добрый
Есть опыт и наработки по парсингу сложных PDF, содержащих таблицы, графики и диаграммы. Предлагаю использовать подход с несколькими инструментами. OCR с вашей стороны под вопросом, скорее всего будет удобнее его реализовать вместе с остальным функционалом, тем более, то вряд ли вы будете использовать какие-то уникальные инструменты, о которых я не знаю.
Для проверки качества есть еще пару вариантов vl моделей, надо будет протестировать.
Нужны образцы книг, желательно самых сложных по структуре, для тестов.
Еще вопрос по скорости парсинга - какие минимальные-макс требования, если таковые есть.

В списке не показаны ставки, скрытые заказчиком или фрилансером c профилем Plus, а также ставки, нарушающие правила

Актуальные фриланс-проекты в категории Python

  1. Не указан
  2. Разработка ботов 69 ставок 31 июля

    3000 UAH
  3. Парсинг данных 47 ставок 30 июля

    Не указан
  4. 20 000 UAH
  5. Разработка ботов 88 ставок 27 июля

    Не указан