Бюджет: 9999 UAH Термін: 6 днів
Вітаю, Костянтине! Ваше завдання потребує системного підходу до обробки неструктурованих даних. Маю досвід роботи з PDF-аналітикою та розробки масштабованих Python-проєктів.
Мій план реалізації згідно з вашими вимогами:
Архітектура: Побудую модульну структуру (OOP), де кожен тип виписки — це окремий плагін-модуль. Це дозволить легко додавати нові банки без зміни ядра системи.
Гібридний парсинг: Використаю pdfplumber для миттєвого витягування тексту та EasyOCR/Tesseract для графічних елементів (печатки, рукописні дати). Це забезпечить швидкість 1–3 сек на файл.
Нормалізація: Створю універсальну схему даних (Transaction Model). На виході ви отримаєте чистий JSON або DataFrame з валідованими полями (дата, сума, призначення, залишок).
Навчання: Натреную логіку на ваших 3-х типах виписок, забезпечивши стійкість до зсувів верстки та специфічних кодувань банків.
Безоплатність: Використаю виключно open-source рішення без прив’язки до платних хмарних API.
Готовий обговорити структуру вихідного шаблону та розпочати розробку прототипу.
З повагою,
Віктор