ZADANIE:
Jest biblioteka z książkami PDF, które zawierają przewodniki po naprawie samochodów. Jakość źródeł jest „typograficzna” (to nie jest ręczne skanowanie stron z papierowych podręczników). Łączna objętość do 100 książek / łącznie około 30 000 stron.
Po naszej stronie zostanie przeprowadzona obróbka OCR wszystkich książek PDF zgodnie z uzgodnieniami i wymaganiami wykonawcy w tej sprawie.
Trzeba napisać system, który automatycznie wyciągnie (przeanalizuje) z tych książek wszystkie rozdziały, przeprowadzi ich klasyfikację tematyczną i odpowiednio umieści je w bazie danych.
Z CZEGO SKŁADA SIĘ PRACA SYSTEMU:
1. Parser PDF
Odczytuje książkę, znajduje wszystkie rozdziały, wyciąga tekst w odpowiedniej kolejności i wyciąga wszystkie obrazy i tabele. Główna trudność polega na tym, że każda strona jest złożona w trzy kolumny, tekst i obrazy są pomieszane. Standardowe odczytywanie PDF wiersz po wierszu da śmieci, potrzebna jest praca z współrzędnymi bloków.
2. Sprawdzanie jakości przez Claude API
Po analizie każdy rozdział jest wysyłany do Claude API. Claude odczytuje tekst i wydaje werdykt: wszystko w porządku — rozdział trafia do bazy; są problemy (tekst pomieszał się z dwóch kolumn, przerwa w sensie tekstu itp.) — rozdział jest automatycznie analizowany ponownie, do trzech prób. W przypadku niepowodzenia Claude wskazuje przyczyny zatrzymania.
3. Interfejs administratora
Prosty interfejs do zarządzania systemem: dodaj nową książkę, uruchom analizę, zobacz statystyki, zajmij się rozdziałami, które nie mogły zostać przeanalizowane po trzech próbach, i sprawdź logi błędów. Platforma — przeglądarka internetowa.
CO POWINNO BYĆ W EFEKCIE KOŃCOWYM:
Uruchamiasz polecenie z podaniem książki — system sam wszystko analizuje, sprawdza przez Claude i umieszcza w bazie.
Każdy rozdział w bazie: czysty tekst + powiązane z tekstem zdjęcia (PNG)
Funkcjonalny interfejs administratora z panelem sterowania, logami i zarządzaniem kolejką
README w języku rosyjskim
Ważne przed odpowiedzią! Pokaż przykłady pracy z wydobywaniem tekstu z PDF na podstawie współrzędnych lub pracy z wielokolumnowym układem. Doświadczenie z LLM API jest mile widziane. Szczegółowe wymagania wyślemy po pierwszym kontakcie.