Budżet: 25000 UAH Termin: 8 dni
⚙️ OCR + NLP-pipeline dla dokumentów medycznych — moja codzienna praca. Wiem, gdzie takie projekty zazwyczaj napotykają trudności: nieczytelne skany, różnorodne formaty formularzy, mieszany język terminologii.
Zrobię wyciąg z danych strukturalnych z raportów i formularzy długoterminowej opieki za pomocą Pythona — z wstępnym oczyszczeniem wyjścia OCR i modelem NLP do wyciągu pól.
Na wejściu: skany/zdjęcia dokumentów
Rozpoznawanie tekstu (Tesseract lub podejście dostosowane do twoich danych)
NLP-wyciąg encji w strukturalnym JSON
Walidacja wyniku na próbie kontrolnej
Robiłem podobne rzeczy z złożonymi raportami medycznymi — główną korzyścią jest to, że po skonfigurowaniu pipeline sam podstawia pola bez ręcznej pracy.
Mogę zacząć dzisiaj, na początek potrzebna jest tylko próbka dokumentów.
Napisz — a w ciągu 10 minut przedstawię plan pierwszego etapu dostosowanego do twoich formatów.