Бюджет: 25000 UAH Срок: 8 дней
⚙️ OCR + NLP-пайплайн для медицинских документов — моя ежедневная работа. Знаю, где такие проекты обычно спотыкаются: нечеткие сканы, разнообразные форматы бланков, смешанный язык терминологии.
Сделаю извлечение структурированных данных из отчетов и форм долгосрочного ухода через Python — с предварительной очисткой OCR-вывода и NLP-моделью для извлечения полей.
На вход: сканы/фото документов
Распознавание текста (Tesseract или подход под ваши данные)
NLP-извлечение сущностей в структурированный JSON
Валидация результата на контрольной выборке
Делал подобное со сложными медицинскими отчетами — главный выигрыш в том, что после настройки пайплайна он сам подставляет поля без ручной работы.
Могу стартовать сегодня, для старта нужна лишь выборка образцов документов.
Напишите — и я за 10 минут накидаю план первого этапа под ваши форматы.