Бюджет: 4000 UAH Срок: 5 дней
Доброго дня!
Соберу базу на Python, але не парсером по сайтах наосліп, а насамперед через відкриті академічні API — OpenAlex, Crossref, ORCID і OAI-PMH українських журналів на OJS. Там дані віддаються офіційно й пачками: автор, установа, посада, посилання на джерело, а в метаданих статей у Crossref лежить пошта автора для листування. Сайти кафедр та інституційні репозитарії добираю зверху, щоб закрити тих, хто мало публікується за кордоном.
На виході один файл у Excel і CSV: ПІБ, email, установа, посада, посилання на джерело, дата збору. Дублікати чищу у два проходи — за email і за нормалізованим ПІБ разом з установою, бо люди міняють афіліацію і просте порівняння рядків тут не спрацьовує. Пошти проганяю через перевірку синтаксису та MX-запису домену, статус виношу окремою колонкою, щоб ви одразу бачили, що з бази робоче.
Питання по суті: який орієнтир за обсягом ви тримаєте — умовно 5 тисяч контактів чи ближче до 30-40 тисяч? І чи лишати в базі рядки без знайденої пошти як заготовку, чи потрібні тільки контакти з email? Від цього залежить, куди тягнути глибину збору.
Ціна 4000 грн, як у бюджеті, строк 5 днів. Проміжний зріз на кілька сотень рядків покажу вже на другий день, щоб ви звірили структуру колонок до того, як я поїду по всьому масиву.
Петро Панков, BotCraft Group