Budżet: 4000 UAH Termin: 5 dni
Dzień dobry!
Zbieram bazę na Pythonie, ale nie parserem po stronach na ślepo, a przede wszystkim przez otwarte akademickie API — OpenAlex, Crossref, ORCID i OAI-PMH ukraińskich czasopism na OJS. Tam dane są udostępniane oficjalnie i w paczkach: autor, instytucja, stanowisko, link do źródła, a w metadanych artykułów w Crossref znajduje się adres e-mail autora do korespondencji. Strony katedr oraz instytucjonalne repozytoria dobieram z góry, aby zamknąć tych, którzy mało publikują za granicą.
Na wyjściu jeden plik w Excelu i CSV: imię i nazwisko, e-mail, instytucja, stanowisko, link do źródła, data zbierania. Duplikaty czyszczę w dwóch przejściach — według e-maila i według znormalizowanego imienia i nazwiska razem z instytucją, ponieważ ludzie zmieniają afiliację i proste porównanie wierszy tutaj nie działa. Adresy e-mail przepuszczam przez sprawdzenie składni oraz MX rekordu domeny, status umieszczam w osobnej kolumnie, abyście od razu widzieli, co z bazy jest działające.
Pytanie zasadnicze: jaki orientacyjny zakres trzymacie — umownie 5 tysięcy kontaktów czy bliżej 30-40 tysięcy? I czy zostawiać w bazie wiersze bez znalezionego e-maila jako szablon, czy potrzebne są tylko kontakty z e-mailem? Od tego zależy, jak głęboko zbierać dane.
Cena 4000 UAH, jak w budżecie, termin 5 dni. Pośredni wycinek na kilka setek wierszy pokażę już drugiego dnia, abyście zweryfikowali strukturę kolumn przed tym, jak przejdę przez cały zbiór.
Piotr Pankow, BotCraft Group