Mamy gotową stronę na WordPress, na której będą umieszczone profile właścicieli firm z określonej kategorii. Zadanie polega na zbieraniu, oczyszczaniu, przechowywaniu i wyświetlaniu tych profili na stronie.
Trzeba zeskrobać dane z LinkedIn — około pięciu tysięcy właścicieli firm z konkretnej kategorii, w tym zdjęcia profilowe.
Są też inne źródła danych (dawcy), z których można będzie przeprowadzać skrobanie; szczegóły można będzie omówić. W trakcie zbierania danych należy prawidłowo zorganizować informacje (imię, nazwa firmy, kategoria biznesu, dane kontaktowe, zdjęcia itp.), jednocześnie sprawdzając wpisy pod kątem duplikatów i usuwając je przed dodaniem do bazy danych i wyświetleniem ich na stronie. Dane powinny być maksymalnie czyste i ujednolicone pod względem formatu.
Aby przechować wyniki skrobania, należy stworzyć osobną tabelę w bazie danych, aby nie przeciążać głównej bazy WordPress. Część interfejsu strony i panelu administracyjnego musi być dostosowana do pracy z tą tabelą. Po oczyszczeniu i weryfikacji dane powinny być zaimportowane na stronę i wyświetlone w sekcji „Właściciele firm” zgodnie z strukturą i projektem strony.
Od Ciebie potrzebujemy krótkiego opisu, w jaki sposób będziesz skrobać dane z LinkedIn, a także podania swojej ceny za pracę i orientacyjnego terminu realizacji — od zbierania danych do publikacji profili na stronie.
Doświadczenie:
Wykonawca powinien mieć doświadczenie w tworzeniu skrobaków dla Google Maps, mediów społecznościowych oraz wyników wyszukiwania Google i stron agregatorów. To nie jest jednorazowe zadanie — potrzebna jest osoba, która będzie mogła regularnie przeprowadzać skrobanie danych z różnych źródeł w miarę potrzeby.
Skrobanie → Tymczasowe przechowywanie → Oczyszczanie → Finalna baza danych → Połączenie danych z witryną i wyświetlenie na WP
Python — Playwright (automatyzacja przeglądarki, omijanie zabezpieczeń), BeautifulSoup, asyncio, integracja API. Biblioteki requests, BeautifulSoup, Selenium, Scrapy lub Selenium.
Dla Google Maps — SerpAPI/Outscraper jako niezawodne źródło danych.
Oczyszczanie tekstu, deduplikacja, klasyfikacja przez AI, filtrowanie według słów kluczowych.
Walidacja telefonów, email, standaryzacja godzin pracy, deduplikacja firm przed zapisaniem w bazie
MySQL, WordPress REST API, Custom Post Types + ACF. Schemat: zbieranie → tymczasowe przechowywanie → oczyszczanie → MySQL → WP przez REST API lub WPAllImport.
Dane - to małe firmy, dane będziemy brać z Google Maps, Google Search, Strony, Yelp, Publiczne strony rządowe
jest budżet na API/proxy do omijania ograniczeń Google
Rozważamy tylko osoby z Ukrainy
Jeśli masz działający zautomatyzowany skrobak w produkcji, to będzie +