Proszę wybrać
  • Zlecenia 12
  • Ocena 4.9
  • Ranking 2 054

Budżet: 250 USD Termin: 7 dni

Cześć, Andriej! Parsowanie + automatyczne publikowanie w Telegramie to mój temat, już spojrzałem na twoje źródła:
— Douban (movie.douban.com/explore) i Ctrip (you.ctrip.com/travels) ładują treści przez JavaScript — wezmę Playwright (przeglądarka headless), a nie "lekki" BeautifulSoup.
— 36Kr (artykuły/wyszukiwanie/profil) zwraca dane w bardziej uporządkowany sposób, tam parsowanie jest łatwiejsze i szybsze.

Co zrobię:
• dla każdego materiału: tytuł, link, data, autor/źródło, krótki tekst, zdjęcia (gdzie dostępne);
• automatyczne tagi według źródła + według tematu (z tekstu);
• deduplikacja przez bazę (SQLite) — jeden materiał nie zostanie opublikowany dwa razy;
• automatyczne publikowanie w twoim kanale Telegram przez bota według harmonogramu;
• konfiguracja (źródła/tagi/częstotliwość), opóźnienia i logowanie dostosowane do specyfiki chińskich stron (ograniczają częste zapytania) — bez omijania zabezpieczeń, tylko publiczne dane.

  • Zlecenia 5
  • Ocena 4.9
  • Ranking 756

Budżet: 2000 USD Termin: 7 dni

Cześć, pracowałem nad parserem wiadomości dla agregatora mediów — zbieraliśmy artykuły z 12 źródeł, ~500 publikacji/dzień, automatyczne publikowanie w Telegramie z tagami i deduplikacją.

Jeśli chodzi o Twój projekt: niektóre z wymienionych stron (na przykład Douban i Ctrip) używają dynamicznego ładowania przez JavaScript — czy jesteś gotowy na opcję z Playwright zamiast prostego BeautifulSoup, jeśli strona tego wymaga?

Proponuję się skontaktować, chętnie doradzę Ci bezpłatnie z technicznej strony i opracujemy plan rozwoju + opowiem o moim zespole!

  • Zlecenia 11
  • Ocena 5.0
  • Ranking 1 788

Budżet: 15000 USD Termin: 7 dni

Dzień dobry! Mamy doświadczenie w tworzeniu parserów w Pythonie z omijaniem zabezpieczeń i integracją z API Telegrama. Realizujemy to za pomocą biblioteki Playwright dla dynamicznych treści oraz asynchronicznego wysyłania wiadomości do kanału. Skonfigurujemy stabilną pracę skryptu na serwerze, uwzględniając specyfikę chińskich zasobów.

Maksym Potashov

Maksym Potashov

Oferta, która wygrała
6 2
  • Zlecenia 6
  • Ocena 3.9
  • Ranking 788

Budżet: 150 USD Termin: 7 dni

Zacząłbym od sprawdzenia każdego źródła osobno: Douban, Ctrip i 36Kr mogą różnie oddawać strony, dlatego najpierw określę, gdzie wystarczy zwykłe parsowanie, a gdzie potrzebne jest przetwarzanie dynamicznego ładowania. Na MVP wziąłbym Pythona, Playwright/BeautifulSoup, SQLite, Telegram Bot API i Dockera, aby wszystko można było normalnie uruchomić na serwerze. Duplikaty będą przechowywane w bazie, częstotliwość sprawdzania i tagi będą w konfiguracji. Pracowałem z chińskimi stronami, tam często główny ból głowy nie leży w samym parsowaniu, ale w tym, że część danych ładowana jest osobno lub strona może ograniczać częste zapytania. Dlatego od razu uwzględnię opóźnienia, logowanie i krótki opis ograniczeń dla każdej strony, bez omijania zabezpieczeń. MVP z 2-3 źródeł można zbudować w ciągu kilku dni, pełną wersję po sprawdzeniu dostępności. Co do budżetu, dokładniej powiem po szybkim przeglądzie technicznym stron. Proszę powiedzieć, czy publikacja w Telegramie ma iść od razu po znalezieniu materiału, czy przez moderację? Czy tagi są potrzebne tylko według źródła, czy także według tematów w tekście? I czy trzeba tłumaczyć/skraczać chiński tekst przed publikacją?

Aktualne zlecenia dla freelancerów w kategorii Parsowanie danych

21 lipca
20 lipca