Budżet: 100 USD Termin: 3 dni
Dzień dobry, jeśli strony będą różne, to logika i identyfikatory stron będą różne w polach rejestracyjnych, jeśli są podobne, to można to zrealizować, dodatkowo będą koszty anti-captcha i proxy, poleciłbym również zakupić trochę, możemy omówić projekt bardziej szczegółowo, wszystko wam opowiem, wyjaśnię, a następnie podejmiecie dalsze decyzje.
Krótko o sobie:
Tworzę solidną architekturę dla łatwego wdrożenia za pomocą Dockera i mogę spakować tam wszystko, czego potrzebujesz, znam bin, bash, zsh na wysokim poziomie, jestem pewnym użytkownikiem Linuksa.
Tworzenie zarówno zwykłych botów aiogram, jak i użytkowników botów pyrogram.
Jeśli chodzi o stos technologiczny, mam duże doświadczenie
W parsowaniu używam proxy, user-agent i różnych nagłówków w razie potrzeby, potrafię pracować z inspektorem, JavaScript, DOM, potrafię pobierać dane nawet z ajax i graphql
Główne biblioteki do parsowania: aiohttp, lxml, bs4, scrapy
Automatyzacja webowa: Selenium
Tworzenie API w językach Go i Python, GinGo, Flask, FastAPI, RestfulAPI, Swagger
Mam doświadczenie w pracy z arkuszami Google i konsolą Google Cloud
Umiejętność pracy z różnymi bazami danych SQL i NoSQL.
Rozwiązanie dla captcha anticaptcha.
Znajomość wątków Semaphore, threading, concurrent.future. Umiejętność pracy z numpy i more_itools, w szczególności chunked do równomiernego podziału skrapingu na równomierne strumienie, co znacznie przyspiesza zbieranie dużych ilości danych
Podstawowa wiedza do tworzenia interfejsów webowych
Jako dodatkowe umiejętności, umiejętność wydobywania ukrytych interfejsów API i praca z XML
PyQuery do pracy z dokumentami HTML
Pyppeteer również do automatyzacji