Budżet: 333 UAH Termin: 179 dni
Напишите в ЛС этот "сложный интернет магазин", после ознакомления смогу сделать конкретное предложение.
Нужно спарсить сложный интернет магазин. Запросы и код обфусцирован, сайт нужно открывать многопоточно в puppeteer или selenium. Парсить нужно все категории товаров, подкатегории, таблицу со списком товаров, зайти в каждый товар, спарсить картинку, описание, название. Парсер должен быть написан на Node и TypeScript, другие варианты не рассматриваем. Запуск и остановку парсера нужно сделать на html, чтобы можно было управлять из браузера, а не через консоль. Парсить нужно тысячи товаров каждые 1-5 секунд, обновляться всё должно в реальном времени.
Весь код должен быть покрыт тестами на Mocha+Chai.
Сборка проекта должна быть сделана с помощью Webpack.
Budżet: 333 UAH Termin: 179 dni
Напишите в ЛС этот "сложный интернет магазин", после ознакомления смогу сделать конкретное предложение.
Budżet: 299000 UAH Termin: 10 dni
В принципе, если потратится на достаточно мощный комп, то это вполне посильная задача.
Вам треба дуже багато оперативки, і дуже багато ядер, якщо ви хочети парсити за допомогою Selenium, на такій швидкості.
Так вам нужен не парсинг, а ПАРСЕР. Изменить название проекта, не вводите в заблуждение фрилансеров.
Запросы и код обфусцирован
Это вы так сказали? Как по-вашему тогда клиент (сайт) эти запросы читает и рендерит в html? Что бы нормально работать с несколькими инстансами selenium нужен не многопоток, а многопроцессорность, ибо вы запустив пару инстансов упретесь в потолок производительности ядра, параллельные вычисления на node - боль, никто такими костылями даже за вменяемые деньги не будет. Найдите нормального программиста, который не будет вам рассказывать сказки про обфусцированные запросы и городить ерунду про многопоточный node и selenium.
С уважением.
Скажите что Вы можете предложить?
В принципе сервера не проблема, купим столько сколько нужно
Могу сделать ставку, напишите мне в ЛС сайт, я посмотрю и тогда что-то предложу. Я несколько лет занимаюсь парсерами и сбором данных и видал все эти "обфусцированные запросы". Работаю на Python/C#. Если возьмусь за работу то никаких модных словечек в коде типа mocha, chai, webpack и прочее вы не получите, но вы получите результат.
А это вообще возможно - Парсить нужно тысячи товаров каждые 1-5 секунд ?
Даже однократно это будет за гранью, а постоянно - это как вам видится?
Потоки - это одна из разновидностей параллельных вычислений.
Что значит какой толк? Берешь 1000 ссылок и одновременно их парсишь, при наличии соответствующего интернет-канала.
Ну якщо ти не через браузер будеш парсити то ніяких
Прямими запросами до сервера це вприниципі реально
Я имел ввиду - как сервер это отдаст и как поведёт себя серверный анализатор ботов?
на зеннопостере такое потянет на 5 серверах .на каждом по 200 браузерных потоков.сам делаю масштабные проекты.протестировано уже многократно и это получше будет чем извращение с селениумом.на 1 инстанс идет 100-100 мбайт памяти оперативной.проц грузит 80% при 200 потоках браузера
И сервер это не блокирует, 1000 потоков ? И владелец согласен на такой бессмысленный трафик? Вы кого парсите - деревенский сельсовет?
Что за чушь. Использовать 5 каких-то серверов для всего-то 1000 потоков. Про асинхронный код и корутины не слыхали? И это ты называешь "масштабными"?
Люди забийте на цей проект!
Скидав заказчик пару днів назад, приклад сайту який потрібно парсити, то цей сайт купляє дані в міжнародних компаній, і від того що ви будете парсити цей сайт , вони будуть мати не погані збитки(1 секунда == 1000 запросів).
Potrzebne jest wykonanie dla konfiguracji połączenia Solomono + SalesDrive CRM. Zadanie: skonfigurować na stronie zbieranie identyfikatorów reklamowych i danych o odwiedzającym, aby następnie te dane można było powiązać z zamówieniem w CRM. Co należy zrobić: Skonfigurować skrypt przez gtm lub wykorzystać wbudowane możliwości Solomono, jeśli są ukryte pola / mechanizm przechowywania danych reklamowych. Zbierać dane typu: gclid, utm_source, utm_medium, utm_campaign, user_agent itp. Przechowywać te dane razem z zamówieniem na stronie, jeśli to możliwe. Lub przekazywać te dane do SalesDrive CRM razem z zamówieniem lub osobno przez API/webhook. Doprowadzić zadanie do momentu, gdy dane o kliknięciu reklamowym będą widoczne w CRM w zamówieniu . Plusem będzie doświadczenie z Solomono, SalesDrive, GTM, integracjami API/webhook. Celem zadania jest, aby każde zamówienie w CRM zawierało informację, z jakiego kliknięcia reklamowego / źródła pochodzi klient.
Potrzebny doświadczony programista 1C do jednorazowej migracji danych z 1C do nowego systemu CRM. Konieczne jest wykonanie eksportu danych z 1C z zachowaniem wszystkich powiązań między encjami: produkty, klienci, przychody, faktury, stany, historia ruchu towarów oraz inne słowniki. Format eksportu może być JSON, SQL lub inny wygodny format do dalszego importu. Główne wymaganie — zachowanie struktury danych oraz wszystkich powiązań między dokumentami a obiektami, aby dane mogły być poprawnie przeniesione do innego CRM bez utraty informacji. Doświadczenie w migracji danych między 1C a systemami zewnętrznymi będzie dodatkowym atutem. Nie trzeba migrować do innego CRM, wystarczy dać plik lub stworzyć funkcjonalność, aby przy kliknięciu plik zrzutu był zapisywany lokalnie. Wszystko prowadzę lokalnie, więc trzeba będzie pracować przez AnyDesk lub coś innego. Nie znam cen za taką pracę, więc proszę o propozycje.
Potrzebny specjalista do pisania parserów, który będzie w stanie obejść CLOUDFRAME. Parsowanie produktów odbywa się z witryn z autoryzacją. Jest 10+ donorów o różnym stopniu trudności, z różnym poziomem ochrony. Parsowanie produktów odbywa się z witryn z autoryzacją. Parsuje dane do gotowej bazy danych Mysql + zdjęcia na serwer. Należy napisać parser zgodnie z zadaniami opisanymi w specyfikacji technicznej i dostosować dane do istniejącej bazy danych, aby zapewnić pełną funkcjonalność na stronie. Specyfikacja techniczna oraz przykład donora na żądanie. Nie rozważamy parserów desktopowych ani C#.
Trzeba stworzyć bota na Telegram, który będzie monitorował ogłoszenia na trzech stronach z wynajmem mieszkań (olx, lun, rieltor.ua) i wysyłał je w sposób zorganizowany na Telegram
konieczne jest zorganizowanie sposobu zbierania nowo utworzonych FOP-ów oraz, jeśli to możliwe, TOW. czy to ma być parsowanie, czy coś innego - powiedzcie, jaki to ma być sposób