Будь ласка, виберіть
  • Проєкти 12
  • Оцінка 4.9
  • Рейтинг 2 054

Бюджет: 250 USD Термін: 7 днів

Привіт, Андрію! Парсинг + автопостинг у Telegram — моя тема, і я вже переглянув ваші джерела:
— Douban (movie.douban.com/explore) та Ctrip (you.ctrip.com/travels) підвантажують контент через JavaScript — візьму Playwright (headless-браузер), а не «легкий» BeautifulSoup.
— 36Kr (статті/пошук/профіль) віддає дані структурніше, там парсинг легший і швидший.

Що зроблю:
• по кожному матеріалу: заголовок, посилання, дата, автор/джерело, короткий текст, картинки (де доступні);
• авто-теги по джерелу + по темі (з тексту);
• дедуплікація через базу (SQLite) — один матеріал не піде двічі;
• автопостинг у ваш Telegram-канал через бота за розкладом;
• конфіг (джерела/теги/частота), затримки та логування під специфіку китайських сайтів (ріжуть часті запити) — без обходу захистів, тільки публічні дані.

  • Проєкти 5
  • Оцінка 4.9
  • Рейтинг 756

Бюджет: 2000 USD Термін: 7 днів

Привіт, я працював над парсером новин для медіа-агрегатора — збирали статті з 12 джерел, ~500 публікацій/день, автопостинг у Telegram з тегами та дедублікацією.

Щодо вашого проекту: деякі з вказаних сайтів (наприклад, Douban та Ctrip) використовують динамічне завантаження через JavaScript — чи готові ви до варіанту з Playwright замість легкого BeautifulSoup, якщо сайт цього вимагає?

Пропоную зв'язатися, я безкоштовно проконсультую вас з технічної сторони та складемо план розробки + розповім про мою команду!

  • Проєкти 11
  • Оцінка 5.0
  • Рейтинг 1 788

Бюджет: 15000 USD Термін: 7 днів

Добрий день! Ми маємо досвід у розробці парсерів на Python з обходом захисту та інтеграцією з Telegram API. Реалізуємо це через бібліотеку Playwright для динамічного контенту та асинхронну відправку повідомлень у канал. Налаштуємо стабільну роботу скрипта на сервері з урахуванням специфіки китайських ресурсів.

Maksym Potashov

Maksym Potashov

Переможець
6 2
  • Проєкти 6
  • Оцінка 3.9
  • Рейтинг 788

Бюджет: 150 USD Термін: 7 днів

Я б почав з перевірки кожного джерела окремо: Douban, Ctrip і 36Kr можуть по-різному віддавати сторінки, тому спочатку визначу, де вистачить звичайного парсингу, а де потрібна обробка динамічного завантаження. Для MVP взяв би Python, Playwright/BeautifulSoup, SQLite, Telegram Bot API і Docker, щоб усе можна було нормально запустити на сервері. Дублі зберігатимуться в базі, частота перевірки і теги будуть у конфігу.
З китайськими сайтами працював, там часто головний біль не в самому парсингу, а в тому, що частина даних підвантажується окремо або сайт може різати часті запити. Тому одразу закладу затримки, логування і короткий опис обмежень по кожному сайту, без обходу захистів.
MVP по 2-3 джерелах можна зібрати за кілька днів, повну версію по всіх джерелах після перевірки доступності. По бюджету точніше скажу після швидкого технічного огляду сайтів.
Підкажіть, публікація в Telegram має йти одразу після знаходження матеріалу чи через модерацію? Теги потрібні тільки по джерелу чи ще по темах всередині тексту? І чи потрібно перекладати/скорочувати китайський текст перед публікацією?

Актуальні фриланс-проєкти в категорії Парсинг даних

3:47
21 липня
20 липня