Пожалуйста выберите
  • Проекты 11
  • Оценка 5.0
  • Рейтинг 1 973

Бюджет: 250 USD Срок: 7 дней

Здравствуйте, Андрей! Парсинг + автопостинг в Telegram — моя тема, и я уже глянул ваши источники:
— Douban (movie.douban.com/explore) и Ctrip (you.ctrip.com/travels) подгружают контент через JavaScript — возьму Playwright (headless-браузер), а не «лёгкий» BeautifulSoup.
— 36Kr (статьи/поиск/профиль) отдаёт данные структурнее, там парсинг легче и быстрее.

Что сделаю:
• по каждому материалу: заголовок, ссылка, дата, автор/источник, краткий текст, картинки (где доступны);
• авто-теги по источнику + по теме (из текста);
• дедупликация через базу (SQLite) — один материал не уйдёт дважды;
• автопостинг в ваш Telegram-канал через бота по расписанию;
• конфиг (источники/теги/частота), задержки и логирование под специфику китайских сайтов (режут частые запросы) — без обхода защит, только публичные данные.

  • Проекты 5
  • Оценка 4.9
  • Рейтинг 756

Бюджет: 2000 USD Срок: 7 дней

Привет, я работал над парсером новостей для медиа-агрегатора — собирали статьи из 12 источников, ~500 публикаций/день, автопостинг в Telegram с тегами и дедубликацией.

Что касается вашего проекта: некоторые из указанных сайтов (например, Douban и Ctrip) используют динамическую загрузку через JavaScript — готовы ли вы к варианту с Playwright вместо легкого BeautifulSoup, если сайт этого требует?

Предлагаю связаться, я бесплатно проконсультирую вас с технической стороны и составим план разработки + расскажу о моей команде!

  • Проекты 11
  • Оценка 5.0
  • Рейтинг 1 788

Бюджет: 15000 USD Срок: 7 дней

Добрый день! Мы имеем опыт в разработке парсеров на Python с обходом защиты и интеграцией с Telegram API. Реализуем это через библиотеку Playwright для динамического контента и асинхронную отправку сообщений в канал. Настроим стабильную работу скрипта на сервере с учетом специфики китайских ресурсов.

Maksym Potashov

Maksym Potashov

Победившая ставка
6 2
  • Проекты 6
  • Оценка 3.9
  • Рейтинг 788

Бюджет: 150 USD Срок: 7 дней

Я бы начал с проверки каждого источника отдельно: Douban, Ctrip и 36Kr могут по-разному отдавать страницы, поэтому сначала определю, где хватит обычного парсинга, а где нужна обработка динамической загрузки. Для MVP взял бы Python, Playwright/BeautifulSoup, SQLite, Telegram Bot API и Docker, чтобы все можно было нормально запустить на сервере. Дубликаты будут храниться в базе, частота проверки и теги будут в конфиге.
С китайскими сайтами работал, там часто головная боль не в самом парсинге, а в том, что часть данных подгружается отдельно или сайт может резать частые запросы. Поэтому сразу закладываю задержки, логирование и краткое описание ограничений по каждому сайту, без обхода защит.
MVP по 2-3 источникам можно собрать за несколько дней, полную версию по всем источникам после проверки доступности. По бюджету точнее скажу после быстрого технического обзора сайтов.
Подскажите, публикация в Telegram должна идти сразу после нахождения материала или через модерацию? Теги нужны только по источнику или еще по темам внутри текста? И нужно ли переводить/сокращать китайский текст перед публикацией?

Актуальные фриланс-проекты в категории Парсинг данных

9:16
20 июля