Budget: 800 UAH Deadline: 2 days
Good day, Mr. Oleksandr. Once again, I suggest you abandon your idea. You will save neither money nor time. I will be happy to cooperate.
Looking forward to working with you!
Yaroslav Zhomiruk
Winning proposal- Projects 4
- Rating -
- Rating 465
Budget: 2000 UAH Deadline: 5 days
Ready to take on this project and ensure its successful completion.
Budget: 10000 UAH Deadline: 10 days
I don't understand what the "violation of service rules" is? Because most won't be able to handle such a task. And if I can't, does that mean a complaint? Go to the factory.
I suggested to the author my option - to fill the content from Telegram, and he will clean it up.
Budget: 1000 UAH Deadline: 1 day
Good afternoon, in theory, it is feasible, but not all websites are written similarly, etc., write to discuss, I will explain.
Budget: 1200 UAH Deadline: 1 day
Good day.
I have drafted a rough version of the script. For more detailed information, please contact me via private messages.
Budget: 4000 UAH Deadline: 5 days
Good day!
The task looks interesting. Write to me in private messages, we will discuss.
---------------------------------------------------------------------
Budget: 3000 UAH Deadline: 2 days
Good day
I can implement your parsing logic in nodejs.
Budget: 1000 UAH Deadline: 5 days
Good day, I can scrape data using nodejs/puppeteer. I need a list of websites, I will set up auto-posting on WordPress via REST API.
Budget: 2000 UAH Deadline: 4 days
Hello! I am ready to take on this task. I already have experience with data parsing, so I will complete everything promptly and efficiently. Let's get in touch and discuss the details.
Proposals are currently absent
-
Vasil Sobovy 12 August 2024На практике это не работает. Все верстают по разному и не всегда семантически правильно. Подзаголовки и параграфы могут быть не только в теле статьи, но и в меню и в дополнительных блоках. Кроме параграфов будут еще изображения, списки и ссылки. Вам как минимум нужно найти начало и конец контентной части.
Может на простых однотипных сайтах ваш метод и будет работать, но об универсальности речь не идет. -
Vladimir Smirnov 12 August 2024Когда-то программисты считали что невозможно написать программу которая распознает рукописный ввод, так как считали что программа должна учитывать все возможные варианты. Но потом появился ИИ и все оказалось возможным. Идея автора задания вполне реализуема.
-
Vladislav Z. 13 August 2024Ну так твій АІ створювався не один день. На це пішли багато років збору різної інформації. Тепер можно цю інформацію ПРОДАВАТИ. Так що, якщо розробити парсера на АІ, то ціна буде дорожкою, ані ж просто ручками копіювати :)
Поки що це так. Можливо, пізніше буде це безкоштовно.
-
Irina G. 13 August 2024я вас растрою. распознавание рукописного текста появилось еще в 97 году когда про ИИ никто не думал. так что это разное. И дрессировали той псевдо-ИИ на паспортах. веселое было занятие.
конечно я по такому пути тоже шёл - взять видимый текст на странице. и там вместе с контентом было столько же мусора сколько и полезной информации. рекламные блоки, меню, какие то масивы текста переменных. так что программы и люди одно и тоже видят по разному.
Так что создание универсального парсера который бы парсил мох и болото вполне возможно даже на сегодня. но я думаю что это будет с серьезным вливанием денег в виде машино*часов для аренды гпу (либо купить свою Nvidia Tesla A100 ) чтобы обучить свой ИИ. внедрение в изучение структуры документа я считаю тупиковым развитием из за большой вариативности.
-
Irina G. 12 August 2024Вы просто не понимаете как работает ЛЮБОЙ софт. возьмите напишите ТЗ и тогда у программистов не будет вопросов что "сайты все разные"
-
Irina G. 12 August 2024Так само з текстом. Ось <div class="article-content__container"> <div> </div> <p>Текст.</p>
Ми можемо вчепитися за "article-content__container". Но на іншому сайті він буде інший. Навіщо теж так робити? Чому не можна вчепитися просто за <p></p>. Невже так не можна зробити?обьясняю - полно сайтов которые построены чисто на div без всяких там p h1
-
Irina G. 12 August 2024Одно понятно - вам нужен контент. рерайтить лень. нужно копипаст.
как я делал для себя когда мне нужно было 20тыс страниц контента:
написал прогу которая - парсит нужные телеграмм группы - сохраняет. парсит 5 сайтов - сохраняет. далее все сохраненные посты (а их было порядка 45тыс) чиститься по ключевым словам и вырезалась реклама. пропускаеться через чатгпт с нужными промтами. на выходе имел чистый код со статьей который я по апи вордпресс закинул на сайт. все. а не вот это вот.
А вы и дальше можете доказывать что ваш способ лучше. но вы не учитываете тот момент что между движениями мышки мозг анализирует информацию. И я много раз сталкивался с тем что контент который занимает 10000 символом в странице занмиает 600-1000кбайт. И мусор вычищать то еще занятие. так что теория и практика это разное.
Current freelance projects in the category Python
-
Not specified
Refinement of the Python program for the new Twitter (X) chat interface.
Desktop Apps 69 proposals 31 July
-
67 USD
Signal bot for trading
Bot Development 67 proposals 31 July
-
Not specified
Website parsing, bypassing Akamai protection
Data Parsing 46 proposals 30 July
-
448 USD
Development of an AI bot for receiving and processing orders from restaurants in Telegram with integration into 1C.
77 proposals 29 July
-
Not specified
Need to fix a bug in the current version of the bot.
Bot Development 87 proposals 27 July