python爬虫求一个只用requests库和beautifulsoup库抓取淘宝目录页面内 ...

发布网友 发布时间:2022-04-23 10:04

我来回答

9个回答

热心网友 时间:2022-04-18 23:59

可以将网页下载下来先练习 BeautifulSoup 的解析。

requests  请求也是一样先各个击破的学习。

淘宝的请求回来的页面 html 没有目录数据,是因为有可能他们的页面渲染是通过 JS 来渲染的,所以你只用 BeautifulSoup 是不行的。需要使用其他支持 JS 的库。

追问如果爬京东这种,爬取那些职业类型,薪水什么的,只用这两个,应该怎么爬,之前爬了一次,但是一直在单独循环爬爬取到的第一个。。。

追答尽量模拟真实用户的请求行为吧。毕竟它总会响应用户请求的。
比如我上面说的尝试一下一些支持 JS 的库。

热心网友 时间:2022-04-19 01:17

我最近在写淘宝爬虫,只用requests库:登录目前解决了,基本100%登录。
就是爬取pc网页时太频繁会出现滑块验证码,我试了好多次最多爬到2000条数据,只用requests库很难解决淘宝的滑块验证!
爬取淘宝遇到的问题太多了,各种反扒。。。。
教程这几天就写出来了,你可以关注我的vx公号:「裸睡的猪」,回复:淘宝 获取教程

热心网友 时间:2022-04-19 02:51

京东比较好爬,只要有个user-agent的请求头就能爬取,淘宝的话比较难,因为反爬做的很好

热心网友 时间:2022-04-19 04:43

淘宝的话有防采集,你要采集的话第一步要先模拟登录,然后可以通过开发者工具获取请求接口。

热心网友 时间:2022-04-19 06:51

淘宝的话比较难,因为反爬做的很好

热心网友 时间:2022-04-19 09:15

给个url地址来看看

热心网友 时间:2022-04-19 11:57

这次要爬取的是一个壁纸网站wallhaven,里面有很多用户上传的高清壁纸分享。点击进去会出现一个搜索页面,输入dota2,这就得到了我们要爬取的第一个url:”https://alpha.wallhaven.cc/search?q=dota2&search_image=&“。没错,今天的任务是爬取的是上面dota2专题的所有高清壁纸。 这就懵*了呀!难道这是遇上了号称最难爬取的动态加载页面??? 别着急,慢慢来。。。突然我发现上面的url好像变了: 这样我们得到了第二页的url:”https://alpha.wallhaven.cc/search?q=dota2&search_image=&page=2“。与第一个url进行比较,可以大胆猜测第3页url是后面加个”page=3”。这样的话只要通过字符串处理函数,就能得到dota2专题的所有url。问题是最后一个url是啥呢?仅供参考!

热心网友 时间:2022-04-19 14:55

不要拒绝一个向你推荐机会的人,即使你不相信、不懂、不会做、不想做,或许你很忙,了解过很多,很反感,千万不要一口回绝,在这个科技发展的时代,信息瞬息万变,也许眼前这个机会就能使你出人头地,你最好能把它了解清楚,了解之后感觉不值得你行动,也不会给你造成什么损失,但也许这个机会就是你一直想要的,是你所处朋友圈接触不到的,就是这个机会可能会改变你的一生!

热心网友 时间:2022-04-19 18:09

京东比较,我把泡泡补缴吧。睫毛比较大。不见百度上边app比较烦。追问可以写个爬京东的例子么。非常感谢。。

声明声明:本网页内容为用户发布,旨在传播知识,不代表本网认同其观点,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。E-MAIL:11247931@qq.com