java爬取闲鱼商品信息（三）

最新推荐文章于 2024-12-16 23:39:11 发布

AaronLin_

最新推荐文章于 2024-12-16 23:39:11 发布

阅读量5.1k

点赞数 1

CC 4.0 BY-SA版权

分类专栏：爬虫文章标签： java爬虫闲鱼爬虫网络爬虫

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_35159818/article/details/79868901

爬虫专栏收录该内容

10 篇文章

订阅专栏

本文介绍了一种通过Fiddler捕获动态加载数据的方法，并详细解释了如何利用这些数据完成网页信息的完整抓取。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

这一篇距离前两篇更新的时间有点久了，最近忙着刷题- -。

好了，上次说到没办法获取到动态加载的部分。

我用了phantomjs尝试了一下，多获取到的部分是复杂的js代码，代码量太大了，没找到我们需要的信息。

也可能是我使用的方式不对，要是有可以获得的方法欢迎大家在评论介绍一下，我去试试看。

好了，最后我还是弄到了动态加载的数据，当然不是用的phantomjs。

既然找不到数据，那为什么不问问神奇的fiddler呢。

我们打开fiddler，然后访问闲鱼闲置广场的3C数码。

再看看突然多出来的数据包。

看。我们发现了什么，没错，翻下去我们发现了很多在闲鱼倒卖小米MIX2S的老黄牛。。。。。

更重要的是，发现了需要动态加载出来的数据。。当然这是json格式的数据，被我们拦截下来了。。

然后看看这些个数据的网址。

https://s.2.taobao.com/list/waterfall/waterfall.htm?wp=3&_ksTS=1523262257881_271&callback=jsonp272&stype=1&catid=57544002&oon=10&st_trust=1&ist=1

然后用浏览器打开。

可以看到，是json格式的数据，那这个网址又和我们要的数据有什么关系呢？

https://s.2.taobao.com/list/waterfall/waterfall.htm?wp=3&_ksTS=1523262257881_271&callback=jsonp272&stype=1&catid=57544002&oon=10&st_trust=1&ist=1

再次仔细看一下，这两个参数是我们需要的，catid可以控制商品类型（结合第一篇），而ist则是第几页的动态数据。

接下来的事情就水到渠成了，下载这个页面，正则提取，然后和上一篇的处理方法封装在一起，就变成了一个获取完整的网页的方法。

接下篇，下篇刷阵题更新，不过剩下的都是简单的事情了。

欢迎大家探讨获取网页的其他方法，我这个效率好像还可以但是有些取巧，也没有普适性。

评论 9

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。