中间件|scrapy实例进阶篇之下载中间件(一)

中间件|scrapy实例进阶篇之下载中间件(一)

文章图片

中间件|scrapy实例进阶篇之下载中间件(一)

文章图片

中间件|scrapy实例进阶篇之下载中间件(一)

我们通过前两节课的学习 , 基本上已经掌握了scrapy的爬取数据的操作 , 从简单的爬取一张页面到深度爬取(爬取详情页的数据) , 再到翻页爬取 , 但是我们还有一个特殊的情况就是 , 怎么爬取动态网页?之前学习requests模块的时候 , 我们借助于Ajax请求 , 获取动态加载的数据 , 后来学习了selenium , 我们也可以轻松获取动态加载的网页 , 那么scrapy怎么获取动态加载的内容呢?我们接下来以一个案例:爬取网易新闻数据为例 , 来介绍怎么爬取动态加载的内容 , 其中会涉及到的知识点包括下载器中间件 。
1.下载器中间件是什么?

中间件是Scrapy里面的一个核心概念 。 使用中间件可以在爬虫的请求发起之前或者请求返回之后对数据进行定制化修改 , 从而开发出适应不同情况的爬虫 。
2.爬取网易新闻思路讲解
目的:获取国内、国际、军事新闻板块中所有的新闻标题以及对应的新闻内容

1)我们要想获取想要的数据内容 , 就需要先对首页发起请求解析得到列表页的url

2)然后我们再对列表页发起请求解析获得详情的地址

3)最后通过第二步获得的详情的地址获得详情页的内容

4)难点:第一步正常发请求解析数据 , 第二步 , 我们会发现列表页的数据是动态加载的数据 , 因此我们无法运用解析数据获得详情页的url因此需要借助下载器中间件来获取动态加载的内容 。
【中间件|scrapy实例进阶篇之下载中间件(一)】好了 , 通过上面的讲解我们也大概了解了我们要完成这个任务 , 所需要的步骤 , 由于这次的案例会复杂一些 , 涉及的知识点比较多 , 为了更好的让大家理解 , 接下来会分几节课讲解 。 下节课正式开始我们案例 。