Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片

Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片


Python爬取《中国医生》评论并实现数据可视化(内附源码)

前言
前段时间 , 主旋律电影《中国医生》上线 , 大家有没有去看?反正我去看了 , 有点感人(其实哭的稀里哗啦的) 。 看完后 , 内心感慨万分 , 回到家缓了好久 。 看着电影的海报画面 , 想着可以爬一爬大家对电影的评论啊 , 正好也要给大家写文了 。 于是 , 利用下班时间给大家做了这个爬虫练习小项目 。 废话就不多说了 , 咱们开始吧!
爬取目标:爬取豆瓣电影中国医生评论实现数据可视化
开发环境
系统:Windows10 64位
Python版本:Python3.7
IDE:Pycharm
第三方库:
selenium
lxml
re
wordcloud PIL
Numpy
Jieba
matplotlib
项目思路分析
1 获取网址规律

可以看到 start  和  status是变化的关键
在这个页面可以通过xpath获取地址网页 评论详情 和评分
地址网页:

评论详情:

评分 :
【Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化】
2 打开地址网页 , 获取地址信息

有些没有地址信息 所有需要获取全部 后期通过数据处理获取有地址信息的
3 把获取的数据进行解析 分别存放三个文件

4 通过读取相应的文件生成相应的图表

项目难点分析
1 滑块验证
这个参考代码里面的滑块验证的方法
通过像素对比找到缺口
移动一段距离 之后速度变化慢慢往前面走 到达缺口就能够验证成功
2 切换iframe

需要切换iframe才能找到滑块和输入账号 密码 的元素位置
3 显示等待

等待元素出现才进行下一步的处理
4 数据处理
出现不合法的数据 比如 该用户已经主动注销帐号
判断源代码中是否存在 如果存在就跳过 防止等待时间过长 退出程序

5 抓取思维
采取先抓大在抓小
这样可以确定几个元素是相对应的
循环的时候会再次使用xpath 此时的xpath写法