Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化

文章图片
文章图片
文章图片
文章图片
文章图片
文章图片
文章图片
文章图片
文章图片
文章图片
文章图片
Python爬取《中国医生》评论并实现数据可视化(内附源码)
前言
前段时间 , 主旋律电影《中国医生》上线 , 大家有没有去看?反正我去看了 , 有点感人(其实哭的稀里哗啦的) 。 看完后 , 内心感慨万分 , 回到家缓了好久 。 看着电影的海报画面 , 想着可以爬一爬大家对电影的评论啊 , 正好也要给大家写文了 。 于是 , 利用下班时间给大家做了这个爬虫练习小项目 。 废话就不多说了 , 咱们开始吧!
爬取目标:爬取豆瓣电影中国医生评论实现数据可视化
开发环境
系统:Windows10 64位
Python版本:Python3.7
IDE:Pycharm
第三方库:
selenium
lxml
re
wordcloud PIL
Numpy
Jieba
matplotlib
项目思路分析
1 获取网址规律
可以看到 start 和 status是变化的关键
在这个页面可以通过xpath获取地址网页 评论详情 和评分
地址网页:
评论详情:
评分 :
【Python|用Python爬取豆瓣电影中国医生评论生成词云并实现数据可视化】
2 打开地址网页 , 获取地址信息
有些没有地址信息 所有需要获取全部 后期通过数据处理获取有地址信息的
3 把获取的数据进行解析 分别存放三个文件
4 通过读取相应的文件生成相应的图表
项目难点分析
1 滑块验证
这个参考代码里面的滑块验证的方法
通过像素对比找到缺口
移动一段距离 之后速度变化慢慢往前面走 到达缺口就能够验证成功
2 切换iframe
需要切换iframe才能找到滑块和输入账号 密码 的元素位置
3 显示等待
等待元素出现才进行下一步的处理
4 数据处理
出现不合法的数据 比如 该用户已经主动注销帐号
判断源代码中是否存在 如果存在就跳过 防止等待时间过长 退出程序
5 抓取思维
采取先抓大在抓小
这样可以确定几个元素是相对应的
循环的时候会再次使用xpath 此时的xpath写法
- One|基于Android 13打造:三星Galaxy S22抢先用上One UI 5.0
- 跑分|vivoS16Pro选用9000芯片,103万高跑分+1亿像素,配置崛起了
- 户外|“小眼镜”增多 专家支招教你科学用眼
- 创业|八成互联网电视非法采集用户数据, 彩电企业怎么办?
- ios16|一步到位能用5年,目前这3款手机能闭眼入,买手机不要太小气
- 你用过的头像都成了明星,林彦俊走红网络,只有她默默无闻
- 为什么科学家用昆虫翅膀的起源质疑进化论?达尔文到底是对是错?
- 高通骁龙|夏天一到骁龙8Gen1没怎么玩就发热?Find X5 Pro用户最有发言权
- 潘博文|腾讯QQ回应用户号码被盗:目前受影响范围已得到控制
- 够我国用130年!南海可燃冰试采成功,资源量相当于650亿吨石油
