情报分析学习比赛准备
2026/9/17 15:52:35 网站建设 项目流程

这篇笔记是为了准备这个比赛用的,可以用八爪鱼,也可以用python进行pa取,pythonpa取的初赛三代码后续会同步更新在本片文章中。但是八爪鱼可以用无代码编程爬取,更适合大部分初学者,但是这个网站要充钱,我也是暂时用了学生会员免费,后续可能还是用python的selenium库会比较多。

初赛二

任 务 1

采集**网站**栏目前10页的数据,包含(标题,时间,作者,正文,图片)(豆瓣书评)

任 务 2

采集**网站**栏目的数据,且这些数据包含(**,**,**),包含(标题,时间,作者,正文,图片)(新闻网站)

任 务 3

采集微博某个关健词的博文列表100条,字段包含(博文,作者,发布时间,评论数量,点赞数,转发数)

首先网页打开微博,进行关键词检索,进行搜索后。

再点击高级搜索,进行选择

之后,点击搜索,将网址复制到八爪鱼。

点击自动识别,左上角的灯泡。之后根据任务选择需要爬取的字段

不过因为有的地方需要优化字段,比如说我们有展开的肯定是要展开的文本。

但是因为点击展开后,八爪鱼会呈现两个文本的形式,

之后需要修改一下博文的元素定位为/descendant-or-self::P[contains(@class,"txt")][last()]。

同时优化字段,优化评论、转发、点赞数

输入\d+进行正则匹配,从而只要数字

任 务 4

采集微博某个关健词的博文列表100条(仅要原创的,转发不要),字段包含(博文,作者,发布时间,评论数量,点赞数,转发数)

在高级搜索添加原创的约束,或者是网址最后加个&scope=ori,进行限制原创搜索

任 务 5

采集指定帐号的百家号最近一周更新的文章。

这个好像直接用自动识别网页就完成了,主要是在于这个时间,我是先用了格式化时间,之后再用触发器限制了七天的时间

参考链接:

利用八爪鱼爬取关键词搜索的微博数据_八爪鱼微博关键词爬取-CSDN博客

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询