谈起爬虫, 众人或许在第一时间所想到的便是, 于今日会简单地给大家讲讲常用的那些库, 就这么回事, 没错吧。
请求库:实现基础Http操作
:内置基本库,实现了一系列用于操作url的功能。
一种建立于特定基础编撰而成的, 具备封堵特性并非即时响应的 HTTP 请求库, 发起一项请求, 持续等待, 直至服务器给出相对应的回应之后, 程序才能够开展后续的处理步骤。
)
存在一种自动化测试工具, 有一个能够调用浏览器, 借助这个库, 你能够直接调用浏览器去完成某些操作。
)
:一个基于的 API。()
解析库:从网页中提取信息
lxml, 能够对HTML以及XML予以解析, 它支持XPath的解析方式, 并且其解析效率极其高。()。
对:html以及XML进行解析, 要从网页里提取信息, 并且是同时具备强大的API以及多样的解析方式。
)
该功能的达成, 可凭借特定的语法去对 HTML 文档予以操作解析, 其具备良好的易用性, 并且解析速度也颇为不错。
)
数据库:数据存储
mysql()
redis()
()
web框架:
Flask, 是那种轻量级的web服务程序, 它具备简单的特性, 有着易用的优点, 还呈现出灵活的特质, 主打做一些API服务, 在做代理的时候有可能会用到。
)
有一个用于 web 的服务器框架, 它提供了一整套完备的后台管理, 还配置了引擎以及各式接口之类, 借助使用这个框架能打造出一个完整的网站。
)
:能让你非常方便的在数据探索过程中有良好的实时交互效果()
爬虫框架
爬虫框架极为强大, 能够用以满足最为基础的简单页面爬取, 像是那种能够明确知晓 url 的情形。借助这个框架能够便捷地成功爬取诸如亚马逊商品信息这类的数据。然而, 对于稍有复杂度的别的页面, 比如说 weibo 的页面信息, 此框架便无法达成需求了。
能够在高速状态下, 对相应网站的内容展开爬取, 它支持关系型数据库, 同时也支持非关系型数据库, 并且这种数据能够被导出为JSON格式, 能导出为XML格式等。
:可视化爬取网页内容。
:提取新闻、文章以及内容分析。
-goose:java 写的文章提取工具。
可乐: 是一个用于分布式的爬虫框架。这个项目在整体方面的设计存在着一定程度的糟糕情形, 其模块之间的耦合程度颇高。