本次课程主要讲解了爬虫的基础原理及开发工具的应用。在开始爬虫之前,需要了解一些相关的术语,并对所使用的浏览器进行案例分析。此外,我们已经为大家准备好了中奖书籍,希望各位能够喜欢并积极转发。
简单来说,无论是爬虫还是浏览器,都需要向服务器发送请求来获取数据。请求头包含了这些请求的重要信息,比如 user-agent 和 referer。其中,user-agent 表示发起请求的客户端工具,通常使用浏览器,但在爬虫中,可以通过 Python 发起请求;referer 则表示请求来源的页面 URL。
Cookies 是一种存储在本地的数据形式,用于保存已访问页面的信息,方便后续浏览时使用。
浏览器是进行爬虫开发不可或缺的工具。通过浏览器,可以更好地定位网页中的数据。在之前的课程中,我们已经用 360 浏览器演示了网络请求的过程。接下来,我们将用谷歌浏览器进行更详细的操作演示。在上一节课程中,我们介绍了如何通过右键点击“检查”进入开发者界面,该界面包含九个标签页。
在案例演示中,我们选择虎扑体育官网作为分析对象。首先,打开谷歌浏览器,通过搜索或其他方式进入官网。右键点击“检查”,可以看到许多信息。
在开发者工具中,有两个关键部分:Network 和 Elements。Network 部分主要用于查看浏览器向服务器发送的所有请求情况,而 Elements 部分则用于查看 HTML 结构和样式信息。
在 Elements 中,左侧显示所有 HTML 代码,右侧有 styles、computed 和 event listeners 三个部分。通过点击代码,可以在右侧看到相关的内容。
Network 部分展示了所有请求的详细信息,如请求名、状态、类型、大小、时间和花费的时间等。例如,获取虎扑体育官网的信息需要 72 个请求。通过点击任意一个请求,可以看到详细的请求头、响应信息、Cookies 信息等。
过滤器部分可以帮助我们筛选出感兴趣的请求内容,从而更专注于核心部分的学习和操作。其他部分由于目前用不到,暂时不做详细介绍。建议大家重点掌握核心部分的内容,以便日后更好地进行爬虫开发。