文章目录
- 概要&序論
- 一、服务器如何解析 HTTP 请求中的资源路径
- 1.1 先聊一聊三个概念
- 1.2 路径拼接规则
- 1.2.1 显式请求具体文件
- 1.2.2 隐式请求根目录(自动拼接首页)
- 1.3 总结
- 二、HTTP 请求协议格式详解
- 2.1 请求行的组成要素
- 2.2 为什么请求和响应中必须携带版本号
- 2.3 网站的树状访问逻辑与二次请求
- 2.4 如何读取到一个完整的 HTTP 请求报文
- Tips:/favicon.ico请求
- 三、HTTP 响应报文与异常处理机制
- 3.1 HTTP 状态码分类
- 3.2 常见服务器处理异常场景解析
- 3.2.1 代理服务器帮助传递错误码
- 3.2.2 代码层面的异常捕获与回调机制
- 3.2.3 公司里的状态码还有隐藏策略
- 3.3 应答告诉对方我的有效载荷是什么
- Tips:需要注意的小问题
- 3.4 有效载荷的类型
- 3.5 客户端支持的属性字段
- 3.6 Host 字段的作用
- 3.7 User-Agent 的作用与爬虫原理
概要&序論
Hello,大家好,我是此方。接着上篇继续讲HTTP,本文将继续深入 HTTP 协议,从服务器视角分析一个 HTTP 请求是如何被接收、解析和处理的。文章将详细介绍请求行、HTTP 版本号、URI 路径及网站资源的访问逻辑,并分析如何读取完整的 HTTP 请求报文。在此基础上进一步探讨 HTTP 响应状态码、异常处理、有效载荷以及 Host、User-Agent 等常见请求字段,理解浏览器、代理服务器与 Web 服务器之间的实际交互过程。
一、服务器如何解析 HTTP 请求中的资源路径
网页内容(图片、CSS、JS等)都存储在服务器的特定路径下,而非在代码中硬编码。浏览器在发送 HTTP 请求时是通过 URI 来告知服务器自己需要什么资源。
1.1 先聊一聊三个概念
- URI(统一资源标识符):当浏览器请求http://8.137.19.140:8081/a/b/c.html时,服务端收到的请求行如GET /a/b/c.html HTTP/1.1,其中/a/b/c.html即 URI,用于指示请求资源的相对位置。
- Web 根目录(Web Root):代码中定义的资源存储根目录(如const std::string webroot = “./wwwroot”)。注意:它并非 Linux 系统的绝对根目录 /,所有静态资源均需放置于此目录下。
- 资源路径:资源在服务器磁盘上的真实物理路径,由 Web 根目录与 URI 拼接而成。
1.2 路径拼接规则
服务器收到请求后,会根据 URI 情况选择不同的拼接逻辑:
1.2.1 显式请求具体文件
当请求行为GET /a/b/c.html HTTP/1.1时,服务器直接将 Web 根目录webroot(./wwwroot)与 URI(/a/b/c.html)拼接,最终得到的真实文件路径为./wwwroot/a/b/c.html。
1.2.2 隐式请求根目录(自动拼接首页)
当请求行为GET / HTTP/1.1时,服务器无法直接返回目录,需要自动拼接默认首页(如index.html)。服务器通过预设的homepage = “/index.html”完成拼接:filename = webroot + homepage,得到真实路径./wwwroot/index.html,随后读取该文件并返回。
1.3 总结
HTTP 请求的本质,就是请求代码中./wwwroot目录下特定路径的资源,而 URI 中的路径则是寻找该资源的磁盘索引。
二、HTTP 请求协议格式详解
在了解了服务器如何根据 URI 解析文件路径后,我们需要进一步拆拆 HTTP 请求本身的报文结构。
2.1 请求行的组成要素
- 请求方法告知服务器本次操作的意图。虽然 HTTP 定义了多种请求方法,但最常用的是GET和POST。其中GET主要用于从远端获取内容,而POST则用于向远端进行参数提交。
- URI 表明客户端要请求的资源,目前在请求行中的表现形式为一段相对路径。
- HTTP 版本号指定客户端发送请求时所采用的协议版本,例如HTTP/1.0或HTTP/1.1。
2.2 为什么请求和响应中必须携带版本号
在 HTTP 协议的报文设计中,请求和响应都会明确标明版本号。原因在于:客户端和服务器是两款独立运行的软件!
在实际的应用场景中,一个厂家给他的服务器进行了软件升级,但是市面上的用户还有很多没有更新他们的客户端,于是就会出现新老版本的客户端和服务器同时在网络中并存的情况。
因此,客户端发送请求必须带上自己的版本号,然后服务器和客户端协商版本号,为客户端提供对应版本的服务。否则,如果缺乏版本协商机制,就会出现客户端解析或处理错误。
2.3 网站的树状访问逻辑与二次请求
我们在浏览器端发起请求时,首页作为整个站点的入口,本质上一个网站就是一颗多叉树。当用户在网页上点击链接时,浏览器会形成新的访问地址并发起二次请求,进而拼接出新的 URI。我们在服务器端请求的所有资源,最终都是通过HTTP Request中的 URI 来精准表示的。
2.4 如何读取到一个完整的 HTTP 请求报文
HTTP的底层是TCP,TCP 是面向字节流的,直接调用recv无法保证单次读取就能拿到完整请求。那么怎么做呢?
- 逐字节或按行读取数据,查找代表报头结束的空行(即连续的\r\n\r\n),以此确保读取到完整的请求报头。
- 对读取到的报头进行反序列化解析,提取出Content-Length属性,该属性明确标明了后续请求正文(有效载荷)的字节长度。
- 根据提取到的Content-Length数值,继续从剩余的字符流缓冲区中精准提取对应字节数的字符,从而拼接出完整的 HTTP 请求正文。
Tips:/favicon.ico请求
浏览器向服务器发送一次网页请求,除了请求这个网页本身,还会请求/favicon.ico。
我们采取忽略的方式:
if(_targetfile=="./wwwroot/favicon.ico"){LOG(LogLevel::DEBUG)<<"用户请求: "<<_targetfile<<"忽略它";returnfalse;}/favicon.ico是什么?就是你这个网页的小图标:
三、HTTP 响应报文与异常处理机制
在 Web 服务器完成请求解析与业务逻辑处理后,需要向客户端返回 HTTP 响应报文。状态行中的状态码与状态码描述,是服务器向客户端表达请求处理结果与进行异常处理的核心。
3.1 HTTP 状态码分类
状态码由三位数字组成,根据首位数字划分为五种主要类别:
3.2 常见服务器处理异常场景解析
3.2.1 代理服务器帮助传递错误码
大型公司内部通常会由代理服务器与机房中的多台服务器共同组成负载均衡系统。如果其中某台后端服务器因过载等原因发生异常,该服务器会向代理服务器返回错误码,最终由代理服务器统一将错误信息返回给终端用户。(我在后面正反向代理的时候会讲)
3.2.2 代码层面的异常捕获与回调机制
500错误的一种可能是服务器创建子进程失败。但是子进程创建都失败了,如何给我们的网页发送500呢?有一种方法可以处理:如果fork错误,可以在进程退出前调用一下回调函数excepter(),可以执行回调由服务器自己发送一个网页回去。
pid_t id=fork();if(id<0){LOG(LogLevel::FATAL)<<"fork error ...";// excepter(sock); //exit(FORK_ERR);}如果父子进程都挂了,那么没有任何办法,没有任何返回。
3.2.3 公司里的状态码还有隐藏策略
很多大公司,如果是服务器出错,正确的应该返回5xx,但是实际上会返回4xx,为了防止暴露自己服务器的错误,会有黑客趁你病要你命。
3.3 应答告诉对方我的有效载荷是什么
如果你的应答是携带了数据的,我就应该在 response 的响应报头中包含Content-Length:XXX\r\n。
那么我们必然要知道一个文件的大小是多少?有三种方法:
- C语言的文件读写位置接口。
- C++的 ifstream 的读写位置接口。
- stat 系统调用,传入文件名称会返回文件结构体,里面有文件大小。
我们认为,文件内容,就是一个char类型的数组!文件读写位置就是数组下标。
#ifndef__UTIL__#define__UTIL__#include"./BasicElement/Common.hpp"namespaceHttpUtilModule{classUtil{public:longGetFileSize(std::string filename){std::ifstreamin(filename,std::ios::binary);in.seekg(0,std::ios::end);std::streamoff size=in.tellg();in.seekg(0,std::ios::beg);return(long)size;}voidGetFileContent(std::string&filename,std::string&content){longn=GetFileSize(filename);intsize=n;content.resize(size);std::ifstreamin(filename,std::ios::binary);in.read(content.data(),size);std::cout<<"FileName: "<<filename<<std::endl;std::cout<<"FileSize: "<<n<<std::endl;std::cout<<"ContentSize: "<<content.size()<<std::endl;}private:};}#endifTips:需要注意的小问题
必须得提一嘴:我们前面在为 Tcp 服务器设计协议的时候使用的是字符串读取,但是这样是有失偏颇的。严格意义上讲,我们是面向“字节流”。字节流应该使用vector作为你读取的缓冲区。
staticboolReadFileContent(conststd::string&filename/*std::vector<char>*/,std::string*out){// version1: 默认是以文本方式读取文件的,图片是二进制的。}如果采用字符串的方式,在遇到不可显示字符,或者\0的时候就可能读取错误或者停止读取。这在读取图片文件的时候是致命的。
3.4 有效载荷的类型
Content-Type,一般是应答要携带这个属性。
因为超文本传输,传输的都是字节流,你得知道我传输过来的字节流是什么东西。
3.5 客户端支持的属性字段
Accept-Encoding和Accept-Language分别表示我们的客户端可以支持的压缩模式和语言。
一般我们的网页比较大的时候,我们会把它打包一下成为一个压缩包再发出来,这个时候就需要双方商量好压缩/解压方式。
3.6 Host 字段的作用
Host字段:客户端告知服务器,所请求的资源是在哪个主机的哪个端口上。
假设浏览器向服务器发送这么一段请求,中间经过代理服务器时,代理服务器接到请求后向后端发送到对应Host的主机。后端目标主机接到请求后执行任务并返回回应。
3.7 User-Agent 的作用与爬虫原理
我们在百度中搜索信息的时候本质上也是在向百度的服务器发送 HTTP,服务器会接收到我们的客户端的请求,通过User-Agent判断我们的客户端是否合法,是否是一个真的客户端,客户端支持的平台版本。于是给我们提供对应的搜索结果。比如我们搜索微信,手机上搜索结果会给你推送安卓的下载,电脑上会给你推win/mac的版本。
于是User-Agent是一个描述客户端信息的一个属性。
让我们的机器给百度发送一个最简单的 HTTP 请求就是这样一个请求行:
GET / HTTP/1.1于是我们可以使用一些工具,向服务器发起请求,于是我们就可以抓取我们想要的网页了。
我们刚好有一个工具wget https://tool.oschina.net/commons。
这就是爬虫pachong!,本质就是用 http 客户端,来模拟浏览器行为,获取指定链接下的网页!