上篇聊了点云分割的几种经典方法——RANSAC去地面、欧式聚类、区域生长。这些方法处理的是3D数据,但机器人感知世界不只有激光雷达,视觉传感器同样重要,甚至在很多场景下信息量更丰富。
今天从相机成像原理开始讲起。这是计算机视觉的基础,面试中几乎必考。不管你是做SLAM、做目标检测还是做3D重建,都得先搞明白相机是怎么把三维世界投影到二维图像上的。
小孔成像模型
相机成像最基础的模型就是小孔成像(Pinhole Camera Model)。想象一个完全黑暗的盒子,前面戳一个小孔,光线通过小孔在后面的成像平面上形成倒立的实像。这就是最原始的相机。
小孔模型的核心公式很简单:
x' = f * X / Z y' = f * Y / Z
其中(X, Y, Z)是三维空间中某个点在相机坐标系下的坐标,(x', y')是它在成像平面上的投影坐标,f是焦距(小孔到成像平面的距离)。
这个公式背后的直觉很清晰:Z越大(点越远),投影到成像平面上的x'和y'就越靠近中心——这就是"近大远小"的数学表达。
但实际图像处理中,我们用像素坐标而不是物理坐标(毫米)。所以需要把物理坐标转换成像素坐标,这就引入了像素坐标系和内参矩阵:
[u] [fx s cx] [X/Z] [v] = [0 fy cy] [Y/Z] [1] [0 0 1] [ 1 ]
这就是相机内参矩阵K。fx和fy是焦距(以像素为单位,等于物理焦距除以像素尺寸),cx和cy是主点坐标(光轴与成像平面的交点,通常接近图像中心),s是倾斜因子(描述像素不是严格矩形的程度,大多数相机s=0)。
面试时候这个公式必须脱口而出。内参矩阵描述的是相机自身的几何特性,跟相机在外面的位置姿态无关。只要不换镜头、不调整焦距,内参就是固定的。
import numpy as np # 典型的相机内参矩阵(以1280x720分辨率为例) fx, fy = 718.8560, 718.8560 # 焦距(像素单位) cx, cy = 607.1928, 185.2157 # 主点坐标 K = np.array([ [fx, 0, cx], [ 0, fy, cy], [ 0, 0, 1] ]) # 世界坐标到像素坐标的投影 def project_to_image(point_3d, K, R, t): """将3D点投影到图像平面""" # 先变换到相机坐标系 p_cam = R @ point_3d + t # 投影到像素坐标 p_proj = K @ p_cam p_proj = p_proj / p_proj[2] # 归一化(除以深度) return p_proj[:2]有个面试常考的延伸问题:为什么内参矩阵是3x3而不是4x4?因为内参做的是从3D到2D的投影,这个过程中深度信息被丢弃了(除以Z)。这是一个不可逆的过程——你无法从一张图片恢复深度信息(单目情况下)。这也是为什么我们需要双目、RGB-D或者激光雷达来获取深度。
还有一个容易混淆的点:焦距f和视场角FOV的关系。对于给定的传感器宽度w和焦距f,水平视场角FOV = 2 * arctan(w / (2*f))。焦距越大,视场角越小,看得越远但范围越窄——这就是长焦镜头和广角镜头的区别。
镜头畸变
小孔模型是理想化的,实际镜头存在畸变。畸变会让直线在图像中变成曲线,影响测量精度。畸变分两种主要类型:
径向畸变(Radial Distortion):由镜头形状引起,越靠近图像边缘畸变越大。桶形畸变(barrel distortion)让直线向外弯曲,常见于广角镜头;枕形畸变(pincushion distortion)让直线向内弯曲,常见于长焦镜头。数学模型通常用多项式表示:
x_distorted = x * (1 + k1*r² + k2*r⁴ + k3*r⁶) y_distorted = y * (1 + k1*r² + k2*r⁴ + k3*r⁶)
其中r是点到图像中心的距离,k1、k2、k3是径向畸变系数。一般用k1和k2就够了,只有鱼眼镜头等广角镜头才需要k3。
切向畸变(Tangential Distortion):由镜头和成像平面不完全平行引起(安装误差)。用两个参数p1、p2描述:
x_distorted = x + (2*p1*x*y + p2*(r² + 2*x²)) y_distorted = y + (p1*(r² + 2*y²) + 2*p2*x*y)
五个畸变参数(k1, k2, p1, p2, k3)加上四个内参(fx, fy, cx, cy),一共九个参数,就是相机标定要求解的全部内容(倾斜因子s通常设为0)。
面试时候经常被问:怎么判断一张图片有没有畸变?最简单的办法是看图片中的直线——如果现实中的直线在图像中弯曲了,那就是有畸变。桶形畸变让直线向外凸,枕形畸变让直线向内凹。
外参矩阵与坐标系变换
内参描述相机自身的几何特性,外参描述相机在世界坐标系中的位置和姿态。外参是一个3x3旋转矩阵R和一个3x1平移向量t,合起来就是[R|t],一个3x4的矩阵。
一个3D点从世界坐标系到图像像素坐标的完整投影过程是:
p_image = K * [R | t] * P_world
其中K是3x3内参矩阵,[R|t]是3x4外参矩阵,P_world是3D点的齐次坐标。
理解相机成像,需要理清几个坐标系之间的关系:
世界坐标系(World Frame):全局参考系,描述所有物体的绝对位置。在机器人领域,通常用map或world表示。
相机坐标系(Camera Frame):以相机光心为原点,Z轴指向拍摄方向,X轴向右,Y轴向下(OpenCV约定)。注意不同框架的约定可能不同,比如ROS中相机坐标系是X右Y下Z前,而OpenGL是X右Y上Z后。
图像物理坐标系:成像平面上的物理坐标,原点在光轴与成像平面的交点(主点),单位是毫米。
像素坐标系:以图像左上角为原点,u向右,v向下,单位是像素。这是我们在代码中实际使用的坐标系。
从世界坐标系到像素坐标系的变换链是:世界坐标 →(外参R,t)→ 相机坐标 →(内参K)→ 像素坐标。
这个变换链在SLAM、视觉里程计、手眼标定等任务中反复出现。理解它,是理解整个视觉几何的基础。
面试时候经常问的一个问题是:给定一张图片和对应的相机位姿,怎么把3D模型渲染到图片上?答案就是用这个投影公式,把3D模型的每个点先通过外参变换到相机坐标系,再通过内参投影到像素坐标。AR(增强现实)的核心就是这个过程。
面试中怎么聊
面试官问相机成像原理,你可以按这个顺序回答:先说小孔模型和投影公式,再说内参矩阵的物理含义和各参数的意义,然后讲镜头畸变的两种类型和数学模型,最后说外参和坐标系变换链。
如果面试官追问"为什么需要相机标定",你可以说:因为内参和畸变参数是相机自身的属性,每台相机、每个镜头组合都不一样,必须通过标定来获取。标定之后才能做精确的测量和重建,否则像素坐标和真实世界坐标之间的映射关系是不准确的。
如果面试官追问"单目相机能测深度吗",你可以说:单目相机本身无法直接测量深度,因为投影过程丢失了深度信息。但可以通过一些间接方法估计深度,比如已知物体大小的先验、运动视差(Structure from Motion)、或者用深度学习方法从单张图片预测深度。不过这些方法都有局限性,精度和鲁棒性远不如双目或RGB-D相机。
补充一个实际项目中容易踩的坑:相机坐标系约定不一致的问题。OpenCV的相机坐标系是X右Y下Z前(Z轴指向拍摄方向),而ROS的相机坐标系是X右Y下Z前(和OpenCV一致),但OpenGL是X右Y上Z后。如果你在做AR或者3D渲染,需要把OpenGL的坐标系转换到OpenCV的坐标系,只需要把Y和Z取反。我有一次做相机和IMU的联合标定,标定结果一直不对,最后发现是IMU的坐标系和相机的坐标系手性不同(一个是右手系一个是左手系),加了一个坐标轴翻转就解决了。面试时候提到这种坐标系踩坑经验,面试官会觉得你确实做过实际项目。
下一篇讲相机标定的实操流程——怎么用OpenCV做棋盘格标定,获取内参和畸变系数。
如果这篇文章对你有帮助,欢迎点赞、在看、转发三连。 你的支持是我持续更新的最大动力。
「机器人软件开发面试·从入门到精通」连载系列上一篇:第150篇 激光雷达点云分割——地面分离、聚类分析和物体提取 下一篇预告:第152篇 相机标定实操——内参/外参/畸变系数的标定流程
有任何问题欢迎评论区留言,我会尽量回复。