约克大学开发CBS立体视觉算法:提升人形机器人深度感知能力

打印派   2026-08-28 10:35:11

加拿大约克大学(York University)研究团队近日发布了一种新型立体视觉算法,可使人形机器人通过更接近人类视觉的方式感知深度。该算法名为会聚双目立体视觉(Convergent Binocular Stereo,简称CBS),专为双眼摄像头可向同一目标会聚的机器人头部设计,而非传统平行布置的立体相机系统。

传统立体视觉系统主要计算平行摄像头之间图像的水平视差。CBS则同时处理摄像头会聚时产生的水平和垂直视差,将摄像头运动纳入深度感知过程。算法首先将两个摄像头固定于同一三维点,确定图像间的几何关系,然后通过五层高斯金字塔在多分辨率下进行分析。在粗略层级匹配SIFT特征并利用对极几何约束估算视差,随后用Gabor滤波器分析纹理和边缘信息以确定对应像素。系统从低分辨率向原始分辨率逐级细化视差估计,最终生成水平和垂直视差图并转换为三维信息与深度估计。研究团队称,CBS还能获取表面倾斜、物体姿态及深度缩放信息,提供更具仿生特性的视觉处理。

为验证算法,团队构建了包含49个场景的CBS-BM测试数据集,涵盖桌面环境、重复纹理、无特征表面和高度自遮挡物体等。每个场景包含平行图像及5至12组会聚图像对。

测试中,CBS在整体数据集上的平均水平视差和深度误差均低于所对比的平行立体方法。在重复纹理场景中,其优势最为明显——传统系统在此类场景中难以匹配视觉上相似的特征,而CBS的平均深度误差比次优方法低约0.8米,水平视差误差低约100像素。

研究团队指出,该算法存在局限:远距离目标精度下降,且依赖精确的相机标定和电机定位。当前在AMD Ryzen 7 7700X处理器上运行约需69秒,仍有较大优化空间。

研究人员表示,CBS并非用于取代无需仿生视觉场景中的平行立体系统,而是为人形机器人提供一种更接近人类主动会聚视觉的感知基础,适用于需要眼动与视觉处理协同工作的应用场景。该算法为提升人形机器人的环境感知与导航能力提供了新的技术路径。


0

96 0

发表评论

登陆后参与评论