(来源:计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12567847/pdf/sensors-25-06394.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文系统梳理了 LLM 与 3D 视觉交叉领域的前沿进展、技术路线与应用方向。本文带你一文读懂这场正在发生的机器人感知革命。
PART/1
背景
传统机器人感知多依赖 2D 视觉与固定规则,缺乏语义理解与空间推理能力;而大模型虽然拥有海量知识与推理能力,却无法直接理解物理世界的三维结构。二者的强互补性,催生了 “LLM+3D 视觉” 这一全新赛道。
1. LLM 的进化:从文字到多模态
从 BERT、GPT 系列到 LLaMA、DeepSeek R1,大模型的参数规模与推理能力飞速提升。Transformer 架构与自注意力机制让模型能够捕捉长距离语义依赖,而视觉 Transformer(ViT)的出现,进一步将这一能力延伸到了视觉领域。
主流大模型发展时间线,包含参数规模与核心技术特性2. 3D 数据的独特价值
相比 2D 图像,3D 数据包含更丰富的空间、几何与深度信息,是机器人理解物理世界的基础。3D 数据主要分为两大类:
- 欧几里得型
:如 RGB-D、体素网格、多视图图像,具备网格结构,可沿用 2D 深度学习方法;
- 非欧几里得型
:如点云、网格、图结构,无规则网格排布,需专门的几何深度学习算法处理。
3D 数据表示形式分类框架3. 三大核心研究问题
这篇综述围绕三个关键问题展开系统梳理:
如何将大模型的符号推理与 3D 传感器的几何数据对齐,实现精准的空间定位与物体指代?
如何让大模型融合触觉、听觉、热成像等非视觉数据,构建更完整的 3D 世界模型?
如何破解 3D 数据稀缺的难题,打造更具泛化性的机器人感知系统?
PART/2
机器人的 “感官系统”
要实现智能感知,首先要有过硬的硬件基础。目前机器人常用的 3D 感知技术主要分为四大类,各有优劣与适用场景:
立体视觉、结构光、ToF、激光雷达四大类技术的代表传感器、参数与适用场景除了视觉,新一代机器人正在向 “多感官” 进化,突破单一视觉的局限:
- 触觉传感器
:如 GelSight、BioTac,能感知纹理、压力与滑动,实现灵巧抓取与材质识别;
- 听觉传感器
:麦克风阵列实现声源定位与语音交互,检测环境异常声响;
- 热成像传感器
:如 FLIR 系列,在黑暗、烟雾、大雾环境下仍能检测人体与热源。
多模态机器人感知系统示意图,包含视觉、触觉、听觉、热成像四类传感器的功能与局限PART/3
七大前沿方向
目前,LLM 与 3D 视觉的融合已经在多个关键方向取得实质性进展,全面赋能机器人的感知、理解与交互能力。
1. 定位与指代:让机器人听懂 “拿桌上的杯子”
物体接地(Object Grounding)是人机交互的基础 —— 让机器人把自然语言描述对应到三维空间里的具体物体。目前主要有两条技术路线:
- 预探索式
:依赖预先建图与标注,适合静态环境,效率高但灵活性弱;
- 自探索式
:通过 SLAM 实时建图与探索,适应动态未知环境,灵活性强但算力要求高。
代表性工作如 Transcrib3D,先通过 3D 目标检测器提取物体语义与空间信息,再转成结构化文本输入大模型,通过生成 Python 代码进行空间计算推理,零样本即可完成指代定位。
2. 动态场景理解:看懂人的动作与环境变化
对于服务机器人与自动驾驶,理解动态场景(尤其是人体动作)至关重要。比如 CrossGLG 框架,用大模型生成语义描述来指导骨骼动作识别,让模型关注关键关节的运动,实现小样本下的动作分类泛化。
3. 室内外场景全场景适配
- 室内场景
:利用房间功能分区的先验知识,结合语义拓扑地图(如 QueSTMaps),机器人可以推断 “牙刷大概率在卫生间”,大幅提升搜索效率;
- 室外场景
:以 WildRefer 为代表,融合激光雷达点云、RGB 图像与自然语言,实现野外动态场景下的 3D 视觉指代。
4. 开放词汇理解:见过没见过的都能认
传统 3D 模型只能识别训练过的类别,而开放词汇技术让机器人能泛化到未知物体。比如 ULIP 通过对比学习,将图像、文本、点云对齐到同一特征空间,零样本即可完成 3D 物体分类;视觉编程方法则让大模型把自然语言查询拆解成可执行的空间推理程序,无需重新训练就能定位新物体。
5. 文本生成 3D:用一句话造一个虚拟世界
3D 数据稀缺是行业痛点,而文本生成 3D(Text-to-3D)技术可以低成本生成海量训练数据。目前主流路线包括:
NeRF/DreamFusion:用 2D 扩散模型指导神经辐射场优化,渲染效果逼真;
3D-GPT:用大模型驱动程序化生成,通过多智能体协作生成 Blender 可执行代码,可控性强,适合机器人仿真训练。
6. 多模态大模型:不止于 “看”
单一视觉传感器在恶劣环境下容易失效,多模态融合是破局之道。比如 ConceptFusion 将 CLIP、DINO 等视觉语言模型的特征融合到 3D 建图中,支持文本、图像、音频等多模态查询;LiDAR-LLM 则直接让大模型理解原始激光雷达数据,赋能自动驾驶。
7. 具身智能:让机器人自主行动
感知的最终目的是行动。LLM+3D 视觉正在催生真正的自主具身智能体:
机械臂操作:PolarNet 用点云编码空间信息,结合语言指令,预测 7 自由度抓取动作;
自动驾驶:OmniDrive 构建 3D 多模态大模型,实现场景描述、交通规则理解、反事实推理与轨迹规划全链路能力。
PART/4
数据集与评价
如何衡量 3D-LLM 的真实能力?
1. 主流数据集一览
高质量数据集是模型训练的基石。目前 3D 语言领域的经典数据集包括 ScanNet、ScanRefer、Matterport3D 等室内场景数据集,以及 KITTI360、nuPlan 等自动驾驶数据集,还有 3D-Grand、EmbodiedScan 等大规模 3D 语言对齐数据集。
主流 3D 基准数据集的规模、场景与适用任务汇总相比 2D 视觉的百万级、亿级数据,3D 数据集规模普遍只有数千到数万,数据稀缺是制约行业发展的核心瓶颈之一。
2. 评价指标体系
- 文本生成类
:METEOR、CIDEr 等,衡量描述文本的质量;
- 定位分类类
:Top-k 准确率、交叉熵损失等;
- 几何对齐类
:推土机距离(EMD)、Smooth L1 损失等;
- 具身任务类
:SPL(路径长度加权成功率)、SCT(时间加权成功率),重点衡量任务完成效率。
需要特别注意的是,机器人领域不能只看 NLP 指标,任务成功率、执行效率等功能性指标远比语言流畅度更重要。
PART/5
总结与展望
挑战与未来:距离真正的自主机器人还有多远?
尽管进展迅速,LLM+3D 视觉仍面临诸多核心挑战,也是未来的重点研究方向。
1. 算力与实时性瓶颈
传统 3D 算法仅需 10-200 GFLOPs 算力,而 LLM-3D 流水线动辄 1-5+ TFLOPs,功耗从几十瓦飙升到 250 瓦以上,延迟也从百毫秒级涨到数百毫秒甚至数秒。对于需要实时响应的机器人与自动驾驶,这是亟待突破的硬瓶颈。
传统 3D 方法与 LLM-3D 流水线的算力、功耗、延迟对比2. 数据稀缺与泛化难题
3D 数据采集与标注成本高、周期长,高质量文本 - 3D 对齐数据集匮乏。未来文本生成 3D、合成数据增强、点云增广等技术将是重要的破局方向。
3. 可解释性与安全风险
大模型的 “黑箱” 特性 + 3D 感知的不确定性,给安全部署带来巨大挑战。尤其是自动驾驶、医疗机器人等高风险场景,模型的可解释性、对抗鲁棒性、伦理合规性都需要系统性的解决方案。
4. 未来展望
未来的研究将重点聚焦于:
自适应轻量化架构,实现端侧实时推理;
更高效的跨模态对齐与知识蒸馏,缩小 2D 到 3D 的领域鸿沟;
多传感器深度融合,打造全天候、全场景的鲁棒感知;
建立更科学的评价体系,以任务成功为核心导向。
当大模型的 “大脑” 接上 3D 视觉的 “眼睛”,再配上触觉、听觉等多元感官,机器人正在从 “自动化工具” 向 “自主智能体” 加速进化。这场感知层面的质变,终将让机器人真正走进我们的生活,成为工业生产、家庭服务、公共服务场景中不可或缺的智能伙伴。
有相关需求的你可以联系我们!
