场景感知RGB-D / 点云
徐延飞
面向计算机视觉、具身智能与智能应用系统的研究与实践
围绕多模态感知、计算机视觉、结构化语义理解展开,关注算法模型在机器人操作、图像分析中的可复现实现与应用闭环。
33研究方向
10+10+工程仓库
11论文成果
01
具身智能自主清洁机器人
面向复杂场景的多模态感知、任务规划与机器人操作闭环
该工作基于 Isaac Sim 与 IsaacLab 构建仿真验证环境,围绕大小模型协同垃圾识别、空间定位、导航决策与机械臂抓取建立端到端流程,并将视觉语言模型、YOLO 实例分割和运动规划模块纳入统一任务框架。
- 融合 RGB-D、相机图像与点云信息进行环境表征
- 大小模型协同兼顾实时性和准确性,识别类别、位置
- 构建从目标选择、导航站位到抓取投放的任务执行链
- 通过仿真数据与真实样本提升模型迁移和执行稳定性
感知、规划与执行的闭环流程
场景感知RGB-D / 点云
目标定位目标框与位姿
路径规划全局 / 局部路径
操作执行抓取与投放控制
Isaac SimIsaacLabPyTorchOpen3DROS2
02
VLSE-Net 岩心 SEM 孔隙鲁棒分割
面向异质岩土材料的跨域孔隙结构表征
该研究提出 VLSE-Net,通过视觉语言先验与结构增强机制提升复杂 SEM 图像中的孔隙-基质判别能力,并保持细长孔隙及连通结构,为岩石物理参数计算提供可靠分割结果。
Dice 相对提升+3.12%
孔隙度误差降幅39.6%
关键模块结构可视化
模块设计目标
LSCM 引入语义先验提升孔隙-基质判别;ASRM 通过方向敏感建模保持细长孔隙与弱边界连续性。
03
传感器-视觉多模态分类与服务系统
面向真实场景的多模态分类与服务系统
该系统面向公众应用场景,集成视觉识别、RAG 知识服务、地理信息查询、社区激励与设备联动,实现从分类判别到回收指导、用户反馈和设备管理的应用闭环。
视觉识别知识检索问答空间投放服务社区激励机制设备互联
系统方案与应用验证