专题论坛

空间理解与推理专题论坛

观点嘉宾

高林

中国科学院

计算技术研究所

高俊

密歇根大学

陈颖聪

香港科技大学

(广州)

赵恒爽

香港大学

赵昊

清华大学

论坛嘉宾:高林
报告题目:基于显示3D表征与隐式生成模型双擎驱动的世界模型仿真
报告摘要:世界模型成为三维视觉和计算机图形学等领域最受关注的焦点之一。随着大语言推理模型、多模态大模型、视频生成和三维重建等技术快速发展,研究者能够以更高层次建构和预测复杂世界状态,使“可理解、可预测、可交互”的数字世界逐渐成为可能。本次报告中,我们将分析和梳理构建世界模型的主要技术流派并将分析各自的特点,已经探讨基于显式3D表征和隐式生成模型联合驱动的世界模型仿真方法。
嘉宾简介:高林,中国科学院计算技术研究所研究员、博士生导师、泛在计算系统研究中心副主任、中国科学院大学岗位教授。在清华大学获得博士学位(导师:胡事民院士)。研究方向为计算机图形学、三维计算机视觉。在SIGGRAPH、TPAMI、TVCG等期刊会议发表论文100余篇,研发的人脸AIGC的APP被全球180余个国家或者地区的用户所使用。现任或者曾任亚洲图形学学会秘书长, CSIG智能图形专委秘书长,SIGGRAPH技术论文程序委员会委员,CVPR领域主席,IEEE TVCG编委,作为项目负责人承担国家重点研发计划、国家自然科学基金委优青等项目,曾获得亚洲图形学会青年学者奖,吴文俊人工智能优秀青年奖,CCF技术发明一等奖等奖励。
论坛嘉宾:高俊
报告题目:Towards 3D grounded generative world simulator
报告摘要:The emergence of video generative models has revolutionized content generation community, raising important questions about the role and necessity of 3D structure in the loop. In this talk, I will explore a co-existence framework between 2D and 3D, with a particular focus on controllable video generation for a generative world simulator.
嘉宾简介:Jun Gao is an Assistant Professor at the University of Michigan as well as a senior research scientist at NVIDIA. His research stays at the intersection of 3D computer vision, computer graphics and generative models. He is interested in developing controllable generative AI models for photorealitic, diverse and interactive virtual environments.
论坛嘉宾:陈颖聪
报告题目:基于扩散先验的空间理解与推理
报告摘要:空间理解与推理是计算机视觉中极具挑战性的课题,尤其在处理具有高度歧义的场景(如透明、反光等)时,传统方法常常难以建模其真实的三维结构。近年来,基于扩散模型的生成式方法在空间理解任务中取得了显著进展,然而,其有效性背后的机理仍未十分清晰。本报告审视了扩散模型在空间理解中的作用,指出其关键并不在于多步的随机生成过程,而在于其通过大规模训练所学到的世界先验。这些先验知识蕴含了丰富的几何与语义信息,使模型在面对复杂场景时具备更强的结构感知能力。我们进一步提出,在空间理解上以生成为目标的随机性建模往往会导致次优结果。通过确定性建模,我们展示了其在深度、法相估计等问题能够以极低的数据成本得到目前SOTA的效果。同时,报告还将展示该扩散先验还适用于3D生成、立体电影生成等多种下游任务。
嘉宾简介:陈颖聪,香港科技大学 (广州)人工智能学域助理教授,博导,受国家人才计划青年项目资助,毕业于香港中文大学,曾担任麻省理工学院担任博士后研究员。多年以来一直致力于计算机视觉,特别是视觉生成模型的研究,在TPAMI、CVPR、ICCV、ECCV等顶级学术会议、期刊发表论文六十余篇。其工作专注于视觉生成模型基础与应用研究,多次以第一作者或者通信作者身份在顶级会议中做口头报告,其研究成果入选ESI高被引论文、ICCV 2023最佳论文提名,获中国图像图形学会自然科学奖一等奖、广东省人工智能学会科学进步奖、广东省工业软件科学技术奖。在TPAMI、IJCV、CVPR、ICCV、ECCV、NeurlPS、AAAI、IJCAI等顶级学术会议、期刊担任领域主席、程序委员会成员或审稿人。其工作成果受到工业界的广泛认同,受思谋科技、华为诺亚方舟实验室、趣丸科技、快手科技、Adobe等科技公司资助,并建立深入的合作关系。
论坛嘉宾:赵恒爽
报告题目:空间表征赋能空间智能
报告摘要:空间智能是人类认知的核心能力之一,使我们能够理解三维世界的结构、预测物体运动轨迹、规划导航路径并与环境进行有效交互。从视觉输入中准确捕捉和推理空间关系是实现高级视觉智能的关键基石。当前视觉基础模型(如CLIP、DINO、SAM等)虽然在图像分类、目标检测、语义分割等多种二维视觉任务上表现优异,但在空间结构理解和三维关系推理方面仍有较大提升空间,难以准确理解物体的三维位置、距离关系和场景的整体空间布局等重要问题。本研究致力于构建具有空间感知能力的视觉表征,通过引入几何先验和三维结构建模,以提升模型的空间理解与推理性能。本报告将系统介绍我们在空间表征学习方面的最新研究进展,包括空间感知预训练方法、多模态三维场景理解框架和几何先验驱动的场景推理机制。我们将展示其在自动驾驶、机器人、具身智能等关键应用场景中的效果,并探讨空间智能领域面临的挑战与未来研究前沿。
嘉宾简介:赵恒爽博士是香港大学计算与数据科学学院助理教授,国家优秀青年基金获得者。此前,他曾在麻省理工学院和牛津大学担任博士后研究员。他的研究兴趣涵盖计算机视觉、机器学习和人工智能等广泛领域,特别着重于构建智能视觉系统。他在CVPR、NeurIPS和TPAMI等顶级会议和期刊上发表论文100余篇,研究成果被引约48,000余次,其中单篇一作论文被引超18,000次,六篇一作论文被引超1,000次。他曾获得过多次国际学术竞赛的冠军,世界人工智能大会明日之星、璀璨明星和青年优秀论文奖,蚂蚁InTech科技奖,CVPR最佳演示荣誉奖,AI100青年先锋,被AI 2000评为计算机视觉领域最具影响力的学者之一,被斯坦福大学列为世界前2%终身影响力科学家。此外,他曾担任CVPR、ICCV、ECCV、NeurIPS和ICLR等会议的领域主席,IEEE TPAMI和Pattern Recognition的副编辑,以及IEEE TCSVT的客座编辑。
论坛嘉宾:赵昊
报告题目:可量产的自动驾驶世界模型
报告摘要:要实现可靠的自动驾驶,亟需具备可扩展性、可泛化性与可量产能力的世界模型(World Model),能够在多样化的真实环境中完成感知、决策与安全评估。然而,现有生成式管线往往仅关注单一模态、缺乏可控性,或无法支持闭环决策。在本次报告中,我将基于我们近期的三项工作,系统阐述下一代自动驾驶世界模型的统一框架与技术路线。首先,UniScene 提出了以占据(occupancy)为核心的生成范式,通过“语义占据 → 视频与激光雷达”的渐进式合成,实现高保真、可控且具备丰富标注的模拟与训练数据生成。其次,DiST-4D 通过引入metric depth作为统一几何表示,显著提升动态场景生成性能,在时间轨迹外推与空间新视角渲染上均达到当前最优效果,并摆脱了逐场景优化的依赖。最后,OmniNWM 将世界模型拓展至真正的可量产层面,联合建模状态、动作与奖励,构建全景导航式的闭环世界模型,实现精确的自车控制与基于占据的安全评估。综合来看,这三项系统展示了一条通向工业级落地的可行路径:世界模型作为可控、几何感知、奖励驱动的模拟器,在学习与安全执行之间架起桥梁。报告最后将探讨如何从离线生成式基准过渡到高可靠、实时运行的自动驾驶系统。
嘉宾简介:赵昊,清华大学智能产业研究院(AIR)助理教授,智源学者(BAAI Scholar),于清华大学电子工程系获得学士和博士学位,曾于英特尔中国研究院担任研究员,曾在北京大学从事博士后研究。他在CVPR/NeurIPS/SIGGRAPH/ICRA等学术会议以及TPAMI/IJCV等学术期刊上发表了50余篇研究论文,赢得过多项三维场景理解算法挑战赛的冠军,并主导研发了全球首个开源的模块化真实感自动驾驶仿真器MARS,在CICAI 2023获得Best Paper Runner-up奖项,被工业界广泛使用。其主导研发的渲染阶段可调整精度速度的神经渲染方法SlimmeRF于3DV 2024获得Best Paper奖项。

时空重建与生成专题论坛

观点嘉宾

彭思达

浙江大学

廖依伊

浙江大学

刘晓培

上海科技大学

孙赫

北京大学

论坛嘉宾:彭思达
报告题目:时空重建的技术发展分析
报告摘要:本次报告旨在系统分析时空重建技术的未来发展趋势。我们将从第一性原理出发,深入剖析基于图像序列恢复动态三维场景结构所涉及的本质技术问题。在准确把握底层挑战的基础上,对现有技术体系进行重构与推演,进而探索高精度时空重建能力实现的可能路径。
嘉宾简介:彭思达,浙江大学软件学院“百人计划”研究员,博士生导师,研究方向为三维计算机视觉和计算机图形学。至今在TPAMI、CVPR、ICCV等期刊或会议发表六十余篇论文,谷歌学术引用7100余次,其中一篇一作论文获得CVPR最佳论文提名,成果获得GitHub数万次stars和2024年中国CCF图形开源软件奖;入选China3DV 2025年度杰出青年学者、斯坦福2024全球Top 2%科学家榜单、2024年中国计算机学会优博(国内计算机领域评选十人);被苹果公司评为2022 Apple Scholar(亚太地区唯一),被华为公司评为2024启真优秀青年学者。
论坛嘉宾:廖依伊
报告题目:重建与生成交汇:迈向更便捷的三维内容生产
嘉宾简介:廖依伊,浙江大学信电学院特聘研究员。研究兴趣主要为三维视觉与编码。在TPAMI、CVPR、ICCV、NeurIPS等期刊和会议发表文章五十余篇,谷歌学术引用6000余次。获IEEE MMSP 2025多媒体信息处理新星奖,ICRA 2024最佳机器人视觉论文奖,华为火花价值奖。担任3DV 2025程序主席,MPEG国际标准组织高斯泼溅编码(GSC)专题组联席组长,多次担任CVPR、NeurIPS等会议领域主席。
论坛嘉宾:刘晓培
报告题目:从流体仿真到流体交互智能体
报告摘要:兼具视觉真实感、物理计算精度与一致性及计算效率的流体仿真器,始终是工业界与学术界亟待突破的核心痛点与关键需求。本报告重点阐述我们团队针对该痛点取得的最新技术突破:通过对核心流体求解器进行建模和多维度优化,并耦合参数化降阶模型,构建出高性能直接和混合求解器平台。该平台既可作为工业产品设计的仿真验证平台,同时也为无人机、机器鱼等流体交互智能体的控制设计与策略学习提供高效支撑,并借助参数优化技术实现仿真模型向实物系统的快速迁移。报告将同步展示实物系统分析计算及控制实验,并通过对比验证该技术平台的综合优势。
嘉宾简介:刘晓培博士现任上海科技大学信息科学与技术学院视觉与数据智能中心常任终生副教授,博士生导师。他的研究主要专注于高性能流体仿真与建模、科学可视化与渲染、大规模并行计算、机器学习、无人飞行器/潜航器的动力学仿真、建模、设计与控制,以及与流体交互的智能体仿真与迁移。其成果发表在计算机图形学、可视化、计算物理及机器人等多个领域的重要顶级期刊及会议上,如SIGGRAPH/SIGGRAPH Asia, TOG, TVCG, JCP, PRD, POF, RAL, ICRA, IROS等,主持国家自然科学基金青年及面上项目,参与上海市科委及香港ITF重点研发项目,带领团队独立研发自主国产化高性能流体仿真工业软件系统,并逐步应用于实际工程研发与制造中。
论坛嘉宾:孙赫
报告题目:让语言约束几何:视觉语言模型驱动的空间理解与3D生成
报告摘要:当前的 3D 生成模型——无论是基于文本驱动的生成管线,还是原生的 3D 扩散模型以及 NeRF / 高斯场等表示——在视觉效果上已经相当逼真,但在“空间智能”方面仍存在明显短板:整体几何不一致、姿态与尺度错误、遮挡关系与物体间空间关系不合理等。 本报告提出一个通用框架,将大规模视觉语言模型(VLM)变成 3D 生成的空间评论家,从而“让语言约束几何”。给定文本描述和候选 3D 场景的多视角渲染,我们设计一系列关于形状、对称性、深度与遮挡、局部结构以及物体间关系的“是/否”问题,让 VLM 对空间结构进行理解与推理,并将其输出的对数几率转化为可微的奖励或优化信号。这一语言奖励可以无缝嵌入到多种 3D 生成管线中,包括基于 2D 模型蒸馏的方法和原生 3D 生成模型,用于训练或推理,从而显著提升语义一致性与几何合理性。 从理念上看,我们不再把语言仅视作对三维世界的注释,而是视作一种关于空间结构的可执行先验:用符号化的空间推理去塑造连续的三维场,实现更具空间理解和推理能力的 3D 生成。
嘉宾简介:孙赫,北京大学未来技术学院/国家生物医学成像科学中心助理教授。2014年和2019年分别获北京大学学士和美国普林斯顿大学博士学位。2019-2022获Amazon AI4Science Fellowship资助在美国加州理工大学从事博士后研究。2022年5月起在北京大学任教。主要研究方向为计算成像和计算摄影学,尤其是人工智能在生物、医学、天文等科学成像问题中的应用。相关成果已应用于银河系黑洞成像等多项国际重大科学成像任务,以及超声成像、计算显微成像等多种生物医学成像技术。

2024年议题回顾:具身智能

观点嘉宾

马月昕

上海科技大学

叶琦

浙江大学

黄思远

北京通用人工智能

研究院

宋杰

香港科技大学

(广州)

仉尚航

北京大学

论坛嘉宾:马月昕
报告题目:基于多源反馈的具身自主学习
报告摘要:当前基于VLA与世界模型的具身基座模型存在泛化不足、鲁棒性欠缺的问题。本报告聚焦基于多源反馈的具身自主学习,探讨如何融合演示数据、成败结果及人类自然语言等关键信息反馈,构建新的自主学习范式,推动具身大模型实现持续迭代、动态调整,最终达成 “越用越好、越交互越强” 的实用化目标。
嘉宾简介:马月昕,上海科技大学研究员、助理教授、博士生导师,博士毕业于香港大学。主要研究方向为三维视觉、具身智能、自动驾驶。共发表相关领域顶会或顶刊论文90余篇,其中一作与通讯论文50余篇,包括Science Robotics、TPAMI、CVPR、ICCV、SIGGRAPH等,谷歌学术引用6000余次。参与指导的论文获MICCAI 2024唯一最佳论文奖,ACM MM 2024最佳论文候选。曾获上海市海外高层次人才、上海市优秀教学成果一等奖、China 3DV 2025年度优秀青年学者、2025年World’s Top 2% Scientist等。
论坛嘉宾:叶琦
报告题目:高自由度灵巧手抓取轨迹优化和生成
报告摘要:生成大规模符合物理约束的抓取运动轨迹面临复杂的手物接触和高自由度优化空间挑战。本报告将介绍以接触图作为中间表示和引导的“接触区域生成—抓取姿态映射—高自由度运动轨迹优化”框架,并通过人手抓取动作协同先验,运动轨迹时序参数化,联合目标优化等方式,显著降低优化参数规模,在保证运动姿态合理性的前提下,该框架显著压缩优化参数规模、提升计算效率,使系统在实物平台上实现低时延、稳定且可复现的抓取。基于该方法,生成了覆盖 8,000+ 物体、100 万+ 轨迹的 GraspM³ 数据集,为后续高自由度灵巧手操作研究与产业落地提供数据基础。
嘉宾简介:叶琦,浙江大学控制科学与工程学院“百人计划”研究员,博士生导师。于英国帝国理工学院获得博士学位,随后加入英国剑桥微软研究院Mixed Reality & AI Lab,从事三维人体重建和跟踪、混合现实相关工作她的研究兴趣集中在计算机视觉、计算机图形学、机器人的交叉方向,包括手物交互下感知、高自由度机械手操作、自主场景感知。在TPAMI、IJRR、CVPR、ECCV、RAL、ICRA等计算机视觉领域和机器人顶级期刊和会议中发表三十余篇一作和通讯作者论文,多篇录用为oral/splotlight论文。目前她担任了3DV2026的出版主席,CVPR2025, ICRA2026的领域主席。
论坛嘉宾:黄思远
报告题目:通用人形机器人的进展与挑战
报告摘要:本次演讲将关注通用人形机器人的前沿研究以及应用落地问题,分析人形机器人领域最新的技术进展与突破,并展望通用人形未来走进千家万户所面临的机遇与挑战。
嘉宾简介:黄思远博士是北京通用人工智能研究院(BIGAI)的研究科学家,并担任具身机器人中心主任。他在加州大学洛杉矶分校(UCLA)统计系获得博士学位。他的研究旨在构建一个能够理解和与三维环境交互的类人通用机器人。他的研究发表于六十余篇会议及期刊论文,并曾获得CoRL、ICML workshop、IROS workshop等最佳论文。
论坛嘉宾:宋杰
报告题目:Towards Democratizing Human Motion Capture in the Wild at a Large Scale
报告摘要:Human skills are shaped by motion and influenced by the environment. The rapid development of humanoid robots has increased the demand for motion data that reflects these skills and egocentric operations. However, the scarcity of large-scale, high-quality motion data in real-world settings creates a bottleneck for learning human and humanoid skill foundation models, highlighting the urgent need for scalable and efficient data-collection systems. In this talk, we will discuss our efforts to democratize large-scale human motion capture in the wild.
嘉宾简介:宋杰博士毕业于苏黎世联邦理工大学,目前是香港科技大学(广州)机器人学域助理教授。他长期致力于计算机视觉、机器人技术和人机交互的研究。曾获得高通创新奖学金提名、瑞士电信最佳毕业论文奖以及3DV最佳论文奖等荣誉。学术服务方面,宋杰博士多次担任计算机顶级会议的领域主席,以及3DV2025的联合大会主席。
论坛嘉宾:仉尚航
报告题目:具身多模态基础模型发展现状与演进趋势
报告摘要:具身多模态大模型引领了人工智能与机器人融合研究的新范式,而现实世界中的具身智能体往往面对开放环境中跨本体、跨场景、跨任务等泛化性挑战,已有的多模态大模型面临不好用、不易用、不通用的关键难题。本次报告将介绍一系列关于具身多模态大模型的研究工作,包括具身大脑大模型、身智能端到端视觉-语言-动作大模型、具身世界模型的相关研究,并介绍各技术路线的发展趋势。
嘉宾简介:仉尚航,北京大学计算机学院研究员、博士生导师、博雅青年学者、智源学者。致力于开放环境泛化机器学习理论与系统研究,Google Scholar引用数2.1万次,荣获世界人工智能顶级会议AAAI 最佳论文奖。由Springer Nature出版《Deep Reinforcement Learning》,至今电子版全球下载量近三十万次,入选中国作者年度高影响力研究精选。入选美国“EECS Rising Star”、“全球AI华人女性青年学者榜”、“中国科协青年百人会”、“AI100青年先锋”。曾获多项国际竞赛前三名,曾多次在国际顶级会议NeurIPS、ICML上组织Workshop,担任AAAI 2022-2026 高级程序委员。仉尚航于2018年博士毕业于美国卡内基梅隆大学,并于加州大学伯克利分校从事博士后研究。
©2025 GAMES