论坛嘉宾:高林
报告题目:基于显示3D表征与隐式生成模型双擎驱动的世界模型仿真
报告摘要:世界模型成为三维视觉和计算机图形学等领域最受关注的焦点之一。随着大语言推理模型、多模态大模型、视频生成和三维重建等技术快速发展,研究者能够以更高层次建构和预测复杂世界状态,使“可理解、可预测、可交互”的数字世界逐渐成为可能。本次报告中,我们将分析和梳理构建世界模型的主要技术流派并将分析各自的特点,已经探讨基于显式3D表征和隐式生成模型联合驱动的世界模型仿真方法。
嘉宾简介:高林,中国科学院计算技术研究所研究员、博士生导师、泛在计算系统研究中心副主任、中国科学院大学岗位教授。在清华大学获得博士学位(导师:胡事民院士)。研究方向为计算机图形学、三维计算机视觉。在SIGGRAPH、TPAMI、TVCG等期刊会议发表论文100余篇,研发的人脸AIGC的APP被全球180余个国家或者地区的用户所使用。现任或者曾任亚洲图形学学会秘书长, CSIG智能图形专委秘书长,SIGGRAPH技术论文程序委员会委员,CVPR领域主席,IEEE TVCG编委,作为项目负责人承担国家重点研发计划、国家自然科学基金委优青等项目,曾获得亚洲图形学会青年学者奖,吴文俊人工智能优秀青年奖,CCF技术发明一等奖等奖励。
论坛嘉宾:高俊
报告题目:Towards 3D grounded generative world simulator
报告摘要:The emergence of video generative models has revolutionized content generation community, raising important questions about the role and necessity of 3D structure in the loop. In this talk, I will explore a co-existence framework between 2D and 3D, with a particular focus on controllable video generation for a generative world simulator.
嘉宾简介:Jun Gao is an Assistant Professor at the University of Michigan as well as a senior research scientist at NVIDIA. His research stays at the intersection of 3D computer vision, computer graphics and generative models. He is interested in developing controllable generative AI models for photorealitic, diverse and interactive virtual environments.
论坛嘉宾:陈颖聪
报告题目:基于扩散先验的空间理解与推理
报告摘要:空间理解与推理是计算机视觉中极具挑战性的课题,尤其在处理具有高度歧义的场景(如透明、反光等)时,传统方法常常难以建模其真实的三维结构。近年来,基于扩散模型的生成式方法在空间理解任务中取得了显著进展,然而,其有效性背后的机理仍未十分清晰。本报告审视了扩散模型在空间理解中的作用,指出其关键并不在于多步的随机生成过程,而在于其通过大规模训练所学到的世界先验。这些先验知识蕴含了丰富的几何与语义信息,使模型在面对复杂场景时具备更强的结构感知能力。我们进一步提出,在空间理解上以生成为目标的随机性建模往往会导致次优结果。通过确定性建模,我们展示了其在深度、法相估计等问题能够以极低的数据成本得到目前SOTA的效果。同时,报告还将展示该扩散先验还适用于3D生成、立体电影生成等多种下游任务。
嘉宾简介:陈颖聪,香港科技大学 (广州)人工智能学域助理教授,博导,受国家人才计划青年项目资助,毕业于香港中文大学,曾担任麻省理工学院担任博士后研究员。多年以来一直致力于计算机视觉,特别是视觉生成模型的研究,在TPAMI、CVPR、ICCV、ECCV等顶级学术会议、期刊发表论文六十余篇。其工作专注于视觉生成模型基础与应用研究,多次以第一作者或者通信作者身份在顶级会议中做口头报告,其研究成果入选ESI高被引论文、ICCV 2023最佳论文提名,获中国图像图形学会自然科学奖一等奖、广东省人工智能学会科学进步奖、广东省工业软件科学技术奖。在TPAMI、IJCV、CVPR、ICCV、ECCV、NeurlPS、AAAI、IJCAI等顶级学术会议、期刊担任领域主席、程序委员会成员或审稿人。其工作成果受到工业界的广泛认同,受思谋科技、华为诺亚方舟实验室、趣丸科技、快手科技、Adobe等科技公司资助,并建立深入的合作关系。
论坛嘉宾:赵恒爽
报告题目:空间表征赋能空间智能
报告摘要:空间智能是人类认知的核心能力之一,使我们能够理解三维世界的结构、预测物体运动轨迹、规划导航路径并与环境进行有效交互。从视觉输入中准确捕捉和推理空间关系是实现高级视觉智能的关键基石。当前视觉基础模型(如CLIP、DINO、SAM等)虽然在图像分类、目标检测、语义分割等多种二维视觉任务上表现优异,但在空间结构理解和三维关系推理方面仍有较大提升空间,难以准确理解物体的三维位置、距离关系和场景的整体空间布局等重要问题。本研究致力于构建具有空间感知能力的视觉表征,通过引入几何先验和三维结构建模,以提升模型的空间理解与推理性能。本报告将系统介绍我们在空间表征学习方面的最新研究进展,包括空间感知预训练方法、多模态三维场景理解框架和几何先验驱动的场景推理机制。我们将展示其在自动驾驶、机器人、具身智能等关键应用场景中的效果,并探讨空间智能领域面临的挑战与未来研究前沿。
嘉宾简介:赵恒爽博士是香港大学计算与数据科学学院助理教授,国家优秀青年基金获得者。此前,他曾在麻省理工学院和牛津大学担任博士后研究员。他的研究兴趣涵盖计算机视觉、机器学习和人工智能等广泛领域,特别着重于构建智能视觉系统。他在CVPR、NeurIPS和TPAMI等顶级会议和期刊上发表论文100余篇,研究成果被引约48,000余次,其中单篇一作论文被引超18,000次,六篇一作论文被引超1,000次。他曾获得过多次国际学术竞赛的冠军,世界人工智能大会明日之星、璀璨明星和青年优秀论文奖,蚂蚁InTech科技奖,CVPR最佳演示荣誉奖,AI100青年先锋,被AI 2000评为计算机视觉领域最具影响力的学者之一,被斯坦福大学列为世界前2%终身影响力科学家。此外,他曾担任CVPR、ICCV、ECCV、NeurIPS和ICLR等会议的领域主席,IEEE TPAMI和Pattern Recognition的副编辑,以及IEEE TCSVT的客座编辑。
论坛嘉宾:赵昊
报告题目:可量产的自动驾驶世界模型
报告摘要:要实现可靠的自动驾驶,亟需具备可扩展性、可泛化性与可量产能力的世界模型(World Model),能够在多样化的真实环境中完成感知、决策与安全评估。然而,现有生成式管线往往仅关注单一模态、缺乏可控性,或无法支持闭环决策。在本次报告中,我将基于我们近期的三项工作,系统阐述下一代自动驾驶世界模型的统一框架与技术路线。首先,UniScene 提出了以占据(occupancy)为核心的生成范式,通过“语义占据 → 视频与激光雷达”的渐进式合成,实现高保真、可控且具备丰富标注的模拟与训练数据生成。其次,DiST-4D 通过引入metric depth作为统一几何表示,显著提升动态场景生成性能,在时间轨迹外推与空间新视角渲染上均达到当前最优效果,并摆脱了逐场景优化的依赖。最后,OmniNWM 将世界模型拓展至真正的可量产层面,联合建模状态、动作与奖励,构建全景导航式的闭环世界模型,实现精确的自车控制与基于占据的安全评估。综合来看,这三项系统展示了一条通向工业级落地的可行路径:世界模型作为可控、几何感知、奖励驱动的模拟器,在学习与安全执行之间架起桥梁。报告最后将探讨如何从离线生成式基准过渡到高可靠、实时运行的自动驾驶系统。
嘉宾简介:赵昊,清华大学智能产业研究院(AIR)助理教授,智源学者(BAAI Scholar),于清华大学电子工程系获得学士和博士学位,曾于英特尔中国研究院担任研究员,曾在北京大学从事博士后研究。他在CVPR/NeurIPS/SIGGRAPH/ICRA等学术会议以及TPAMI/IJCV等学术期刊上发表了50余篇研究论文,赢得过多项三维场景理解算法挑战赛的冠军,并主导研发了全球首个开源的模块化真实感自动驾驶仿真器MARS,在CICAI 2023获得Best Paper Runner-up奖项,被工业界广泛使用。其主导研发的渲染阶段可调整精度速度的神经渲染方法SlimmeRF于3DV 2024获得Best Paper奖项。