MLNLP学术Talk是由 MLNLP社区 和 中国中文信息学会青年工作委员会 联合举办的学术交流活动,旨在邀请一线青年学者分享最前沿的技术,期待最精彩的思想火花碰撞。
本期MLNLP学术Talk邀请了北京大学人工智能学院博士生刘烜奕在2026年9月12日9:00-10:00为我们带来“CamGeo:基于 3D 几何先验的稀疏相机条件图生视频生成”的主题报告。详细信息如下:
本次活动组织者:王奕辰、蒋官语、张宸源、涂耿、卢俊宇
战略合作伙伴:腾讯
讲者简介
刘烜奕,北京大学博士研究生,主要研究方向为可控视频生成、3D 几何先验与视频世界模型。在ICML、CVPR、NeurIPS等国际顶级会议和期刊上发表论文,入选2025年腾讯犀牛鸟精英人才计划。
报告摘要
随着视频生成模型逐步走向交互式创作、虚拟拍摄和世界模型应用,如何精确控制相机运动成为一个关键问题。现有 camera-conditioned image-to-video 方法通常依赖逐帧 dense camera poses,用户需要提供完整相机轨迹,或先从参考视频中估计 dense camera,这在真实使用场景中并不友好。更自然的方式是仅通过少量关键帧相机条件引导生成过程,但稀疏条件往往会导致轨迹漂移、运动抖动和 3D 结构不一致。本报告将介绍 CamGeo,一个稀疏相机条件的视频生成框架。CamGeo 在训练和测试阶段都采用 sparse camera condition,并引入 VGGT 提供的 3D 几何先验,通过关键帧轨迹蒸馏和跨帧几何一致性约束,将相机控制信号传播到未标注的中间帧。同时,CamGeo 采用 curriculum learning,从粗粒度到细粒度逐步增强模型的稀疏控制能力。实验表明,该方法在 SVD 和 CogVideoX 等基础模型上均能更准确地跟随相机轨迹,同时保持更好的时序一致性、三维稳定性和视觉质量。本报告也将进一步讨论 CamGeo 如何作为连接可控视频生成、虚拟拍摄与未来 video world model 的几何接口。
主持人介绍
卢俊宇,大连理工大学计算机学院四年级博士生,导师为林鸿飞教授,入选2025年度中国科协青年科技人才培育工程博士生专项计划。研究方向包括大模型安全和仇恨言论检测,以第一作者身份在NeurIPS、ACL、SIGIR、TASLP等人工智能国际顶级会议以及期刊上发表论文多篇,并担任相关会议的审稿人。参与SemEval、NLPCC等多项国际语义评测并获得一等奖。
直播平台
视频号
B站