技术前沿

AI视频相关技术论文与突破

技术前沿2026-08-11 10:15

中科院等发布WorldExam:全球首个视频世界模型能力评测基准

这项由中国科学院自动化研究所(CASIA)联合香港中文大学(CUHK)、上海人工智能实验室(SLAI)、高德地图(AMAP)及清华大学(THU)共同完成的研究,于2026年8月以预印本形式公开发布,论文编号arXiv:2608.02603。 核心问题:当前的AI视频生成模型评测体系长期停留在"画面好不好看"和"角色有没有按指令动"的层面,没有追问更关键的问题——AI生成的"世界"真的会对周遭环境做出合理反应吗? WorldExam把视频世界模型的能力层层拆解: 1. 表面画质层:画面清晰度、色彩还原 2. 运动合理性层:角色动作是否符合物理规律 3. 世界反应性层:当AI角色靠近障碍物时障...

技术前沿2026-08-11 15:30

CVPR 2026:六个基准从六个维度重新定义"好视频"

CVPR 2026收录六篇视频生成评估相关工作,从六个维度重新定义视频生成质量评估标准。 六维评估框架: 1. 人体姿态(Google WyD):1,544个精选视频,覆盖9大类别56个子类别,细粒度人体动作标注,通过姿态检测器提取关键点轨迹用匈牙利匹配算法评估 2. 美学评估:关注视频的视觉美感和构图质量 3. 虚假信息:检测AI生成视频中的虚假内容和不合理信息 4. 物理真实感:验证视频中的物理规律是否正确(重力、碰撞、流体) 5. 社会推理:评估视频中的社会行为逻辑是否合理 6. 参考对比:与参考视频的质量对比评估 核心趋势:否定FVD"一个数字定胜负"的评估范式。FVD衡量的是像素...

技术前沿2026-08-11 13:00

Xmax X2.0:清华团队发布全球首个虚实融合实时交互视频模型

清华史佳欣团队(KEG出身,和智谱同实验室)Xmax AI发布X2.0实时交互视频模型。2026年2月发X1(全球首个虚实融合实时交互视频模型),7月15日发X2.0。 X1到X2.0演进: - 分辨率:480p → 960p@24fps - 延迟:毫秒级 - 端侧:iPhone可跑384p@16fps - 六大模式:CharX(角色变身)/ClothX(换装)/VibeX(氛围)/MoX(动态)/DimX(维度)/Free(自由) 技术底座: - 流式DiT + 多阶段蒸馏 + FP8 + 统一交互架构 - 破解"速度/成本/质量"不可能三角 定价爆点: - 海外:$6/h - 国内:...