Sora :从文本创建视频| OpenAI
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
AI视频相关技术论文与突破
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA基于过去对DALL · E和GPT模型的研究。它使用了来自DALL · E 3的recaptioning技术,该技术……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA基于过去对DALL · E和GPT模型的研究。它使用了来自DALL · E 3的recaptioning技术,该技术……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
我已经使用希格斯菲尔德进行创意工作一段时间了,老实说,它是最好的平台之一-工具功能强大,结果不言而喻。但让我写这篇文章的原因是支持。我对我的旅行基金有疑问, Tim以你很少看到的透明度和谨慎处理所有事情。
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
我已经使用希格斯菲尔德进行创意工作一段时间了,老实说,它是最好的平台之一-工具功能强大,结果不言而喻。但让我写这篇文章的原因是支持。我对我的旅行基金有疑问, Tim以你很少看到的透明度和谨慎处理所有事情。
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026 年4月 26日 · SORA是一个扩散模型,它从一个看起来像静态噪音的视频开始,逐渐生成视频……
Seedance 2.0采用统一的多模式音视频联合生成架构,支持文本、图像、音频和视频输入, ……
2026年4月26日 · Sora is a diffusion model, which generates a video by starting off with one that looks like static noise and gradually …
Seedance 2.0 adopts a unified multimodal audio-video joint generation architecture that supports text, image, audio, and video inputs, …
Kling 3.0 Pro is a professional-tier AI video generation platform built on a fully upgraded architecture. It offers deep multimodal …
Seedance 2.0 adopts a unified multimodal audio-video joint generation architecture that supports text, image, audio, and video inputs, …
2026 年 4 月 26 日·Sora 以过去对 DALL·E 和 GPT 模型的研究为基础。它使用 DALL·E 3 的重述技术,该技术……
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
2026年4月26日 · Sora is a diffusion model, which generates a video by starting off with one that looks like static noise and gradually …
Seedance 2.0 adopts a unified multimodal audio-video joint generation architecture that supports text, image, audio, and video inputs, …
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Kling 3.0 是第一个统一的多模式模型 - 它在单一架构中生成视频、音频和图像。以前的型号...
Kling 3.0 Pro是一款基于全面升级架构打造的专业级AI视频生成平台。它提供深度多式联运……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
Seedance 1.0 支持从文本和图像生成多镜头视频的模型。它在语义上实现了突破……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Kling 3.0 Pro是一款基于全面升级架构打造的专业级AI视频生成平台。它提供深度多式联运……
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
Seedance 1.0 支持从文本和图像生成多镜头视频的模型。它在语义上实现了突破……
2026年5月27日·2026年AI视频生成模型完整指南。比较架构、功能和 API 访问……
2026年4月26日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Kling 3.0 Pro是一款基于全面升级架构打造的专业级AI视频生成平台。它提供深度多式联运……
Kling 3.0 是第一个统一的多模式模型 - 它在单一架构中生成视频、音频和图像。以前的型号...
Sora 是一种扩散模型,它从看起来像静态噪声的视频开始生成视频,然后逐渐将其转换为……
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
Seedance 1.0 支持从文本和图像生成多镜头视频的模型。它在语义上实现了突破……
2024年2月15日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Kling 3.0 Pro是一款基于全面升级架构打造的专业级AI视频生成平台。它提供深度多式联运……
Kling 3.0 是第一个统一的多模式模型 - 它在单一架构中生成视频、音频和图像。以前的型号...
2024年2月15日 · Sora 是一种扩散模型,它通过从看起来像静态噪声的视频开始并逐渐......
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
2024 年 2 月 15 日·Sora 建立在过去对 DALL·E 和 GPT 模型的研究基础上。它使用 DALL·E 3 的重述技术,该技术……
Kling 3.0 是第一个统一的多模式模型 - 它在单一架构中生成视频、音频和图像。以前的型号...
Kling 3.0 Pro是一款基于全面升级架构打造的专业级AI视频生成平台。它提供深度多式联运……
Seedance 2.0采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频输入……
这项由中国科学院自动化研究所(CASIA)联合香港中文大学(CUHK)、上海人工智能实验室(SLAI)、高德地图(AMAP)及清华大学(THU)共同完成的研究,于2026年8月以预印本形式公开发布,论文编号arXiv:2608.02603。 核心问题:当前的AI视频生成模型评测体系长期停留在"画面好不好看"和"角色有没有按指令动"的层面,没有追问更关键的问题——AI生成的"世界"真的会对周遭环境做出合理反应吗? WorldExam把视频世界模型的能力层层拆解: 1. 表面画质层:画面清晰度、色彩还原 2. 运动合理性层:角色动作是否符合物理规律 3. 世界反应性层:当AI角色靠近障碍物时障...
CVPR 2026收录六篇视频生成评估相关工作,从六个维度重新定义视频生成质量评估标准。 六维评估框架: 1. 人体姿态(Google WyD):1,544个精选视频,覆盖9大类别56个子类别,细粒度人体动作标注,通过姿态检测器提取关键点轨迹用匈牙利匹配算法评估 2. 美学评估:关注视频的视觉美感和构图质量 3. 虚假信息:检测AI生成视频中的虚假内容和不合理信息 4. 物理真实感:验证视频中的物理规律是否正确(重力、碰撞、流体) 5. 社会推理:评估视频中的社会行为逻辑是否合理 6. 参考对比:与参考视频的质量对比评估 核心趋势:否定FVD"一个数字定胜负"的评估范式。FVD衡量的是像素...
清华史佳欣团队(KEG出身,和智谱同实验室)Xmax AI发布X2.0实时交互视频模型。2026年2月发X1(全球首个虚实融合实时交互视频模型),7月15日发X2.0。 X1到X2.0演进: - 分辨率:480p → 960p@24fps - 延迟:毫秒级 - 端侧:iPhone可跑384p@16fps - 六大模式:CharX(角色变身)/ClothX(换装)/VibeX(氛围)/MoX(动态)/DimX(维度)/Free(自由) 技术底座: - 流式DiT + 多阶段蒸馏 + FP8 + 统一交互架构 - 破解"速度/成本/质量"不可能三角 定价爆点: - 海外:$6/h - 国内:...