LTX-2.5:6.8秒生成AI视频

LTX-2.5:6.8秒生成AI视频

开源世界模型新突破:LTX-2.5正式发布

LTX,这家从Lightricks分拆出的开源世界模型公司,今日正式发布了LTX-2.5,这是其最新一代开源权重视频和”世界”模型。通过两家公司的战略合作,该模型已原生集成到ComfyUI中——这款基于节点的工作流工具已成为开放生成媒体领域事实上的原型开发环境。

该模型现可通过Hugging Face获取,内置于ComfyUI中,同时LTX API也为需要托管生成的团队提供服务。对于年收入低于1000万美元的组织,该模型可免费使用;大型企业则需要协商许可证。LTX表示,其模型累计下载量已达3300万次,使LTX系列成为市场上最常用的”开放世界”模型系列。

在此次发布前,VentureBeat独家采访了LTX联合创始人兼CEO Zeev Farbman以及ComfyUI联合创始人兼CEO Yoland Yan,就此次发布、合作以及两家公司为何押注开放权重(而非封闭API)将在视频和世界模型市场获胜进行了深入交流。

“我们试图保持我们所熟知的高效率与推理速度,同时不断提升质量,”Farbman表示,”此次发布我们引入了许多新功能:多镜头支持、提高质量的扩散解码器、新的条件模式,以及对自回归模型更好的支持,这些模型对于实时应用和机器人技术至关重要。”

LTX-2.5的革新亮点

根据公司公告,LTX-2.5几乎是重建了整个生成管道的每个阶段,而非在旧有核心上添加新功能。主要改进包括:

  • 新的扩散视频解码器:减少高动态画面的视觉伪影,重建文本和面部等精细细节,同时保持LTX的高压缩比。
  • 原生多镜头生成:将整个序列渲染为单一输出,保持角色、场景和声音在各个镜头间的一致性,而非将单独生成的镜头拼接在一起。
  • 定制化Gemma 4语言骨干网络:配备专用提示增强器,能够更准确地处理复杂的多主题提示。
  • 针对物理AI和机器人技术预训练的检查点:为团队提供基础,可在此基础上针对看起来完全不同于电影视频的领域数据进行微调。
  • 显著改进的蒸馏模型:以更低成本和更快推理速度接近全模型质量,并通过与NVIDIA的优化工作,可在NVIDIA RTX GPU上本地运行,内存需求降低。

该公司声称,与同类模型相比,LTX-2.5成本约为八分之一,渲染时间约为七分之一,输出可从数据中心GPU到Mac等各种硬件上运行。

LTX-2.5的性能与质量表现

LTX发布材料中最引人注目的数字是速度:公司表示,LTX-2.5可在6.8秒内生成一段10秒、720p的图像到视频片段,比实时生成还要快。

需要注意的是背后的硬件支持。这一数据是在两颗NVIDIA顶级GB200芯片上自托管测量的,配置远超大多数团队拥有的设备;通过LTX自己的托管API完成同一任务需要23.7秒,尽管渲染的是更高的1080p分辨率(API没有720p选项)。

根据公司对同一任务上竞争API的端到端测量,Google的Gemini Omni Flash需要52秒,xAI的Grok 1.5需要63秒,Google的Veo 3.1需要70秒(生成8秒片段),MiniMax H3需要180秒,字节跳动的Seedance 2.5需要317秒,快手的Kling 3.0 Pro需要398秒。

在质量方面,LTX分享了盲测并排人类偏好测试的结果,评估者对相同提示生成的视频进行投票,但不知道哪个模型 produced了哪个视频。

LTX-2.5的得胜率为67%,略高于Seedance 2.5的65%,Gemini Omni Flash为55%,MiniMax H3为50%,Seedance 2.0为44%,Wan 2.6为42%,FLUX 3为28%。

所有这些数字都是供应商报告或由LTX自行测量的,未经独立验证,公司将偏好结果标记为初步,并指出预计它们”将随着评估的扩展而演变”。这些是指向性的主张,买家应该针对自己的工作负载进行测试,而非既定的排名。

发布材料也侧重于部署条款而非原始性能:LTX-2.5可在任何配备至少16GB显存的GPU上运行,可在本地、边缘设备或通过API部署,输出上无强制品牌要求,并且可在客户自己的数据和IP上微调,这种灵活性公司将其与仅提供封闭API的竞争对手以及权重在美国和欧洲不可用或许可证限制微调的开源竞争对手进行了对比。

押注非API商业模式

对于Farbman而言,此次发布是始于对封闭模型行业整合反应的策略的又一章。

“我们最初开发自己的模型是出于必要,因为在Sora发布前后,我们意识到所有大公司都在试图封闭他们的模型,而通过API工作对许多企业来说都不行,包括我们想要构建的东西,”他说。

他解释说,技术论点是视频和世界模型的用例”表面区域” fundamentally比语言模型更广。

“对于LLM,API的表面区域相当狭窄,我们通常提出某种问题,传递文字并获取文字,”Farbman表示,”对于视频模型、世界模型,有太多不同的用例需要人们能够访问权重并创建真正适合他们的流程。”

他直率地表示,这种开放性并非慈善行为。”我们绝对不是在做慈善,”他说,”我们的答案是提供开放权重,并允许收入低于特定水平的个人和公司免费使用模型,一旦他们成功了,再与我们达成某种许可协议。”

“我们试图构建一个让开发者能够自信地在其上构建的模型,”他补充道,”我们是在说:各位,开放权重对我们来说不是某种一次性慈善的侥幸。这是策略。我们相信这是提供这些模型的正确方式,我们将继续这样做。”

从Facetune到世界模型及成为标准的节点图

LTX起源于总部位于耶路撒冷的Lightricks公司,该公司以Facetune和Videoleap等消费者创意应用而闻名。Lightricks自筹资金且盈利,于2022年转向基础模型,2024年初推出LTX Studio电影制作平台,并于2024年11月发布其第一个开源权重LTX视频模型(LTXV),随后在2025年5月推出一个130亿参数的版本。Farbman与CTO Yaron Inger和CMO Nir Pochter共同创立了该公司,LTX品牌现在代表其世界模型业务,在纽约、伦敦和芝加哥设有办事处。

ComfyUI始于2023年1月,由一位匿名开发者作为一个开源副项目开始…

关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://venturebeat.com/technology/ltx-2-5-can-generate-a-10-second-ai-video-from-an-image-in-just-6-8-seconds-on-nvidia-superchips-and-its-open-weights

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2503篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类