LTX-2.5 – Lightricks 开源的 AI 视频生成基础模型
LTX-2.5:革新视频创作的开源AI基石
LTX-2.5,由Lightricks倾力打造,是一款具有里程碑意义的开源AI视频生成基础模型。这款拥有220亿参数的强大模型,自发布之初即开放全部权重,为AI视频领域注入了新的活力。它不仅支持原生多镜头创作、4K HDR及RAW/EXR专业工作流,更能同步生成逼真的音频,并具备精细的视频编辑能力。在闭源模型价格日益攀升的当下,LTX-2.5以其开放生态策略,为专业级AI视频创作提供了卓越的开源替代方案。
LTX-2.5的核心亮点
- 原生多镜头叙事:一次生成即可输出多个视角、不同景别的连续镜头。在镜头切换间,角色形象、场景氛围、光影效果乃至声音都能保持高度一致,有效解决了AI剧情创作中镜头连贯性的核心难题。
- 智能扩散渲染:根据场景的复杂程度,模型能自适应分配计算资源。动态复杂的镜头将获得更充沛的算力支持,而静态或简单的场景则能智能节省资源,从而在保证画质的同时,大幅提升整体生成效率。
- 精细化视频编辑:在保留原有实拍素材轨迹与空间结构的基础上,LTX-2.5能够进行高精度的风格化改写、场景重绘以及角色替换。这使得创作者得以实现“实拍骨架+AI风格化覆膜”的精细化可控创作。
- 自动时长预判:内置的Duration Head模块,能够根据提示词中描述的动作,自动估算出最合适的片段时长,免去了创作者反复试验的繁琐过程。
- 专业级输出格式:支持原生4K HDR、RAW以及EXR无损格式输出,可无缝对接专业的影视调色、特效合成和后期剪辑流程,为专业制作提供了坚实的基础。
- 同步音频生成:通过的Audio VAE模块,模型能够为视频同步生成匹配的声音轨道,实现视听内容的完美契合。
- IC-LoRA精细控制:提供Canny边缘、Depth深度、Pose姿态三种参考视频控制模式。这使得生成结果能够严格遵循参考素材的构图、空间结构或人物动作,实现更精准的创作控制。
LTX-2.5背后的技术支撑
- Gemma 4 12B文本编码器:这是Lightricks专为LTX定制的大型语言模型编码器,能够完整捕捉复杂长提示中的多主体关系、动作细节、光照描述和镜头方向,即使提示词冗长,也不会丢失关键信息。
- Prompt Enhancer:一个轻量级的辅助模型,能将用户输入的简洁提示扩展为详尽的电影级指令,大大降低了提示词工程的门槛,且计算开销极小。
- Diffusion Video Decoder:该新架构取代了传统的VAE解码器,特别针对快速场景进行了优化,显著减少了画面涂抹和伪影,使人脸更加清晰,文字更易辨认。
- Audio VAE:运行的音频潜空间编码器,负责将视频内容映射到匹配的音频表示,从而实现画面与声音的同步生成。
- Diffusion Fidelity Rendering:采用“先结构后细节”的两阶段渲染策略。第一阶段在8倍时间压缩的潜空间中构建、构图和镜头框架,并自适应生成高保真关键帧;第二阶段则结合结构和关键帧进行扩散渲染,以像素级精度解析纹理、材质和面部细节。
- Duration Head:部署在扩散过程之前的预测模块,能够理解提示词中的动作语义,自动推断并输出最合适的视频时长,赋予模型对叙事节奏的初步感知能力。
如何驾驭LTX-2.5
- 选择部署方式:您可以选择使用API云服务,或是进行ComfyUI本地部署。
- API接入指南:在LTX官网申请API Key,并选择Fast或Pro套餐调用接口。
- 本地部署步骤:若选择本地部署,需将ComfyUI更新至最新版本,并通过Manager安装
ComfyUI-LTXVideo节点包。 - 模型下载:在ComfyUI模板浏览器搜索“LTX-2.5”,选择相应的可视化工作流后,即可一键下载所有必需的模型文件。
- 参数配置:请将宽高设置为32的倍数,帧数设置为1+8的倍数,帧率选择24/25/48/50fps。基础分辨率建议设置为目标分辨率的一半,以启用2倍放大功能。
- 撰写精妙提示词:使用连贯的散文体描述镜头景别、场景光照、角色动作、相机及音频需求,避免使用标签堆叠或权重语法。
- 启动生成:点击运行。对于文生视频,将直接生成最终画面;对于图生视频,需要上传首帧;首尾帧模式则需上传首帧与尾帧。
- 进阶控制:高级用户可加载Canny、Depth或Pose模式的IC-LoRA,接入参考视频以实现构图或动作锁定。
- 模型选择策略:快速迭代时可选用distilled模型,以获得更快的预览速度;最终出片则建议使用完整的dev模型,以实现更细腻的细节表现。
LTX-2.5的核心竞争优势
- 无与伦比的叙事连贯性:原生Multishot多镜头生成能力,一次输出即可确保角色形象、环境氛围、光线条件和声音的高度统一,从根本上解决了AI剧情创作中镜头连贯性的最大痛点。
- 可控性的飞跃:通过精确视频编辑保留实拍素材的轨迹与空间结构,并结合Canny/Depth/Pose三种IC-LoRA控制模式,实现了从“盲目抽卡”到“实拍骨架+AI风格化覆膜”的可控生产模式转变。
- 工业级工作流兼容性:原生RAW/HDR/EXR输出能够直接接入专业的调色、特效合成与后期剪辑流程,无需经过压缩转码,完美满足影视工业对无损素材的严苛要求。
- 自适应效率提升:Diffusion Fidelity Rendering技术能够根据场景复杂度动态分配渲染算力,对复杂动态镜头进行精细渲染,同时智能节省静态简单场景的资源,在保证像素级画质的同时,显著提升整体生成效率。
LTX-2.5项目资源链接
- 官方网站:https://ltx.io/model/ltx-2-5
- HuggingFace模型库:https://huggingface.co/Lightricks/LTX-2.5
LTX-2.5与同类竞品深度对比
| 对比维度 | LTX-2.5 | Minimax H3 |
|---|---|---|
| 出品方 | Lightricks() | MiniMax(中国) |
| 发布时间 | 2026 年 8 月 | 2026 年 8 月 |
| 开放程度 | 22B 权重完全开源,支持本地部署与微调 | 权重部分区域开放(排除美/英/欧/韩),不支持本地微调 |
| 参数规模 | 22B(公开) | 未公开 |
| 最大分辨率 | 4K (3840×2160) | 2K(固定) |
| 最大时长 | 20 秒 | 10 秒 |
| 原生多镜头 | ✅ 支持 | ❌ 不支持 |
| 同步音频 | ✅ 支持 | ❌ 未开放 |
| 输入模式 | 文本 / 图像 / 音频 | 文本 / 图像 |
| 输出格式 | 4K HDR、RAW、EXR 无损 | 常规压缩格式 |
| 可控性 | 精确视频编辑 + IC-LoRA(Canny/Depth/Pose) | 主要依赖提示词驱动 |
LTX-2.5的广泛应用场景
- 专业影视后期制作:原生4K HDR、RAW与EXR无损输出,可直接接入调色、特效合成与剪辑管线,满足院线及流媒体级别的后期制作需求,彻底告别压缩MP4格式带来的调色困扰。
- AI短剧与漫剧创作:Multishot多镜头生成一次性输出连贯叙事分镜,精确视频编辑支持“真人实拍动作骨架+AI角色替换与风格化覆膜”的创作模式,从根本上解决了镜头连贯性和动作可控性两大关键难题。
- 广告与品牌内容制作:能够快速迭代高质量的商业视频。Prompt Enhancer降低了提示词工程门槛,Distilled模型支持快速预览,完整模型则可输出最终成片,兼顾效率与品质。
- 物理AI与机器人领域:Physical AI Checkpoint为具身智能团队提供了世界模型基础,帮助机器人系统感知物理世界和规律,突破了纯内容创作的范畴。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


