LTX-2 是一个能直接生成「带声音视频」的开源 AI 模型:给它一句文字描述,它能产出一段画面和声音同步的视频——人物开口说话时,口型和语音是对得上的。这和大多数只能输出无声画面的视频生成模型不同。项目由以色列影像软件公司 Lightricks 开发并开源,GitHub 仓库(Lightricks/LTX-2)目前有 9300 多颗 star 和 1500 个 fork。

它适合三类人:想在本机生成视频素材的创作者、打算给产品接入视频生成能力的开发者、以及想研究或微调视频模型的研究者。仓库同时给出推理(生成)与训练(微调)代码,在同类项目中不多见。

先用大白话交代几个术语:LTX-2 属于扩散模型——一种从纯噪声一步步「还原」出画面或声音的生成方式,Stable Diffusion 生成图片用的就是同类原理,只不过 LTX-2 生成的对象是视频加音频。**DiT(Diffusion Transformer)**指用 Transformer 神经网络(一种擅长处理序列数据的模型结构)作为扩散主干的架构,是当前视频生成模型的主流设计;LTX-2 自称是第一个基于 DiT、把视频生成核心能力集于一身的音视频基础模型。

推荐模型 LTX-2.5:按需下载组件

仓库当前推荐的是 LTX-2.5 版本:220 亿参数(22B)的主模型,全部组件加起来约 66GB。官方把权重拆成多份文件,各管一摊:生成主干的 Transformer、把文字指令翻译成模型可理解向量的文本编码器(采用 Google Gemma 4 12B 的微调版)、把压缩的中间表示还原成画面的视频解码器(VAE)、以及处理声音的音频解码器。跑哪个功能就下哪个文件,不必全量下载。

不止文生视频:配音、局部重拍、HDR

  • 文生视频 / 图生视频:两阶段管线,可输出 2 倍分辨率成品
  • Dub-It 配音:换上新的台词,同时保持原说话人的音色与口型
  • Retake 局部重拍:只重生成视频中某一时间段的内容
  • 音频驱动视频:给一段音频,生成与声音同步的画面
  • 原生 HDR / EXR 支持:面向专业影视工作流的输出格式
  • ComfyUI 集成:可在 ComfyUI 中以节点方式使用

训练代码一并开源:LoRA 微调

除推理外,仓库还包含 ltx-trainer 训练包,支持 LoRA 微调、全参数微调和 IC-LoRA。LoRA 是一种低成本微调手段:只训练模型的一小部分参数,就能让模型学会特定风格或特定人物,显存和算力开销远小于全量重训。想训练出「自己风格」的视频模型,可以在这套代码上起步。

跑起来需要的条件

项目用 Python 的 uv 工具安装。官方推荐 Linux + NVIDIA CUDA 环境以获得最快速度;Windows 和 macOS 也能跑,但部分解码会退回较慢的实现。显存紧张时可用 FP8 量化(把权重精度降到 8 位以节省显存)或把部分模型卸载到 CPU 或磁盘;追求速度可安装 FlashAttention(一种加速注意力计算的库)。

LTX-2 是目前少数把画面与声音同步生成做进同一个开源模型的方案:22B 参数、约 66GB 权重、推理与训练代码全套开放。对普通开发者来说,它意味着两件事变得可及——用文字生成一段带人声的视频,以及用 LoRA 微调出一个属于自己的视频模型。