
LTX-2.5 是 Lightricks 开放权重的 22B 音画生成模型可根据文本、图片和视频条件生成同步音画。本文把模型变化、AutoDL 环境安装、ModelScope 权重下载、Distilled 文生视频、首帧图生视频和平台接入边界整理到一篇可执行的记录中。本文同时覆盖本地部署和在线体验。只想验证效果时可以先使用两个在线入口需要控制权重、工作流和硬件环境时再按后文完成本地部署。01_总览1. 核心更新新的 Diffusion Video Decoder改善动态画面LTX-2.5 使用新的扩散视频解码器替换此前的 VAE 重建阶段重点改善人脸、纹理、画面文字和运动中的可见瑕疵。在越野摩托穿过泥水的官方案例中画面同时包含高速主体运动、飞溅泥点、积水和镜头跟随适合观察复杂动态下的稳定性。02_新的扩散视频解码器原生多镜头一次生成连续场景LTX-2.5 支持在一次生成中组织多个相互衔接的镜头并在切镜后延续人物、环境、光照、声音和视觉风格。官方以极光下的探索者展示了同一段视频内的景别变化与镜头衔接。03_原生多镜头复杂 Prompt 理解更完整模型使用定制的 Gemma 4 12B 文本编码器并加入 Prompt Enhancer用于处理多人物、动作、镜头运动和光照要求等复杂描述减少长提示词中的指令遗漏。04_复杂Prompt理解根据动作自动判断视频时长LTX-2.5 新增可选的 Duration Predictor。用户不手动指定帧数时模型可以根据提示词中的动作判断所需时长再设置生成帧数使镜头长度与动作节奏更匹配。05_自动判断视频时长面向专业制作的 4K HDR 与 RAW 工作流官方还展示了原生 4K HDR 和 RAW/EXR 工作流面向调色、合成等后期制作环节。该能力对应完整的模型与制作流程本地可达到的分辨率、速度和显存占用仍取决于权重格式、VAE、上采样流程和硬件配置。06_4K_HDR_RAW工作流2. 技术细节新的扩散视频解码器Diffusion Video Decoder 将视频潜变量还原为最终画面替代此前的 VAE 重建阶段改善人脸、纹理、画面文字和运动稳定性。权重包同时提供速度优先的卷积 VAE可以根据画质、速度和显存条件选择解码方式。提示词增强与自动时长预测定制的 Gemma 4 12B 文本编码器配合 Prompt Enhancer将复杂提示词转换为模型使用的条件信息。可选的 Duration Head 根据提示词中的动作预测所需帧数未指定num_frames时自动确定片段长度手动指定后则按用户设置生成。Diffusion Fidelity RenderingLTX-2.5 引入 Diffusion Fidelity Rendering根据场景复杂度分配渲染计算。官方表示该方法用于在控制计算开销的同时保持逐帧像素质量。07_Diffusion_Fidelity3. 开源模型权重4. 模型下载与推理4.1 硬件和软件准备24GB 显存应使用量化、CPU offload 或专用 ComfyUI 工作流。完整 BF16 不适合按 24GB 单卡路径直接加载。建议内存 64GB 起步offload 场景预留 96GB 到 128GB硬盘至少预留 100GB。官方当前建议 Python 3.12、CUDA 12.7 及以上、PyTorch 2.7 左右。如果现有日志显示 Python 3.11出现兼容问题时应先升级 Python。4.2 安装gitclone https://github.com/Lightricks/LTX-2.gitcdLTX-2 uvsyncsource.venv/bin/activate4.3 用 ModelScope 下载所需权重python-mpipinstall-Umodelscope\-ihttp://mirrors.aliyun.com/pypi/simple\--trusted-host mirrors.aliyun.comcd/root/LTX-2 modelscope download\--modelLightricks/LTX-2.5\--include\diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors\text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors\vae/ltx-2.5-video-vae-bf16.safetensors\vae/ltx-2.5-audio-vae-bf16.safetensors\model_patches/ltx-2.5-duration-head-bf16.safetensors\--local_dirmodels/ltx-2.5Distilled 推理流程还需要 LTX-2.3 提供的空间升频器modelscope download\--modelLightricks/LTX-2.3\--includeltx-2.3-spatial-upscaler-x2-1.1.safetensors\--local_dirmodels/ltx-2.34.5 Distilled 文生视频cd/root/LTX-2 uv run python-mltx_pipelines.distilled\--transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors\--text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors\--video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors\--audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors\--spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors\--duration-head-path models/ltx-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors\--promptA golden retriever running through a sunny meadow, cinematic lighting\--seed42\--output-path output_distilled.mp4省略--num-frames时才会使用 Duration Predictor。手动指定时帧数需要满足num_frames % 8 1宽度和高度需要能被 32 整除。4.6 首帧图生视频cd/root/LTX-2 uv run python-mltx_pipelines.distilled\--transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors\--text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors\--video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors\--audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors\--spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors\--duration-head-path models/ltx-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors\--imagepath/to/first_frame.jpg01.0\--promptThe camera slowly dollies out as wind moves through the grass\--seed42\--output-path output_i2v.mp4--image PATH FRAME_IDX STRENGTH可传多次。帧 0 是首帧条件。【视频位置 5Distilled 文生视频结果】【视频位置 6首帧图生视频结果】5. 两个独立的在线试用入口如果当前目标是验证提示词或图生视频效果不必先在业务服务器加载整套 22B 权重。下面两个地址是不同的页面分别对应模型直达体验和完整应用流程。试用入口一maizitech.xyz LTX-2.5 模型直达页入口地址https://www.maizitech.xyz/app/video?modelltx-2.5该地址通过modelltx-2.5直接指定模型适合快速检查 LTX-2.5 的基础生成能力。操作顺序打开链接并确认模型为LTX-2.5选择文生视频或上传首帧进行图生视频填写主体、动作、运镜、环境、光线和声音要求使用直达页为当前模型提供的时长、分辨率和比例提交任务并查看生成结果。试用入口二maizimarket.com 短视频生成应用入口地址https://www.maizimarket.com/creative-tools/short-video-generate该地址进入麦子市场的“短视频生成”应用。进入后需要在模型下拉框中选择LTX-2.5。操作顺序选择LTX-2.5等待时长、清晰度和比例选项完成联动未勾选“使用规划”时应用按当前提示词直接提交勾选“使用规划”后应用会先分析参考图并整理更适合视频模型的镜头、动作和声音提示词提交后在右侧生成区域查看结果并通过历史记录核对任务状态和失败原因。maizitech.xyz适合快速验证模型maizimarket.com适合验证参考图分析、规划任务、积分处理、任务轮询、失败提示、历史记录和结果下载等完整链路。6. 常见问题ModelScope 找不到模型或文件ModelScope 不保证每个文件都已同步。出现model not found或file not found时改用 Hugging Face 官方仓库或可用镜像。24GB 显存能否直接运行 BF16不建议。24GB 路径应使用 INT8、FP8/NVFP4、CPU offload 或 ComfyUI 对应权重。BF16 权重下载成功不代表能一次性全部装入 24GB 显存。为什么装了包仍然 import 失败通常是pip指向系统 Python而运行命令使用/root/LTX-2/.venv/bin/python。用python -m pip --version检查安装位置。为什么自动时长没有生效确认已传--duration-head-path并且没有手动传--num-frames。7. 参考链接ModelScopehttps://modelscope.cn/models/Lightricks/LTX-2.5GitHubhttps://github.com/Lightricks/LTX-2官方 Bloghttps://ltx.io/model/ltx-2-5ComfyUIhttps://docs.ltx.video/open-source-model/integration-tools/comfy-ui