大模型(四)Text and Image To Video FramePack学习

参考repo

https://github.com/lllyasviel/FramePack

学习过程

主要想对代码整体流程有一个大致理解,不纠结每一个函数的具体调用过程是什么。

2025.07.16 - prompt处理

  • 代码中if not high_vram的理解
    在这里插入图片描述

  • vae.requires_grad_(False)的理解
    在这里插入图片描述

  • fake_diffusers_current_device函数的作用
    在这里插入图片描述

  • load_model_as_complete函数的作用
    在这里插入图片描述

  • text_encoder和text_encoder_2在代码中的作用
    在这里插入图片描述

  • LlamaModel和CLIPTextModel的不同
    在这里插入图片描述

  • 详细说明encode_prompt_conds的执行过程
    在这里插入图片描述

  • crop_start的作用是什么
    在这里插入图片描述

  • llama_input_ids和llama_attention_mask代表的含义
    在这里插入图片描述

  • cfg的作用
    在这里插入图片描述

  • crop_or_pad_yield_mask的作用
    在这里插入图片描述

  • 负向提示词在代码里面哪里有体现
    在这里插入图片描述

2025.07.17 - 输入图片处理

  • vae_encode函数的作用
    在这里插入图片描述
  • hf_clip_vision_encode函数的作用
    在这里插入图片描述