Hunyuan-Video

简介

  • CausalConv3D VAE,降采样倍数为时间上4倍,空间上8x8倍
  • 扩散模型:FLUX的结构(Dual-Stream DiT Blcok+Single-Stream DiT Block),Full Attention机制,能统一生成视频和图片,130亿参数


    扩散模型结构

    参数
  • Rotary Position Embedding
  • Text Encoder: CLIP-large and MLLM(xtuner/llava-llama-3-8b-v1_1-transformers)
  • 数据清洗
    训练数据:图片几十亿+视频: 356P+360P+540P+720P+SFT(约一百万人工筛选和人工标注,包括短描述,细致描述,背景,风格,镜头类型,光照,氛围等等)


    数据清洗
  • 训练
    图片预训练:
  1. 256p training
  2. mix-scale training

图片视频联合训练

1.低分辨率,短视频训练
2.低分辨率,长视频训练
3.高分辨率,长视频训练

High-performance Model Fine-tuning

  • 推理

A100-SXM4-80GB 50 steps takes ~50min
74GB/80GB with cpu-offload off
56GB/80GB with cpu-offload on

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容