Sana:高性能图像与视频生成的效率革命
你是否曾被动辄数百GB的扩散模型所困扰?在追求高分辨率图像与视频生成的道路上,FLUX.1等12B参数大模型虽效果惊艳,但其庞大的体积与高昂的推理成本,往往让个人开发者望而却步。NVIDIA实验室推出的Sana,旨在彻底解决这一痛点。这是一个以效率为核心导向的开源扩散模型代码库,提供完整的训练与推理流程。它通过线性注意力机制和深度压缩自编码器等创新技术,将高分辨率图像生成模型的体积缩小20倍、速度提升100倍,同时保持甚至超越顶级的生成质量。本文将带你全面了解这个在ICLR 2025、ICML 2025、ICCV 2025以及ICLR 2026上均获得Oral或Highlight荣誉的高效生成新星。
截至收录:
Sana项目stars数:8774
Sana项目forks数:702
Sana项目目录截图

Sana项目核心亮点
🌟 突破性的线性注意力机制:Sana摒弃了传统DiT模型中的标准注意力,转而采用线性注意力。这使得模型在处理高分辨率输入时,计算复杂度从二次方降低为线性,从而在不牺牲质量的前提下,大幅提升训练和推理效率。这一核心设计让Sana能在保持顶尖生成质量的同时,实现数十倍的速度飞跃。
🎯 极致的效率与性能比:Sana参数量仅为0.6B至4.8B,却能在1024px图像生成上,取得比FLUX-dev-12B更优的CLIP Score和GenEval分数。在NVIDIA H100等硬件上,Sana-0.6B的延时低至0.9秒(FLUX为23秒),吞吐量高达每秒1.7张。而SANA-Video-2B在720p视频生成上,仅需36秒即可完成,远快于Wan-2.1-14B(1897秒),同时VBench总分更高。
🔒 开箱即用的生态集成:Sana提供了极其友好的上手路径。它深度集成了Hugging Face Diffusers、ComfyUI和SGLang等主流生态,用户无需编写复杂代码,只需几行Python或简单的节点操作,即可体验其强大的生成能力。甚至可以在8GB显存的笔记本GPU上,通过4-bit量化运行,真正将高性能生成模型带入了个人工作站。
🧩 全栈开源的能力图谱:这不仅仅是一个单点模型,而是一个涵盖图像与视频的完整技术矩阵。从文生图的SANA和SANA-1.5,到少步生成的SANA-Sprint,再到可控世界模型SANA-WM和实时流式编辑的SANA-Streaming,代码库覆盖了模型训练、后训练(RL)、量化、部署等全生命周期。同时提供FSDP训练支持、ControlNet、LoRA等多种扩展,满足从研究到生产的各类定制化需求。
Sana项目快速开始
只需几步,你就能在本地运行起 Sana:
1. 环境安装:
bash
git clone https://github.com/NVlabs/Sana.git
cd Sana && ./environment_setup.sh sana
- 使用Diffusers进行推理。升级你的
diffusers至0.32.0或以上版本:
“`python
import torch
from diffusers import SanaPipelinepipe = SanaPipeline.from_pretrained(
“Efficient-Large-Model/SANA1.5_1.6B_1024px_diffusers”,
torch_dtype=torch.bfloat16,
)
pipe.to(“cuda”)pipe.vae.to(torch.bfloat16)
pipe.text_encoder.to(torch.bfloat16)prompt = a cyberpunk cat with a neon sign that says “Sana”
image = pipe(
prompt=prompt,
height=1024,
width=1024,
guidance_scale=4.5,
num_inference_steps=20,
generator=torch.Generator(device=”cuda”).manual_seed(42),
)[0]image[0].save(“sana.png”)
“`
3. 查看官方文档:更多详细的训练、微调、量化及视频生成示例,请参阅项目文档。
Sana项目应用场景
场景一:高效创意设计与广告素材生成:设计师和内容创作者可利用Sana在数秒内生成1024px乃至4K级别的高质量图像,快速产出概念图、海报素材或社交媒体配图。Sana的少步生成能力(如SANA-Sprint,可在0.1秒内完成一张1024px图像),使得实时交互式设计成为可能。
场景二:视频内容生成与编辑:Sana-Video模型支持文本到视频、文图到视频生成,能够在极短时间内生成流畅的720p视频。配合SANA-Streaming,甚至可以对分钟级的长视频进行实时流式编辑,为影视预演、短视频创作和游戏内容生成提供了新的可能。而SANA-WM则凭借其6自由度相机控制能力,为机器人仿真和自动驾驶提供可控的世界模型基线。
场景三:端侧部署与实时应用:得益于其小巧的模型体积和高效的线性注意力,Sana能够通过4-bit量化部署在8GB显存以内的消费级GPU上。这使得在笔记本电脑或边缘设备上运行媲美云端的大模型生成应用成为现实,例如本地AI绘画助手、离线视频换装工具等。
用户案例:目前,Sana已被广泛应用于Hugging Face Diffusers生态(已合入主仓库)、ComfyUI节点库等知名开源项目中。开发者可通过SGLang获得高性能的OpenAI兼容API服务,并可借助Cosmos-RL框架后训练一个专属的Sana模型。
Sana项目链接
NVlabs / Sana项目地址:https://github.com/NVlabs/Sana
本文地址:https://www.tgoos.com/46013
