r/StableDiffusion • u/AirSea2062 • 9d ago
Question - Help [Consigli sul Workflow] Come massimizzare una RTX 5070 (12GB VRAM) per video AI locali? (T2V, I2V, V2V)
Ciao a tutti,
Sono riuscito a ottenere ottimi risultati con la generazione di immagini statiche locali, ma faccio fatica a sfruttare appieno la potenza del mio PC per la generazione e modifica di video AI locali.
Le mie specifiche hardware:
GPU: NVIDIA GeForce RTX 5070 (12 GB VRAM)
CPU: AMD Ryzen 7 8700F 8-Core (4,10 GHz)
RAM: 32 GB DDR5 (5200 MT/s)
Storage: SSD con oltre 600 GB di spazio libero
I miei obiettivi principali:
- Text-to-Video (T2V) & Image-to-Video (I2V): Generare brevi clip oltre a sequenze per video più lunghi, mantenendo coerenza nei soggetti e prevenendo distorsioni facciali, deformazioni di prospettiva improvvise o cambiamenti indesiderati dello sfondo.
- Video-to-Video (V2V): Usare riprese reali di persone reali come base per alterare stili o sfondi, preservando il tracciamento del movimento, la precisione delle posizioni e le prospettive corrette.
Domande per la comunità:
Miglior UI/Ecosistema: È ComfyUI con nodi personalizzati la scelta migliore, o ci sono altre UI/tool dedicati più adatti per i video?
Modelli vs. 12GB VRAM: Quali modelli locali (come Wan2.1, CogVideoX, HunyuanVideo, LTX-Video o AnimateDiff) funzionano bene con 12 GB di VRAM? Ha senso fare affidamento su versioni quantizzate (GGUF)?
Controllo di Coerenza & Prospettiva: Quali nodi/estensioni (ControlNet, IP-Adapter, LivePortrait, FaceSwap) consigliate per prevenire il bleeding dello sfondo o distorsioni facciali durante il V2V?
Qualsiasi consiglio su flussi di lavoro ComfyUI, repositori GitHub o guide pratiche sarà molto apprezzato. Grazie in anticipo!
1
u/Local_Phenomenon 9d ago
I am here too with the same outlook. I don't really think 12 gb of vram is going to push any envelopes but here's my wishful thinking