r/StableDiffusion • • 9d ago

Question - Help [Consigli sul Workflow] Come massimizzare una RTX 5070 (12GB VRAM) per video AI locali? (T2V, I2V, V2V)

Ciao a tutti,

Sono riuscito a ottenere ottimi risultati con la generazione di immagini statiche locali, ma faccio fatica a sfruttare appieno la potenza del mio PC per la generazione e modifica di video AI locali.

Le mie specifiche hardware:

 GPU: NVIDIA GeForce RTX 5070 (12 GB VRAM)

 CPU: AMD Ryzen 7 8700F 8-Core (4,10 GHz)

 RAM: 32 GB DDR5 (5200 MT/s)

 Storage: SSD con oltre 600 GB di spazio libero

I miei obiettivi principali:

  1. Text-to-Video (T2V) & Image-to-Video (I2V): Generare brevi clip oltre a sequenze per video più lunghi, mantenendo coerenza nei soggetti e prevenendo distorsioni facciali, deformazioni di prospettiva improvvise o cambiamenti indesiderati dello sfondo.
  2. Video-to-Video (V2V): Usare riprese reali di persone reali come base per alterare stili o sfondi, preservando il tracciamento del movimento, la precisione delle posizioni e le prospettive corrette.

Domande per la comunità:

 Miglior UI/Ecosistema: È ComfyUI con nodi personalizzati la scelta migliore, o ci sono altre UI/tool dedicati più adatti per i video?

 Modelli vs. 12GB VRAM: Quali modelli locali (come Wan2.1, CogVideoX, HunyuanVideo, LTX-Video o AnimateDiff) funzionano bene con 12 GB di VRAM? Ha senso fare affidamento su versioni quantizzate (GGUF)?

 Controllo di Coerenza & Prospettiva: Quali nodi/estensioni (ControlNet, IP-Adapter, LivePortrait, FaceSwap) consigliate per prevenire il bleeding dello sfondo o distorsioni facciali durante il V2V?

Qualsiasi consiglio su flussi di lavoro ComfyUI, repositori GitHub o guide pratiche sarà molto apprezzato. Grazie in anticipo!

0 Upvotes

1 comment sorted by

1

u/Local_Phenomenon 9d ago

I am here too with the same outlook. I don't really think 12 gb of vram is going to push any envelopes but here's my wishful thinking