KEN’S CAT LOG

LoRA di accelerazione per MiniMax H3: quanto velocizzano davvero? Confronto di 20 video con FL2 e REF4

Ho confrontato arry v4_step600 su FL2 e PDD Ref2VA su REF4, con e senza LoRA di accelerazione, su 20 video. Ho misurato i tempi di generazione e le differenze visive.

Ho aggiunto LoRA di accelerazione a FL2 e REF4 di MiniMax H3, quindi ho provato a vedere quanto cambiano i tempi di generazione a parità di condizioni.

La configurazione usata è questa.

  • FL2: arry v4_step600. Versione normale a 20 step, versione con LoRA di accelerazione a 8 step
  • REF4: PDD Ref2VA. Versione normale a 20 step, versione con LoRA di accelerazione a 8 step
  • Tutti i video sono di 8 secondi, 768×1344, 24 fps
  • Ogni coppia usa lo stesso prompt, lo stesso seed e la stessa immagine di riferimento
  • A sinistra senza LoRA di accelerazione, a destra con LoRA di accelerazione

Ho testato cinque tipi di contenuto: movimento rapido, transizioni di scena intense, immagini quasi statiche, dettagli di capelli e tessuti, movimento di camera e occlusione in primo piano. Ho realizzato 10 video con FL2 e 10 con REF4, per un totale di 20.

FL2 — arry v4_step600

1. Movimento rapido

Un video di parkour in una strada al neon sotto la pioggia. Ho scelto condizioni con spostamenti veloci, schizzi d'acqua e molti movimenti di vestiti e capelli.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
FL2 movimento rapido senza LoRA再生 FL2 movimento rapido con LoRA再生

Senza LoRA di accelerazione ha richiesto 504 secondi (8 minuti e 24 secondi), con LoRA 272 secondi (4 minuti e 32 secondi). Il tempo sul lato senza LoRA include anche il primo caricamento di FL2 nella VRAM. Sul lato con LoRA, alla prima commutazione la connessione al container si è interrotta una volta, quindi riporto il tempo del tentativo riuscito.

2. Transizioni di scena intense

Mantenendo fisso un colibrì cromato, ho alternato in rapida successione un museo, una giungla, una fonderia, una grotta di ghiaccio, una città di carta e lo spazio.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
FL2 transizioni di scena intense senza LoRA再生 FL2 transizioni di scena intense con LoRA再生

Senza LoRA di accelerazione: 454 secondi (7 minuti e 34 secondi); con LoRA: 236 secondi (3 minuti e 56 secondi). Per questa coppia, la generazione con LoRA è stata circa 1,92 volte più veloce.

3. Video con pochi cambiamenti

Una ripresa fissa di un orologiaio. Si muovono solo i battiti di ciglia, le pinzette di pochi millimetri, la lancetta dei secondi e la polvere.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
FL2 pochi cambiamenti senza LoRA再生 FL2 pochi cambiamenti con LoRA再生

Senza LoRA di accelerazione: 447 secondi (7 minuti e 27 secondi); con LoRA: 233 secondi (3 minuti e 53 secondi). Anche con poco movimento, i tempi di generazione sono cambiati poco: la differenza è stata di circa 1,92 volte.

4. Dettagli di capelli e tessuti

Una rapida rotazione con un abito di chiffon semitrasparente ricamato con fili d'argento. È una condizione pensata per osservare quanto tessuti e capelli si degradino con l'accelerazione.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
FL2 dettagli senza LoRA再生 FL2 dettagli con LoRA再生

Senza LoRA di accelerazione: 448 secondi (7 minuti e 28 secondi); con LoRA: 234 secondi (3 minuti e 54 secondi). Anche qui è stata circa 1,91 volte più veloce.

5. Movimento di camera e occlusione in primo piano

Una mountain bike che corre nel bosco. Le felci coprono completamente l'inquadratura, mentre la camera compie una rotazione di 180 gradi.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
FL2 occlusione della camera senza LoRA再生 FL2 occlusione della camera con LoRA再生

Senza LoRA di accelerazione: 448 secondi (7 minuti e 28 secondi); con LoRA: 234 secondi (3 minuti e 54 secondi). Anche in condizioni con un grande movimento di camera, è stata circa 1,91 volte più veloce.

Facendo la media dei quattro casi FL2 con la VRAM già caricata, il risultato è 449,25 secondi senza LoRA e 234,25 secondi con LoRA. In questo ambiente, l'accelerazione è stata di circa 1,92 volte.

REF4 — PDD Ref2VA

Per REF4, ho fornito come singola immagine di riferimento uno storyboard di sei fotogrammi creato con la generazione di immagini di ChatGPT.

1. Movimento rapido

Ho trasformato in video la stessa sequenza di parkour di FL2, partendo da sei pose.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
REF4 movimento rapido senza LoRA再生 REF4 movimento rapido con LoRA再生

Senza LoRA di accelerazione: 481 secondi (8 minuti e 1 secondo); con LoRA: 299 secondi (4 minuti e 59 secondi). Il lato senza LoRA include il caricamento di REF4 nella VRAM. Sul lato con LoRA, il primo tentativo si è disconnesso durante la decodifica, quindi riporto il tempo del tentativo riuscito.

2. Transizioni di scena intense

Ho sviluppato lo stesso colibrì e sei diversi mondi a partire da uno storyboard di sei fotogrammi.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
REF4 transizioni di scena intense senza LoRA再生 REF4 transizioni di scena intense con LoRA再生

Senza LoRA di accelerazione: 424 secondi (7 minuti e 4 secondi); con LoRA: 251 secondi (4 minuti e 11 secondi). È stata circa 1,69 volte più veloce.

3. Video con pochi cambiamenti

Ho condensato in sei fotogrammi i piccoli cambiamenti dell'orologiaio. Con la LoRA di accelerazione, la suddivisione dello storyboard è rimasta visibile direttamente nel video.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
REF4 pochi cambiamenti senza LoRA再生 REF4 pochi cambiamenti con LoRA再生

Senza LoRA di accelerazione: 418 secondi (6 minuti e 58 secondi); con LoRA: 247 secondi (4 minuti e 7 secondi). Il tempo è circa 1,69 volte più rapido, ma in questo caso la differenza visiva è notevole.

4. Dettagli di capelli e tessuti

Ho usato sei fotogrammi della rotazione della stessa ballerina come riferimento. Sia con sia senza LoRA, il risultato si è sviluppato relativamente bene in un video a schermo intero.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
REF4 dettagli senza LoRA再生 REF4 dettagli con LoRA再生

Senza LoRA di accelerazione: 420 secondi (7 minuti e 0 secondi); con LoRA: 249 secondi (4 minuti e 9 secondi). È stata circa 1,69 volte più veloce.

5. Movimento di camera e occlusione in primo piano

Ho specificato in sei fotogrammi l'avvicinamento della mountain bike, il wipe in primo piano e il movimento della camera verso il retro. Questa volta, in entrambi i casi, la struttura a riquadri è rimasta piuttosto evidente.

Senza LoRA di accelerazione · 20 step Con LoRA di accelerazione · 8 step
REF4 occlusione della camera senza LoRA再生 REF4 occlusione della camera con LoRA再生

Senza LoRA di accelerazione: 419 secondi (6 minuti e 59 secondi); con LoRA: 248 secondi (4 minuti e 8 secondi). È stata circa 1,69 volte più veloce.

Facendo la media dei quattro casi REF4 con la VRAM già caricata, il risultato è 420,25 secondi senza LoRA e 248,75 secondi con LoRA. In questo ambiente, l'accelerazione è stata di circa 1,69 volte.

Cosa ho imparato dal test

Considerando soltanto il tempo di generazione, l'effetto della LoRA di accelerazione è piuttosto grande. FL2 ha richiesto quasi la metà del tempo, mentre REF4 si è ridotto di circa il 40%. Sembra molto utile per le prove nella fase di rifinitura di prompt e composizione.

Tuttavia, passando a REF4 uno storyboard a riquadri come singola immagine, a volte il modello sembra apprendere anche la griglia stessa come composizione. Soprattutto con la LoRA di accelerazione, in alcuni casi la suddivisione in riquadri è rimasta a lungo. Se si vuole ottenere un normale video a schermo intero con REF4, probabilmente è più sicuro fornire ogni fotogramma come immagine separata anziché usare un unico contact sheet.

Inoltre, sia con FL2 sia con REF4, la connessione al container è caduta una volta soltanto al primo passaggio dalla versione normale a quella con LoRA di accelerazione. Rieseguendo alle stesse condizioni l'operazione è riuscita, e in seguito tutto è rimasto stabile. Potrebbe quindi essere utile generare un breve video di prova dopo il primo cambio di configurazione.

I valori riportati qui sono misurazioni effettuate su questa macchina, a questa risoluzione e con video di 8 secondi. Non vanno intesi come benchmark assoluti, ma come confronto tra con e senza LoRA nello stesso ambiente.