
LoRA di accelerazione per MiniMax H3: quanto velocizzano davvero? Confronto di 20 video con FL2 e REF4
Ho confrontato arry v4_step600 su FL2 e PDD Ref2VA su REF4, con e senza LoRA di accelerazione, su 20 video. Ho misurato i tempi di generazione e le differenze visive.
Ho aggiunto LoRA di accelerazione a FL2 e REF4 di MiniMax H3, quindi ho provato a vedere quanto cambiano i tempi di generazione a parità di condizioni.
La configurazione usata è questa.
- FL2:
arry v4_step600. Versione normale a 20 step, versione con LoRA di accelerazione a 8 step - REF4:
PDD Ref2VA. Versione normale a 20 step, versione con LoRA di accelerazione a 8 step - Tutti i video sono di 8 secondi, 768×1344, 24 fps
- Ogni coppia usa lo stesso prompt, lo stesso seed e la stessa immagine di riferimento
- A sinistra senza LoRA di accelerazione, a destra con LoRA di accelerazione
Ho testato cinque tipi di contenuto: movimento rapido, transizioni di scena intense, immagini quasi statiche, dettagli di capelli e tessuti, movimento di camera e occlusione in primo piano. Ho realizzato 10 video con FL2 e 10 con REF4, per un totale di 20.
FL2 — arry v4_step600
1. Movimento rapido
Un video di parkour in una strada al neon sotto la pioggia. Ho scelto condizioni con spostamenti veloci, schizzi d'acqua e molti movimenti di vestiti e capelli.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione ha richiesto 504 secondi (8 minuti e 24 secondi), con LoRA 272 secondi (4 minuti e 32 secondi). Il tempo sul lato senza LoRA include anche il primo caricamento di FL2 nella VRAM. Sul lato con LoRA, alla prima commutazione la connessione al container si è interrotta una volta, quindi riporto il tempo del tentativo riuscito.
2. Transizioni di scena intense
Mantenendo fisso un colibrì cromato, ho alternato in rapida successione un museo, una giungla, una fonderia, una grotta di ghiaccio, una città di carta e lo spazio.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 454 secondi (7 minuti e 34 secondi); con LoRA: 236 secondi (3 minuti e 56 secondi). Per questa coppia, la generazione con LoRA è stata circa 1,92 volte più veloce.
3. Video con pochi cambiamenti
Una ripresa fissa di un orologiaio. Si muovono solo i battiti di ciglia, le pinzette di pochi millimetri, la lancetta dei secondi e la polvere.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 447 secondi (7 minuti e 27 secondi); con LoRA: 233 secondi (3 minuti e 53 secondi). Anche con poco movimento, i tempi di generazione sono cambiati poco: la differenza è stata di circa 1,92 volte.
4. Dettagli di capelli e tessuti
Una rapida rotazione con un abito di chiffon semitrasparente ricamato con fili d'argento. È una condizione pensata per osservare quanto tessuti e capelli si degradino con l'accelerazione.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 448 secondi (7 minuti e 28 secondi); con LoRA: 234 secondi (3 minuti e 54 secondi). Anche qui è stata circa 1,91 volte più veloce.
5. Movimento di camera e occlusione in primo piano
Una mountain bike che corre nel bosco. Le felci coprono completamente l'inquadratura, mentre la camera compie una rotazione di 180 gradi.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 448 secondi (7 minuti e 28 secondi); con LoRA: 234 secondi (3 minuti e 54 secondi). Anche in condizioni con un grande movimento di camera, è stata circa 1,91 volte più veloce.
Facendo la media dei quattro casi FL2 con la VRAM già caricata, il risultato è 449,25 secondi senza LoRA e 234,25 secondi con LoRA. In questo ambiente, l'accelerazione è stata di circa 1,92 volte.
REF4 — PDD Ref2VA
Per REF4, ho fornito come singola immagine di riferimento uno storyboard di sei fotogrammi creato con la generazione di immagini di ChatGPT.
1. Movimento rapido
Ho trasformato in video la stessa sequenza di parkour di FL2, partendo da sei pose.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 481 secondi (8 minuti e 1 secondo); con LoRA: 299 secondi (4 minuti e 59 secondi). Il lato senza LoRA include il caricamento di REF4 nella VRAM. Sul lato con LoRA, il primo tentativo si è disconnesso durante la decodifica, quindi riporto il tempo del tentativo riuscito.
2. Transizioni di scena intense
Ho sviluppato lo stesso colibrì e sei diversi mondi a partire da uno storyboard di sei fotogrammi.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 424 secondi (7 minuti e 4 secondi); con LoRA: 251 secondi (4 minuti e 11 secondi). È stata circa 1,69 volte più veloce.
3. Video con pochi cambiamenti
Ho condensato in sei fotogrammi i piccoli cambiamenti dell'orologiaio. Con la LoRA di accelerazione, la suddivisione dello storyboard è rimasta visibile direttamente nel video.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 418 secondi (6 minuti e 58 secondi); con LoRA: 247 secondi (4 minuti e 7 secondi). Il tempo è circa 1,69 volte più rapido, ma in questo caso la differenza visiva è notevole.
4. Dettagli di capelli e tessuti
Ho usato sei fotogrammi della rotazione della stessa ballerina come riferimento. Sia con sia senza LoRA, il risultato si è sviluppato relativamente bene in un video a schermo intero.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 420 secondi (7 minuti e 0 secondi); con LoRA: 249 secondi (4 minuti e 9 secondi). È stata circa 1,69 volte più veloce.
5. Movimento di camera e occlusione in primo piano
Ho specificato in sei fotogrammi l'avvicinamento della mountain bike, il wipe in primo piano e il movimento della camera verso il retro. Questa volta, in entrambi i casi, la struttura a riquadri è rimasta piuttosto evidente.
| Senza LoRA di accelerazione · 20 step | Con LoRA di accelerazione · 8 step |
|---|---|
再生 |
再生 |
Senza LoRA di accelerazione: 419 secondi (6 minuti e 59 secondi); con LoRA: 248 secondi (4 minuti e 8 secondi). È stata circa 1,69 volte più veloce.
Facendo la media dei quattro casi REF4 con la VRAM già caricata, il risultato è 420,25 secondi senza LoRA e 248,75 secondi con LoRA. In questo ambiente, l'accelerazione è stata di circa 1,69 volte.
Cosa ho imparato dal test
Considerando soltanto il tempo di generazione, l'effetto della LoRA di accelerazione è piuttosto grande. FL2 ha richiesto quasi la metà del tempo, mentre REF4 si è ridotto di circa il 40%. Sembra molto utile per le prove nella fase di rifinitura di prompt e composizione.
Tuttavia, passando a REF4 uno storyboard a riquadri come singola immagine, a volte il modello sembra apprendere anche la griglia stessa come composizione. Soprattutto con la LoRA di accelerazione, in alcuni casi la suddivisione in riquadri è rimasta a lungo. Se si vuole ottenere un normale video a schermo intero con REF4, probabilmente è più sicuro fornire ogni fotogramma come immagine separata anziché usare un unico contact sheet.
Inoltre, sia con FL2 sia con REF4, la connessione al container è caduta una volta soltanto al primo passaggio dalla versione normale a quella con LoRA di accelerazione. Rieseguendo alle stesse condizioni l'operazione è riuscita, e in seguito tutto è rimasto stabile. Potrebbe quindi essere utile generare un breve video di prova dopo il primo cambio di configurazione.
I valori riportati qui sono misurazioni effettuate su questa macchina, a questa risoluzione e con video di 8 secondi. Non vanno intesi come benchmark assoluti, ma come confronto tra con e senza LoRA nello stesso ambiente.























