
LoRA d’accélération pour MiniMax H3 : à quel point est-elle vraiment plus rapide ? Comparatif de 20 vidéos avec FL2 et REF4
Comparaison, sur 20 vidéos, de FL2 arry v4_step600 et REF4 PDD Ref2VA avec et sans LoRA d’accélération. Mesures du temps de génération et des différences visuelles.
J’ai ajouté une LoRA d’accélération à FL2 et REF4 de MiniMax H3, puis j’ai testé dans quelle mesure le temps de génération changeait à conditions identiques.
Voici la configuration utilisée.
- FL2:
arry v4_step600. Version standard : 20 étapes ; version avec LoRA d’accélération : 8 étapes - REF4:
PDD Ref2VA. Version standard : 20 étapes ; version avec LoRA d’accélération : 8 étapes - Toutes les vidéos durent 8 secondes, en 768×1344 et 24 fps
- Chaque paire utilise le même prompt, la même seed et la même image de référence
- Sans LoRA d’accélération à gauche, avec LoRA d’accélération à droite
Les tests couvrent cinq situations : mouvement rapide, transitions visuelles intenses, vidéo presque statique, détails des cheveux et du tissu, déplacement de caméra et occultation au premier plan. J’ai créé 10 vidéos avec FL2 et 10 avec REF4, soit 20 au total.
FL2 — arry v4_step600
1. Mouvement rapide
Une vidéo de parkour dans une rue néon sous la pluie. Les conditions incluaient des déplacements rapides, des éclaboussures et beaucoup de mouvements des vêtements et des cheveux.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 504 secondes (8 min 24 s) ; avec : 272 secondes (4 min 32 s). Le côté sans LoRA inclut aussi le temps de chargement initial de FL2 dans la VRAM. Lors du premier basculement vers la version avec LoRA, la connexion au conteneur a été interrompue une fois ; le temps indiqué correspond donc à la tentative réussie.
2. Transitions visuelles intenses
En conservant un colibri chromé, la scène bascule successivement entre un musée, une jungle, une fonderie, une grotte de glace, une ville de papier et l’espace.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 454 secondes (7 min 34 s) ; avec : 236 secondes (3 min 56 s). Pour cette paire, la génération était environ 1,92 fois plus rapide.
3. Vidéo avec peu de changements
Plan fixe d’un horloger. Seuls les clignements, un déplacement de quelques millimètres de la pince, l’aiguille des secondes et la poussière bougent.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 447 secondes (7 min 27 s) ; avec : 233 secondes (3 min 53 s). Même avec peu de mouvement, le temps de génération change peu : l’écart reste d’environ 1,92 fois.
4. Détails des cheveux et du tissu
Rotation rapide avec une robe en mousseline semi-transparente brodée de fils d’argent. L’objectif était d’observer à quel point le tissu et les cheveux se dégradent avec l’accélération.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 448 secondes (7 min 28 s) ; avec : 234 secondes (3 min 54 s). Ici aussi, la génération était environ 1,91 fois plus rapide.
5. Déplacement de caméra et occultation au premier plan
Un VTT traverse une forêt. Des fougères masquent entièrement l’image, pendant que la caméra contourne le sujet sur 180 degrés.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 448 secondes (7 min 28 s) ; avec : 234 secondes (3 min 54 s). Même avec d’importants mouvements de caméra, la génération était environ 1,91 fois plus rapide.
Sur les quatre cas FL2 avec VRAM déjà chargée, la moyenne est de 449,25 secondes sans LoRA contre 234,25 secondes avec. Dans cet environnement, le gain est d’environ 1,92 fois.
REF4 — PDD Ref2VA
Pour REF4, j’ai fourni comme image de référence unique un storyboard de six vignettes créé avec la génération d’images de ChatGPT.
1. Mouvement rapide
Le même déroulé de parkour que pour FL2 a été transformé en vidéo à partir de six poses.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 481 secondes (8 min 1 s) ; avec : 299 secondes (4 min 59 s). Le côté sans LoRA comprend le chargement de REF4 dans la VRAM. La première tentative avec LoRA a perdu la connexion pendant le décodage ; le temps indiqué est donc celui de la tentative réussie.
2. Transitions visuelles intenses
Le même colibri et six mondes ont été développés à partir d’un storyboard de six vignettes.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 424 secondes (7 min 4 s) ; avec : 251 secondes (4 min 11 s). La génération était environ 1,69 fois plus rapide.
3. Vidéo avec peu de changements
Les changements subtils de l’horloger ont été répartis en six vignettes. Avec la LoRA d’accélération, la mise en cases du storyboard est restée visible telle quelle dans la vidéo.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 418 secondes (6 min 58 s) ; avec : 247 secondes (4 min 7 s). Le temps est environ 1,69 fois plus rapide, mais la différence visuelle est ici très marquée.
4. Détails des cheveux et du tissu
La rotation de la même danseuse a été fournie sous forme de six vignettes. Dans les deux cas, avec et sans LoRA, le storyboard a été développé de manière relativement propre en vidéo plein écran.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 420 secondes (7 min 0 s) ; avec : 249 secondes (4 min 9 s). La génération était environ 1,69 fois plus rapide.
5. Déplacement de caméra et occultation au premier plan
L’approche du VTT, un balayage au premier plan et le contournement vers l’arrière ont été spécifiés en six vignettes. Cette fois, la structure en cases est restée très présente dans les deux résultats.
| Sans LoRA d’accélération · 20 étapes | Avec LoRA d’accélération · 8 étapes |
|---|---|
再生 |
再生 |
Sans LoRA d’accélération : 419 secondes (6 min 59 s) ; avec : 248 secondes (4 min 8 s). La génération était environ 1,69 fois plus rapide.
Sur les quatre cas REF4 avec VRAM déjà chargée, la moyenne est de 420,25 secondes sans LoRA contre 248,75 secondes avec. Dans cet environnement, le gain est d’environ 1,69 fois.
Ce que j’en retiens
Si l’on ne regarde que le temps de génération, l’effet de la LoRA d’accélération est considérable. Pour FL2, il est pratiquement divisé par deux ; pour REF4, il est réduit d’environ 40 %. Cela semble particulièrement utile pour les essais lors de l’ajustement des prompts et de la composition.
Cependant, lorsqu’on donne à REF4 un storyboard en cases sous la forme d’une seule image, il peut apprendre la grille elle-même comme élément de composition. En particulier avec la LoRA d’accélération, les séparations entre les cases sont restées visibles longtemps dans certains résultats. Pour obtenir une vidéo plein écran classique avec REF4, il semble plus sûr de fournir chaque vignette comme image distincte plutôt qu’une seule planche-contact.
Par ailleurs, avec FL2 comme avec REF4, la connexion au conteneur a été interrompue une fois uniquement lors du premier passage de la version standard à la version avec LoRA d’accélération. Relancer dans les mêmes conditions a réussi, puis l’exécution est restée stable. Il semble préférable de générer une courte vidéo de test après le premier changement de version.
Ces chiffres sont des mesures effectuées sur cette machine, à cette résolution et pour des vidéos de 8 secondes. Il faut les considérer non comme un benchmark absolu, mais comme une comparaison avec et sans LoRA dans le même environnement.























