Pour le lancement de FULLCUT, un logiciel d’aide au montage doublé d’un studio IA, il fallait une campagne de pubs. On a décidé de ne pas sortir une seule caméra. Trois films en quelques semaines, sans tournage, sans comédiens, sans décor : chaque plan est généré, et tout ce qui vient après, le montage, l’étalonnage, le son, les textes, est fait à la main dans DaVinci Resolve. Je vais vous raconter comment on s’y est pris, étape par étape, avec ce qui a marché du premier coup, ce qu’on a dû refaire, et quelques notions techniques qui nous ont fait gagner du temps. Ce n’est pas un tuto, c’est un carnet de fabrication.
Étape 1 : la charte visuelle, avant le moindre prompt
Je n’ai pas commencé par un modèle, j’ai commencé par une page. Pour le premier film, la charte tient en trois mots : nuit bleue, lumière dure, air doux. Le noir n’est jamais gris, il est teinté de bleu. Une seule source de lumière, dure, hors champ, qui découpe les contours. Une brume légère, et c’est la seule douceur permise. La référence, je l’assume, c’est la pub de parfum : du néon, de la nuit, un seul geste, aucune explication. Sur cette page il y a aussi la palette (un noir bleuté, un bleu électrique, un bleu plus clair pour les halos, un crème réservé à ce qui est humain), les interdits (pas de lumière chaude, pas d’orange, pas de reflet d’objectif, pas de caméra à l’épaule) et le grain, fin et régulier, celui d’un négatif 35 mm poussé d’un diaph. S’il se remarque, il est trop fort.
On s’est d’ailleurs trompés au début sur ce grain. Mes premiers prompts l’interdisaient, parce que je pensais photo produit. Les références que j’aime en portent toutes un, et c’est une partie de ce qui les rend chères. On l’a remis, en le dosant.
Ce qu’il faut bien comprendre, c’est que cette charte est celle du premier film, pas de la campagne. Le deuxième film se passe le lendemain matin et il fait exactement ce que la première page interdit : de la lumière dorée. Le troisième se passe dans une vraie salle de montage le soir, écran froid sur les visages, lampes chaudes derrière. Trois films, trois lumières, donc trois blocs d’ambiance différents, chacun collé à la fin de chaque prompt de son film et jamais modifié à l’intérieur du film. C’est ce bloc qui fait la série. Sans lui, chaque génération part dans sa direction et au bout de vingt rendus on a un moodboard. Avec lui, cent rendus différents appartiennent au même monde. Et un plan qui ne respecte pas la charte ne se rattrape pas à l’étalonnage : il se refait.


Étape 2 : écrire le film plan par plan, pas en une phrase
Un prompt vidéo, chez nous, ressemble à un découpage. En tête, les consignes dures que le modèle lit le mieux : la durée totale, le nombre de plans, « No subtitles » et « No BGM » parce que sinon il invente des sous-titres et colle une musique. Puis une phrase de résumé. Puis les plans, un par ligne, horodatés à la seconde, avec le cadre, le mouvement de caméra, une seule action, et « Hard cut. » à la fin de chaque ligne. Quelque chose comme : Shot 3 [0:10-0:15] [Close shot, locked-off], une main déjà posée sur la molette, la main se lève et sort du cadre à droite, rien d’autre ne bouge. Hard cut.
Deux règles de ce découpage m’ont coûté des rendus avant que je les respecte. La première : une seule action par plan. Si vous en enchaînez deux dans la même ligne, la seconde est simplement abandonnée, et ce n’est pas un réglage qu’on peut changer, c’est de la dramaturgie. On enchaîne au montage. La seconde : le personnage est déjà en mouvement quand le plan ouvre. Un plan qui commence par quelqu’un qui commence un geste sent le rendu à trois kilomètres. Quatre à six secondes par plan, jamais plus, le modèle dérive au-delà. Et aucune génération ne dépasse trente secondes, c’est la limite du modèle et c’est aussi la mienne : un film plus long se monte à partir de plusieurs générations, il ne se génère pas d’un coup.
La bonne surprise est venue du premier film, le teaser. Je pensais qu’un prompt qui décrit six plans en rendrait trois. Faux. Deux prises de trente secondes, 721 images chacune, et les six plans y sont, dans l’ordre, aux durées demandées, coupés net toutes les cinq secondes. Et les deux prises ne se valent pas plan par plan : la timeline de l’une est bien meilleure, la chaise vide de l’autre aussi. Le film final est un montage des deux. Choisir, assembler, raccorder, c’est exactement le travail qu’on fait tous les jours.
Étape 3 : les références, ou comment tenir un personnage d’un plan à l’autre
Un modèle qui n’a qu’un texte redessine tout à chaque plan : le visage, la pièce, la veste. Pour que les plans appartiennent au même film, on lui donne des images de référence, chacune avec un rôle étroit. Dans le deuxième film, la femme à la veste verte qu’on croise dans la foule la nuit est la même qui s’assoit dans le soleil du bureau le matin. Ça ne vient pas tout seul : sa planche est fournie au modèle, et elle est décrite de la même façon dans chaque plan où elle apparaît. Ce film est aussi celui où j’ai renversé la charte, avec une lampe chaude dès le premier plan, une lectrice sous sa lampe, puis le métro à l’aube, une rue en contre-jour, un bureau inondé de soleil. Le bleu ne vit plus que dans les écrans. C’est le sujet du film, la nuit pour la machine et le matin pour le monteur, et c’est pour ça que ce film a son propre bloc d’ambiance.
Deux références demandent un traitement particulier. Le logo d’abord : on ne demande jamais à un modèle d’écrire FULLCUT. Il écrira FULCUT, ou FULL CUT, ou une lettre en trop, et jamais deux fois pareil. La seule voie fiable, c’est de lui donner le logotype déjà composé en première image et de le laisser faire bouger la lumière autour. Même logique pour tout ce qui est nom propre : le modèle ne corrige pas vos approximations, il rend littéralement ce que vous écrivez. L’interface du logiciel ensuite : elle n’est jamais générée. Quand elle apparaît à l’écran, c’est une vraie capture, faite sur un projet de démonstration, insérée au montage ou fournie en référence avec la consigne stricte de ne rien changer. Un modèle qui invente une interface fait douter de la vraie.
Étape 4 : générer, en local d’abord
On travaille avec deux moteurs. MiniMax H3 tourne en local, sur une station dédiée, via ComfyUI. C’est notre laboratoire : chaque essai est gratuit, on itère vite, et c’est là qu’on a mesuré presque toutes les règles de ce carnet, la seule action par plan, l’orthographe exacte, le logo qu’on n’écrit pas. Rien ne sort de la machine, ce qui compte aussi pour la suite. Seedance 2.5 prend le relais pour les films finaux, en référence vers vidéo : on lui donne les images de départ et il anime. Pour le dernier film, on a aussi essayé les modèles sortis en cours d’été, Flux 3 en tête, parce que sur les visages ils font une vraie différence.
On tire toujours plusieurs prises du même prompt, et on regarde au premier rendu quatre choses avant de relancer quoi que ce soit : est-ce que les coupes tombent aux secondes demandées, est-ce que le sujet est déjà en mouvement au premier plan, est-ce qu’il n’y a aucun texte inventé, et est-ce que l’ambiance du film est tenue, pas d’orange dans la nuit, pas de bleu hors écran au matin. Si vingt-quatre secondes sur trente sont bonnes, on ne réécrit que le plan qui rate, jamais tout le prompt.
Étape 5 : diriger des comédiens qui n’existent pas
Le troisième film est pensé pour l’international : textes à l’écran en anglais, pas de voix off, une musique et un seul souffle de surprise. Son prompt n’est plus un paragraphe, c’est un fichier JSON, et c’est ce qui ressemble le plus à un dossier de tournage que j’aie écrit pour une machine. Il déclare le format, 16:9, trente secondes, 24 images par seconde, son généré avec l’image. Il liste sept références : une planche du personnage, une planche de la salle de montage, quatre captures exactes de l’interface, une par étape du logiciel, et le logo. Pour chacune, ce qu’elle verrouille (même visage, même garde-robe, même mobilier, même heure de la nuit) et ce qu’elle n’a pas le droit de toucher : une capture d’interface ne doit influencer ni le personnage, ni la pièce, ni l’étalonnage. Il énumère le seul texte autorisé à l’écran, mot pour mot, du chemin de menu dans Resolve jusqu’à la phrase de l’e-mail. Puis dix-neuf temps horodatés au centième de seconde, avec pour chacun l’action, la focale, le jeu et le son. Et à la fin, une quarantaine de choses qu’on ne veut pas voir, du sixième doigt au logo redessiné.
C’est dans ce fichier que s’écrit ce qu’on pourrait appeler la direction d’acteur IA. La fatigue dans les yeux, le souffle qu’on retient, un sourcil qui se lève, le « Whaaat » retenu quand le projet se range tout seul, et à la fin un monteur qui s’étire, les bras derrière la tête. Micro-expression par micro-expression, avec une consigne à laquelle je tiens : pas de sourire de pub, pas de panique de théâtre, des gens compétents et fatigués, pas des caricatures. La caméra suit la même logique : un peu d’épaule tant que le monteur est épuisé, et elle se pose dès que le logiciel travaille. Une focale par usage, 28 mm pour l’ouverture, 85 pour les visages, macro pour l’œil où se reflète la timeline.
Il reste des erreurs, et je préfère les dire. Demandez une larme à Flux 3 ou à Seedance 2.5 et il en coule deux, une par œil, parfaitement synchrones. Une main à six doigts de temps en temps. Un logo qui se redessine si on le laisse faire. Avec du temps pour la création, tout ça se règle : on refait le plan, on change une ligne, on remonte.
Étape 6 : le montage, l’étalonnage et le son, comme sur n’importe quel film
Une fois les prises rendues, on est de retour dans Resolve et le métier reprend ses droits. Premier piège : la détection automatique de coupes ne trouve rien sur des plans bleu sombre sur fond noir, l’écart entre deux images de part et d’autre d’une coupe est trop faible. On coupe donc au chronomètre, toutes les cinq secondes, puisque le prompt a été écrit comme ça. Deuxième chose : deux rendus du même prompt ne donnent pas le même noir. On étalonne pour remettre tout le monde dans la même nuit, et on remonte très légèrement les noirs avant export, parce que les plateformes écrasent les scènes sombres et que le grain fin de la charte est ce qui casse les paliers.
Tout le texte se compose dans Resolve, jamais dans le modèle : les sous-titres, les cartons, le logotype. Le son se pose au montage aussi. Le modèle en génère, et il sert de guide de synchronisation, pas de mixage final. On s’est donné une règle sonore simple : un seul événement fort par film. S’il y en a deux, il n’y en a plus aucun.
Étape 7 : une règle que je ne négocie pas
Aucun rush client ne part vers un modèle, jamais. Les seules images qu’on envoie à un service de génération sont les actifs de marque du projet concerné. Les plans dont on a besoin sont générés exprès, les captures d’interface sont faites sur un projet de démonstration, sans un nom de client à l’écran, et le laboratoire en local ne fait rien sortir de la machine. C’est la réponse la plus simple à la question des droits sur les films de nos clients. J’ai détaillé notre position dans ce qu’on fait et ce qu’on refuse en films IA. Et comme pour tout ce qui sort de chez nous, rien ne démarre sans un storyboard validé : ici, c’est le prompt.
Les trois films sont dans le portfolio, catégorie Films IA : « On fait les heures », « La nuit a tout regardé » et « Ready for review ».
Questions fréquentes
Une vidéo 100 % IA, c’est vraiment 100 % IA ?
Chaque plan filmé est généré. Deux choses ne le sont pas : l’interface du logiciel, toujours une vraie capture, et tout le travail autour, la charte, l’écriture des plans, le choix des prises, le montage, l’étalonnage, le son et les textes, fait dans DaVinci Resolve. L’IA remplace le plateau, pas le studio.
Pourquoi générer en local avec MiniMax H3 ?
Parce que chaque essai y est gratuit. C’est là qu’on met au point les règles de prompt, une action par plan, orthographe exacte, logo en première image, avant de lancer les rendus finaux sur Seedance 2.5. Et rien ne sort de la machine, ce qui règle la question de la confidentialité.
Pourquoi écrire les prompts en JSON ?
Parce qu’un film de trente secondes ne tient pas dans une phrase. Le JSON pose le format, les références avec leur rôle, le texte exact autorisé à l’écran et une timeline horodatée plan par plan. Il se relit, se versionne et se corrige un temps à la fois. C’est le storyboard du tournage IA.
Utilisez-vous les rushes de vos clients pour entraîner ou générer ?
Non, jamais. Aucun média client ne part vers un service de génération. Les seules images envoyées sont des créations de marque dédiées, et les plans dont on a besoin sont générés exprès pour cet usage.
Vous vous demandez ce qu’un film 100 % IA, ou augmenté par IA, peut faire pour votre marque ? Écrivez-nous. On répond sous 24 h, et on vous dira franchement ce que l’IA sait faire pour votre projet, et ce qu’elle ne sait pas encore faire.