Retour au blogen
7 août 2026Maxime Jegat

Prompt Seedance 2.5 : le guide complet pour des vidéos qui tiennent 30 secondes

Écrire un prompt Seedance 2.5 qui tient 30 secondes demande un plan de tournage, pas une description. La structure, la syntaxe audio et les erreurs à éviter.

Prompt Seedance - Guide complet

Un prompt Seedance 2.5 qui marchait sur 5 secondes ne tient plus sur 30. Le modèle génère maintenant une prise continue de 30 secondes en une passe, avec l'audio, et cette durée change complètement la façon d'écrire. Tu ne décris plus une image qui bouge un peu. Tu écris un déroulé.

C'est là que la plupart des prompts cassent. Le modèle a 30 secondes à remplir et si tu ne lui dis pas où le plan doit atterrir à chaque étape, il improvise. Le personnage change de visage à la douzième seconde, les accessoires se téléportent, et tu récupères un rush inutilisable que tu as quand même payé.

Voilà comment on écrit les prompts Seedance chez nous : ce que la doc officielle impose, et ce qu'on a appris en livrant des rushes.

Ce que Seedance 2.5 change, et où l'utiliser aujourd'hui

ByteDance a annoncé le modèle le 23 juin 2026 à sa conférence Volcano Engine FORCE, l'a ouvert aux créateurs le 31 juillet sur Dreamina, Jimeng et Doubao, et l'API publique est ouverte depuis le 7 août 2026 sur Volcano Ark et BytePlus ModelArk. Les revendeurs d'API l'exposent aussi.

Quatre points changent ta façon d'écrire.

La durée. 30 secondes en une seule passe, sans recoller des plans de 5 secondes bout à bout. Avec l'extension de vidéo (en anglais : « video extension »), tu montes à une minute.

Les références. Jusqu'à 50 par génération : 30 images, 10 clips vidéo, 10 pistes audio. Le chiffre est spectaculaire et il est trompeur, j'y reviens.

L'audio, généré avec l'image et pas ajouté après. Le lip-sync couvre 11 langues et le français n'en fait pas partie. Les langues optimisées sont le chinois, l'anglais, l'espagnol, l'indonésien et le malais ; le thaï, l'arabe, le portugais, le vietnamien, le japonais et le coréen sont supportés. Pour une ad en français, tu génères le plan muet et tu poses ta voix au montage. C'est aussi ce qu'on fait par défaut, parce qu'une voix générée avec l'image, tu ne peux plus la corriger sans tout refaire.

L'édition par zone (en anglais : « region-level editing »), qui change un élément dans une fenêtre de temps précise sans regénérer le clip entier.

Sur la résolution, méfie-toi de ce que tu lis. La 4K native est annoncée par le modèle, mais les routes d'API ouvertes en premier plafonnent à 480p et 720p. C'est le cas chez nous aussi : Seedance 2.5 sort en 720p maximum, quand Seedance 2.0 monte à 1080p. Si ton livrable a besoin de 1080p natif, la version précédente reste la bonne. Regarde ce que ton fournisseur expose réellement avant de bâtir un workflow dessus.

Un mot sur les benchmarks, parce que le modèle est trop récent pour être classé. Seedance 2.5 n'apparaît pas encore dans l'arène texte-vers-vidéo d'Artificial Analysis. Son prédécesseur y est troisième avec 1 224 points d'Elo, derrière Gemini Omni Flash (1 244) et MiniMax H3 (1 240), et devant Kling 3.0 Pro (1 111) et Veo 3.1 (1 093). En image-vers-vidéo avec audio, Seedance 2.0 est premier. C'est le point de départ de la 2.5, pas sa note finale, mais ça situe le niveau.

L'anatomie d'un prompt Seedance 2.5

La formule officielle tient en six blocs : sujet, action, décor, style visuel, mouvement de caméra, audio. Seuls les deux premiers sont obligatoires. En pratique, sur un plan de 30 secondes, les six servent tous : les prompts qui décrochent en cours de route sont presque toujours ceux où le décor et le style n'ont jamais été posés, donc le modèle les redécide à chaque seconde.

Un squelette qui marche :

[GOAL] 30s vertical 9:16 product ad, single continuous take.
[REFERENCES] @Image 1 defines the bottle. Do not use its background.
[SUBJECT] ...
[TIMELINE] [0-6s] ... End state: ...
[CAMERA] ...
[LIGHT & LOOK] ...
[SOUND] ...
[LOCK] ...
[AVOID] ...

Un prompt long n'est pas un meilleur prompt. Chez nous le budget de travail est de 2000 à 2900 caractères, plafond dur à 3000 espaces comprises. Au-delà, tu ne gagnes plus en contrôle, tu ajoutes du bruit que le modèle arbitre à ta place. Chaque phrase doit changer quelque chose à l'image. Si tu peux la retirer sans que le plan bouge, retire-la.

Dernier point, écris tes prompts en anglais, même pour une ad française. Le modèle est nettement plus stable dessus. Ne traduis jamais un nom de marque ni un texte imprimé sur le produit.

Découper les 30 secondes : la règle de l'état de fin

Tu découpes tes 30 secondes en intervalles. Une action principale par intervalle, jamais deux. Et tu termines chaque intervalle par son image d'arrivée, l'état de fin (en anglais : « end state »).

[0-6s] Hands lift the bottle from the marble counter, slow rotation to face camera.
End state: bottle upright, label fully readable, centered in frame, hands out of shot.

[6-14s] The dropper is pulled out; one drop falls onto the back of a hand.
End state: dropper held mid-air above the hand, single drop visible on skin.

Pourquoi ça compte : l'image de fin d'un intervalle est ce que le suivant hérite. Si tu ne l'écris pas, le modèle repart d'une interprétation neuve. C'est exactement là que les objets apparaissent de nulle part et que les poses se réinitialisent.

Deuxième règle sur le découpage : traite tes intervalles comme des budgets de temps, pas comme des points de montage au frame près. Un geste qui prend quatre secondes dans la vraie vie ne rentre pas dans un intervalle de deux secondes. Le modèle va l'accélérer, et une main qui bouge trop vite est le premier signe qu'un rush n'est pas utilisable.

Troisième règle, celle qu'on applique systématiquement en production : un seul changement d'état par plan. Fermé vers ouvert, éteint vers allumé, emballé vers déballé. Tu en empiles deux et tu récupères un plan où les deux transitions sont ratées à moitié.

Enfin, ferme toujours ton prompt par un verrou d'identité. Une ligne, en fin de prompt :

Same face, same hairstyle, same outfit, same body type for the entire video.

Sur les plans avec un produit, on verrouille pareil, mais sur 5 attributs maximum : la silhouette, la couleur, le logo, le texte de l'étiquette, la matière. On a essayé d'en lister douze, le résultat est moins bon. Au-delà de cinq, le signal se dilue et le modèle choisit tout seul ce qu'il protège.

Lier les références : une image, un sujet, une exclusion

50 références, c'est le maximum théorique. Le maximum utile est très en dessous : entre 1 et 8 sujets distincts venant d'images, 1 à 5 depuis de la vidéo, des clips de référence de 5 à 10 secondes. Passe au-dessus et la cohérence se dégrade au lieu de s'améliorer.

Nomme chaque référence par son rang, dans l'ordre où tu l'envoies : @Image 1, @Image 2, @Video 1.

Donne à chacune un rôle explicite, et surtout dis ce qu'il ne faut pas en prendre. La formulation qui marche : @Image 1 defines the bottle shape, glass texture and label typography. Do not use its background or lighting. Sans l'exclusion, tu hérites du fond, de la lumière et parfois d'un objet posé à côté dont tu n'avais pas besoin.

Une référence, un sujet. La formulation « les images 1 à 4 définissent les quatre personnages » ne fonctionne pas, il faut mapper un par un. Cas particulier utile : quand plusieurs images montrent le même objet sous plusieurs angles, dis-le explicitement, sinon tu récupères plusieurs exemplaires de l'objet dans le plan. All four images define one single lamp. The output must contain exactly one lamp.

Un point que tu vas rencontrer vite : les images de référence contenant des humains sont souvent bloquées par les filtres de contenu, y compris des photos parfaitement anodines. La parade est de décrire le personnage en texte, dans un bloc dédié, plutôt que de le fournir en image. Tu perds en fidélité, tu gagnes en taux de passage.

La syntaxe audio que presque personne n'utilise

Seedance 2.5 distingue quatre types de contenu sonore par leur ponctuation, et mélanger tout ça en texte brut est une des causes les plus fréquentes de son raté.

(...) pour la musique : (slow acoustic guitar riff)

<...> pour les bruitages : <a bicycle bell rings twice>

{...} pour le dialogue : {Order ready, table six.}

【...】 pour les sous-titres incrustés : 【Jour 1】

Avant un dialogue non anglophone, annonce la langue et l'accent : Dialogue language: natural conversational American English.

Le cas le plus utile en ad : couper la musique. Écrire « no music » échoue régulièrement, le modèle repose une nappe par-dessus. La directive qui tient :

[SOUND] Strictly only naturally occurring sound and foley, no music allowed.

Nous, on va plus loin : on demande zéro parole, zéro sous-titre, zéro texte incrusté sur la quasi-totalité des rushes. Les overlays et la voix sont ajoutés au montage. Un texte généré dans l'image est un déchet à détourer, et il est presque toujours mal orthographié.

Caméra et émotion : nomme le mouvement, décris l'observable

« Cinématique » ne veut rien dire pour le modèle. Les termes standard, eux, passent directement : travelling avant (« push-in »), travelling arrière (« pull-out »), panoramique, orbite, plongée, contre-plongée, caméra à l'épaule, whip pan.

Pour un terme moins courant, traduis-le en changement visible plutôt que de l'employer tel quel. Au lieu de « rack focus », écris : shift focus smoothly from the foreground leaves to the person standing behind them.

Même logique pour les émotions. « Elle est déçue » produit une expression générique. Ce qui marche, c'est de décrire ce qu'on voit : le regard qui descend, la mâchoire qui se relâche, la main qui repose l'objet plus lentement que nécessaire. Tu écris la conséquence physique, pas l'étiquette.

Et écris tes transitions au lieu de les laisser au hasard. Une jonction non décrite est un endroit où un objet peut apparaître ou disparaître. → WHIP PAN RIGHT on her turn, smears to white, hard cut.

Corriger sans tout regénérer

C'est la fonction la plus sous-utilisée du modèle, et celle qui fait le plus gagner de temps quand un rush est bon à 90 %.

Un prompt d'édition tient en quatre éléments : quelle vidéo est la source, ce qui change, sur quelle fenêtre de temps, et surtout ce qui ne bouge pas. Le dernier point est le plus important, c'est la clause de préservation.

[EDIT] Edit @Video 1. Only from 4s to 7s, change the cool blue light to warm orange.
[PRESERVE] Keep character identity, clothing, expression, position, motion,
room structure, camera movement, dialogue and ambience exactly as in @Video 1.

Pour prolonger un plan, décris uniquement ce qui est nouveau et exige la continuité :

Extend the video naturally. [new content only]. Smooth motion continuity,
no hard cuts, nothing appears out of thin air.

Trois verrous à connaître avant de lancer. En édition, le ratio est verrouillé sur la source et la durée ne bouge que de quelques dixièmes de seconde. En génération première image / dernière image, le ratio est verrouillé sur la première image. En extension, le ratio est verrouillé sur la source. Donc si tu veux changer de format, c'est une nouvelle génération, pas une édition.

Les 6 erreurs qui reviennent le plus

Décrire une photo au lieu d'un déroulé

Le symptôme, c'est un plan de 30 secondes où il ne se passe rien pendant 25. La cause, c'est un prompt écrit au présent descriptif, sans intervalles. Découpe et pose tes états de fin.

Empiler deux actions dans le même intervalle

Le modèle en choisit une, ou fusionne les deux en un geste bizarre. Une action principale par intervalle. Si tu en as trois à faire passer, allonge le plan ou coupe une action.

Mal dimensionner les intervalles

Le geste est joué en accéléré et les mains bavent. Recalcule le temps réel du geste et redonne-lui son intervalle.

Envoyer trop de références

Passé 8 sujets distincts, les personnages se mélangent et les objets se dupliquent. Sélectionne tes références scène par scène au lieu de tout envoyer en bloc.

Coller une liste d'interdits générique

Vingt interdictions recopiées d'un autre prompt diluent les trois qui comptaient. On s'en tient à 3 à 5 interdits, tous plausibles pour ce plan précis.

Réécrire tout le prompt après un rush raté

C'est l'erreur qui coûte le plus cher, parce que tu perds l'information. Identifie le défaut dominant, modifie la seule section concernée, relance. Une variable à la fois. Et on a une règle pour ne pas brûler le budget : au bout de 2 relances sur un clip qui dérive toujours, on arrête et on rebrief le plan au lieu de continuer à payer des générations.

Un prompt d'ad, commenté

30 secondes, format vertical, focus produit, sans voix. C'est le format qu'on livre le plus souvent, parce que la voix et les sous-titres se posent au montage.

[GOAL] 30s single continuous take, vertical 9:16, product-focused UGC-style ad.

[REFERENCES] @Image 1 defines the serum bottle: shape, amber glass, white label
typography, gold dropper cap. Do not use its background or lighting.

[SUBJECT] A woman's hands only, no face in frame, on a pale marble bathroom counter,
soft morning window light from the left.

[TIMELINE]
[0-7s] Hands enter frame and lift the bottle from the counter, slow rotation until
the label faces camera. End state: bottle upright and centered, label fully readable,
hands holding it at the base.
[7-16s] The dropper cap is unscrewed and lifted out. End state: dropper held in the
right hand above the open bottle, one drop hanging at the tip.
[16-24s] One drop falls onto the back of the left hand. End state: single visible drop
on the skin, dropper out of frame.
[24-30s] Fingertips spread the serum in one slow circular motion. End state: skin
lightly glossy, hands resting flat on the counter, bottle standing beside them.

[CAMERA] Locked medium close-up, very slow push-in across the whole take.
No cuts, no whip pans.

[LIGHT & LOOK] Natural window light, soft shadows, realistic skin texture,
handheld phone-camera realism, no color grading, no lens flare.

[SOUND] Strictly only naturally occurring sound and foley, no music allowed.
<glass cap unscrewing> <a single drop landing on skin> <quiet room tone>

[LOCK] Same bottle throughout: amber glass, gold dropper cap, white label with the
exact printed text from @Image 1, same proportions. The bottle at 30s must be the
same object as at 0s.

[AVOID] No spoken words, no lip movement, no on-screen text or subtitles,
no second bottle appearing, no fingers covering the label.

Ce qui fait tenir ce prompt : un objectif en une ligne, une référence avec son exclusion, quatre intervalles qui ont chacun un état de fin, un seul changement d'état sur tout le plan (le flacon qui s'ouvre), un verrou nominatif sur cinq attributs, et quatre interdits qui correspondent aux erreurs réellement probables ici. 1 800 caractères environ. Sous le budget, et chaque ligne sert.

Utiliser Seedance 2.5 dans Hoox

Le modèle est disponible dans Hoox depuis son ouverture, sur les plans Pro et Entreprise. Tu écris ton prompt, tu choisis ta durée entre 4 et 30 secondes seconde par seconde, et tu récupères le rush.

Trois détails utiles si tu compares aux autres modèles de la plateforme. Les six ratios sont là, dont le 9:16 dont tu as besoin pour des ads. Tu peux joindre jusqu'à 50 images de référence, contre 12 sur Seedance 2.0 et 3 sur Veo 3.1. Et une génération Seedance 2.5 revient à environ un tiers de moins qu'une Seedance 2.0 en 1080p, pour une durée maximale deux fois plus longue. La comparaison n'est pas à résolution égale, puisque la 2.5 s'arrête à 720p, mais sur un rush destiné à du 9:16 social c'est rarement ce qui te bloque.

Le reste de la méthode ne change pas : le prompt en anglais, la timeline avec états de fin, le verrou d'identité en clôture, les overlays et la voix au montage. Si tu débutes sur le sujet, j'ai expliqué ailleurs comment fonctionne la génération de vidéos UGC par intelligence artificielle.

FAQ

Quelle est la structure d'un prompt Seedance 2.5 ?

Six blocs : sujet, action, décor, style visuel, mouvement de caméra, audio. Seuls le sujet et l'action sont obligatoires, mais sur un plan long, poser le décor et le style évite que le modèle les redécide en cours de route. Ajoute une timeline découpée en intervalles avec un état de fin par intervalle, un verrou d'identité en clôture et 3 à 5 interdits.

Combien de temps peut durer une vidéo Seedance 2.5 ?

30 secondes en une passe. Avec l'extension de vidéo, tu peux prolonger jusqu'à environ une minute au total. Au-delà, tu assembles au montage.

Combien de références peut-on utiliser ?

50 au maximum théorique : 30 images, 10 vidéos et 10 audios. En pratique, reste entre 1 et 8 sujets distincts issus d'images et 1 à 5 issus de vidéos. Au-delà, la cohérence se dégrade.

Seedance 2.5 gère-t-il le français en lip-sync ?

Non. Le lip-sync couvre 11 langues et le français n'en fait pas partie. Pour une ad en français, génère le plan sans parole et ajoute la voix au montage. Tu gardes en plus la possibilité de corriger le script sans regénérer la vidéo.

Comment supprimer la musique dans une génération Seedance ?

Écrire « no music » ne suffit pas. Utilise une directive explicite dans le bloc son : Strictly only naturally occurring sound and foley, no music allowed. Précise ensuite les bruitages que tu veux entendre entre chevrons.

Faut-il écrire ses prompts en anglais ?

Oui. Le modèle est plus stable en anglais, y compris pour une vidéo destinée à un marché français. Ne traduis pas les noms de marque ni les textes imprimés sur le produit.

Où utiliser Seedance 2.5 ?

Chez ByteDance directement, via Dreamina, Jimeng et Doubao pour les créateurs, et via l'API Volcano Ark ou BytePlus ModelArk pour les développeurs. Le modèle est aussi disponible dans Hoox sur les plans Pro et Entreprise, en 4 à 30 secondes et jusqu'à 50 images de référence.

Le prompt n'est pas le goulot

Bien écrire tes prompts améliore ton taux de rush utilisable, et c'est déjà beaucoup. Mais si tu produis des ads, ce qui te limite c'est le nombre de concepts que tu sors chaque semaine. Un prompt parfait sur un compte qui livre quatre créas par mois ne change pas ton ROAS.

La méthode ci-dessus prend sa valeur le jour où elle tourne en boucle : un concept, un prompt, un rush contrôlé, une variante le lendemain.

C'est exactement le travail qu'on fait pour les marques qu'on accompagne, avec des vidéos type UGC générées et livrées en batch, à un coût par vidéo qu'on a détaillé ailleurs. Seedance 2.5 est dans la plateforme si tu veux prompter toi-même, et si tu préfères qu'on s'occupe du volume, c'est par là.

Prêt à créer des vidéos avec l'IA ?

Commencez gratuitement et créez vos premières vidéos en quelques secondes.

Commencer gratuitement