Vous avez filmé un événement. Pendant que vous filmez, vous commentez à voix haute ce que vous voulez faire au montage : « coupe là », « garde ça », « c'est le moment fort », « à refaire ». Ces instructions, alignées sur le timecode de la vidéo, peuvent être transformées en une EDL importable dans Premiere Pro ou DaVinci Resolve.
Le montage, c'est le moment où les instructions données sur le terrain prennent du sens. Mais entre le tournage et la table de montage, les détails s'oublient : quel plan était le bon, à quelle seconde exactement, pourquoi vous aviez dit de garder celui-là. Les instructions vocales timecodées évitent ce passage à vide.
Prérequis
Avant de commencer, vous avez besoin de :
Le mode vidéo timecodé (à venir)
KontexVoX today enrichit des photos : vous regardez une image, vous parlez, la description se grave dans l'EXIF. Pour la vidéo, le principe est le même mais le support change : vous regardez votre enregistrement, vous dictez vos instructions de montage au moment où elles vous viennent, et l'app génère un fichier timecodé (SRT ou JSON) relié à la vidéo — pas une description EXIF par image. Ce mode n'existe pas encore, il est au backlog. En attendant, transcrivez votre vidéo avec n'importe quel outil (Whisper, CapCut, Premiere) et lancez le prompt ci-dessous. Le résultat est le même.
Ce que vous avez dicté : un exemple
Voici ce que contient la transcription SRT d'une vidéo de 12 minutes :
Ces instructions, vous les avez dites en regardant la vidéo. L'agent IA va parser ces entrées, identifier les instructions de montage (« coupe », « garde », « moment fort », « à refaire »), et les transformer en entrées EDL avec timecodes précis.
Le prompt
Ce que l'IA produit avec ce prompt
Deux fichiers :
Le monteur part d'une timeline pré-construite au lieu d'un projet vide. Les instructions que vous avez données en regardant la vidéo sont déjà là, positionnées au bon timecode, avec le contexte de votre voix. Il ne lui reste plus qu'à exécuter les coupes et ajuster le rythme.
Outil recommandé : Codex CLI
Codex CLI est excellent pour le parsing structuré et la génération de fichiers techniques dans des formats précis. L'EDL CMX 3600 est un format strict, et Codex gère bien ce type de génération.
Questions fréquentes
Est-ce que ça marche avec n'importe quel format de transcription ?
Le prompt demande du SRT ou du VTT, qui sont les formats standards de transcription timecodée. Si votre transcription est dans un autre format (TXT sans timecodes, JSON), l'agent peut le lire mais le résultat sera moins précis — les timecodes sont essentiels pour positionner les instructions sur la timeline.
Est-ce que l'IA devine les timecodes de fin ?
Non. Le prompt extrait les timecodes de début et de fin de l'EDL à partir des instructions vocales. Pour les coupes (« coupe là »), l'IA prend le timecode de l'instruction comme point de coupe. Pour les segments à garder (« garde tout »), elle prend le timecode de l'instruction comme début et le timecode de l'instruction suivante comme fin. C'est une base de travail, pas un montage fini — le monteur ajuste ensuite.
Est-ce que je peux éditer l'EDL à la main après ?
Oui, et c'est recommandé. L'EDL générée est un point de départ, pas un montage final. Les timecodes sont précis mais les choix de montage s'affinent à la table. L'avantage, c'est que vous partez d'une structure déjà construite au lieu de tout repositionner manuellement.
Est-ce que ça marche si j'ai plusieurs vidéos ?
Oui, mais il faut une transcription par vidéo. Lancez le prompt séparément pour chaque transcription, puis fusionnez les EDL dans Premiere ou DaVinci. Le prompt ne gère pas le multi-caméra — il traite une timeline linéaire par vidéo.