Vous avez filmé un événement. Pendant que vous filmez, vous commentez à voix haute ce que vous voulez faire au montage : « coupe là », « garde ça », « c'est le moment fort », « à refaire ». Ces instructions, alignées sur le timecode de la vidéo, peuvent être transformées en une EDL importable dans Premiere Pro ou DaVinci Resolve.

Le montage, c'est le moment où les instructions données sur le terrain prennent du sens. Mais entre le tournage et la table de montage, les détails s'oublient : quel plan était le bon, à quelle seconde exactement, pourquoi vous aviez dit de garder celui-là. Les instructions vocales timecodées évitent ce passage à vide.

Prérequis

Avant de commencer, vous avez besoin de :

1. Une transcription timecodée de votre vidéo, au format SRT ou VTT. Vous la générez depuis votre enregistrement avec Whisper, CapCut, ou n'importe quel outil de transcription. Si vous voulez dicter vos instructions de montage à la voix — dire « coupe là » au moment exact — un mode vidéo timecodé est prévu dans KontexVoX (voir plus bas).
2. Un agent IA avec accès au système de fichiers : Claude Code, Codex CLI, ou Gemini. Pas un chatbot web.
3. La transcription exportée vers votre ordinateur.
Un chatbot web ne lit pas vos fichiers locaux et ne génère pas de fichiers techniques dans un format précis. Pour produire une EDL et des markers, il faut un agent qui travaille dans votre dossier.

Le mode vidéo timecodé (à venir)

KontexVoX today enrichit des photos : vous regardez une image, vous parlez, la description se grave dans l'EXIF. Pour la vidéo, le principe est le même mais le support change : vous regardez votre enregistrement, vous dictez vos instructions de montage au moment où elles vous viennent, et l'app génère un fichier timecodé (SRT ou JSON) relié à la vidéo — pas une description EXIF par image. Ce mode n'existe pas encore, il est au backlog. En attendant, transcrivez votre vidéo avec n'importe quel outil (Whisper, CapCut, Premiere) et lancez le prompt ci-dessous. Le résultat est le même.

Ce que vous avez dicté : un exemple

Voici ce que contient la transcription SRT d'une vidéo de 12 minutes :

00:01:23,400 → « Ici c'est le discours d'ouverture, garde tout. » 00:03:47,200 → « Coupe là, le mec qui passe devant c'est mort. » 00:05:12,800 → « Moment fort : elle pleure en lisant la lettre. Garde en plan large. » 00:07:30,000 → « À refaire, j'ai bégayé. Recommence après. » 00:09:15,600 → « C'est le final, garde la musique, coupe sur le plan d'ensemble. »

Ces instructions, vous les avez dites en regardant la vidéo. L'agent IA va parser ces entrées, identifier les instructions de montage (« coupe », « garde », « moment fort », « à refaire »), et les transformer en entrées EDL avec timecodes précis.

Le prompt

Lis le fichier de transcription timecodée (SRT ou VTT). Parse chaque entrée pour extraire les instructions de montage en langage naturel (« coupe », « garde », « moment fort », « à refaire », etc.). Génère un fichier EDL au format CMX 3600, le standard pour Premiere Pro et DaVinci Resolve. Chaque entrée EDL doit contenir : le timecode de début, le timecode de fin, le type d'événement (video, audio), et une note avec le commentaire vocal original. Inclut aussi un fichier de markers au format CSV pour DaVinci Resolve.

Ce que l'IA produit avec ce prompt

Deux fichiers :

1. Un fichier EDL au format CMX 3600, importable directement dans Premiere Pro ou DaVinci Resolve. Chaque entrée contient le timecode de début, le timecode de fin, le type d'événement, et une note avec votre commentaire vocal original.
2. Un fichier de markers CSV pour DaVinci Resolve, qui place des repères sur la timeline aux moments que vous avez indiqués.

Le monteur part d'une timeline pré-construite au lieu d'un projet vide. Les instructions que vous avez données en regardant la vidéo sont déjà là, positionnées au bon timecode, avec le contexte de votre voix. Il ne lui reste plus qu'à exécuter les coupes et ajuster le rythme.

Outil recommandé : Codex CLI

Codex CLI est excellent pour le parsing structuré et la génération de fichiers techniques dans des formats précis. L'EDL CMX 3600 est un format strict, et Codex gère bien ce type de génération.

Questions fréquentes

Est-ce que ça marche avec n'importe quel format de transcription ?

Le prompt demande du SRT ou du VTT, qui sont les formats standards de transcription timecodée. Si votre transcription est dans un autre format (TXT sans timecodes, JSON), l'agent peut le lire mais le résultat sera moins précis — les timecodes sont essentiels pour positionner les instructions sur la timeline.

Est-ce que l'IA devine les timecodes de fin ?

Non. Le prompt extrait les timecodes de début et de fin de l'EDL à partir des instructions vocales. Pour les coupes (« coupe là »), l'IA prend le timecode de l'instruction comme point de coupe. Pour les segments à garder (« garde tout »), elle prend le timecode de l'instruction comme début et le timecode de l'instruction suivante comme fin. C'est une base de travail, pas un montage fini — le monteur ajuste ensuite.

Est-ce que je peux éditer l'EDL à la main après ?

Oui, et c'est recommandé. L'EDL générée est un point de départ, pas un montage final. Les timecodes sont précis mais les choix de montage s'affinent à la table. L'avantage, c'est que vous partez d'une structure déjà construite au lieu de tout repositionner manuellement.

Est-ce que ça marche si j'ai plusieurs vidéos ?

Oui, mais il faut une transcription par vidéo. Lancez le prompt séparément pour chaque transcription, puis fusionnez les EDL dans Premiere ou DaVinci. Le prompt ne gère pas le multi-caméra — il traite une timeline linéaire par vidéo.