Vous avez filmé un événement. Pendant que vous filmez, vous commentez à voix haute ce que vous voulez faire au montage : « on garde », « c'est bon », « on coupe », « à refaire ». Ces instructions, alignées sur le timecode de la vidéo, peuvent être transformées en un cut préliminaire — un fichier EDL que vous importez dans Premiere, DaVinci ou Final Cut, et qui pré-remplit la timeline avec les bons segments.

Le pré-montage, c'est le travail le plus ingrat du montage : éliminer les prates, identifier les segments à garder, positionner les timecodes. Si vous avez déjà fait ce travail devant l'écran, vous savez que c'est trois heures pour une vidéo de 30 minutes. Avec les instructions vocales timecodées, l'agent IA fait ce repérage en lisant la transcription.

Prérequis

Avant de commencer, vous avez besoin de :

1. Une transcription timecodée de votre vidéo, au format SRT ou VTT. Vous la générez depuis votre enregistrement avec Whisper, CapCut, ou n'importe quel outil de transcription. Si vous voulez dicter vos instructions de montage à la voix — dire « coupe là » au moment exact — un mode vidéo timecodé est prévu dans KontexVoX (voir plus bas).
2. Un agent IA avec accès au système de fichiers : Claude Code, Codex CLI, ou Gemini. Pas un chatbot web.
3. La transcription exportée vers votre ordinateur.
Un pré-montage, c'est un fichier technique : une EDL avec des timecodes précis. Un chatbot web ne génère pas ce type de fichier dans votre dossier de travail. Il faut un agent qui lit la transcription et écrit le fichier en local.

Le mode vidéo timecodé (à venir)

KontexVoX today enrichit des photos : vous regardez une image, vous parlez, la description se grave dans l'EXIF. Pour la vidéo, le principe est le même mais le support change : vous regardez votre enregistrement, vous dictez vos instructions de montage au moment où elles vous viennent, et l'app génère un fichier timecodé (SRT ou JSON) relié à la vidéo. Ce mode est en développement. En attendant, transcrivez votre vidéo avec n'importe quel outil (Whisper, CapCut, Premiere) et lancez le prompt ci-dessous.

Ce que vous avez dicté : un exemple

Voici ce que contient la transcription SRT d'une vidéo de 20 minutes :

00:01:12,400 → « On garde, c'est l'intro. » 00:03:45,200 → « On coupe, j'ai bégayé. » 00:05:30,800 → « C'est le moment fort, garde en plan large. » 00:08:20,000 → « Raté, on recommence. Coupe. » 00:12:15,600 → « C'est bon, on garde tout. »

Ces instructions, vous les avez dites en regardant la vidéo. L'agent IA va parser la transcription, identifier les segments à garder et à couper, et générer une EDL avec les timecodes précis.

Le prompt

Lis le fichier de transcription timecodée (format SRT ou VTT) dans ce dossier. Analyse les commentaires vocaux pour identifier : les segments à garder (marqués par « on garde », « c'est bon », « moment fort »), les segments à couper (marqués par « on coupe », « raté », « à refaire »), et les segments potentiellement intéressants (sans marqueur explicite). Génère un fichier de cut préliminaire au format EDL (Edit Decision List) avec les timecodes de début et fin de chaque segment gardé. Inclut une note pour chaque segment avec le commentaire vocal correspondant.

Ce que l'IA produit avec ce prompt

Un fichier EDL avec les timecodes précis des segments à garder. Vous l'importez dans Premiere Pro, DaVinci Resolve, ou Final Cut. La timeline se construit automatiquement avec les bons segments. Le pré-montage est fait. Vous partez de là pour le montage final au lieu de partir de zéro.

La différence avec le prompt EDL pour Premiere/DaVinci : celui-ci génère un cut préliminaire complet (segments gardés/coupés), tandis que l'autre génère une EDL d'instructions ponctuelles (coupe là, garde ça). Les deux se complètent.

Outil recommandé : Claude Code

Claude Code est particulièrement adapté pour lire un transcript timecodé et générer un fichier EDL ou des markers. Il comprend les instructions de montage en langage naturel et les traduit en timecodes précis.

Questions fréquentes

Est-ce que le cut préliminaire remplace le montage ?

Non. C'est un point de départ. L'IA identifie les segments à garder d'après vos instructions vocales, mais le rythme, les transitions, le mixage audio restent votre travail. L'avantage, c'est que vous partez d'une timeline pré-remplie au lieu de tout positionner manuellement.

Est-ce que ça marche avec une transcription automatique sans annotations ?

Oui, mais c'est moins précis. Sans vos instructions (« on garde », « on coupe »), l'IA doit deviner les segments intéressants à partir du contenu. Ça marche, mais avec plus de faux positifs. L'idéal, c'est d'annoter à la voix en regardant le replay.

Est-ce que je peux cibler un format vertical (Shorts, Reels) ?

Pas avec ce prompt. Le pré-montage génère une EDL pour une timeline linéaire. Pour des clips verticaux, utilisez plutôt le prompt Extraction de moments forts.

Est-ce que l'EDL est compatible avec Final Cut Pro ?

L'EDL CMX 3600 est le standard universel, compatible avec Premiere Pro, DaVinci Resolve, et Final Cut Pro. Si vous utilisez Final Cut, demandez en plus un fichier XML FCPXML dans le prompt.