
Le mode Vidéo arrive dans KontexVoX : ta voix transcrite en temps réel, synchronisée au timecode. Chaque mot relié à l'image. Le monteur, ou l'IA, saura exactement quoi faire. L'app démarre avec les modes photo — inscris-toi pour être prévenu du mode Vidéo.
Tu reviens d'un tournage avec 2 heures de rushes.
Le dérushage automatique enlève les silences. Mais il ne sait pas quel plan est bon, quel moment est fort, quelle prise est la meilleure. Ça, seul un humain le sait. Et cet humain, c'est toi.
Un geste pour garder, un geste pour supprimer — le tri se fait à toute vitesse. Les monteurs ont déjà leur système de débrouille pour ça. Mais il y a un moment où tu veux dire : "À 3 minutes 12, il y a un bon plan. Je veux rajouter tel effet motion design à tel endroit. Je veux qu'on aille dans telle direction."
Le fait de le dire, ça évite de l'écrire. Et c'est juste relié au bon moment de la vidéo.
Tu revois ta vidéo. Tu la regardes en entier. Sur toute la vidéo, tu fais des commentaires à l'oral.
"Ça c'est le plan large de l'entrée, on voit bien le bâtiment."
"Là c'est bon, la lumière est top, on garde ça pour l'intro."
"Celui-là est raté, on coupe."
"À ce moment précis, elle sourit, c'est le moment fort du film."
Cette voix sera transcrite en temps réel, synchronisée au timecode de la vidéo. Chaque mot, chaque groupe de mots, chaque idée, relié à une image.
À la fin, tu auras une vidéo enrichie d'une transcription timecodée complète.
Cette transcription, c'est :
Une review complète de tes rushes, ancrée dans le temps. Un cahier des charges de montage, intégré au fichier. Un script exploitable par un monteur humain OU par un agent IA.
Important : le mode Vidéo est en développement — il arrivera après le lancement des modes photo, et ce sera un mode PRO payant, proposé en add-on distinct des modes photo (voir la grille tarifaire). Cette page décrit le revisionnage de vidéos existantes ; le mode Capture permettra aussi de filmer en direct tout en parlant, par exemple pour filmer chaque page d'un classeur en disant ce qu'il contient. C'est un usage différent, plus proche de l'inventaire vidéo. On parle de ça dans le blog.
Tu revois tes rushes et tu commentes en les regardant. À la fin, tu as ton dérushage fait. Plus besoin de tout revoir. Tu envoies le tout à ton agent IA qui pré-monte à partir de tes instructions timecodées.
Au lieu d'écrire un document de montage séparé qui se désynchronise du footage, tu revois la vidéo et tu parles. Le monteur reçoit la vidéo avec les instructions intégrées, au bon timecode. Plus d'approximation.
Le transcript timecodé est exploitable par un agent IA (Claude Code, Codex, Gemini). L'IA lit les instructions, identifie les plans à garder, génère un cut préliminaire ou une EDL pour Premiere/DaVinci.