Vous avez streamé pendant 3 heures avec OBS. Le replay est là, la vidéo fait 12 Go. Vous savez qu'il y a des moments forts dedans, mais les retrouver dans 3 heures de vidéo, c'est un travail de moine. À la main, vous scrubbez, vous écoutez, vous notez les timecodes, vous oubliez la moitié. Sur des dizaines de moments potentiels, on abandonne.
Des applis de derushage IA existent pour ça. Elles analysent votre replay, détectent les pics audio, les mots-clés, les changements de rythme, et génèrent des clips verticaux avec sous-titres animés. Ça marche, et c'est rapide. Mais elles entendent des patterns, pas du sens. Un rire peut être nerveux ou enthousiaste. « Non mais c'est pas possible » peut être de l'énervement ou de l'émerveillement. L'appli ne fait pas la différence.
Un agent IA qui lit votre transcription timecodée peut aller plus loin. Les outils de derushage utilisent déjà des agents IA, et ils sont bons. Mais ils travaillent avec ce qu'ils ont : une transcription brute. Ils manquent du contexte que seul vous avez. Pourquoi ce moment est drôle et pas gênant ? Pourquoi c'est le move du siècle et pas un échec ordinaire ? KontexVoX, c'est le moyen de rajouter ces informations à la voix, au moment où vous regardez le replay, pour que l'IA — qu'elle soit dans Captions, dans Opus Clip, ou dans votre agent local — ait enfin tout ce qu'il faut pour comprendre.
Prérequis
Avant de commencer, vous avez besoin de :
Le mode vidéo timecodé (à venir)
KontexVoX today enrichit des photos : vous regardez une image, vous parlez, la description se grave dans l'EXIF. Pour la vidéo, le principe est le même mais le support change : vous regardez le replay, vous commentez au moment où ça se passe, et l'app génère un fichier timecodé (SRT ou JSON) relié à la vidéo — pas une description EXIF par image. Ce mode est en développement. En attendant, vous pouvez transcrire votre replay avec n'importe quel outil (Whisper, CapCut, Premiere) et lancer le prompt ci-dessous. Le résultat est le même.
Ce que les applis entendent vs ce que vous voyez
Prenons trois extraits d'une transcription de live de 3 heures :
L'IA de Captions ou Opus Clip détecte les pics : l'exclamation à 01:47, le rire à 01:12, l'émotion à 02:33. Elle génère trois clips. C'est correct. Mais elle ne sait pas pourquoi le move est « du siècle » — elle ne voit pas les deux tentatives ratées avant, l'arc de tension. Elle ne sait pas que « je pleure » est du rire, pas des larmes. Elle ne sait pas que le moment à 02:33 est un merci sincère après 3 heures de stream, pas une fin polie.
Ce contexte, c'est vous qui l'avez. KontexVoX, c'est le moyen de le transmettre à l'IA. Vous regardez le replay, vous dites à voix haute : « là c'est le move du siècle, il l'a raté deux fois avant, garde 30 secondes avant la réussite ». L'IA — qu'elle soit dans Captions, dans Opus Clip, ou dans votre agent local — récupère non plus une transcription brute, mais une transcription enrichie de votre contexte humain. C'est l'information manquante qui fait la différence entre un clip correct et un clip vraiment bon.
Le prompt
Ce que l'IA produit avec ce prompt
Une liste de clips en Markdown. Chaque clip a :
Son timecode de début et de fin
Le passage transcript mot pour mot
Une note explicative : pourquoi c'est un moment fort (rire, emphase, exclamation, changement de ton)
Vous récupérez un document de travail, pas un montage. À partir de cette liste, vous allez dans Premiere, DaVinci ou CapCut, vous extrayez les clips aux timecodes indiqués, et vous publiez. Le travail de repérage, qui aurait demandé 3 heures de visionnage, est fait en minutes.
La précision n'est pas parfaite : l'IA identifie les candidats, mais le jugement final vous revient. Sur 20 clips proposés, vous en gardez 10 ou 12. C'est toujours plus rapide que de tout re-regarder.
L'avantage KontexVoX (quand le mode vidéo sortira)
Les applis de derushage facturent un abonnement premium pour le volume : Captions est à 25 dollars par mois, Opus Clip à 19 dollars. Pour un créateur qui stream 3 heures par semaine, c'est 300 dollars par an. KontexVoX proposera le mode vidéo timecodé pour quelques euros par mois — un abonnement léger, pas un abonnement pro.
Et ce n'est pas l'un ou l'autre. L'idée est de combiner les deux : vous enrichissez votre replay avec KontexVoX (annotations vocales qui donnent le contexte et le pourquoi de chaque moment), puis vous passez le tout à votre appli de derushage préférée. Captions ou Opus Clip récupère non plus une transcription brute, mais une transcription annotée par un humain. Les clips générés sont meilleurs, mieux ciblés, avec le sens que l'appli seule ne pouvait pas deviner. KontexVoX avant Captions, pas contre Captions.
Outil recommandé : Gemini
Gemini est adapté pour l'analyse de longs transcripts et l'identification de patterns. Sur 3 heures de transcription, il faut un modèle qui gère un contexte long tout en repérant les nuances. Gemini gère bien les longues entrées.
Questions fréquentes
Est-ce que l'IA identifie les bons moments ?
Elle identifie les candidats. Les patterns linguistiques (« attends », « non mais », « incroyable », rires) sont de bons indicateurs, mais pas infaillibles. Sur 20 clips proposés, certains seront des faux positifs. Le jugement final vous revient — mais vous jugez en 30 secondes par clip, pas en 3 heures de re-visionnage.
Est-ce que ça marche sur un replay sans annotations ?
Oui, avec la transcription automatique. Whisper ou CapCut transcrivent la piste audio de votre replay. L'IA repère les moments d'émotion dans le texte transcript. C'est moins précis que si vous aviez annoté les moments à la voix (« ça c'est bon » au moment exact), mais ça marche déjà bien sur les exclamations et les rires.
Est-ce que je peux cibler un format spécifique (Shorts, Reels, TikTok) ?
Oui. Ajoutez dans le prompt : « Chaque clip doit durer entre 15 et 60 secondes pour un format Short/Reel. » L'IA ajustera le timecode de fin en conséquence. Pour des clips plus longs (extraits YouTube), demandez 1 à 3 minutes.
Pourquoi payer KontexVoX si j'ai déjà une appli de derushage ?
C'est justement fait pour fonctionner ensemble. Vous enrichissez avec KontexVoX (annotations vocales, contexte humain), puis vous passez le tout à Captions ou Opus Clip qui produisent les clips. L'appli de derushage récupère une transcription annotée, pas une transcription brute. Les clips sont meilleurs. Le mode vidéo timecodé est en développement, l'abonnement sera léger — quelques euros par mois. En attendant, le prompt ci-dessus marche déjà avec n'importe quelle transcription.