
Lecture de vidéo sur Okou
Lire une vidéo au lieu de la regarder : d'abord une transcription horodatée, puis les quelques images qui méritent vraiment un coup d'œil. Gratuit pour l'instant.
Exécution · Aucune mise en place · Enregistré pour le suivi d'usage, actuellement 0 crédit
Un agent ne peut pas regarder une heure de vidéo, et vous non plus avant le déjeuner. Alors il la lit : les paroles avec des horodatages, qui forment un index de tout ce qui s'est passé, puis des images tirées des deux ou trois moments qu'il faut voir plutôt que lire.
Cela fonctionne depuis un lien, depuis un fichier partagé dans la conversation ou depuis un fichier sur disque, et les appels ne coûtent rien pour l'instant. Cette combinaison en fait la première étape sensée pour tout enregistrement qui arrive avec une question.
Ce qu'est Lecture de vidéo
Les enregistrements s'accumulent plus vite que personne ne les revoit : démos, démonstrations guidées, entretiens, réunions, séances captées parce que cela semblait important sur le moment.
La façon efficace d'en venir à bout n'est pas de le regarder. C'est de lire la transcription, de repérer les moments importants par leurs horodatages et de ne regarder que ceux-là. Ce sont deux étapes, et elles sont toutes les deux ici.
La transcription renvoie les paroles avec des plages de temps, ce qui sert aussi de sommaire. L'extraction d'images prend une liste d'instants et renvoie les images, ce dont vous avez besoin quand la réponse est à l'écran plutôt que dans le son.
Comme les appels ne coûtent rien pour l'instant, il n'y a aucune raison d'être sélectif sur les enregistrements à lire. Un flux qui indexe tous les enregistrements coûte autant qu'un flux qui n'en indexe aucun.
Ce que Lecture de vidéo sait faire
Ce qu'un agent peut en faire, et ce qui revient quand il le fait.
Portée et limites
Ce qu'il ne fait pas, dit d'emblée, pour que personne ne bâtisse un workflow autour de quelque chose qui est hors périmètre.
Des mots et des images, pas de la compréhension
Le service donne à l'agent la transcription et les images. Comprendre ce qui s'est passé est ensuite sa propre lecture, généralement meilleure qu'un résumé produit sans ni l'une ni les autres.
C'est le son qui porte la transcription
Un enregistrement d'écran muet ne donne rien à lire. Dans ce cas, les images à intervalles constituent toute la méthode, et les instants doivent venir d'ailleurs que des paroles.
Un long enregistrement fait une longue transcription
Une heure de parole représente beaucoup de texte à donner d'un coup à un modèle. Travailler par tranches est plus fiable que tout demander en une passe.
Il transcrit, il n'identifie pas les intervenants
Vous obtenez ce qui a été dit et quand. Qui l'a dit se déduit du contexte de la transcription et non du service : un flux qui a besoin de l'attribution doit le dire et le vérifier.
Ce que coûte Lecture de vidéo
Les services web sont facturés en crédits par appel, pas par token. Il n'y a pas de facture fournisseur séparée à rapprocher.
zero videoLes appels sont enregistrés pour que vous les voyiez et coûtent actuellement 0 crédit, dans la limite d'un usage raisonnable. L'extraction d'images se fait sur la machine où tourne l'agent, elle ne coûte donc rien d'autre que le temps. Aucun forfait de transcription en dessous et aucun tarif à la minute à surveiller.
Mise en place et accès
Rien à mettre en place
Rien à connecter. Pas de compte de transcription, pas de clé, pas de forfait. Donnez à un agent le lien d'un enregistrement et il pourra le lire dès sa première exécution.
Qui peut l'utiliser
Lire un enregistrement qu'on lui a confié fait partie de ce qu'un agent fait des fichiers qu'il reçoit : il n'y a donc pas d'autorisation distincte à accorder ici. Ce qui le limite, c'est ce à quoi vous lui donnez accès.
Ce que les équipes font avec Lecture de vidéo
Transformer un enregistrement en notes
Une démo, un entretien ou une séance devient un résumé horodaté avec les trois captures qui portent l'essentiel, produit tant que la réunion est encore fraîche.
Trouver le moment dans une longue séance
Quelqu'un affirme que la réponse s'y trouve. La transcription la situe en quelques secondes et une image le confirme, plutôt qu'une personne qui fouille la timeline.
Rendre la vidéo consultable
Transcrivez les enregistrements à mesure qu'ils arrivent et conservez le texte. Une bibliothèque impossible à fouiller devient une bibliothèque dont un agent peut tirer des réponses.
Quand ne pas utiliser Lecture de vidéo
À éviter quand il faut décrire un enregistrement muet, où les images à intervalles sont la vraie méthode et la transcription reste vide. À éviter quand un procès-verbal formel est exigé, car une transcription automatique est un document de travail et non un compte rendu officiel. Et évitez de transcrire une heure en une passe quand la question ne concerne qu'un passage.
Comment cela s'appelle ailleurs
La même chose porte plusieurs noms sur le marché. Si vous avez cherché l'un d'eux, voici à quoi il correspond ici.
API de transcription vidéo
Transformer la parole d'un enregistrement en texte utilisable par un programme. C'est la première moitié de ceci, sans compte ni clé de votre côté.
Reconnaissance vocale
Le nom courant de l'étape sous-jacente. Ici, elle revient avec des plages de temps, ce qui la rend utile pour naviguer et pas seulement pour lire.
Vidéo vers texte
Ce que l'on cherche quand on a un enregistrement et qu'il faut quelque chose de lisible, citable et consultable.
Extraction d'images
Tirer des images fixes à des instants choisis. C'est la partie qu'on oublie de demander, et c'est elle qui rend la transcription exploitable quand la réponse est à l'écran.
Notes de réunion depuis un enregistrement
Le flux habituel construit avec les deux moitiés : la transcription pour ce qui a été dit, les images pour ce qui a été montré, et l'agent qui rédige.
Lecture de vidéo comparé
Lecture de vidéo face à un service de transcription
Un service de transcription vous donne une interface, un éditeur et un archivage, et facture à la minute. Ceci donne à un agent le texte et les images au milieu d'un flux, et ne facture rien pour l'instant.
Lecture de vidéo face à un preneur de notes de réunion
Un preneur de notes rejoint l'appel et produit des notes comme produit fini. Ceci fonctionne sur n'importe quel enregistrement que vous avez déjà, y compris ceux que personne n'avait prévu de bien capter.
Lecture de vidéo face à demander à un modèle de regarder la vidéo
Confier un enregistrement entier est lent et coûteux. Lire la transcription puis regarder trois images mène à la même réponse pour une fraction du travail.
En bref
Le moyen le moins cher de rendre un enregistrement utilisable : la transcription d'abord comme index, les images ensuite pour les moments qui réclament des yeux. Gratuit pour l'instant, donc aucune raison de ne pas lire chaque enregistrement qui arrive.
Questions fréquentes
Combien coûte la transcription ?
Les appels sont enregistrés et coûtent actuellement 0 crédit, dans la limite d'un usage raisonnable. L'extraction d'images tourne en local et ne coûte que du temps.
D'où peut venir la vidéo ?
D'un lien, d'un fichier partagé dans la conversation ou d'un fichier sur la machine où tourne l'agent.
Y a-t-il des horodatages ?
Oui, une plage par ligne par défaut, et c'est ce qui fait fonctionner la transcription comme index. Vous pouvez demander du texte simple quand elle part dans un texte rédigé.
Me dit-il qui parlait ?
Non. Vous obtenez ce qui a été dit et quand. L'attribution doit venir du contexte, et un flux qui en dépend doit vérifier plutôt que supposer.
Peut-il lire un enregistrement d'écran muet ?
Il n'y a rien à transcrire : la méthode devient les images à intervalles, avec des instants choisis plutôt que trouvés dans les paroles.
Quelle durée de vidéo peut-il traiter ?
Les longues fonctionnent, mais une heure de parole fait beaucoup de texte à traiter d'un coup. Tranche par tranche est le schéma le plus fiable.
Quelles langues transcrit-il ?
Les langues courantes prises en charge par le modèle sous-jacent. Pour une langue rare, mieux vaut transcrire un court échantillon avant de bâtir dessus.
Puis-je avoir un résumé plutôt qu'une transcription ?
Demandez-le. Le service renvoie la transcription et les images, et le résumé est écrit par l'agent qui les a lues, ce qui lui permet de pointer l'horodatage d'où il vient.
Comment demander Lecture de vidéo
Vous décrivez ce que vous voulez en langage courant. L'agent en déduit le service dont il a besoin et fait les appels.
“Transcris cette séance, résume les décisions avec les horodatages et extrais les images des trois moments qui méritent une capture.”
“Quelque part dans cet appel d'une heure, ils parlent des tarifs. Trouve le passage, cite-le et montre-moi ce qu'il y avait à l'écran.”
“Transcris tous les enregistrements de ce dossier et dis-moi lesquels mentionnent l'intégration des nouveaux utilisateurs.”