Vous avez transformé votre PowerPoint en vidéo, posé une voix off, soigné chaque diapositive. Trois minutes plus tard, vos apprenants consultent leur téléphone. Rassurez-vous : le fond de votre formation est rarement en cause. Vos apprenants décrochent à cause de ce que l’écran et la voix exigent en même temps de leur attention.
En refermant cet article, vous saurez :
- Repérer les huit pièges qui font décrocher d’une vidéo de formation faite de diapositives et d’une voix off.
- Construire une diapositive que la voix complète au lieu de la répéter.
- Régler le rythme de vos animations et choisir la voix de votre vidéo.
Pourquoi décroche-t-on d’une vidéo de formation ?
On décroche d’une vidéo de formation quand elle demande plus d’attention que l’apprenant n’en a. Les chercheurs appellent cela la surcharge cognitive : notre mémoire de travail ne traite consciemment qu’une petite quantité d’éléments nouveaux à la fois. Au-delà, l’information passe, mais elle ne s’installe pas. La théorie de la charge cognitive, posée par le psychologue John Sweller en 1988, en a fait un principe de conception pédagogique.
Chacun sait ce qu’est l’attention. [...] Elle implique de se retirer de certaines choses pour pouvoir s’occuper efficacement des autres.
Au studio, nous aimons une image plus parlante que tous les schémas : l’attention est une scène de théâtre, et le projecteur n’en éclaire qu’une petite partie à la fois. Tout ce qui déborde du faisceau passe dans l’ombre. Concevoir une vidéo de formation, c’est donc faire le métier d’un metteur en scène : décider ce qui passe dans la lumière, et à quel moment.
- Retirer ce qui n’a pas de rôle dans la scène : décor, logo, texte en double.
- Faire entrer un élément à la fois, au moment où la voix l’amène.
- Laisser respirer entre deux idées, pour que la première s’installe avant la suivante.
Ce métier-là est le nôtre. Au studio, sur une formation de quinze modules narrée par une voix de synthèse, chaque vidéo est construite pour la voix, et non l’inverse. Les puces apparaissent au mot près, à l’instant où la voix les prononce. Chaque chapitre se referme sur des diapositives de synthèse. Ce sont ces gestes que nous vous livrons ici, sans rien garder sous le coude.
Pour les rendre visibles, nous avons fabriqué un petit module de démonstration sur un sujet que tout formateur devrait connaître : la courbe de l’oubli. En 1885, le psychologue allemand Hermann Ebbinghaus apprend par cœur des listes de syllabes sans signification. Puis il mesure le temps qu’il gagne à les réapprendre, vingt minutes, une heure, un jour ou un mois plus tard. Sa conclusion : l’oubli est brutal dans les premières heures, puis il ralentit. Vous apprendrez donc deux choses dans cet article, et nous espérons que vous oublierez la seconde moins vite que prévu.
Que mettre à l’écran quand la voix parle ?
Quand la voix parle, l’écran doit montrer ce que la voix ne peut pas dire : une courbe, un schéma, deux ou trois mots clés. Tout ce qui répète la voix ou la concurrence occupe l’attention sans rien apporter.
Je voudrais que l’on prenne soin de lui choisir un guide qui eût plutôt la tête bien faite que la tête bien pleine.
Montaigne le demandait au précepteur ; nous le demandons à la diapositive, bien faite plutôt que bien pleine.
Piège 1 : lire à l’écran ce que la voix dit déjà
C’est le piège le plus répandu, et il part d’une bonne intention : tout écrire pour que rien ne se perde. Le problème, c’est que l’apprenant lit plus vite que la voix ne parle. Il arrive au bout du paragraphe, attend la voix qui traîne derrière lui, puis décroche par ennui poli. Richard Mayer étudie l’apprentissage multimédia à l’université de Californie. Il appelle cela l’effet de redondance : on n’apprend pas mieux quand on ajoute à l’image et à la voix un texte imprimé qui dit la même chose.
L’effet ne concerne que le texte qui reprend la narration mot pour mot. Selon Mayer et Fiorella, il disparaît quand le texte à l’écran est court. Au studio, la diapositive porte donc des puces de quelques mots, et c’est la voix qui développe.
Par exemple : un formateur en sécurité écrit « Couper l’alimentation avant toute intervention » et laisse la voix expliquer pourquoi, au lieu d’afficher les quatre lignes du règlement.
L’erreur de correction à éviter : tout retirer. Une diapositive vide oblige l’apprenant à tout retenir de l’oreille ; trois mots clés lui servent de rampe.
Piège 2 : les sous-titres incrustés sur une diapositive déjà écrite
Sur une vidéo de diapositives, les sous-titres incrustés ajoutent une troisième lecture à l’écran : le titre, les puces, et maintenant la phrase de la voix qui défile en bas. L’œil fait des allers-retours et ne sait plus où se poser. C’est le même mécanisme que le piège 1, en plus visible.
Faut-il pour autant supprimer les sous-titres ? Surtout pas : pour un apprenant sourd ou malentendant, ils sont indispensables. La loi l’impose d’ailleurs à une partie des acteurs : services publics, grandes entreprises, et certains services fournis depuis le 28 juin 2025. La règle que nous appliquons : des sous-titres proposés, que l’apprenant active s’il en a besoin, jamais incrustés dans l’image.
Par exemple : sur votre plateforme de formation ou sur YouTube, chargez un fichier de sous-titres séparé plutôt que d’exporter une vidéo où ils sont gravés.
Piège 3 : la diapositive surchargée
Sept puces, un logo, un pictogramme, un encadré « Le saviez-vous ? », un bandeau de bas de page. Chaque élément semble utile pris seul ; ensemble, ils tirent le projecteur dans tous les sens. Mayer appelle cela le principe de cohérence : on apprend mieux quand le matériel superflu est retiré plutôt qu’ajouté.
Au studio, nos diapositives de contenu portent trois ou quatre puces. Quand une idée en demande davantage, elle mérite une deuxième diapositive, pas une police plus petite. Et le logo ? Il a sa place sur la diapositive de titre et sur la dernière, pas sur les quatre-vingts autres.
Par exemple : les informations « Le saviez-vous ? » vont très bien dans le cahier d’exercices ou dans le quiz de fin de module, où elles ne concurrencent rien.
Piège 4 : l’image qui décore au lieu d’expliquer
C’est le piège le plus élégant, car l’image est souvent très belle. Une femme pensive devant sa fenêtre illustre-t-elle la courbe de l’oubli ? Elle ne dit rien de la courbe. L’œil s’y arrête, l’admire, et l’idée passe sans lui.
On apprend mieux avec des mots et des images qu’avec des mots seuls.
Encore faut-il que l’image porte l’idée. Au studio, chaque notion importante reçoit son infographie, et chaque cas pratique ses scènes en roman-photo, avec les personnages et la situation dont parle la voix. Pour chaque image de vos diapositives, posez-vous une question simple : « Si je l’enlève, l’apprenant perd-il quelque chose ? » Si la réponse est non, l’image peut partir.
Par exemple : pour un module sur l’accueil d’un client, la photo d’une poignée de main décore ; le schéma des trois étapes de l’accueil explique.
Quand faire apparaître chaque élément d’une diapositive ?
Chaque élément d’une diapositive doit apparaître au moment où la voix l’amène, ni avant ni après. Arrivé au mauvais moment, le bon contenu fait décrocher lui aussi.
Piège 5 : tout afficher d’un coup
Les trois puces arrivent avec la diapositive. L’apprenant les lit toutes pendant que la voix commente encore la première : son œil est à la troisième idée, son oreille à la première, et son attention nulle part. Mayer parle de contiguïté temporelle : on apprend mieux quand les mots et les images qui se correspondent sont présentés en même temps.
Au studio, chaque puce apparaît au mot près, à l’instant où la voix la prononce. Dans PowerPoint, le réglage tient en deux menus : chaque puce reçoit son animation d’entrée, déclenchée « Au clic » ou « Après la précédente », et l’on cale le moment de chaque apparition sur la voix enregistrée. Il faut un peu de patience la première fois ; ensuite, c’est une habitude.
Par exemple : la voix dit « Premier réflexe, couper l’alimentation », et la puce « Couper l’alimentation » apparaît sur « couper », pas trente secondes plus tôt.
Piège 6 : l’image figée trop longtemps
À l’inverse, une même diapositive peut rester figée pendant que la voix enchaîne trois idées. L’œil n’a plus rien à suivre, et il part chercher ailleurs, souvent sur un téléphone. Notre règle se compte en idées plutôt qu’en secondes : chaque nouvelle idée de la voix amène un changement à l’écran, qu’il s’agisse d’une puce qui apparaît, d’un mot qui s’allume ou d’une nouvelle diapositive.
Attention toutefois : bouger davantage ne suffit pas. Une étude publiée en 2025 dans Educational Technology Research and Development a comparé, chez 312 futurs enseignants, des diapositives fixes et des diapositives animées, toutes avec voix off : les animations seules n’ont pas amélioré l’apprentissage. Ce qui a aidé, ce sont les indications qui montrent où regarder. Un changement à l’écran sert donc quand il désigne l’idée en cours.
Piège 7 : enchaîner sans respiration
Un chapitre se termine, et le suivant démarre dans la même seconde. L’apprenant n’a pas eu le temps de ranger la première idée qu’on lui en tend déjà une autre. Mayer parle de segmentation : on apprend mieux en segments qu’en bloc continu.
- Piège 5, tout d’un coup les trois puces arrivent avant que la voix ne les amène.
- Piège 6, l’image figée l’écran ne bouge plus pendant que la voix enchaîne trois idées.
- Piège 7, sans respiration le chapitre suivant démarre dans la même seconde.
- Version corrigée une puce par idée, au mot près, un silence entre les idées, puis la synthèse avant le chapitre suivant.
Au studio, chaque chapitre de contenu se referme de la même façon : deux secondes de silence, puis cinq diapositives « Points à retenir », muettes, huit secondes chacune. Muettes, parce que c’est le moment où l’apprenant relit et range, sans voix pour le presser. Entre deux phrases, la voix respire aussi : nous laissons au moins une seconde de silence, le temps que l’idée se pose.
Et la durée totale ? En 2014, Guo, Kim et Rubin ont étudié 6,9 millions de sessions de visionnage sur la plateforme edX. Le temps d’engagement médian y plafonnait à six minutes environ, quelle que soit la longueur de la vidéo. Leur recommandation : découper en segments de moins de six minutes. Elle mesure l’attention, pas l’apprentissage, mais le signal est net.
Quelle voix off choisir pour une vidéo de formation ?
Pour une vidéo de formation, choisissez une voix qui porte l’intention du texte et qui convient à votre public. Une voix monocorde endort ; une voix mal assortie au sujet distrait.
Piège 8 : la voix monocorde, ou mal assortie à son public
Une voix peut avoir un timbre magnifique et endormir toute une salle. Ce qui compte, c’est la mélodie de la phrase : les appuis sur les mots importants, les montées et les descentes, les pauses. Sans eux, toutes les idées ont le même poids, et l’oreille cesse de les trier.
Écoutez la même phrase de notre démonstration, dite trois fois. Les trois extraits ont été créés pour l’article. Les deux premiers utilisent la même voix de synthèse clonée : la version juste avec ElevenLabs, la version monocorde avec Chatterbox, un moteur libre qui tourne sur notre station. Le troisième utilise une voix du catalogue d’ElevenLabs.
Faut-il alors fuir les voix de synthèse ? Pas du tout. Mayer recommande une voix humaine plutôt qu’une voix de machine. Mais en 2017, une étude de Craig et Schroeder a montré qu’une voix de synthèse moderne était jugée à égalité avec une voix humaine, pour l’apprentissage comme pour la crédibilité. La façon dont la voix dit le texte compte donc davantage que la façon dont elle a été fabriquée.
La règle : avant de retenir une voix, écoutez-la sur une minute entière, avec votre public en tête. Une voix grave et posée convient à un module de conformité ; la même voix peut sembler glaciale dans un module sur l’accueil des enfants. Et si votre voix de synthèse bute sur certaines phrases, le problème vient souvent du texte : notre article sur les sept pièges d’écriture d’une voix off IA vous montre comment l’écrire pour l’oreille.
L’erreur de correction à éviter : surjouer. Une voix qui force l’enthousiasme sur chaque phrase fatigue aussi vite qu’une voix plate.
Les huit pièges en un coup d’œil
| Piège | Ce qu’on fait | Ce qui se passe | Comment corriger |
|---|---|---|---|
| 1. Texte recopié | Afficher le script à l’écran | L’apprenant lit plus vite que la voix, puis décroche | Quelques mots clés, la voix développe |
| 2. Sous-titres incrustés | Graver les sous-titres dans l’image | Trois textes se disputent l’œil | Des sous-titres qu’on active |
| 3. Diapositive surchargée | Ajouter logo, encadrés, pictogrammes | Le projecteur part dans tous les sens | Quatre puces au plus, rien de superflu |
| 4. Image décorative | Illustrer par une belle photo | L’œil s’arrête, l’idée passe | Une infographie qui porte la notion |
| 5. Tout d’un coup | Afficher toutes les puces avec la diapositive | L’œil devance la voix | Une puce au mot près |
| 6. Image figée | Garder le même écran pendant plusieurs idées | L’œil part chercher ailleurs | Un changement par idée |
| 7. Sans respiration | Enchaîner les chapitres sans pause | Rien n’a le temps de s’installer | Silence, puis synthèse muette |
| 8. Voix monocorde ou mal assortie | Garder la première voix venue | L’oreille cesse de trier | Écouter une minute entière, public en tête |
- Le texte l’écran affiche-t-il quelques mots clés, et non le script ?
- Les sous-titres sont-ils proposés en fichier séparé, et non gravés dans l’image ?
- La diapositive tient-elle en quatre puces, sans élément superflu ?
- Les images expliquent-elles quelque chose, ou décorent-elles ?
- Les apparitions chaque puce arrive-t-elle au moment où la voix l’amène ?
- Le rythme chaque nouvelle idée amène-t-elle un changement à l’écran ?
- Les respirations y a-t-il un silence entre les idées et une synthèse à la fin de chaque chapitre ?
- La voix l’avez-vous écoutée une minute entière, votre public en tête ?
Votre action pour aujourd’hui : ouvrez votre dernière vidéo de formation, passez-la à la liste de contrôle, et corrigez le premier piège que vous trouvez. Si vous préférez confier ce travail, c’est exactement ce que nous faisons avec nos formations e-learning clés en main. Les diapositives y sont construites pour la voix, les animations calées au mot près, et chaque vidéo est contrôlée avant d’être livrée. Pour la voix elle-même, notre offre de voix off et narration vous attend, et pour les infographies qui expliquent, notre motion design.
FAQ
Comment transformer un PowerPoint en vidéo ?
Dans PowerPoint, le menu Fichier, puis Exporter, puis Créer une vidéo produit un fichier MP4. Par défaut, chaque diapositive reste affichée cinq secondes ; si vous avez enregistré une narration et un minutage, choisissez « Utiliser le minutage et les narrations enregistrés », sinon vos animations ne suivront pas la voix. La page d’aide de Microsoft détaille chaque réglage.
Quelle durée pour une vidéo de formation ?
Visez des segments de moins de six minutes. C’est la recommandation de l’étude de Guo, Kim et Rubin, menée sur 6,9 millions de sessions de visionnage : au-delà, l’engagement médian ne progresse plus. Un module d’une heure se découpe donc en une dizaine de vidéos courtes.
Faut-il sous-titrer une vidéo de formation ?
Oui, en sous-titres que l’apprenant active, et non gravés dans l’image. Ils sont indispensables à un apprenant sourd ou malentendant, et le référentiel d’accessibilité français, le RGAA, les exige pour les vidéos des acteurs soumis à la loi. Pour les autres, c’est une affaire de respect envers tous les apprenants.
Que sont les principes de Mayer ?
Ce sont des règles de conception tirées des recherches de Richard Mayer sur l’apprentissage multimédia, réunies dans son livre Multimedia Learning. Six d’entre elles structurent cet article : la redondance, la cohérence, le signalement, la contiguïté temporelle, la segmentation et le principe multimédia.
Sources
- John Sweller, « Cognitive Load During Problem Solving: Effects on Learning », Cognitive Science, 12(2), p. 257-285, 1988, DOI 10.1207/s15516709cog1202_4.
- Richard E. Mayer, Multimedia Learning, 3e édition, Cambridge University Press, 2020, DOI 10.1017/9781316941355.
- Richard E. Mayer, « The Past, Present, and Future of the Cognitive Theory of Multimedia Learning », Educational Psychology Review, 36, article 8, 2024, DOI 10.1007/s10648-023-09842-1 ; définitions des principes, tableau 6 ; citation traduite de l’anglais par le studio.
- Richard E. Mayer et Logan Fiorella, « Principles for Reducing Extraneous Processing in Multimedia Learning », The Cambridge Handbook of Multimedia Learning, 2e édition, p. 279-315, 2014, DOI 10.1017/CBO9781139547369.015.
- Katharina Reuter, Marta Lazzara, Manuela Leuchter, « Static, dynamic, or human ? The role of slide dynamics and instructor cues in video lectures », Educational Technology Research and Development, 74, p. 469-492, 2025, DOI 10.1007/s11423-025-10572-0.
- Philip J. Guo, Juho Kim, Rob Rubin, « How video production affects student engagement: An empirical study of MOOC videos », Proceedings of the First ACM Conference on Learning @ Scale, p. 41-50, 2014, DOI 10.1145/2556325.2566239.
- Scotty D. Craig et Noah L. Schroeder, « Reconsidering the voice effect when learning from a virtual human », Computers & Education, 114, p. 193-205, 2017, DOI 10.1016/j.compedu.2017.07.003.
- Hermann Ebbinghaus, Über das Gedächtnis, 1885 ; traduction anglaise Memory: A Contribution to Experimental Psychology, 1913, texte en ligne, chapitre 7.
- William James, The Principles of Psychology, 1890, chapitre XI, texte en ligne ; citation traduite de l’anglais par le studio.
- Montaigne, Essais, livre I, chapitre 26, « De l’institution des enfants », texte sur Wikisource ; citation dans la traduction en français moderne de Guy de Pernon, d’après l’édition de 1595.
- Direction interministérielle du numérique, champ d’application des obligations d’accessibilité numérique (loi n° 2005-102, article 47 ; loi n° 2023-171) et RGAA 4.1.2, critère 4.3, consultés le 30/09/2026.
- Microsoft, « Convertir votre présentation en vidéo » et « Définir l’heure de début et la vitesse d’un effet d’animation », consultés le 30/09/2026.
- OpenAI, Whisper, code et modèles sous licence MIT.
- Resemble AI, Chatterbox, moteur de synthèse vocale sous licence MIT.
- Studio Ali Prod, méthode de construction des vidéos de modules (synchronisation au mot, diapositives « Points à retenir », contrôle d’intégralité par transcription) sur une formation de quinze modules ; diaporama de démonstration, images et extraits audio créés pour cet article.


