L'interface vocale : la fin du clavier par défaut
Le verrou technique a sauté. Où la dictée fait vraiment gagner du temps dans une PME, où elle ne sert à rien, et le risque qu'elle fait courir à vos données.
Le clavier n’est plus l’interface par défaut, il est devenu une option
Une équipe de Stanford, de l’université de Washington et de Baidu a mesuré la saisie de texte sur smartphone. La voix atteint 161 mots par minute contre 53 au clavier tactile en anglais, soit trois fois plus vite, avec un taux d’erreur inférieur de 20 % (Ruan et al., 2016). L’écart n’est pas marginal.
Pendant des décennies, le clavier est resté la seule interface sérieuse, parce que la reconnaissance vocale ne comprenait ni le contexte ni le vocabulaire métier. C’est ce verrou qui a sauté. La chaîne actuelle ne se contente plus de transcrire : elle nettoie les hésitations, reconnaît les termes propres à votre activité, et un modèle de langage structure ensuite le texte en informations exploitables.
Deux précisions, parce qu’elles conditionnent la suite. La mesure porte sur du smartphone, en anglais, dans une pièce calme, sur des phrases courtes. Elle ne dit rien de la saisie sur un clavier physique, où l’écart se resserre nettement.
Ce qui ne change pas : la validation de l’action et la responsabilité sur la donnée restent humaines. Et si l’on vous parle de l’Acte européen sur l’accessibilité, applicable depuis le 28 juin 2025, il ne vous impose rien ici : il encadre les produits et services que vous mettez sur le marché, pas l’outillage interne de vos équipes.
Vous payez un expert métier au tarif de la frappe
Ce coût n’apparaît sur aucune facture. Il se calcule, et vous seul avez les quatre variables :
nombre de collaborateurs concernés × durée quotidienne de saisie × jours travaillés dans l’année × coût horaire chargé.
Prenez le processus le plus lourd chez vous et renseignez-les. Nous ne mettons pas de valeurs par défaut dans cette formule : un chiffre moyen serait faux chez vous, et vous le sauriez tout de suite.
Le second coût ne se calcule pas, et il est souvent le plus lourd. Pour s’épargner la frappe en fin de journée, le collaborateur ampute la donnée. Il écrit « client visité, incident résolu » au lieu de décrire la panne, la pièce en cause et ce qu’il faut prévoir au prochain passage. Ce qui disparaît là, c’est la mémoire technique de l’entreprise, perdue à cause de l’inconfort d’un clavier tactile.
Le compte rendu qui se fait sur le parking
Prenons un commercial en tournée. Aujourd’hui, il sort de rendez-vous, cherche une connexion, et tape laborieusement son résumé dans le CRM, quand il le fait le soir même.
Avec une chaîne vocale, il ouvre une application en regagnant son véhicule et dicte en langage naturel : « rendez-vous chez Dupont, le stock de pompes est vide, relancer dans trois semaines pour une commande de cinquante pièces ». La transcription convertit l’audio en texte, puis un modèle d’extraction isole les entités métier, le client, le produit, la quantité, l’échéance, et remplit les champs correspondants. L’audio n’est pas conservé.
Où ça ne sert à rien. Trois situations, et un risque
L’open space. Personne ne dictera un compte rendu à voix haute au milieu de ses collègues. La voix est un outil de mobilité, voiture, chantier, tournée, ou de bureau fermé. Dans un plateau ouvert, l’outil sera installé et jamais utilisé.
Le travail de précision. Construire un tableau financier, éditer une architecture technique, corriger une clause : le clavier et la souris restent maîtres. La voix capte de l’information brute, elle ne manipule pas une structure.
La relecture, qui mange une partie du gain. Le facteur trois mesuré en laboratoire porte sur des phrases courtes transcrites sans enjeu. Dès que le texte part chez un client ou alimente un système, il se relit et se corrige, et cette relecture prend souvent autant de temps que la dictée. Le gain réel sur un document engageant est plus proche du double que du triple. C’est encore beaucoup, mais annoncez le bon chiffre.
Et le risque : le shadow IT. Si vos équipes se débrouillent seules avec des applications grand public pour transcrire réunions et mémos, vos échanges commerciaux et techniques partent sur des serveurs tiers, sans que vous sachiez ni où ni pour combien de temps. C’est le scénario par défaut quand rien n’est fourni. Une chaîne de transcription hébergée sur vos machines ou chez un fournisseur européen coûte moins cher que l’incident qu’elle évite.
Et chez vous ? Le test qui coûte 10 minutes
Ne lancez pas de projet de transformation vocale. Cette semaine, repérez le processus de saisie le plus détesté par vos équipes de terrain, celui qu’on repousse au soir.
Puis faites deux vérifications. Demandez à un collaborateur de remplir un champ avec la dictée native de son téléphone et chronométrez l’écart avec la frappe, relecture comprise. Et ouvrez le logiciel concerné pour vérifier s’il expose une interface permettant d’y injecter du texte depuis l’extérieur. Sans cette ouverture, le sujet n’est pas la voix, c’est votre outil.
Sources
Stanford / University of Washington / Baidu, 2016
Directive (UE) 2019/882, transposée à l'article L412-13 du Code de la consommation.
Journal officiel de l'Union européenne, 2019