Un assistant vocal destiné aux Ghanéens doit être évalué là où les conversations ont vraiment lieu, y compris dans un véhicule en mouvement. Le calme d’une pièce peut masquer les difficultés que révèlent le moteur, les voix voisines, les interruptions et le passage naturel du twi à l’anglais.
En 1996, à Kourou, le premier vol d’Ariane 5 bascule en quelques secondes. Une partie du logiciel de navigation venait d’Ariane 4. Elle avait fonctionné auparavant, mais les conditions de vol d’Ariane 5 sortaient de la plage pour laquelle certains calculs avaient été conçus. Une conversion numérique provoqua une erreur, les systèmes inertiels s’arrêtèrent et la fusée fut détruite peu après le décollage.
Le rapport officiel de la commission d’enquête d’Ariane 501, présidée par Jacques-Louis Lions, documente précisément cet enchaînement. Le logiciel avait un passé rassurant. Le nouveau contexte a révélé ce que ce passé ne permettait pas de voir.
Une pièce calme ne représente pas une conversation ghanéenne
Sur une table, dans une chambre silencieuse, une commande vocale arrive proprement. Une seule personne parle. Elle attend son tour. Elle tient le téléphone à une distance stable. Chaque mot entre dans une phrase bien délimitée.
Dans un trotro à Accra ou Kumasi, la parole suit rarement ce scénario. Le moteur couvre certaines syllabes. Une autre conversation démarre à côté. Quelqu’un appelle depuis l’arrière. Le locuteur hésite, reprend sa phrase, change de langue ou interrompt la réponse avant qu’elle se termine.
Ces conditions ne sont pas des exceptions gênantes autour du produit. Elles font partie de l’usage à comprendre.
Une démonstration réussie au calme répond à une question étroite: le système peut-il traiter une voix nette dans un environnement contrôlé? Elle ne permet pas de conclure qu’il suivra une conversation réelle entre une personne et son assistant pendant un trajet.
Le parallèle avec Ariane 5 tient ici. Un système peut fonctionner dans le cadre où on l’a observé, puis rencontrer une limite dès que le contexte change. Pour la voix, le contexte comprend le bruit, le rythme, les interruptions et les langues réellement mélangées dans une même pensée.
Le code-switching fait partie du signal
Beaucoup de Ghanéens ne choisissent pas une langue avant chaque phrase. Le twi porte parfois l’intention, l’anglais précise un terme, puis la phrase revient au twi sans prévenir. C’est une conversation ordinaire, pas une anomalie à corriger.
Une évaluation utile doit donc conserver cette réalité. Elle doit examiner les passages de langue au milieu d’une phrase comme ceux qui arrivent entre deux phrases. Le modèle public cité dans les recherches sur la reconnaissance vocale anglais-twi couvre justement ces deux formes de code-switching. Sa fiche signale aussi des faiblesses liées aux variations orthographiques et aux segments monolingues. Ce type de limite déclarée compte, car il indique où chercher les erreurs au lieu de laisser une moyenne générale les cacher.
Le problème apparaît aussi quand un système exige que l’utilisateur sépare artificiellement ses langues. Une phrase naturelle devient alors deux commandes préparées pour la machine. Ce que l’IA perd lorsqu’elle oblige à séparer le twi et l’anglais dépasse la simple transcription: le contexte, le ton et l’intention peuvent se déplacer avec le changement de langue.
Nkomo est conçu pour des échanges naturels en twi et en anglais ghanéen, à l’écrit comme à l’oral. En mode vocal, on maintient pour parler, on peut interrompre naturellement et on entend la réponse. Ces fonctions définissent ce qu’il faut tester. Elles ne remplacent pas les résultats d’une évaluation menée dans les conditions visées.
Un bon test cherche les endroits où la conversation casse
Évaluer la voix dans un trotro ne consiste pas à enregistrer une scène bruyante, constater quelques réponses correctes, puis déclarer le travail terminé. Il faut chercher les ruptures.
Le système garde-t-il le fil après une interruption? Que se passe-t-il lorsqu’un mot twi se trouve au milieu d’une phrase anglaise? L’utilisateur sait-il qu’une demande a échoué? Peut-il recommencer sans deviner ce qui vient de se passer?
Cette dernière question compte autant que la reconnaissance elle-même. Nkomo affiche les erreurs au lieu de les avaler en silence. Un échec visible permet à la personne de répéter, reformuler ou choisir d’écrire. Un échec invisible lui laisse croire que sa parole a été ignorée ou mal comprise sans raison.
La confidentialité doit subir le même réalisme. Une conversation en déplacement peut contenir un nom, un problème familial ou une information que l’on ne souhaite pas envoyer automatiquement. Nkomo propose trois choix explicites pour l’accès au cloud: jamais, demander à chaque fois ou autoriser pour cette session. L’historique reste sur l’appareil sous le contrôle de l’utilisateur; lorsqu’il est désactivé, il est purgé immédiatement. L’export des données et la suppression du compte se font en une action.
Tester le trajet complet, pas une phrase idéale
Le test pertinent commence avant le premier mot et se termine après la réponse. Il couvre le consentement au cloud, la prise de parole, le changement de langue, l’interruption, l’erreur visible et le contrôle de l’historique.
Il doit aussi distinguer les résultats. Une bonne performance sur des phrases bilingues ne prouve pas automatiquement une bonne performance sur du twi seul, de l’anglais seul ou plusieurs variantes d’écriture. Chaque condition mérite ses propres exemples et ses propres constats.
La commission Ariane 501 n’a pas conclu que le logiciel était inutile. Elle a montré qu’un héritage validé dans un contexte ne suffisait pas pour un autre domaine de fonctionnement. La leçon vaut pour la technologie vocale: les conditions réelles définissent le test.
Le trotro devient alors un laboratoire exigeant. Il oblige à mesurer la conversation telle qu’elle se vit, avec son bruit, ses reprises et son mélange de langues. C’est là que les promesses cessent d’être des phrases de démonstration et deviennent des critères vérifiables.
Commentaires
Pas encore de commentaires.