Akua estaba en la parada del tro-tro, con el teléfono pegado a la oreja, intentando que el asistente entendiera una sola frase. "Please, I'm coming, wait for me". Lo repitió tres veces, separando las palabras como si hablara con un niño. Nada. El asistente solo respondía si elegía "inglés" o "twi" antes de hablar, y su frase no era ni lo uno ni lo otro. Era lo que ella habla todos los días, lo que suena en Accra, en Kumasi y en cada llamada con su familia: una mezcla natural que ningún menú de configuración puede capturar.
El problema de elegir un idioma antes de hablar
La mayoría de los asistentes de voz obligan a decidir. ¿Inglés o twi? Esa pregunta no tiene sentido para quien creció hablando "I'm coming" dentro de una frase en twi, o "me pa wo kyɛw" dentro de una en inglés. La conversación real no funciona por turnos limpios. Una frase como "Me pɛ sɛ me call you later" no es un error, no es falta de dominio de ningún idioma, es la forma natural de hablar. Pedir que elija es pedir que traduzca su propio pensamiento antes de expresarlo, y eso rompe la fluidez de lo que quiere decir. El resultado: la gente termina hablando más lento, más forzado, o directamente abandona.
Cuando la voz se convierte en otro trámite
Akua no es un caso raro. Es la hermana que llama desde el extranjero y mezcla todo en una misma frase para que su madre la entienda. Es el amigo que pide un tro-tro y necesita decir rápido dónde va, sin pausas artificiales. La voz debería ser el canal más natural para hablar con una máquina, pero cuando el sistema no tolera el code-switching, se convierte en un trámite más: elegir idioma, hablar despacio, repetir, frustrarse.
Por eso una compañera de voz que entienda el inglés dentro del twi cotidiano no es un lujo. Es la diferencia entre un asistente que escucha de verdad y uno que solo obedece cuando hablas como él espera. Si la herramienta no reconoce la forma real de hablar, la gente deja de usarla, no por falta de interés, sino porque obliga a un esfuerzo que no vale la pena.
La respuesta que llega en el momento justo
Esa tarde, Akua probó Nkomo casi sin esperanza. Dijo la frase como le salía, sin preparar nada: "Please, me srɛ wo, I'm almost there". No eligió ningún idioma. El asistente respondió en el mismo tono natural, entendiendo el "please" y el "I'm almost there" dentro de la estructura twi, como haría cualquier persona en la calle. No hubo repetición. No hubo pausa incómoda. La conversación fluyó, y ella colgó con la sensación de que, por primera vez, no había tenido que traducirse a sí misma para que una máquina la entendiera.
La diferencia no está en un diccionario más grande ni en un modelo que sepa más palabras sueltas. Está en aceptar que el twi y el inglés no viven en cajas separadas en la cabeza de quien habla, y que un asistente que obliga a elegir está negando cómo funciona la lengua de verdad. En este post exploramos por qué los asistentes generales fallan justo en este punto, y en la historia de Kwame, cómo un obstáculo cotidiano se convierte en la clave para diseñar mejor.
Hablar como se habla, no como pide el sistema
Al final, la prueba de una buena herramienta de voz no es cuántos idiomas domina por separado, sino cómo maneja el momento en que una frase los mezcla. Akua sigue usando Nkomo, ahora sin pensarlo. Y eso es exactamente el punto: cuando el asistente entiende la forma natural de hablar, la tecnología desaparece y solo queda la conversación. Ya no hay que elegir entre ser entendido y sonar como uno mismo.
Comentarios
Todavía no hay comentarios.