在嘈杂街头,一段自然语音往往会同时带着环境声、急促语速和英语与 Twi 的切换。对话式 AI 必须沿着说话人的意思继续理解,而不是等对方先选好语言、放慢速度,再重新说一遍。
下面的 Kwame 是一个虚构的复合人物。傍晚,他站在库马西一家 provision shop 外,左手拎着面包和鸡蛋,右手按住手机说话。店门口的收音机开得很响,一辆车从路边经过,前面排队的人正催老板找零。Kwame 得赶紧确认母亲交代的东西,否则回家后才发现买错,商店可能已经关门。
他先用英语问:“Should I get the large one?” 还没等 AI 回完,他想起母亲刚才的原话,马上改用 Twi:“Dabi, ɔkaa sɛ ketewa no, anaa?”
问题没有变,语言变了。第二句里的 “no” 指向前一句正在比较的商品,“anaa” 则把整句话变成一次急切的确认。如果系统把每种语言当成独立会话,Kwame 得停下来选 Twi,再从头解释“大盒”和“小盒”分别是什么。此刻他没有空重建上下文。队伍已经往前挪,老板正在等他开口。
人说话时,不会先整理成干净的语言样本
现实中的双语对话很少按产品菜单来进行。人会在一句话中换语言,也会先用英语提出问题,再用 Twi 补充、纠正或强调。切换常常发生在最需要系统记住上下文的时候。
街边录音还多了一层难度。说话人可能缩短句子,提高音量,吞掉部分音节,或者在听见回答时直接插话。背景里同时有音乐、交谈声和车辆声。对人来说,这仍是一段连续对话。对只等待“标准输入”的工具来说,它可能变成两段互不相干的录音。
KasaSpeech 收录了 54,855 段人工转写录音,总时长超过 95 小时,来自加纳各地的说话人,覆盖日常话题和交流场景中的自然英语与 Twi 切换。这个规模提醒我们,code-switching 不是偶尔出现的例外。它本来就是许多人组织想法、确认细节和表达语气的方式。
真正需要跟住的是意图
Kwame 的第二句话没有完整重复商品名称,因为他默认听者记得上一句。人类听者会自然把两句接起来:他先问要不要买大的,随后根据母亲的话改口,确认是不是小的。
对话式 AI 也应该沿着这条意图线工作。它需要保留当前谈话对象,识别后一句是在修正前一句,并让插话继续作用于同一个问题。语言标签可以帮助系统处理输入,却不该成为说话人的额外任务。
这也是为什么“先选英语或 Twi”会制造摩擦。选择动作看似很小,真正的代价却是打断思路。人在赶时间、腾不出手或周围很吵时,更容易放弃追问,或者为了配合机器而说出一串生硬、失真的句子。关于这种断裂,[这篇讨论语言预选会丢掉什么的文章](/blog/zh-CN/1935年的错色油墨实验-揭示了先选语言会丢掉什么-c527633c/)给出了另一个角度。
一次插话,决定对话还能不能继续
就在老板再次问 Kwame 要哪一种时,手机开始回答他最初的英语问题。Kwame 没有等它念完。他按住说话,直接插入那句 Twi 修正。
Nkomo 支持自然的 Twi 和 Ghanaian English 文字及语音对话。语音模式下,他可以按住说话、自然打断,再听回复。系统面对的是正在推进的一次对话,而不是要求他把生活现场清理干净后重新录制。
这一刻的关键并非回答听起来多漂亮,而是 Kwame 能否及时得到与当前上下文一致的确认。如果系统没听清或处理失败,也不能安静地跳过去。Nkomo 会把错误显示出来,让他知道需要重说。沉默最危险,因为它会让人误以为系统已经理解。
Kwame 看了一眼屏幕,确认系统接住了他的改口。他向老板指了指小盒,把手机放回口袋。回家后,桌上放着母亲要的那一种,而不是一次被语言选择菜单打断后留下的猜测。
跟住说话人,也要让他掌握数据去向
理解自然对话不等于忽略隐私。街边的一句话可能提到家人、购物安排或其他不想长期保留的内容。说话人应该清楚知道什么会到云端,什么留在设备上,以及记录会保留多久。
Nkomo 提供明确的云端同意选项:永不允许、每次询问,或仅本次会话允许。历史记录保存在设备上,由使用者控制;关闭历史后,记录会立即清除。数据可以一键导出,账户也可以一键删除。登录通过 magic link 完成,无需再记一个密码。
好的语音体验应该同时完成两件事:跟住人的表达,也把控制权留给人。下一次有人站在 provision shop 外,从英语转到 Twi 时,他需要继续说下去,不需要先替机器整理语言。
评论
暂无评论。