2004 में अमेरिका के Mojave Desert में DARPA Grand Challenge शुरू हुआ तो स्वचालित गाड़ियों के सामने लगभग 142 मील का रास्ता था। पंद्रह गाड़ियाँ उतरीं, एक भी मंज़िल तक नहीं पहुँची। Carnegie Mellon की Sandstorm सबसे आगे गई, फिर लगभग 7.4 मील पर रुक गई।
यह विफलता किसी प्रस्तुति के दौरान नहीं हुई थी। असली भूभाग ने उन कमियों को सामने रखा जिन्हें सीमित परीक्षण छिपा सकते थे। मोड़, धूल, रास्ते की अनिश्चितता और लगातार बदलती परिस्थिति ने साफ कर दिया कि नियंत्रित माहौल में चलना और वास्तविक दुनिया में भरोसे के साथ चलना अलग उपलब्धियाँ हैं।
प्रयोगशाला सही जवाब देती है, पर अधूरा सवाल पूछती है
रिकॉर्डिंग स्टूडियो में माइक्रोफोन पास होता है। वक्ता पूरा वाक्य बोलता है। पृष्ठभूमि में हॉर्न, इंजन, सहयात्री और सड़क का शोर नहीं होता। ऐसे नमूने यह बताने में मदद करते हैं कि कोई प्रणाली साफ ऑडियो को कितना समझती है।
लेकिन उपयोगकर्ता का असली सवाल दूसरा है: क्या यह मुझे उस समय समझेगी जब मैं सामान्य ढंग से बोल रहा हूँ?
एक trotro में कोई कह सकता है, “Mepa wo kyɛw, remind me sɛ merekɔ fie a…” फिर सामने वाले की बात सुनकर रुक सकता है, वाक्य बदल सकता है या जवाब के बीच में नई बात जोड़ सकता है। यहाँ code-switching कोई असामान्य मामला नहीं है। यही बातचीत का स्वाभाविक रूप है।
इसीलिए केवल Twi और English के अलग-अलग परीक्षण पर्याप्त नहीं हैं। एक सार्वजनिक ASR model card भी intra-sentential और inter-sentential English-Twi code-switching को अपनी कसौटी मानता है, साथ ही orthographic variation और monolingual segments में कमजोरियाँ दर्ज करता है। ऐसी सीमाएँ लिखना उपयोगी है, क्योंकि “Twi समर्थित है” जैसा छोटा दावा यह नहीं बताता कि किस तरह की Twi, किस तरह की English और किन परिस्थितियों में परिणाम जाँचा गया।
Trotro किन कमियों को जल्दी पकड़ लेता है
पहली कमी शोर में सामने आती है। सड़क और इंजन की आवाज़ शब्दों के हिस्से ढक सकती है। प्रणाली को अंदाज़ा लगाकर अर्थ गढ़ने के बजाय अपनी समस्या दिखानी चाहिए। Nkomo इसी कारण त्रुटि को चुपचाप निगलता नहीं है। कुछ गलत हुआ तो उपयोगकर्ता को दिखाई देता है।
दूसरी कमी बातचीत की लय में दिखती है। लोग तैयार भाषण नहीं देते। वे रुकते हैं, दोबारा शुरू करते हैं और सामने वाले की प्रतिक्रिया देखकर दिशा बदलते हैं। Nkomo के voice mode में आप बोलने के लिए दबाकर रख सकते हैं, उत्तर सुन सकते हैं और स्वाभाविक ढंग से बीच में रोक सकते हैं। यह व्यवहार उस बातचीत के अधिक करीब है जो Accra, Kumasi या diaspora के किसी घर में सचमुच होती है।
तीसरी कमी भाषा बदलते समय आती है। एक ही विचार Twi में शुरू होकर Ghanaian English में पूरा हो सकता है। प्रणाली को हर मोड़ पर उपयोगकर्ता से भाषा चुनवानी पड़े तो बातचीत का बोझ इंसान पर लौट आता है। [English और Twi के बीच संदर्भ बचाए रखने का यह उदाहरण](/blog/hi/english-और-twi-switching-कोजो-ने-संदर्भ-खोए-बिना-आवेदन-का-मसौदा-सुधारा-77f76113/) दिखाता है कि भाषा बदलना केवल शब्द पहचानने का प्रश्न नहीं है। पिछले वाक्य का अर्थ भी साथ चलना चाहिए।
कठिन परिस्थिति में गोपनीयता भी परीक्षा देती है
सार्वजनिक जगह पर बोलना केवल accuracy का सवाल नहीं है। यह तय करना भी जरूरी है कि आपकी बात कहाँ जाएगी और कितनी देर रहेगी।
Nkomo में cloud consent के तीन स्पष्ट विकल्प हैं: कभी नहीं, हर बार पूछें, या इस session के लिए अनुमति दें। Device history आपके नियंत्रण में रहती है। उसे बंद करते ही वह तुरंत मिट जाती है। Data export और account deletion भी एक tap में उपलब्ध हैं।
ये नियंत्रण खासकर तब मायने रखते हैं जब बातचीत में परिवार, काम, पैसे या स्वास्थ्य से जुड़ी निजी बात आ जाए। उपयोगकर्ता को भेजने से पहले अपनी सीमा चुनने का मौका चाहिए। [निजी सवाल से पहले cloud consent चुनने की यह स्थिति](/blog/hi/nkomo-क्लाउड-सहमति-मेन्सिमा-ने-निजी-सवाल-से-पहले-अपनी-सीमा-कैसे-चुनी-041f8cb3/) इसी फैसले को ठोस रूप में दिखाती है।
Passwordless magic-link sign-in भी एक छोटा, व्यावहारिक लाभ देता है। याद रखने के लिए नया password नहीं बनाना पड़ता। फिर भी सुविधा को गोपनीयता का विकल्प नहीं माना जा सकता। दोनों अलग समस्याएँ हैं और दोनों के नियंत्रण साफ होने चाहिए।
असली परीक्षा का अर्थ पूर्णता नहीं, ईमानदार प्रगति है
2005 में DARPA ने वही चुनौती फिर आयोजित की। Stanford की Stanley, Sebastian Thrun के नेतृत्व में, लगभग 132 मील का रास्ता सात घंटे से कम समय में पूरा करके जीती। पाँच गाड़ियाँ अंत तक पहुँचीं। इस विकास का विस्तृत तकनीकी विवरण Journal of Field Robotics में प्रकाशित “Stanley: The Robot that Won the DARPA Grand Challenge” में दर्ज है।
एक साल में हुआ बदलाव यह साबित नहीं करता कि कठिन समस्या हमेशा जल्दी हल हो जाती है। वह इससे अधिक उपयोगी बात दिखाता है: वास्तविक परिस्थिति में मिली विफलता अगली कसौटी को बेहतर बनाती है।
Speech technology के लिए trotro वही काम कर सकता है जो Mojave Desert ने स्वचालित गाड़ियों के लिए किया था। वह अच्छे demo को रोज़मर्रा की उपयोगिता से अलग करता है। सही लक्ष्य यह दावा करना नहीं कि हर आवाज़ हर बार समझ ली जाएगी। सही लक्ष्य है प्राकृतिक Twi और Ghanaian English को उन्हीं परिस्थितियों में परखना जहाँ लोग बोलते हैं, सीमाएँ साफ बताना, गलती दिखाना और उपयोगकर्ता को अपने data पर नियंत्रण देना।
टिप्पणियाँ
अभी कोई टिप्पणी नहीं।