ഒരു AI സ്പീച്ച് ക്ലയന്റിനായി സ്കേലബിൾ വോയ്സ് ക്ലോണിംഗ് ഗുണനിലവാര മൂല്യനിർണ്ണയ പരിപാടി ഷായിപ്പ് എങ്ങനെയാണ് നടത്തിയത്
ഡെമോ-ക്വാളിറ്റി മുതൽ ഡിപ്ലോയ്മെന്റ്-റെഡി വരെ - ലാബ് മെട്രിക്സിനും യഥാർത്ഥ ലോക പ്രകടനത്തിനും ഇടയിലുള്ള വിടവ് നികത്താൻ ഒരു AI സ്പീച്ച് ക്ലയന്റിനെ ഘടനാപരമായ മനുഷ്യ വിലയിരുത്തൽ എങ്ങനെ സഹായിച്ചു.
പ്രോജക്റ്റ് അവലോകനം
വോയ്സ് ക്ലോണിംഗ് മോഡലുകൾ ഡെമോകളിൽ മികച്ചതായി തോന്നുമെങ്കിലും യഥാർത്ഥ ലോക ഉപയോഗത്തിൽ അവ ഇപ്പോഴും ബുദ്ധിമുട്ടുന്നു. അവരുടെ മോഡൽ യഥാർത്ഥത്തിൽ മെച്ചപ്പെടുന്നുണ്ടോ എന്ന് അളക്കാൻ ക്ലയന്റിന് വിശ്വസനീയമായ ഒരു മാർഗം ആവശ്യമായിരുന്നു - പ്രത്യേകിച്ച് ഇന്ത്യൻ ഇംഗ്ലീഷിന്, അത് മുൻഗണനാ വിന്യാസ വിപണിയായിരുന്നു.
മൂന്ന് പ്രധാന ബിസിനസ്സ് ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാൻ കഴിയുന്ന ഒരു മനുഷ്യ വിലയിരുത്തൽ പരിപാടി രൂപകൽപ്പന ചെയ്യുന്നതിനും കൈകാര്യം ചെയ്യുന്നതിനുമാണ് ഷായിപ്പിനെ കൊണ്ടുവന്നത്:
- സംസാരം സ്വാഭാവികമായി തോന്നുന്നുണ്ടോ?
- അത് ഇപ്പോഴും യഥാർത്ഥ സ്പീക്കർ പോലെ തന്നെയാണോ തോന്നുന്നത്?
- ഉൽപാദന ഉപയോഗത്തിന് ഇത് സുരക്ഷിതവും വിശ്വസനീയവുമാണോ?
ഓട്ടോമേറ്റഡ് മെട്രിക്സുകളെ മാത്രം ആശ്രയിക്കുന്നതിനുപകരം, പരിശീലനം ലഭിച്ച മനുഷ്യ അവലോകകരെ ഉപയോഗിച്ച് യഥാർത്ഥ ഓഡിയോ ഔട്ട്പുട്ടുകൾ വിലയിരുത്തുകയും മോഡലിന് ഇപ്പോഴും എവിടെയാണ് പോരായ്മ സംഭവിച്ചതെന്ന് തിരിച്ചറിയുകയും ചെയ്തു.
കീ ഡാറ്റാസെറ്റ് മെട്രിക്കുകൾ
കേസ് ഉപയോഗിക്കുക
വോയ്സ് ക്ലോണിംഗ് ഗുണനിലവാര വിലയിരുത്തൽ
പദ്ധതിയുടെ കാലാവധി
ക്സനുമ്ക്സ ആഴ്ച
പരിശോധിച്ച സാമ്പിളുകൾ
12,400 സിന്തസൈസ് ചെയ്ത ഓഡിയോ ക്ലിപ്പുകൾ
അനോട്ടേറ്ററുകൾ വിന്യസിച്ചു
പരിശീലനം ലഭിച്ച 48 ഇംഗ്ലീഷ് ഇവാലുവേറ്റർമാർ
ടിടിഎസും വോയ്സ് ക്ലോണിംഗ് ഗുണനിലവാരവും വിലയിരുത്തുന്നതിലെ വെല്ലുവിളികൾ
- മോഡൽ നന്നായി പ്രവർത്തിക്കേണ്ടതുണ്ടായിരുന്നു ഒന്നിലധികം ഇംഗ്ലീഷ് ഉച്ചാരണങ്ങൾ, പ്രത്യേകിച്ച് ഇന്ത്യൻ ഇംഗ്ലീഷ്.
- ലാബ് മെട്രിക്സിൽ മാത്രമല്ല, അന്തിമ ഉപയോക്താക്കൾക്ക് പ്രാധാന്യമുള്ള രീതിയിൽ ഓഡിയോ ഗുണനിലവാരം മെച്ചപ്പെടുത്തേണ്ടതുണ്ടായിരുന്നു.
- തിരിച്ചറിയാൻ ടീമിന് വ്യക്തമായ ഒരു മാർഗം ആവശ്യമായിരുന്നു സംഭാഷണ ഔട്ട്പുട്ടിൽ എന്താണ് തെറ്റ് സംഭവിച്ചത്?.
- ദൈർഘ്യമേറിയ ഓഡിയോ ക്ലിപ്പുകൾ ചിലപ്പോൾ കാലക്രമേണ യഥാർത്ഥ സ്പീക്കറുടെ ഐഡന്റിറ്റി നഷ്ടപ്പെട്ടു.
- ക്ലയന്റിന് ചെക്കുകളും ആവശ്യമായിരുന്നു സുരക്ഷ, ആൾമാറാട്ട സാധ്യത, വാട്ടർമാർക്ക് സാന്നിധ്യം.
പരിഹാരം: AI ശബ്ദ ഗുണനിലവാരത്തിനായുള്ള മനുഷ്യ വിലയിരുത്തൽ ചട്ടക്കൂട്
വിലയിരുത്തൽ തന്ത്രം
സ്വാഭാവികത, വ്യക്തത, ശബ്ദ സമാനത, സ്ഥിരത, സുരക്ഷ എന്നിവ വിലയിരുത്തുന്നതിനായി ഷായിപ്പ് ഒരു ഘടനാപരമായ അവലോകന ചട്ടക്കൂട് നിർമ്മിച്ചു.
മാനുഷിക അവലോകനം സ്കെയിലിൽ
പരിശീലനം ലഭിച്ച 48 മൂല്യനിർണ്ണയക്കാർ ഇന്ത്യൻ ഇംഗ്ലീഷ്, ന്യൂട്രൽ അമേരിക്കൻ ഇംഗ്ലീഷ്, ഒരു ഹിംഗ്ലീഷ് സബ്-ട്രാക്ക് എന്നിവയിലുടനീളമുള്ള 12,400 ഓഡിയോ സാമ്പിളുകൾ അവലോകനം ചെയ്തു.
മൂന്ന് ഭാഗങ്ങളുള്ള വിലയിരുത്തൽ
- ഓരോ ക്ലിപ്പും എത്രത്തോളം സ്വാഭാവികവും മനസ്സിലാക്കാവുന്നതുമാണെന്ന് അവലോകകർ റേറ്റുചെയ്തു.
- ഏത് പതിപ്പാണ് മികച്ചതെന്ന് തിരിച്ചറിയാൻ അവർ ജോഡി ക്ലിപ്പുകൾ താരതമ്യം ചെയ്തു.
- അസ്വാഭാവിക താളം, പിച്ചിലെ പ്രശ്നങ്ങൾ, സ്പീക്കർ ഡ്രിഫ്റ്റ് തുടങ്ങിയ ആവർത്തിച്ചുള്ള ഗുണനിലവാര പ്രശ്നങ്ങൾ അവർ ടാഗ് ചെയ്തു.
ഗുണനിലവാര നിയന്ത്രണം
സ്കോറിംഗ് സ്ഥിരതയുള്ളതും വിശ്വസനീയവുമായി നിലനിർത്താൻ ഷായിപ്പ് കാലിബ്രേഷൻ ടാസ്ക്കുകൾ, ഗോൾഡ്-സ്റ്റാൻഡേർഡ് പരിശോധനകൾ, ആവർത്തിച്ചുള്ള അവലോകനങ്ങൾ, ക്യുഎ മോണിറ്ററിംഗ് എന്നിവ ഉപയോഗിച്ചു.
പ്രവർത്തനക്ഷമമായ ഫീഡ്ബാക്ക് ലൂപ്പ്
ഓരോ സ്പ്രിന്റിൽ നിന്നുമുള്ള കണ്ടെത്തലുകൾ ക്ലയന്റിന്റെ ട്യൂണിംഗ് പ്രക്രിയയിലേക്ക് തിരികെ കൊണ്ടുവന്നു, ഇത് ഒന്നിലധികം റൗണ്ടുകളിൽ മോഡലിനെ മെച്ചപ്പെടുത്താൻ സഹായിച്ചു.
പ്രോജക്റ്റ് വ്യാപ്തി: ഭാഷകൾ, ഉച്ചാരണങ്ങൾ & അവലോകന കവറേജ്
| ഏരിയ | സ്കോപ്പ് |
|---|---|
| ഭാഷ | ഇംഗ്ലീഷ് |
| മുൻഗണനാ ആക്സന്റുകൾ | ഇന്ത്യൻ ഇംഗ്ലീഷ്, ന്യൂട്രൽ അമേരിക്കൻ ഇംഗ്ലീഷ് |
| സെക്കൻഡറി കവറേജ് | ബ്രിട്ടീഷ് ഇംഗ്ലീഷ്, ഹിംഗ്ലീഷ് സബ്-ട്രാക്ക് |
| സാമ്പിൾ തരങ്ങൾ | ചെറിയ റഫറൻസ് ക്ലിപ്പുകൾ, കുറച്ച് ഷോട്ടുകളുള്ള സാമ്പിളുകൾ, ദീർഘമായ പ്രസംഗം |
| അവലോകന ഔട്ട്പുട്ട് | ഗുണനിലവാര റേറ്റിംഗുകൾ, മുൻഗണന ലേബലുകൾ, പ്രശ്ന ടാഗിംഗ് |
| ഇടപഴകൽ ദൈർഘ്യം | 12 ആഴ്ച |
ഫലങ്ങൾ: വോയ്സ് ക്ലോണിംഗിൽ അളക്കാവുന്ന മെച്ചപ്പെടുത്തലുകൾ.
- ശബ്ദ നിലവാരത്തിൽ വ്യക്തമായ പുരോഗതി: മോഡലിന്റെ മൊത്തത്തിലുള്ള ഗുണനിലവാര സ്കോർ 3.41 ൽ നിന്ന് 4.12 ആയി മെച്ചപ്പെട്ടു, ഇത് സംസാരം കൂടുതൽ സ്വാഭാവികവും നിർമ്മാണത്തിന് തയ്യാറായതുമാണെന്ന് കാണിക്കുന്നു.
- മികച്ച സ്പീക്കർ പൊരുത്തം: യഥാർത്ഥ സ്പീക്കറുടെ ശബ്ദം സംരക്ഷിക്കുന്നതിൽ സിസ്റ്റം വളരെ മികച്ചതായി, സമാനത 0.71 ൽ നിന്ന് 0.87 ആയി മെച്ചപ്പെടുത്തി.
- ശ്രദ്ധിക്കപ്പെടാവുന്ന കുറവ് പിശകുകൾ: ബേസ്ലൈനിലെ 31% സാമ്പിളുകളിൽ നിന്ന് അവസാന സ്പ്രിന്റ് ആയപ്പോഴേക്കും സംസാര പ്രശ്നങ്ങൾ 11% ആയി കുറഞ്ഞു.
- ശക്തമായ ഗ്രഹണശേഷി: ഇന്ത്യൻ ഇംഗ്ലീഷിലെ അന്തിമ പദ പിശക് നിരക്ക് ലക്ഷ്യ പരിധി മറികടന്ന് 4.8% ൽ എത്തി.
- സുരക്ഷിതമായ വിന്യാസ സന്നദ്ധത: ആൾമാറാട്ട അപകടസാധ്യതാ പരിശോധന, വാട്ടർമാർക്ക് പരിശോധന എന്നിവയുൾപ്പെടെയുള്ള പ്രധാന സുരക്ഷാ പരിശോധനകളിലെ ശക്തമായ പ്രകടനവും വിലയിരുത്തൽ സ്ഥിരീകരിച്ചു.
ആത്മനിഷ്ഠമായ ഓഡിയോ നിലവാരത്തെ അളക്കാവുന്ന ഒരു മെച്ചപ്പെടുത്തൽ പരിപാടിയാക്കി മാറ്റാൻ Shaip ഞങ്ങളെ സഹായിച്ചു. അവരുടെ വിലയിരുത്തൽ ചട്ടക്കൂട് എന്ത് പരിഹരിക്കണം, എവിടെ മെച്ചപ്പെടുത്തണം, എങ്ങനെ ആത്മവിശ്വാസത്തോടെ ഉൽപ്പാദനത്തിലേക്ക് അടുക്കാം എന്നതിനെക്കുറിച്ചുള്ള വ്യക്തമായ സൂചനകൾ ഞങ്ങൾക്ക് നൽകി.
— AI സ്പീച്ച് പ്രോഡക്റ്റ് ലീഡർ