ഒരു AI സ്പീച്ച് ക്ലയന്റിനായി സ്കേലബിൾ വോയ്‌സ് ക്ലോണിംഗ് ഗുണനിലവാര മൂല്യനിർണ്ണയ പരിപാടി ഷായിപ്പ് എങ്ങനെയാണ് നടത്തിയത്

ഡെമോ-ക്വാളിറ്റി മുതൽ ഡിപ്ലോയ്‌മെന്റ്-റെഡി വരെ - ലാബ് മെട്രിക്‌സിനും യഥാർത്ഥ ലോക പ്രകടനത്തിനും ഇടയിലുള്ള വിടവ് നികത്താൻ ഒരു AI സ്പീച്ച് ക്ലയന്റിനെ ഘടനാപരമായ മനുഷ്യ വിലയിരുത്തൽ എങ്ങനെ സഹായിച്ചു.

വോയ്‌സ് ക്ലോണിംഗ്

പ്രോജക്റ്റ് അവലോകനം

വോയ്‌സ് ക്ലോണിംഗ് മോഡലുകൾ ഡെമോകളിൽ മികച്ചതായി തോന്നുമെങ്കിലും യഥാർത്ഥ ലോക ഉപയോഗത്തിൽ അവ ഇപ്പോഴും ബുദ്ധിമുട്ടുന്നു. അവരുടെ മോഡൽ യഥാർത്ഥത്തിൽ മെച്ചപ്പെടുന്നുണ്ടോ എന്ന് അളക്കാൻ ക്ലയന്റിന് വിശ്വസനീയമായ ഒരു മാർഗം ആവശ്യമായിരുന്നു - പ്രത്യേകിച്ച് ഇന്ത്യൻ ഇംഗ്ലീഷിന്, അത് മുൻഗണനാ വിന്യാസ വിപണിയായിരുന്നു.

മൂന്ന് പ്രധാന ബിസിനസ്സ് ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകാൻ കഴിയുന്ന ഒരു മനുഷ്യ വിലയിരുത്തൽ പരിപാടി രൂപകൽപ്പന ചെയ്യുന്നതിനും കൈകാര്യം ചെയ്യുന്നതിനുമാണ് ഷായിപ്പിനെ കൊണ്ടുവന്നത്:

  • സംസാരം സ്വാഭാവികമായി തോന്നുന്നുണ്ടോ?
  • അത് ഇപ്പോഴും യഥാർത്ഥ സ്പീക്കർ പോലെ തന്നെയാണോ തോന്നുന്നത്?
  • ഉൽ‌പാദന ഉപയോഗത്തിന് ഇത് സുരക്ഷിതവും വിശ്വസനീയവുമാണോ?

ഓട്ടോമേറ്റഡ് മെട്രിക്സുകളെ മാത്രം ആശ്രയിക്കുന്നതിനുപകരം, പരിശീലനം ലഭിച്ച മനുഷ്യ അവലോകകരെ ഉപയോഗിച്ച് യഥാർത്ഥ ഓഡിയോ ഔട്ട്‌പുട്ടുകൾ വിലയിരുത്തുകയും മോഡലിന് ഇപ്പോഴും എവിടെയാണ് പോരായ്മ സംഭവിച്ചതെന്ന് തിരിച്ചറിയുകയും ചെയ്തു.

വോയ്‌സ് ക്ലോണിംഗ് നിലവാരം

കീ ഡാറ്റാസെറ്റ് മെട്രിക്കുകൾ

കേസ് ഉപയോഗിക്കുക

വോയ്‌സ് ക്ലോണിംഗ് ഗുണനിലവാര വിലയിരുത്തൽ

പദ്ധതിയുടെ കാലാവധി

ക്സനുമ്ക്സ ആഴ്ച

പരിശോധിച്ച സാമ്പിളുകൾ

12,400 സിന്തസൈസ് ചെയ്ത ഓഡിയോ ക്ലിപ്പുകൾ

അനോട്ടേറ്ററുകൾ വിന്യസിച്ചു

പരിശീലനം ലഭിച്ച 48 ഇംഗ്ലീഷ് ഇവാലുവേറ്റർമാർ

ടിടിഎസും വോയ്‌സ് ക്ലോണിംഗ് ഗുണനിലവാരവും വിലയിരുത്തുന്നതിലെ വെല്ലുവിളികൾ

  • മോഡൽ നന്നായി പ്രവർത്തിക്കേണ്ടതുണ്ടായിരുന്നു ഒന്നിലധികം ഇംഗ്ലീഷ് ഉച്ചാരണങ്ങൾ, പ്രത്യേകിച്ച് ഇന്ത്യൻ ഇംഗ്ലീഷ്.
  • ലാബ് മെട്രിക്‌സിൽ മാത്രമല്ല, അന്തിമ ഉപയോക്താക്കൾക്ക് പ്രാധാന്യമുള്ള രീതിയിൽ ഓഡിയോ ഗുണനിലവാരം മെച്ചപ്പെടുത്തേണ്ടതുണ്ടായിരുന്നു.
  • തിരിച്ചറിയാൻ ടീമിന് വ്യക്തമായ ഒരു മാർഗം ആവശ്യമായിരുന്നു സംഭാഷണ ഔട്ട്‌പുട്ടിൽ എന്താണ് തെറ്റ് സംഭവിച്ചത്?.
  • ദൈർഘ്യമേറിയ ഓഡിയോ ക്ലിപ്പുകൾ ചിലപ്പോൾ കാലക്രമേണ യഥാർത്ഥ സ്പീക്കറുടെ ഐഡന്റിറ്റി നഷ്ടപ്പെട്ടു.
  • ക്ലയന്റിന് ചെക്കുകളും ആവശ്യമായിരുന്നു സുരക്ഷ, ആൾമാറാട്ട സാധ്യത, വാട്ടർമാർക്ക് സാന്നിധ്യം.

പരിഹാരം: AI ശബ്ദ ഗുണനിലവാരത്തിനായുള്ള മനുഷ്യ വിലയിരുത്തൽ ചട്ടക്കൂട്

വിലയിരുത്തൽ തന്ത്രം

സ്വാഭാവികത, വ്യക്തത, ശബ്ദ സമാനത, സ്ഥിരത, സുരക്ഷ എന്നിവ വിലയിരുത്തുന്നതിനായി ഷായിപ്പ് ഒരു ഘടനാപരമായ അവലോകന ചട്ടക്കൂട് നിർമ്മിച്ചു.

മാനുഷിക അവലോകനം സ്കെയിലിൽ

പരിശീലനം ലഭിച്ച 48 മൂല്യനിർണ്ണയക്കാർ ഇന്ത്യൻ ഇംഗ്ലീഷ്, ന്യൂട്രൽ അമേരിക്കൻ ഇംഗ്ലീഷ്, ഒരു ഹിംഗ്ലീഷ് സബ്-ട്രാക്ക് എന്നിവയിലുടനീളമുള്ള 12,400 ഓഡിയോ സാമ്പിളുകൾ അവലോകനം ചെയ്തു.

മൂന്ന് ഭാഗങ്ങളുള്ള വിലയിരുത്തൽ

  • ഓരോ ക്ലിപ്പും എത്രത്തോളം സ്വാഭാവികവും മനസ്സിലാക്കാവുന്നതുമാണെന്ന് അവലോകകർ റേറ്റുചെയ്‌തു.
  • ഏത് പതിപ്പാണ് മികച്ചതെന്ന് തിരിച്ചറിയാൻ അവർ ജോഡി ക്ലിപ്പുകൾ താരതമ്യം ചെയ്തു.
  • അസ്വാഭാവിക താളം, പിച്ചിലെ പ്രശ്നങ്ങൾ, സ്പീക്കർ ഡ്രിഫ്റ്റ് തുടങ്ങിയ ആവർത്തിച്ചുള്ള ഗുണനിലവാര പ്രശ്നങ്ങൾ അവർ ടാഗ് ചെയ്തു.

ഗുണനിലവാര നിയന്ത്രണം

സ്കോറിംഗ് സ്ഥിരതയുള്ളതും വിശ്വസനീയവുമായി നിലനിർത്താൻ ഷായിപ്പ് കാലിബ്രേഷൻ ടാസ്‌ക്കുകൾ, ഗോൾഡ്-സ്റ്റാൻഡേർഡ് പരിശോധനകൾ, ആവർത്തിച്ചുള്ള അവലോകനങ്ങൾ, ക്യുഎ മോണിറ്ററിംഗ് എന്നിവ ഉപയോഗിച്ചു.

പ്രവർത്തനക്ഷമമായ ഫീഡ്‌ബാക്ക് ലൂപ്പ്

ഓരോ സ്പ്രിന്റിൽ നിന്നുമുള്ള കണ്ടെത്തലുകൾ ക്ലയന്റിന്റെ ട്യൂണിംഗ് പ്രക്രിയയിലേക്ക് തിരികെ കൊണ്ടുവന്നു, ഇത് ഒന്നിലധികം റൗണ്ടുകളിൽ മോഡലിനെ മെച്ചപ്പെടുത്താൻ സഹായിച്ചു.

പ്രോജക്റ്റ് വ്യാപ്തി: ഭാഷകൾ, ഉച്ചാരണങ്ങൾ & അവലോകന കവറേജ്

ഏരിയ സ്കോപ്പ്
ഭാഷ ഇംഗ്ലീഷ്
മുൻഗണനാ ആക്‌സന്റുകൾ ഇന്ത്യൻ ഇംഗ്ലീഷ്, ന്യൂട്രൽ അമേരിക്കൻ ഇംഗ്ലീഷ്
സെക്കൻഡറി കവറേജ് ബ്രിട്ടീഷ് ഇംഗ്ലീഷ്, ഹിംഗ്ലീഷ് സബ്-ട്രാക്ക്
സാമ്പിൾ തരങ്ങൾ ചെറിയ റഫറൻസ് ക്ലിപ്പുകൾ, കുറച്ച് ഷോട്ടുകളുള്ള സാമ്പിളുകൾ, ദീർഘമായ പ്രസംഗം
അവലോകന ഔട്ട്പുട്ട് ഗുണനിലവാര റേറ്റിംഗുകൾ, മുൻഗണന ലേബലുകൾ, പ്രശ്ന ടാഗിംഗ്
ഇടപഴകൽ ദൈർഘ്യം 12 ആഴ്ച

ഫലങ്ങൾ: വോയ്‌സ് ക്ലോണിംഗിൽ അളക്കാവുന്ന മെച്ചപ്പെടുത്തലുകൾ.

  • ശബ്‌ദ നിലവാരത്തിൽ വ്യക്തമായ പുരോഗതി: മോഡലിന്റെ മൊത്തത്തിലുള്ള ഗുണനിലവാര സ്കോർ 3.41 ൽ നിന്ന് 4.12 ആയി മെച്ചപ്പെട്ടു, ഇത് സംസാരം കൂടുതൽ സ്വാഭാവികവും നിർമ്മാണത്തിന് തയ്യാറായതുമാണെന്ന് കാണിക്കുന്നു.
  • മികച്ച സ്പീക്കർ പൊരുത്തം: യഥാർത്ഥ സ്പീക്കറുടെ ശബ്ദം സംരക്ഷിക്കുന്നതിൽ സിസ്റ്റം വളരെ മികച്ചതായി, സമാനത 0.71 ൽ നിന്ന് 0.87 ആയി മെച്ചപ്പെടുത്തി.
  • ശ്രദ്ധിക്കപ്പെടാവുന്ന കുറവ് പിശകുകൾ: ബേസ്‌ലൈനിലെ 31% സാമ്പിളുകളിൽ നിന്ന് അവസാന സ്പ്രിന്റ് ആയപ്പോഴേക്കും സംസാര പ്രശ്നങ്ങൾ 11% ആയി കുറഞ്ഞു.
  • ശക്തമായ ഗ്രഹണശേഷി: ഇന്ത്യൻ ഇംഗ്ലീഷിലെ അന്തിമ പദ പിശക് നിരക്ക് ലക്ഷ്യ പരിധി മറികടന്ന് 4.8% ൽ എത്തി.
  • സുരക്ഷിതമായ വിന്യാസ സന്നദ്ധത: ആൾമാറാട്ട അപകടസാധ്യതാ പരിശോധന, വാട്ടർമാർക്ക് പരിശോധന എന്നിവയുൾപ്പെടെയുള്ള പ്രധാന സുരക്ഷാ പരിശോധനകളിലെ ശക്തമായ പ്രകടനവും വിലയിരുത്തൽ സ്ഥിരീകരിച്ചു.
ഏറ്റവും പ്രധാനമായി, മോഡൽ ഗുണനിലവാരം വിലയിരുത്താൻ മാത്രമല്ല, അത് തുടർച്ചയായി മെച്ചപ്പെടുത്താനും ഉപയോഗിക്കാവുന്ന ആവർത്തിച്ചുള്ള ഒരു മൂല്യനിർണ്ണയ സംവിധാനം ക്ലയന്റിന് ലഭിച്ചു. ഒരു സാങ്കേതിക അവലോകന പരിപാടിയായി ആരംഭിച്ചത് ഉൽപ്പന്ന ടീമുകൾക്കും, മോഡൽ ടീമുകൾക്കും, വിന്യാസ പങ്കാളികൾക്കും ഒരു പ്രായോഗിക തീരുമാനമെടുക്കൽ ഉപകരണമായി മാറി.
ഉദ്ധരണി ഐക്കൺ

ആത്മനിഷ്ഠമായ ഓഡിയോ നിലവാരത്തെ അളക്കാവുന്ന ഒരു മെച്ചപ്പെടുത്തൽ പരിപാടിയാക്കി മാറ്റാൻ Shaip ഞങ്ങളെ സഹായിച്ചു. അവരുടെ വിലയിരുത്തൽ ചട്ടക്കൂട് എന്ത് പരിഹരിക്കണം, എവിടെ മെച്ചപ്പെടുത്തണം, എങ്ങനെ ആത്മവിശ്വാസത്തോടെ ഉൽപ്പാദനത്തിലേക്ക് അടുക്കാം എന്നതിനെക്കുറിച്ചുള്ള വ്യക്തമായ സൂചനകൾ ഞങ്ങൾക്ക് നൽകി.

— AI സ്പീച്ച് പ്രോഡക്റ്റ് ലീഡർ

★★★★★
ഉദ്ധരണി ഐക്കൺ