ഇന്ത്യൻ ഭാഷാ ഓഡിയോ ട്രാൻസ്ക്രിപ്ഷനും വ്യാഖ്യാനവും: സംഭാഷണ AI കേസ് പഠനം

അവരുടെ AI- പവർഡ് സ്പീച്ച് പ്രോസസ്സിംഗ് എഞ്ചിനെ പരിശീലിപ്പിക്കുന്നതിനായി ഉയർന്ന നിലവാരമുള്ള ഓഡിയോ ട്രാൻസ്ക്രിപ്ഷൻ, അനോട്ടേഷൻ സേവനങ്ങൾ വാഗ്ദാനം ചെയ്തു.

ബഹുഭാഷാ സംഭാഷണ AI

പ്രോജക്റ്റ് അവലോകനം: ഇന്ത്യൻ ഭാഷകൾക്കായി ഒരു ബഹുഭാഷാ സ്പീച്ച് എഞ്ചിൻ നിർമ്മിക്കൽ. 

യുഎസ്, ഇന്ത്യ, കാനഡ, മറ്റ് നിരവധി രാജ്യങ്ങൾ എന്നിവിടങ്ങളിൽ വിപണി സാന്നിധ്യമുള്ള ഇന്ത്യയിലെ മുൻനിര AI ഉൽപ്പന്ന ലാബാണ് ക്ലയന്റ്. സാങ്കേതികവിദ്യയിലൂടെ മനുഷ്യന്റെ കഴിവുകൾ വർദ്ധിപ്പിക്കുക എന്നതാണ് അവരുടെ ദർശനം. പത്ത് വർഷത്തിലേറെയായി നൂതനമായ NLP, ആർട്ടിഫിഷ്യൽ ഇന്റലിജൻസ്, ML, അനലിറ്റിക്സ്, വിഷ്വലൈസേഷനുകൾ, അനുബന്ധ സാങ്കേതികവിദ്യകൾ എന്നിവയിലുടനീളം ശാസ്ത്രീയ ഗവേഷണം എന്നിവയിൽ അവർക്ക് പരിചയമുണ്ട്.

ICOG, Autovox തുടങ്ങിയ AI ഉൽപ്പന്നങ്ങളുമായി മനുഷ്യ-യന്ത്ര ഇടപെടലിൽ അവർ അതിരുകൾ ഭേദിക്കുന്നു. തൊഴിൽ ശക്തി പഠനത്തിനും പരിവർത്തന ലക്ഷ്യങ്ങൾക്കുമായി ICOG ഒരു AI-അധിഷ്ഠിത വ്യക്തിഗതമാക്കിയ ഇന്റലിജന്റ് വെർച്വൽ ലേണിംഗ് അസിസ്റ്റന്റാണ്, അതേസമയം, Autovox ഒരു AI-പവർഡ് സ്പീച്ച് ആണ്.
ഇന്ത്യൻ ഭാഷകൾക്കായുള്ള പ്രോസസ്സിംഗ് എഞ്ചിൻ.

സംഭാഷണ AI

പ്രധാന ഫലങ്ങൾ: 6 ഭാഷകളിലായി 1,200 മണിക്കൂർ വ്യാഖ്യാനം.

ഓഡിയോ ട്രാൻസ്ക്രൈബ് ചെയ്ത് വ്യാഖ്യാനിച്ചത്

ചൊവ്വാഴ്ച

ഇല്ല
ഭാഷകൾ

6 (200 മണിക്കൂർ x 6 ഭാഷകൾ)

ട്രാൻസ്ക്രൈബ് ചെയ്തതും വ്യാഖ്യാനിച്ചതുമായ ഭാഷകൾ

ഇന്ത്യൻ ഇംഗ്ലീഷ്, ഹിന്ദി, തമിഴ്, തെലുങ്ക്, കന്നഡ, മലയാളം

പദ്ധതി
ടൈംലൈൻ

ക്സനുമ്ക്സ ആഴ്ച

വെല്ലുവിളി: ഇന്ത്യൻ ഭാഷാ ഓഡിയോ അനോട്ടേഷനായി വിദഗ്ദ്ധ ഭാഷാശാസ്ത്രജ്ഞരെ കണ്ടെത്തൽ.

ഗുണനിലവാരമുള്ള ഭാഷാശാസ്ത്രജ്ഞർ, വിദഗ്ദ്ധ ഡാറ്റ അനോട്ടേറ്റർമാർ, സമയബന്ധിതമായി മാർക്കറ്റ് ചെയ്യൽ എന്നിവയിലേക്കുള്ള പ്രവേശനക്കുറവ് സംഭാഷണ AI യുടെ പുരോഗതിയിലും സ്വീകാര്യതയിലും ഒരു തടസ്സമായി മാറിയിരിക്കുന്നു. AI കഴിവുകൾ വികസിപ്പിക്കാൻ പര്യാപ്തമായ, ആവശ്യമായ ഗുണനിലവാരമുള്ള വലിയ അളവിൽ ഡാറ്റാസെറ്റുകൾ ട്രാൻസ്‌ക്രൈബ് ചെയ്യുന്നതും വ്യാഖ്യാനിക്കുന്നതുമായ ഭാഷാശാസ്ത്രജ്ഞരെ സോഴ്‌സ് ചെയ്യുന്നത് എല്ലായ്പ്പോഴും സമയമെടുക്കുന്നതും ചെലവേറിയതുമായ ഒരു ജോലിയാണ്, ഇതിന് വിവിധ ഡൊമെയ്‌നുകളിൽ നിന്നുള്ള വൈദഗ്ധ്യമുള്ള വിഭവങ്ങൾ ആവശ്യമാണ്. ഒരു ആന്തരിക അനോട്ടേറ്റർ ടീം ഉണ്ടായിരുന്നിട്ടും, സമയബന്ധിതമായ ഡെലിവറിയും അനോട്ടേഷന്റെ ഗുണനിലവാരവും അവർ നേരിടുന്ന പ്രശ്‌നങ്ങളാണ്.

ഉപഭോക്താവിൻ്റെ നിർണായക ആവശ്യകതകൾ ഇവയായിരുന്നു:

  1. ഗുണനിലവാരമുള്ള ഭാഷാശാസ്ത്രജ്ഞരിലേക്കുള്ള പ്രവേശനം: ഇന്ത്യൻ ഇംഗ്ലീഷ്, ഹിന്ദി, തമിഴ്, തെലുങ്ക്, കന്നഡ, മലയാളം തുടങ്ങിയ ഇന്ത്യൻ ഭാഷകളിൽ വിദഗ്ദ്ധ ഭാഷാ പണ്ഡിതരുടെ ലഭ്യതക്കുറവ്.
  2. ഓഡിയോ ട്രാൻസ്ക്രിപ്ഷനും വ്യാഖ്യാനവും: കുറഞ്ഞത് 95% കൃത്യതയോടെ സങ്കീർണ്ണമായ ഓഡിയോ അനോട്ടേഷൻ & ട്രാൻസ്ക്രിപ്ഷൻ മാർഗ്ഗനിർദ്ദേശങ്ങൾ
  3. ഡാറ്റ ഡെലിവറി: ട്രാൻസ്ക്രിപ്റ്റ് ഫയലുകൾ 10 ആഴ്ചയ്ക്കുള്ളിൽ JSON ഫോർമാറ്റിൽ ഡെലിവറി ചെയ്യണം.

പരിഹാരം: വിദഗ്ദ്ധ ഭാഷാശാസ്ത്രജ്ഞരുടെ ഓഡിയോ ട്രാൻസ്ക്രിപ്ഷനും വ്യാഖ്യാനവും

സംഭാഷണ AI-യെക്കുറിച്ചുള്ള ഞങ്ങളുടെ ആഴത്തിലുള്ള ധാരണ ഉപയോഗിച്ച്, ഇന്ത്യൻ ഭാഷകൾക്കായുള്ള AI-യിൽ പ്രവർത്തിക്കുന്ന സ്പീച്ച് പ്രോസസ്സിംഗ് എഞ്ചിൻ പരിശീലിപ്പിക്കുന്നതിന് വിദഗ്ദ്ധ ഭാഷാശാസ്ത്രജ്ഞരുടെയും വ്യാഖ്യാനക്കാരുടെയും ഒരു ടീമിനെ ഉപയോഗപ്പെടുത്തി, നൽകിയിരിക്കുന്ന ഡാറ്റാസെറ്റുകൾ ട്രാൻസ്ക്രൈബ് ചെയ്യാനും വ്യാഖ്യാനിക്കാനും ഞങ്ങൾ ക്ലയന്റിനെ സഹായിച്ചു.

നിരവധി വെണ്ടർമാരെ (ഇൻഡസ്ട്രിയിലെ ചുരുക്കം ചില ഹെവിവെയ്റ്റുകൾ ഉൾപ്പെടെ) വിലയിരുത്തിയ ശേഷം, കർശനമായ സമയപരിധിക്കുള്ളിൽ വലിയ സംഭാഷണാത്മക AI പ്രോജക്ടുകൾ പൂർത്തിയാക്കാനുള്ള ഞങ്ങളുടെ വൈദഗ്ധ്യവും മത്സരാധിഷ്ഠിത നിരക്കിൽ ഞങ്ങൾ വാഗ്ദാനം ചെയ്ത ഗുണനിലവാരവും കണക്കിലെടുത്താണ് ക്ലയന്റ് Shaip-നെ തിരഞ്ഞെടുക്കുന്നത്.

  1. ഓഡിയോ ട്രാൻസ്ക്രിപ്ഷൻ & വ്യാഖ്യാന മാർഗ്ഗനിർദ്ദേശങ്ങൾ പാലിച്ചു.
    • സംഭാഷണം & നോൺ-സ്പീച്ച് ആയി വ്യാഖ്യാനിച്ച ഓഡിയോ തരം
    • തിരഞ്ഞെടുത്ത സെഗ്‌മെന്റിന്റെ ഓഡിയോ തരം സംഭാഷണമായി അടയാളപ്പെടുത്തിയിട്ടുണ്ടെങ്കിൽ, സംഭാഷണ തരം തിരഞ്ഞെടുക്കണം, അതായത് ക്ലീൻ സ്പീച്ച്, സ്പീച്ച്+സംഗീതം, സ്പീച്ച്+നോയ്‌സ്, ഇൻകംപ്രെഹെൻസിബിൾ സ്പീച്ച്.
    • തിരഞ്ഞെടുത്ത സംഭാഷണ സെഗ്‌മെന്റ് സ്പീക്കർ സംസാരിക്കുന്ന ഭാഷയിൽ പ്രത്യേകമായി ടാഗ് ചെയ്യണം.
    • അനോട്ടേറ്റർ സ്പീക്കർ ടാഗുകൾ ഉപയോഗിച്ച് മേഖലകളെ അടയാളപ്പെടുത്തണം. വ്യത്യസ്ത സ്പീക്കറുകൾ
      വ്യത്യസ്ത സ്പീക്കർ ടാഗുകൾ ഉപയോഗിച്ച് അടയാളപ്പെടുത്തിയിരിക്കുന്നു.
    • വ്യാഖ്യാതാവ് സ്പീക്കറുടെ ലിംഗഭേദം തിരഞ്ഞെടുക്കണം, അതായത് പുരുഷനോ സ്ത്രീയോ.
    • ഓഡിയോയിൽ സംസാരിക്കുന്നതുപോലെ തന്നെ ടെക്സ്റ്റ് എഴുതുകയും വ്യാകരണപരമായി ശരിയായിരിക്കണം.
    • തിരഞ്ഞെടുത്ത ഓഡിയോ തരം നോൺ-സ്പീച്ച് ആണെങ്കിൽ, അതിന് ലേബലുകളിൽ ഒന്ന് നൽകണം - നോ-സ്പീച്ച്, മ്യൂസിക്, ലിപ് സ്മാക്ക്, ബ്രെത്ത്, ചുമ, ചിരി, റിംഗ്, DTMF, ബബിൾ, വാഹന ശബ്ദം, ഇടയ്ക്കിടെയുള്ള ഫോർഗ്രൗണ്ട് നോയ്സ്.
    • ഓഡിയോയിലെ എല്ലാ സെഗ്‌മെന്റുകളും ടാഗുകൾ ഉപയോഗിച്ച് അടയാളപ്പെടുത്തിയിരിക്കണം, അതിനുശേഷം മാത്രമേ സിസ്റ്റത്തിലേക്ക് അപ്‌ലോഡ് ചെയ്യാൻ കഴിയൂ.
  2. ഡാറ്റ ഡെലിവറി
    10 ആഴ്ചയ്ക്കുള്ളിൽ നിർദ്ദിഷ്ട മെറ്റാഡാറ്റ ആവശ്യകതകൾക്കനുസൃതമായി എല്ലാ ട്രാൻസ്ക്രിപ്റ്റ് ഫയലുകളും JSON ഫോർമാറ്റിൽ എത്തിച്ചു.

ഫലം: ഒരു പ്രൊഡക്ഷൻ-റെഡി ബഹുഭാഷാ സംഭാഷണ AI എഞ്ചിൻ

വിദഗ്ദ്ധ ഭാഷാശാസ്ത്രജ്ഞരിൽ നിന്നുള്ള ഉയർന്ന നിലവാരമുള്ള വ്യാഖ്യാനിച്ച ഓഡിയോ ഡാറ്റ, നിശ്ചിത സമയത്തിനുള്ളിൽ ഇന്ത്യൻ ഇംഗ്ലീഷ്, ഹിന്ദി, തമിഴ്, തെലുങ്ക്, കന്നഡ, മലയാളം എന്നീ 6 ഇന്ത്യൻ ഭാഷകളിൽ AI- പവർഡ് സ്പീച്ച് പ്രോസസ്സിംഗ് എഞ്ചിനെ കൃത്യമായി പരിശീലിപ്പിക്കാൻ ക്ലയന്റിനെ പ്രാപ്തരാക്കി.

സുവർണ്ണ നിലവാരമുള്ള പരിശീലന ഡാറ്റാസെറ്റുകൾ ഉപയോഗിച്ച്, യഥാർത്ഥ ലോകത്തിലെ പ്രശ്നങ്ങൾ പരിഹരിക്കുന്നതിന് എൻഡ്-ടു-എൻഡ് (E2E), ഹൈബ്രിഡ് മോഡലുകൾ ഉപയോഗിക്കുന്ന ബഹുഭാഷാ ശേഷിയുള്ള ബുദ്ധിപരവും കരുത്തുറ്റതുമായ ഒരു സംഭാഷണ സംവിധാനം ക്ലയന്റിന് വാഗ്ദാനം ചെയ്യാൻ കഴിയും. ലളിതമായി പറഞ്ഞാൽ, ഇന്ത്യൻ ഉപഭോക്താക്കളെ പ്രത്യേകമായി പരിപാലിക്കുന്നതിനായി സംഭാഷണ AI (അലക്സ, സിരി പോലുള്ളവ) നിർമ്മിക്കുന്നു.

ഉദ്ധരണി ഐക്കൺ

ഷൈപ്പിന്റെ കരുത്തുറ്റ വർക്ക്ഫ്ലോ മാനേജ്മെന്റ്, വേഗത്തിലുള്ള ടേൺഅറൗണ്ട് സമയം, സംഭാഷണ AI-യിലെ അവരുടെ അനുഭവം, വിദഗ്ദ്ധ ഭാഷാശാസ്ത്രജ്ഞരുടെ ശൃംഖല എന്നിവ ഞങ്ങളെ അത്ഭുതപ്പെടുത്തി. മാത്രമല്ല, അവർ വാഗ്ദാനം ചെയ്യുന്ന ചെലവ് മൂല്യ നേതൃത്വം മറ്റൊന്നുമല്ല.

★★★★★
ഉദ്ധരണി ഐക്കൺ