Smarta "pratare"
Rösten är ett naturligt kommunikationsverktyg. Många människor vill snarare lösa problem verbalt än
Röstteknik används inom många områden,och de är lämpliga för vilken publik som helst: barn lockas av en interaktiv "pratare", ungdomar uppskattar röststyrningen av smarta enheter och en assistent läser nyheterna för äldre. Men röstassistenter är mest efterfrågade i de branscher där det finns många punktkommunikationer med kunder - inom finans, detaljhandel och telekom.
"Röstteknik används inom många områden"
Stora företag använder röstteknik är inte det första året. Sedan 2017 har Bank of America drivit Erica, en virtuell assistent. Sedan 2018 har Mercedes-Benz introducerat ett digitalt User Experience-komplex (MBUX) som förstår röstkommandon. Återförsäljaren Walmart har lanserat en applikation med röstassistenten Ask Sam, som hjälper kunder med produktsökning. Enligt Adobe Analytics investerar 91 % av varumärkena redan mycket i röstlösningar och planerar att öka investeringarna. Den ryska marknaden för tal-AI kommer under de kommande fem åren att växa från 38 till 81% och kommer 2025 att nå nivån på 561 miljoner dollar, förutspår Just AI.
Jag tror – jag tror inte
Företag utvärdera effektiviteten i genomförandetröstteknik, med fokus på kundnöjdhet och varumärkeslojalitet. Men många kunder ser på innovation med återhållsam entusiasm. Enligt Voicebot.ai vill bara 45 % av användarna se röstassistenter i mobilapplikationer. De främsta orsakerna till ogillar, enligt Neuro.net, är den dåliga kvaliteten på svaren och röstassistenternas syntetiska tal. Dessa problem är typiska för gränssnitt byggda på tekniker från den senaste generationen. Moderna maskininlärningsalgoritmer gör det möjligt att syntetisera röster som saknar själlöshet.
En annan begränsande faktor är detröstteknologier har blivit utbredda både i "bra" scenarier från klientens synvinkel och i "dåliga". Det finns inte så många företag som specialiserat sig på utveckling av röstgränssnitt på marknaden ännu, och antalet röster som de kan erbjuda är begränsat. Det visar sig att om en person idag störs av reklam eller bedrägliga samtal, och imorgon ringer ett användbart samtal, kommer kommunikationen inte att lyckas, eftersom "alla robotar har en röst." Om röstassistentens rykte skadas, sjunker effektiviteten av samtal som är användbara för klienten till noll. Därför skapas Brand Voice – en unik varumärkesröst.
"En unik röst är en viktig del av ett varumärke, somlogotyp eller företagstypsnitt. Fler och fler av våra kunder använder denna funktion och engagerar sig med kunder med unika röster. Vi spelar in en uppsättning fraser med en viss intonation i rösten hos en företagsanställd eller en utropare. Och många dynamiska data - telefonnummer eller adresser - genererar det självlärande systemet automatiskt, reproducerar medarbetarens röst och bibehåller realistiska intonationer. Det är så företag automatiserar kommunikation, men behåller kundlojaliteten och ökar konverteringen: människor är glada över att de blir tilltalade med en livlig röst och de är villiga att föra en dialog.”
Ivan Artemiev, MTT produktchef
Tala modell
Kostnaden för den färdiga Brand Voice börjar från 150tusen rubel och beror på omfattningen och komplexiteten hos röstsyntesmodellen. Processen att skapa en lösning består av två delar - teknisk och logisk, var och en är ett separat produktteams ansvar.
Ett viktigt steg i denna del är valet av röst, påpå vilket tal kommer att syntetiseras. Rösten bör innationellt återspegla de varumärkesattribut som det är viktigt för företaget att främja. En professionell talare eller dubbande skådespelare kommer att behöva tala upp till 40 timmars språkkonstruktioner under inspelningen. Inspelningen ska vara av hög kvalitet, utan onödigt brus, och uttalet ska vara korrekt, eftersom röstrobotmodellen kommer att tränas på detta material.
Att träna modellen och genomföra en fullfjädradsyntesen tar från en månad till sex månader, beroende på komplexiteten. Men tekniken går framåt och inspelningstiden i studion minskar gradvis. Det är möjligt att det i framtiden kommer att vara möjligt att få en bra röstrobot med bara 2-3 timmar av originalljudet.
"Kostnaden för en färdig Brand Voice börjar från 150 000 rubel"
Att lära sig artificiell intelligens
När inspelningen är klar börjar träningenröstmodell. Hon bearbetar det inspelade materialet, lär sig att återge sin röst och som ett resultat kan hon syntetisera tal från vilken godtycklig text som helst.
För att lösa denna klass av problem,Transformers är en djup neural nätverksarkitektur som introducerades 2017 av Google Brain-forskare. De mest kända transformatorerna är GPT (Generative Pre-trained Transformer) neurala nätverk från den ideella organisationen OpenAI. Den här tekniken, till exempel, låter dig fylla i ett tomrum mest exakt eller förutsäga nästa ord i en fras baserat på tidigare ord.
Enligt denna princip skapas röstvarumärken.Röstlösningar. Den tränade modellen körs på en enorm mängd data - flera modeller lanseras med olika parametrar och den bästa väljs vid utgången. Det är viktigt att roboten korrekt "översätter" texten till röst, inte gör misstag i uttal och intonation. För att förbättra kvaliteten på syntesen är modellen vidareutbildad för specifika användningsfall, vilket gör att du kan få de mest naturligt klingande rösterna.
Var är logiken?
Robotens semantiska innehåll, dess affärslogik ochscenarier för interaktion med människor skapas i nära samverkan med kunden. För att en röstassistent ska ge maximal nytta för en verksamhet behöver du ha en god förståelse för hur denna verksamhet är organiserad, med vilka frågor och i vilka situationer kunden kommer att kontakta assistenten.
Att hitta på fall från grunden är en dålig idé, logikInteraktionen med klienten måste vara verklig. Om en assistent träffar en person på telefonlinjen, är manuset baserat på ett konsultations-, försäljnings- eller något annat manus - en sekvens av handlingar från en callcenteranställd i en dialog med en kund. När man förbereder ett manus för en röstassistent hjälper det att analysera önskemål från verkliga användare, intervjuer med anställda som kommunicerar med dem regelbundet eller UX-experiment som syftar till att ta reda på människors verkliga behov.
"Om en assistent träffar en person på telefonlinjen så är manuset baserat på en konsultation, försäljning eller något annat manus"
Många kunder försöker talaassistenten hjälpte klienter att lösa problem som är svåra för dem att hantera på egen hand. Till exempel, på robotens nåd är det bättre att överföra funktioner som är "djupt" dolda eller inte uppenbara när man arbetar i en mobilapplikation.
Irina Stepanova, designer-analytiker av konversationsgränssnitt på Just AI:"Du måste förstå att det finns en chatt i olika kanaler,applikation, telefon - klienten beter sig annorlunda. Därför måste du först och främst noggrant studera kundresekartan i de kanaler där du planerar att implementera en röstassistent. I det visuella gränssnittet har kunden färre sätt att göra fel – nästan allt som tjänsten har att erbjuda ligger framför hans ögon. I röstgränssnittet känner användaren inte begränsningarna av tjänsten så bra, och det är nödvändigt att se till att en person kan uttrycka en begäran till en assistent med en lång fras där det kommer att vara nödvändigt att markera viktiga fraser med vilka programmet kommer att avgöra kärnan i begäran. En separat uppgift är att designa ett offtopic script som det inte finns något färdigt script för. Kunden kan fråga vad som helst. Det som gör en robot till människa är variationen i svaren, när den svarar på samma fråga på olika sätt.”
Ett av problemen med att utveckla röstgränssnitt - upptäckbarhet: hur man berättar vad assistenten kan och vad han kan hjälpa till med? Här är det nödvändigt agera proaktivt - rösta färdigheter och förmågor och vägleda användaren genom scenariot, föreslå ytterligare steg, hjälpa honom i återvändsgränder när han kommer in i "bearbetning av okända förfrågningar." Du kan också prata om assistentens förmågor utanför assistenten själv: i reklam, utskick och användning av andra marknadsföringsverktyg.
Röstassistenten ska inte bara ta mednytta, men också vara en intressant samtalspartner. Utvecklarna försöker alltid lägga så mycket som möjligt i "hjärnan" av Brand Voice, förse den med karaktär och personlighet.
Lärande är en kontinuerlig process
Utvecklingen av röstmodellen stannar inte ens efterdess driftsättning. Efter sex månaders arbete förbättras modellens kvalitet, och efter ett år utvecklas den till oigenkännlighet. Om klienten har tillåtit loggning, det vill säga registrera information om händelser under driften av röstassistenten, samlas all feldata in och används för att träna om modellen. Loggning kan krävas när assistenten inte kan känna igen specifika ord och fraser eller gör fel i deras uttal, till exempel i namn på läkemedel eller i sortimentet av en leveranstjänst.
Att skapa en varumärkesröst sker vanligtvis i molnetmiljö och kräver användning av personuppgifter, vilket ofta väcker säkerhetsproblem hos kunder. Och även om misstro mot molnen är en förlegad stereotyp, om det är viktigt för kunden att uppgifterna inte går utanför företagets omkrets, kan de behandlas strikt inom organisationens IT-krets. Personuppgifter används även vid loggning, för att säkerställa deras konfidentialitet anonymiseras uppgifterna.
Skapande av nya arbetsscenarier och tilläggsutbildningmodeller för Brand Voice är en pågående process. Faktum är att genom att beställa en färdig röstlösning får kunden en tjänst som hela tiden förbättras. En verkligt högkvalitativ röstassistent kan inte bara lägga märke till personalen på ett helt callcenter, utan också bli en ljus accent som lägger till individualitet till företagets image.
Läs mer
Elon Musks Noaks ark kommer att ta en miljon människor till Mars
Astronomer från Japan har hittat en okänd struktur i galaxen
Saber av okänt ursprung hittades i Grekland. Forskare förbryllade över en märklig artefakt