人間またはボット:電話であなたと話す人を作成する方法

ボットに声をかけるにはどのような方法がありますか?

ボットに音声を与えるには、主に 2 つの方法があります。音声合成を使用するか、

アナウンサーの声でセリフを録音します。前者の場合は、快適で正確ですが、ほとんどの場合感情のない声の演技が得られ、後者の場合は、生き生きとした自然な音声が得られます。どちらの方法でも生きる権利があります。たとえば、音声アシスタントが最初からロボットとして位置付けられている場合、多少機械的な音声はユーザーに否定的に認識されません。ボットを本格的なコールセンターの従業員に変えることが目標であれば、企業が事前に録音した音声を使用して質問を処理する方が合理的です。 

最も有名な音声合成方法の 1 つは、非プログラマーの間 - TTS。コンピューターは単にテキストを読んで話すだけです。顕著な例は、Google による音声サービスの合成であり、Google 翻訳翻訳ツールで聞くことができます。このサービスのロシア語音声は自然音声と区別するのが非常に簡単ですが、これがこのような合成の主な問題です。必要な強調を行うには、SSML (音声合成マークアップ) を使用します。しかし、それでもプロのアナウンサーのような音声を実現するのは難しいです。そのため、私たちは高品質の代替品の開発を開始しました。 

変数を使用した音声合成が必要な理由 

企業は音声機能を積極的に活用していますボットを利用し、顧客に対するスピーチをより快適でパーソナライズしたものにするよう努めています。パーソナライゼーションによりエンゲージメントとロイヤルティが向上: 高度なパーソナライゼーションを使用している企業の 70% が、その取り組みに対して 200% 以上の ROI を達成しました。 

ボットの声をリアルにするために、企業はアナウンサー、俳優、コンタクト センターのオペレーターの音声を録音します。欠点は、すべてのレプリカが静的であることです。これは、注文のキャンセルに関する指示や、現在のプロモーションについての通知などに適しています。しかし、ビジネスコミュニケーションには、多くの変化するデータ、つまり変数が含まれています。

ボットの声をリアルにするために、企業はナレーター、俳優、コンタクト センター オペレーターの声を録音します。欠点は、すべてのレプリカが静的であることです。

たとえば、クリニックの予約を確認するには:患者名、医師名、予約日時。配達の場合:顧客のフルネーム、注文番号とその内容、金額、配達時間。各エントリには、クライアントまたはそのリクエストの個別のパラメータが含まれている必要があります。そして、ファイルの貼り付け、オーディオ ミックス、または単なるロボットの音声演技が使用されます。 

接着の本質は、アナウンサーの多数の録音からの「アプリケーション」。配達の場合は、頻繁に出現する約 1.5 千通りの通り、都市名、家番号、アパート番号を書き留める必要があります。これは非常に手間のかかる作業であり、アナウンサーに多大な労力と時間を要します。録音後、オーディオ ファイルを正しい順序で結合する必要があります。プロのサウンド エンジニアは、カット間のスムーズな移行や一時停止の配置を行うことができますが、接続部分は依然として聞こえるため、大量のソース データによりそのような作業は膨大になります。このオプションを試してみましたが、複雑な問題の解決には適していないことがわかりました。

一部の企業が、Yandex または Google Speech の標準 SpeechKit 音声演技に似た声のスピーカーを見つけようとしていることがわかっています。ただし、この場合、インサートも聞こえます。 

私たちはそれをナレーション録音に統合しようとしましたTTS。つまり、通りや都市の名前をすべて事前に録音するのではなく、アナウンサーの音声に基づいて TTS を使用して目的のフレーズを生成し、事前に録音されたアナウンサーのレプリカに挿入しました。その結果、人間とロボットの感情的な生の音声が混合されました。 

いろいろな楽器で試してみても、良い結果は得られませんでした。その結果、私たちはハイブリッド合成と呼ばれる独自のアルゴリズムを開発するようになりました。このテクノロジーを使用すると、音声ボットのナレーション録音のフレーズをすばやく変更でき、置換内容をアルゴリズムに渡すだけで済みます。同時に、合成音声は話者のイントネーションや感情をコピーし、自然に聞こえ、文脈から目立たなくなります。このようにして、元のナレーション録音に含まれていない変数を音声化したり、新しいシナリオをテストしたりできます。

TTS

ハイブリッド合成はどのように機能するのでしょうか?

最初の段階はアナウンサーと協力することです。ロシア語の多様性をカバーするには、専門のスタジオで 10 時間のスピーチを録音する必要がありました。これらは、書籍、ニュース、および頻繁に発生するデータ (数字、名前、住所、都市) からのフレーズです。これにより十分なトレーニング データが提供され、その後、各スピーカーのハイブリッド合成モデルの作成を開始できます。

ロボコール プロジェクトごとに、アナウンサーは次のようなフレーズ テンプレートを書き留めます。セルゲイ・ペトロヴィッチ!明日、ご注文の商品をご住所にお届けいたしますトヴェルスカヤ通り、314から18時間。ご都合がよろしいでしょうか?」ハイブリッド合成モデルは、セルゲイ・ペトロヴィッチをアンナ・ヴァシリエヴナに置き換える必要がある場合や、ボルシャヤ・ゼレニナ通り24番地の午前10時から午後2時までの住所と時刻などのタスクを処理できます。結果は、合成された変数を含む新しいレプリカです。アンナ・ヴァシリエフナ!明日、ご注文の商品をご住所にお届けいたしますボリシャヤゼレニーナ通り、2410から14時間。ご都合がよろしいでしょうか?」顧客ベースへの通話ごとに、個別のタスクが作成され、実行されます。

ボイスオーバー

ニューラル ネットワークが例の話者のイントネーションと感情を使用するため、高音質が実現されます。

ハイブリッド合成を設定する方法 

既製モデルをいくつかご用意しております女性の声と男性の声を組み合わせたハイブリッド合成。テンプレート呼び出しは JAICP および JAICF プラットフォームで動作し、他のサービスで作成されたボットからの呼び出しは API 経由で可能です。スクリプトを最初からセットアップするには数時間かかります。合成されたレプリカ 1 つには 12 ペックがかかり、プロジェクトのテンプレートのナレーションにはアナウンサーの仕事 1 時間あたり 3,000 ルーブルがかかります。 

既成の声のセットが拡大します。個別に選択されたアナウンサーまたは会社の公式声のモデルを作成するJustAIハイブリッド合成を使用するオプションもあります。

ハイブリッド合成

ハイブリッド合成テクノロジーを使用すると、NPS調査、アンケート、リマインダー、アップセール、およびロイヤルティプログラムのサポートを目的として、IVRおよびロボット呼び出しをパーソナライズできます。

続きを読む:

銀河のブラックホールはアインシュタインが正しいことを証明しました。重要なこと

宇宙は骨を破壊し、その構造を変えます:科学者は人々が火星にどのように飛ぶかを知りません

天文学者は、地球とは異なるが生命に適した惑星を発見しました