トピックモデルを最大限に活用するには、以下のおすすめの方法に従ってください。
トピックモデルのファインチューニング
トピックの割り当てを改善する最善の方法は、モデルをファインチューニングすることです。トピックを追加、編集、削除する際は、以下のガイドラインに沿ってトピックモデルを最適化してください。
トピックを追加または編集する
重複するトピックや類似するトピックを追加すると、トピックの推論の品質に悪影響を及ぼすため、追加しないでください。トピックを作成または変更する際は、以下の命名規則と説明のガイドラインを適用してください。
名前
「 リモコンのトラブルシューティング 」や「 請求ポリシーに関するお問い合わせ 」など、3 ~ 6 語の短く具体的なトピックを使用します。
「 販売 」などの汎用的または抽象的な名前は避けてください。
必要に応じて、以下のおすすめの方法に従ってください。
「 請求 」など、すぐに使用できるカスタム トピック名を使用します。
「請求エラーと払い戻し」のように、トピック名に簡単な説明を追加します。
目的の結果に基づいて、適切なモデル構成を選択します。
例
クレジット カード サポートセンターでは、アーカイブされたサポート通話ログに対してトピック モデリングを実行しています。モデリングでは、会話のクラスタからトピックを作成し、「 クレジット カードの限度額超過に関するお問い合わせ 」という名前を付けます。ビジネスでは、名前を「 利用限度額に関するお問い合わせ 」に短縮します。
説明
一般的な説明の後に、いくつかの例を挙げます。
名前、日付、場所などの個人情報は含めないでください。
「X トピックを含めないでください」など、詳細すぎる情報はトピックの推論に悪影響を及ぼす可能性があります。
例
お客様から固定電話サービスについてお問い合わせがありました。解約をご希望の場合や、現在の請求についてご相談をご希望の場合があります。
お客様から請求書についてお問い合わせがありました。金額や期日について知りたい場合があります。
セカンダリ トピックを削除する
トピックモデルをデプロイして分析が完了したら、[トピックモデルのデプロイ済みデータ] ページでトピックの分布を確認します。セカンダリ トピックは一般的で一致度が高いため、デプロイされた結果で最も多いトピックになる可能性があります。サンプル会話の 30% 以上に一致するトピックは、セカンダリ トピックである可能性があります。これらのトピックを慎重に確認し、関連性のない場合は削除してください。
関連性のないセカンダリ トピックが存在するかどうかは、入力データによって大きく異なります。[デプロイ済みデータ] ページのすべての主要トピックの分布が比較的均等で、各トピックが会話のほんの一部(20% 未満)にのみ一致する場合は、削除するセカンダリ トピックはない可能性があります。
トレーニング データ
音声データの場合、トピックモデルのパフォーマンスには Speech-to-Text 出力の品質が非常に重要です。トレーニング データの品質を向上させるには、以下のガイドラインに沿って設定してください。
会話
データセットで重複する会話は使用しないでください。
各会話には、エージェントからの 5 ターンとお客様からの 5 ターンを含め、合計 10 ターン以上を含める必要があります。
秘匿化された会話を使用しますが、Cloud Data Loss Prevention の秘匿化の品質を確認してください。秘匿化によって音声文字変換テキストから重要な情報が削除されると、トレーニング会話の長さに影響する可能性があります。
ほぼすべての会話が同じ言語であることを確認してください。
話者の役割
会話が取り込まれた後、会話の話者の役割が適切に割り当てられていることを確認してください。
会話のターンに、お客様またはエージェントからのものとして正確にラベルを付けます。1 つのロールしかない会話は、トレーニングで使用されません。
人間の役割には
AGENTを、仮想の役割にはAUTOMATED_AGENTを使用します。お客様の役割には
END_USERまたはCUSTOMERを使用します。