キーワード解説
マルチモーダルAI「tsuzumi」による画像・音声データの統合解析活用法
「マルチモーダルAI「tsuzumi」による画像・音声データの統合解析活用法」とは、NTTが開発した国産大規模言語モデル「tsuzumi」が、テキストデータに加えて画像や音声データも統合的に解析する能力を指します。これにより、単一のモダリティでは捉えきれない複雑な情報や文脈を横断的に理解し、より高度な推論や判断を可能にします。NTT tsuzumiが持つ日本語処理の強みを活かしつつ、視覚情報や聴覚情報を取り込むことで、AIの認識能力と応用範囲を飛躍的に拡大させる技術です。例えば、顧客の表情や声のトーンから感情を読み取り、テキストでのやり取りと合わせて総合的な状況判断を行うといった、人間のような多角的な情報処理が可能になります。
0 関連記事
マルチモーダルAI「tsuzumi」による画像・音声データの統合解析活用法とは
「マルチモーダルAI「tsuzumi」による画像・音声データの統合解析活用法」とは、NTTが開発した国産大規模言語モデル「tsuzumi」が、テキストデータに加えて画像や音声データも統合的に解析する能力を指します。これにより、単一のモダリティでは捉えきれない複雑な情報や文脈を横断的に理解し、より高度な推論や判断を可能にします。NTT tsuzumiが持つ日本語処理の強みを活かしつつ、視覚情報や聴覚情報を取り込むことで、AIの認識能力と応用範囲を飛躍的に拡大させる技術です。例えば、顧客の表情や声のトーンから感情を読み取り、テキストでのやり取りと合わせて総合的な状況判断を行うといった、人間のような多角的な情報処理が可能になります。
このキーワードが属するテーマ
このキーワードに紐付く記事はまだありません