JP2017536601A

Techniques for similarity analysis and data enrichment using knowledge sources

Abstract

The present disclosure relates to performing similarity metric analysis and data enhancement using knowledge sources. The data enhancement service can identify similar related data by comparing the input dataset with the reference dataset stored in the knowledge source. The similarity metric may be calculated to correspond to the semantic similarity of two or more datasets. By using similarity metrics, datasets can be identified based on the metadata attributes and data values of these datasets, which can facilitate indexing and high-performance retrieval of data values. .. Input datasets can be labeled with categories based on the dataset that show the best match with the input dataset. Additional information about the dataset can be obtained by querying the knowledge source using the similarity between the input dataset and the dataset provided by the knowledge source. Recommendations may be provided to the user with additional information.

JP2017536601A, drawing sheet 1
Sheet 1 of 36

Term

9 yearsto projected expiry

Projected expiry 25 September 2035, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

24 claims: 11 independent, 13 dependent

  1. 1
    方法であって、 入力データセットを1つ以上の入力データソースから受けるステップと、 データ強化サービスのコンピューティングシステムによって、前記入力データセットを、参照ソースから取得した1つ以上の参照データセットと比較するステップと、 前記コンピューティングシステムによって、前記1つ以上の参照データセット各々について類似性メトリックを計算するステップとを含み、前記類似性メトリックは、前記入力データセットとの比較における前記1つ以上の参照データセット各々の類似性の程度を示し、 前記コンピューティングシステムによって、前記類似性メトリックに基づいて前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別するステップと、 前記コンピューティングシステムによって、前記1つ以上の参照データセット各々について計算した前記類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示すグラフィカルインターフェイスを生成するステップと、 前記グラフィカルインターフェイスを用いて、前記1つ以上の参照データセット各々について計算した前記類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示すグラフィカルなビジュアライゼーションをレンダリングするステップとを含む、方法。
  2. 2
    前記1つ以上の参照データセットは、ドメインに対応付けられた用語を含み、前記類似性メトリックは、前記1つ以上の参照データセット各々について計算されたマッチングスコアであり、前記マッチングスコアは、前記参照データセットに関するメトリックを示す第1の値と前記入力データセットと前記参照データセットとの比較に基づくメトリックを示す第2の値とを含む1つ以上の値を用いて計算される、請求項1に記載の方法。
  3. 3
    前記グラフィカルなビジュアライゼーションはレンダリングされることによって前記マッチングスコアの計算に用いられる1つ以上の値を示す、請求項2または3に記載の方法。
  4. 4
    前記1つ以上の値は、前記入力データセットと前記データセットとの間で一致する用語の度数値と、前記データセットの母集団値と、前記入力データセットと前記データセットとの間で一致する異なる用語の数を示す固有マッチング値と、前記データセット内の用語の数を示すドメイン値と、前記データセットのキュレーションの程度を示すキュレーションレベルとを含む、請求項1から4のいずれか一項に記載の方法。
  5. 5
    前記コンピューティングシステムによって、アグリゲーションサービスから取得した増補データに基づいて増補リストを生成するステップと、 前記増補リストに基づいて前記入力データセットを増補するステップとをさらに含み、 前記1つ以上の参照データセットと比較される前記入力データは、前記増補リストに基づいて増補される、請求項1に記載の方法。
  6. 6
    前記方法はさらに、 前記コンピューティングシステムによって、前記1つ以上の参照データセットに基づいてインデックス付トライグラム表を生成するステップを含み、 増補後の前記入力データセットにおけるワードごとに、 前記ワードのトライグラムを作成するステップと、 前記トライグラム各々を前記インデックス付トライグラム表と比較するステップと、 前記トライグラムのうちの第1のトライグラムと一致する、トライグラムに対応付けられた前記インデックス付トライグラム表におけるワードを識別するステップと、 前記ワードをトライグラム増補データセットに格納するステップとを含み、 前記トライグラム増補データセットを前記1つ以上の参照データセットと比較するステップと、 前記比較に基づいて前記トライグラム増補データセットと前記1つ以上の参照データセットとの間の一致を判断するステップとを含み、 前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別するステップは、前記比較に基づく前記トライグラム増補データセットと前記1つ以上の参照データセットとの間の一致を用いて実行される、請求項5に記載の方法。
  7. 7
    前記1つ以上の参照データセットの少なくとも一部を表わすデータ構造を生成するステップをさらに含み、前記データ構造における各ノードは、前記1つ以上の参照データセットから抽出された1つ以上のストリングの中の異なる文字を表わし、 前記入力データセットは、前記データ構造をトラバースすることによって前記1つ以上の参照データセットと比較される、請求項1から6のいずれか一項に記載の方法。
  8. 8
    前記類似性メトリックは、前記入力データセットとの比較における前記1つ以上の参照データセットの共通部分のカーディナリティに基づく値として計算され、 前記値は前記カーディナリティによって正規化され、 前記値は、前記1つ以上の参照データセットのサイズに基づく第1のファクタだけ減じられ、前記値は、前記1つ以上の参照データセットのタイプに基づく第2のファクタだけ減じられる、請求項7に記載の方法。
  9. 9
    前記類似性メトリックは、前記1つ以上の参照データセットのうちの各参照データセットについて、前記入力データセットと前記参照データセットとの間のコサイン類似度を求めることによって計算される、請求項1から8のいずれか一項に記載の方法。
  10. 10
    前記一致を識別するステップは、前記1つ以上の参照データセットのうち、前記1つ以上の参照データセット各々について計算した前記類似性メトリックに基づく類似性の程度が最大である参照データを求めるステップを含む、請求項1から9のいずれか一項に記載の方法。
  11. 11
    前記入力データセットは1つ以上のデータ列にフォーマットされる、請求項1から10のいずれか一項に記載の方法。
  12. 12
    データ強化システムであって、 複数の入力データソースと、 クラウドコンピューティングインフラストラクチャシステムとを備え、前記クラウドコンピューティングインフラストラクチャシステムは、 少なくとも1つの通信ネットワークを通して前記複数の入力データソースに通信可能に結合されかつ複数のデータターゲットに通信可能に結合された1つ以上のプロセッサと、 前記1つ以上のプロセッサに結合されたメモリとを含み、前記メモリは、データ強化サービスを提供することを指示する命令を格納し、前記命令は、前記1つ以上のプロセッサによって実行されたときに、前記1つ以上のプロセッサに、 入力データセットを前記複数の入力データソースのうちの1つ以上の入力データソースから受けることと、 前記入力データセットを、参照ソースから取得した1つ以上の参照データセットと比較することと、 前記1つ以上の参照データセット各々について類似性メトリックを計算することとを実行させ、前記類似性メトリックは、前記入力データセットとの比較における前記1つ以上の参照データセット各々の類似性の程度を示し、 前記類似性メトリックに基づいて前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別することと、 前記1つ以上の参照データセット各々について計算した前記類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示すグラフィカルインターフェイスを生成することと、 前記1つ以上の参照データセット各々について計算した前記類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示すグラフィカルなビジュアライゼーションをレンダリングすることとを実行させる、データ強化システム。
  13. 13
    前記1つ以上の参照データセットは、ドメインに対応付けられた用語を含み、前記類似性メトリックは、前記1つ以上の参照データセット各々について計算されたマッチングスコアであり、前記マッチングスコアは、前記参照データセットに関するメトリックを示す第1の値と前記入力データセットと前記参照データセットとの比較に基づくメトリックを示す第2の値とを含む1つ以上の値を用いて計算され、前記グラフィカルなビジュアライゼーションはレンダリングされることによって前記マッチングスコアの計算に用いられる1つ以上の値を示す、請求項12に記載のデータ強化システム。
  14. 14
    前記1つ以上の値は、前記入力データセットと前記データセットとの間で一致する用語の度数値と、前記データセットの母集団値と、前記入力データセットと前記データセットとの間で一致する異なる用語の数を示す固有マッチング値と、前記データセット内の用語の数を示すドメイン値と、前記データセットのキュレーションの程度を示すキュレーションレベルとを含む、請求項13に記載のデータ強化システム。
  15. 15
    前記命令はさらに、前記1つ以上のプロセッサによって実行されたときに、前記1つ以上のプロセッサに、 アグリゲーションサービスから取得した増補データに基づいて増補リストを生成することと、 前記増補リストに基づいて前記入力データセットを増補することと、 前記1つ以上の参照データセットに基づいてインデックス付トライグラム表を生成することとを実行させ、 増補後の前記入力データセットにおけるワードごとに、 前記ワードのトライグラムを作成することと、 前記トライグラム各々を前記インデックス付トライグラム表と比較することと、 前記トライグラムのうちの第1のトライグラムと一致する、トライグラムに対応付けられた前記インデックス付トライグラム表におけるワードを識別することと、 前記ワードをトライグラム増補データセットに格納することとを実行させ、 前記トライグラム増補データセットを前記1つ以上の参照データセットと比較することと、 前記比較に基づいて前記トライグラム増補データセットと前記1つ以上の参照データセットとの間の一致を判断することとを実行させ、 前記1つ以上の参照データセットと比較される前記入力データは、前記増補リストに基づいて増補され、 前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別することは、前記比較に基づく前記トライグラム増補データセットと前記1つ以上の参照データセットとの間の一致を用いて実行される、請求項12から14のいずれか一項に記載のデータ強化システム。
  16. 16
    非一時的なコンピュータ可読記憶媒体であって、前記非一時的なコンピュータ可読記憶媒体に格納された命令を含み、前記命令は、1つ以上のプロセッサによって実行されたときに、前記1つ以上のプロセッサに、 入力データセットを1つ以上の入力データソースから受けることと、 データ強化サービスのコンピューティングシステムによって、前記入力データセットを、参照ソースから取得した1つ以上の参照データセットと比較することと、 前記コンピューティングシステムによって、前記1つ以上の参照データセット各々について類似性メトリックを計算することとを実行させ、前記類似性メトリックは、前記入力データセットとの比較における前記1つ以上の参照データセット各々の類似性の程度を示し、 前記コンピューティングシステムによって、前記類似性メトリックに基づいて前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別することと、 前記コンピューティングシステムによって、前記1つ以上の参照データセット各々について計算した前記類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示すグラフィカルインターフェイスを生成することと、 前記グラフィカルインターフェイスを用いて、前記1つ以上の参照データセット各々について計算した前記類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示すグラフィカルなビジュアライゼーションをレンダリングすることとを実行させる、非一時的なコンピュータ可読記憶媒体。
  17. 17
    方法であって、 入力データセットを1つ以上の入力データソースから受けるステップと、 データ強化サービスのコンピューティングシステムによって、前記入力データセットを、参照ソースから取得した1つ以上の参照データセットと比較するステップと、 前記コンピューティングシステムによって、前記1つ以上の参照データセット各々について類似性メトリックを計算するステップとを含み、前記類似性メトリックは、前記入力データセットとの比較における前記1つ以上の参照データセット各々の類似性の程度を示し、 前記コンピューティングシステムによって、前記類似性メトリックに基づいて前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別するステップと、 前記入力データセットをマッチング情報とともに格納するステップとを含み、前記マッチング情報は、前記1つ以上の参照データセット各々について計算した類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示す、方法。
  18. 18
    前記入力データセットと前記1つ以上の参照データセットとの間の一致の識別に基づいて、前記入力データセットのカテゴリラベルを識別するステップと、 前記カテゴリラベルに対応付けて前記入力データセットを格納するステップとをさらに含む、請求項17に記載の方法。
  19. 19
    前記類似性メトリックは、Jaccard係数、Tversky係数、またはDice-Sorensen係数のうちの1つ以上を用いて計算される、請求項17または18に記載の方法。
  20. 20
    前記入力データセットは、グラフマッチングまたは意味類似性マッチングのうちの1つ以上を用いて、前記1つ以上の参照データセットと比較される、請求項17から19のいずれか一項に記載の方法。
  21. 21
    データ強化システムであって、 複数の入力データソースと、 クラウドコンピューティングインフラストラクチャシステムとを備え、前記クラウドコンピューティングインフラストラクチャシステムは、 少なくとも1つの通信ネットワークを通して前記複数の入力データソースに通信可能に結合されかつ複数のデータターゲットに通信可能に結合された1つ以上のプロセッサと、 前記1つ以上のプロセッサに結合されたメモリとを含み、前記メモリは、データ強化サービスを提供することを指示する命令を格納し、前記命令は、前記1つ以上のプロセッサによって実行されたときに、前記1つ以上のプロセッサに、 入力データセットを1つ以上の入力データソースから受けることと、 前記入力データセットを、参照ソースから取得した1つ以上の参照データセットと比較することと、 前記1つ以上の参照データセット各々について類似性メトリックを計算することとを実行させ、前記類似性メトリックは、前記入力データセットとの比較における前記1つ以上の参照データセット各々の類似性の程度を示し、 前記類似性メトリックに基づいて前記入力データセットと前記1つ以上の参照データセットとの間の一致を識別することと、 前記入力データセットをマッチング情報とともに格納することとを実行させ、前記マッチング情報は、前記1つ以上の参照データセット各々について計算した類似性メトリックを示しかつ前記入力データセットと前記1つ以上の参照データセットとの間の前記識別した一致を示す、データ強化システム。
  22. 22
    前記命令はさらに、前記1つ以上のプロセッサによって実行されたときに、前記1つ以上のプロセッサに、 前記入力データセットと前記1つ以上の参照データセットとの間の一致の識別に基づいて、前記入力データセットのカテゴリラベルを識別することと、 前記カテゴリラベルに対応付けて前記入力データセットを格納することとを実行させる、請求項21に記載のデータ強化システム。
  23. 23
    前記類似性メトリックは、Jaccard係数、Tversky係数、またはDice-Sorensen係数のうちの1つ以上を用いて計算される、請求項21または22に記載のデータ強化システム。
  24. 24
    前記入力データセットは、グラフマッチングまたは意味類似性マッチングのうちの1つ以上を用いて、前記1つ以上の参照データセットと比較される、請求項21または23に記載のデータ強化システム。
Independent claims24