JP7199522B2

Correlated incremental loading of multiple data sets for an interactive data prep application

Abstract

This record has no abstract on file.

JP7199522B2, drawing sheet 1
Sheet 1 of 62

Term

13 yearsleft in the term

Expires 1 October 2039.

  1. Priority
  2. Filed
  3. Granted
  4. Today
  5. Expires

20 claims: 3 independent, 17 dependent

  1. 1
    後続の分析のためにデータを準備するためのコンピュータシステムであって、1つ以上のプロセッサと、メモリと、前記メモリに格納され、前記1つ以上のプロセッサによって実行されるように構成された1つ以上のプログラムと、を含み、前記1つ以上のプログラムが、データフローペイン、プロファイルペイン、およびデータペインを含むユーザインターフェースを表示することであって、前記データフローペインが、データソースを識別するノード/リンクフローダイアグラムを表示する、表示することと、前記データソースに対する複数のクエリの各々について、行数を指定する初期ブロックサイズを用いて、前記データソースに対して非同期で前記それぞれのクエリを発行すること、前記それぞれのクエリを満たす前記データソースからそれぞれの行の初期セットを取得すると、前記クエリを満たす全ての前記行が取得されるまで、更新されたブロックサイズで前記それぞれのクエリを非同期的に繰り返すこと、および前記それぞれのクエリを満たす取得された行をローカルキャッシュに格納することと、定期的に、全ての前記クエリで前記ローカルキャッシュに取得および保存された前記データソースの行を識別する一意の識別子を決定すること、および前記一意の識別子が変更された場合、前記プロファイルペインを更新して、前記データソース内の複数のデータフィールドのデータ値ヒストグラムを表示することであって、各データ値ヒストグラムの各バーが、(i)前記一意の識別子によって指定され、(ii)それぞれのデータフィールドに対して単一の特定のデータ値またはデータ値の範囲を有する前記データソースの行数を示す、表示することと、これにより、複数の独立したクエリが非同期で実行されている間、前記プロファイルペインにデータの一貫したビューを提供することと、を行うための命令を含む、コンピュータシステム。
  2. 2
    前記データソースに対するそれぞれのクエリの各繰り返しが、前記それぞれのクエリの過去のブロックサイズよりも大きいブロックサイズを指定する、請求項1に記載のコンピュータシステム。
  3. 3
    前記データソースに対するそれぞれのクエリの各繰り返しが、前記それぞれのクエリの過去のブロックサイズの2倍のサイズであるブロックサイズを指定する、請求項2に記載のコンピュータシステム。
  4. 4
    前記一意の識別子の前記定期的な決定は、それが1秒に1回以下発生するように調整される、請求項1に記載のコンピュータシステム。
  5. 5
    前記一意の識別子が変更された場合、前記一意の識別子に従って前記データペインに表示された前記データソースからデータの行を更新することをさらに含む、請求項1に記載のコンピュータシステム。
  6. 6
    前記 ノード/リンク フローダイアグラムの第1のノードが最初に選択され、前記プロファイルペインに表示される前記データ値ヒストグラムが、前記第1のノードの計算されたデータセットに対応する、請求項1に記載のコンピュータシステム。
  7. 7
    前記 クエリの実行中に、前記 ノード/リンク フローダイアグラムの第2のノードのユーザ選択を受信することと、前記ユーザ選択に応じて、前記プロファイルペインを更新して、前記第2のノードの結果セットからの複数のデータフィールドの新しいデータ値ヒストグラムを表示することであって、各データ値ヒストグラムの各バーが、それぞれのデータフィールドに対して単一の特定のデータ値またはデータ値の範囲を有する前記結果セットの行数を示す、表示することと、をさらに含む、請求項6に記載のコンピュータシステム。
  8. 8
    前記一意の識別子が、前記データソースの主キーフィールドの主キー値であり、前記データソースの行が、前記行に対応するキー値が前記主キー値よりも小さい場合に、前記一意の識別子によって指定される、請求項1に記載のコンピュータシステム。
  9. 9
    前記一意の識別子が、高水準の行番号であり、前記データソースの行が、前記行に対応する行番号が前記高水準の行番号以下である場合に、前記一意の識別子によって指定される、請求項1に記載のコンピュータシステム。
  10. 10
    前記クエリの各々が、同じソート順序を有する、請求項9に記載のコンピュータシステム。
  11. 11
    前記 クエリのうちの1つ以上が実行されている間、ユーザ入力を受信して、前記プロファイルペインに表示されるデータを変更することと、前記ユーザ入力に応答して、前記ユーザ入力を前記データソースから前記取得した行に適用される操作に変換し、前記操作の定義を保存することと、をさらに含み、前記一意の識別子が変更された場合、前記プロファイルペインを更新することが、 前記プロファイルペインに表示される前記データが変更された後に、 前記クエリによって取得された 追加の 行に前記定義された操作を適用することを含む、請求項1に記載のコンピュータシステム。
  12. 12
    前記ユーザ入力が、最初のデータフィールドの最初のデータ値ビンに対応するデータ値ヒストグラムの単一のバーの選択であり、これにより、前記プロファイルペインに表示された前記データを、前記最初のフィールドのデータ値が前記最初のデータ値ビンに対応する前記データソースの行にフィルタ処理し、前記保存された操作により、前記プロファイルペインに表示された前記データが、前記最初のフィールドのデータ値が前記最初のデータ値ビンに対応する前記データソースの行にフィルタ処理するフィルタに適用される、請求項11に記載のコンピュータシステム。
  13. 13
    前記ユーザ入力により、最初のデータフィールドに対応するデータ値ヒストグラムが前記プロファイルペインから削除され、前記一意の識別子が変更された場合に前記プロファイルペインを更新することが、前記データペインから前記最初のデータフィールドを省略することを含む、請求項11に記載のコンピュータシステム。
  14. 14
    前記ユーザ入力により、前記クエリによって取得された1つ以上の他の列の関数として計算された、対応するデータ値ヒストグラムを備えた計算列が前記プロファイルペインに追加され、前記一意の識別子が変更された場合に前記プロファイルペインを更新することが、前記関数および前記データソースから取得された前記追加の行に従って前記計算列の前記データ値ヒストグラムを更新することを含む、請求項11に記載のコンピュータシステム。
  15. 15
    前記ユーザ入力により、前記プロファイルペインの最初のデータ列の名前が新しい名前に変更され、前記一意の識別子が変更された場合に前記プロファイルペインを更新することが、前記最初のデータ列の前記新しい名前を保持することを含む、請求項11に記載のコンピュータシステム。
  16. 16
    前記ユーザ入力により、変換関数に従って、前記プロファイルペインの最初のデータ列のデータ型が新しいデータ型に変換され、前記一意の識別子が変更された場合に前記プロファイルペインを更新することが、前記データソースから取得した前記追加の行の前記最初のデータ列に前記変換関数を適用することを含む、請求項11に記載のコンピュータシステム。
  17. 17
    前記ユーザ入力により、前記プロファイルペインの最初のデータ列のビンに対応するヒストグラムバーが削除され、前記一意の識別子が変更された場合に前記プロファイルペインを更新することは、前記行が前記ビンに一致する前記最初のデータ列のデータ値を有する場合、取得した前記追加の行のいずれかを削除することを含む、請求項11に記載のコンピュータシステム。
  18. 18
    前記ビンが、個々のデータ値またはデータ値の連続範囲に対応する、請求項17に記載のコンピュータシステム。
  19. 19
    1つ以上のプロセッサ、メモリ、およびディスプレイを有するコンピュータシステムによって実行するように構成された1つ以上のプログラムを格納する非一時的コンピュータ可読記憶媒体であって、前記1つ以上のプログラムが、データフローペイン、プロファイルペイン、およびデータペインを含むユーザインターフェースを表示することであって、前記データフローペインが、データソースを識別するノード/リンクフローダイアグラムを表示する、表示することと、前記データソースに対する複数のクエリの各々について、行数を指定する初期ブロックサイズを用いて、前記データソースに対して非同期で前記それぞれのクエリを発行すること、前記それぞれのクエリを満たす前記データソースからそれぞれの行の初期セットを取得すると、前記クエリを満たす全ての前記行が取得されるまで、更新されたブロックサイズで前記それぞれのクエリを非同期的に繰り返すこと、および前記それぞれのクエリを満たす取得された行をローカルキャッシュに格納することと、定期的に、全ての前記クエリで前記ローカルキャッシュに取得および保存された前記データソースの行を識別する一意の識別子を決定すること、および前記一意の識別子が変更された場合、前記プロファイルペインを更新して、前記データソース内の複数のデータフィールドのデータ値ヒストグラムを表示することであって、各データ値ヒストグラムの各バーが、(i)前記一意の識別子によって指定され、(ii)それぞれのデータフィールドに対して単一の特定のデータ値またはデータ値の範囲を有する前記データソースの行数を示す、表示することと、これにより、複数の独立したクエリが非同期で実行されている間、前記プロファイルペインにデータの一貫したビューを提供することと、を行うための命令を含む、非一時的コンピュータ可読記憶媒体。
  20. 20
    後続の分析のためにデータを準備する方法であって、ディスプレイ、1つ以上のプロセッサ、および前記1つ以上のプロセッサによって実行されるように構成された1つ以上のプログラムを格納するメモリを有するコンピュータシステムにおいて、データフローペイン、プロファイルペイン、およびデータペインを含むユーザインターフェースを表示することであって、前記データフローペインが、データソースを識別するノード/リンクフローダイアグラムを表示する、表示することと、前記データソースに対する複数のクエリの各々について、行数を指定する初期ブロックサイズを用いて、前記データソースに対して非同期で前記それぞれのクエリを発行すること、前記それぞれのクエリを満たす前記データソースからそれぞれの行の初期セットを取得すると、前記クエリを満たす全ての前記行が取得されるまで、更新されたブロックサイズで前記それぞれのクエリを非同期的に繰り返すこと、および前記それぞれのクエリを満たす取得された行をローカルキャッシュに格納することと、定期的に、全ての前記クエリで前記ローカルキャッシュに取得および保存された前記データソースの行を識別する一意の識別子を決定すること、および前記一意の識別子が変更された場合、前記プロファイルペインを更新して、前記データソース内の複数のデータフィールドのデータ値ヒストグラムを表示することであって、各データ値ヒストグラムの各バーが、(i)前記一意の識別子によって指定され、(ii)それぞれのデータフィールドに対して単一の特定のデータ値またはデータ値の範囲を有する前記データソースの行数を示す、表示することと、これにより、複数の独立したクエリが非同期で実行されている間、前記プロファイルペインにデータの一貫したビューを提供することと、を含む、方法。
Independent claims20