Nova Patents
JP4452012B2

Evaluating distinctiveness of document

Abstract

This record has no abstract on file.

Term

Term ended

Expired 4 July 2022, 4.2 years ago.

  1. Priority and filed
  2. Granted
  3. Expired
  4. Today

6 claims: 6 independent, 0 dependent

  1. 1
    一つ以上 の文書セグメントから成る比較文書 T に対する一つ以上の文書セグメントから成る着目文書 D に含まれる用語の特有度を評価し て 、特有な用語を選択する方法 であって、 (a)前記比較文書 T と前記着目文書 Dと に含まれる前記文書セグメント毎に、前記文書セグメントに出現する用語の出現頻度に関連した値を成分とする文書セグメントベクトル t k ,d k であって、 前記比較文書Tに含まれるk番目の文書セグメントの文書セグメントベクトルt k は、t k =(t k1 ,...,t kJ ) T と表され(Tはベクトルの転置を表わし、Jは前記着目文書Dと前記比較文書Tに現れる用語の種類数の大きいほうを表す)、 前記着目文書Dに含まれるk番目の文書セグメントの文書セグメントベクトルd k は、d k =(d k1 ,...,d kJ ) T と表される 文書セグメントベクトルを生成するステップと、 (b)前記文書セグメントベクトル d k ,t k より、 前記比較文書 T と前記着目文書 D に対応する平方和行列 S T ,S D それぞれ を生成するステップと、 (c)前記比較文書 T と前記着目文書 Dと に対応する平方和行列 S T ,S D から着目文書 Dのi次のトピック差分因子ベクトルであって、S D α=λS T αなる一般固有値問題のi次の固有ベクトルα i により計算されるi次の トピック差分因子ベクトル を、一定次数Lまで求めるステップと、 (d)前記着目文書 D 及び前記比較文書 T の各文書セグメントに対して、対応する文書セグメントベクトル d k ,t k それぞれと、前記一定次数Lまでのi次のトピック差分因子ベクトルそれぞれと の内積の値 y ki ,z ki それぞれを 求めるステップと、 (e)前記着目文書 Dと前記比較文書Tと に含まれる各用語の 文書セグメントベクトルd k ,t k それぞれと、前記一定次数Lまでのトピック差分因子ベクトルそれぞれとの内積の値y k i ,z ki それぞれの大きさに対応する前記一定次数Lまでのi次の特有度distinc(w j ,i)、及び、前記一定次数までのi次の特有度の合計に対応する総合特有度distinc(w j )を 求めるステップと、 (f) 前記一定次数Lまでのi次の特有度distinc(w j ,i)それぞれ または総合特有度 distinc(w j )に基づいて、 着目文書 D に特有な用語を選択するステップ と をコンピュータに実行させる方法であって、 前記着目文書Dおよび前記比較文書Tに含まれる各用語の前記一定次数Lまでのi次の特有度distinc(w j ,i)それぞれは、各用語の各文書セグメントにおける頻度と、前記文書セグメントベクトルd k ,t k と前記一定次数Lまでのi次の特有度distinc(w j ,i)それぞれとの内積値y ki ,z ki との間の相関係数の絶対値もしくは2乗値により決定され、総合特有度distinc(w j )は各次の特有度を一定次数加えて決定されること を特徴とする方法。
  2. 2
    前記着目文書 D において、 前記文書セグメント d k の数がM個であり、 前記kは、k=1,..,Mと表され、 d kj は前記文書セグメントに出現するj番目の用語の出現頻度に関連した値を表わす、 とした場合、 前記着目文書 D の平方和行列 S D が、 となるように求められ、 前記比較文書 T において、前記文書セグメントの数が Nであり、 t kj は前記文書セグメントに出現するj番目の用語の出現頻度に関連した値を表わす、 とした場合、 前記比較文書 T の平方和行列 S T が で計算されること を特徴とする請求項 1 に記載の方法。
  3. 3
    一つ以上 の文書セグメントから成る比較文書 T に対する一つ以上の文書セグメントから成る着目文書 D に含まれる文書セグメントの特有度を評価し、特有な文書セグメントを選択する方法 であって、 (a)前記比較文書 T と前記着目文書 Dと に含まれる前記文書セグメント毎に、前記文書セグメントに出現する用語の出現頻度に関連した値を成分とする文書セグメントベクトル t k ,d k であって、 前記比較文書Tに含まれるk番目の文書セグメントの文書セグメントベクトルt k は、t k =(t k1 ,...,t kJ ) T と表され(Tはベクトルの転置を表わし、Jは前記着目文書Dと前記比較文書Tに現れる用語の種類数の大きいほうを表す)、 前記着目文書Dに含まれるk番目の文書セグメントの文書セグメントベクトルd k は、d k =(d k1 ,...,d kJ ) T と表される 文書セグメントベクトルを生成するステップと、 (b)前記着目文書 D の各文書セグメントに対して、対応する文書セグメントベクトル d k と着目文書 D との類似度 sim(D, d k )及び比較文書Tとの類似度sim(T, d k )を、下式により 求めるステップと、 (c)前記着目文書 D の各文書セグメントに対して、前記着目文書 D との類似度 sim(D, d k ) 及び前記比較文書 T との類似度 sim(T, d k ) を用いて、 下式により特有度distinc(d k ) を求めるステップと、 (d) 前記特有度distinc(d k )に基づいて 着目文書 D に特有な文書セグメントを選択するステップ と をコンピュータに実行させる方法。
  4. 4
    一つ以上 の文書セグメントから成る比較文書 T に対する一つ以上の文書セグメントから成る着目文書 D に含まれる文書セグメントの特有度を評価し、特有な文書セグメントを選択する方法 であって、 (a)前記比較文書 T と前記着目文書 Dと に含まれる前記文書セグメント毎に、前記文書セグメントに出現する用語の出現頻度に関連した値を成分とする文書セグメントベクトル t k ,d k であって、 前記比較文書Tに含まれるk番目の文書セグメントの文書セグメントベクトルt k は、t k =(t k1 ,...,t kJ ) T と表され(Tはベクトルの転置を表わし、Jは前記着目文書Dと前記比較文書Tに現れる用語の種類数の大きいほうを表す)、 前記着目文書Dに含まれるk番目の文書セグメントの文書セグメントベクトルd k は、d k =(d k1 ,...,d kJ ) T と表される 文書セグメントベクトルを生成するステップと、 (b)前記着目文書 D の各文書セグメントに対して、対応する文書セグメントベクトル d k と着目文書 D との類似度 sim(D, d k )及び比較文書Tとの類似度sim(T, d k )を、下式により求めるステップであって、 前記着目文書Dの平均文ベクトル及び前記比較文書Tの平均文ベクトルそれぞれを、 としたときに、 前記着目文書Dの類似度sim(D, d k )は、下式 により求められ、 前記比較文書Tの類似度sim(T, d k )は、下式 により求められる ステップと、 (c)前記着目文書 D の各文書セグメントに対して、前記着目文書 D との類似度 sim(D, d k ) 及び前記比較文書 T との類似度 sim(T, d k ) を用いて、 下式により特有度distinc(d k ) を求めるステップと、 (d) 前記特有度distinc(d k ) から着目文書 D に特有な文書セグメントを選択するステップ と をコンピュータに実行させる方法。
  5. 5
    一つ以上 の文書セグメントから成る比較文書に対して一つ以上の文書セグメントから成る着目文書に含まれる用語の特有度を評価し、特有な用語を選択する方法 であって、 (a) 前記比較文書Tと前記着目文書Dとに含まれる前記文書セグメント毎に、前記文書セグメントに出現する用語の出現頻度に関連した値を成分とする文書セグメントベクトルt k ,d k であって、 前記比較文書Tに含まれるk番目の文書セグメントの文書セグメントベクトルt k は、t k =(t k1 ,...,t kJ ) T と表され(Tはベクトルの転置を表わし、Jは前記着目文書Dと前記比較文書Tに現れる用語の種類数の大きいほうを表す)、 前記着目文書Dに含まれるk番目の文書セグメントの文書セグメントベクトルd k は、d k =(d k1 ,...,d kJ ) T と表される 文書セグメントベクトルを生成するステップと、 (b) 前記着目文書Dの各文書セグメントに対して、対応する文書セグメントベクトルd k と着目文書Dとの類似度sim(D, d k )及び比較文書Tとの類似度sim(T, d k )を、下式により求めるステップと、 (c) 前記着目文書Dの各文書セグメントに対して、前記着目文書Dとの類似度sim(D, d k )及び前記比較文書Tとの類似度sim(T, d k )を用いて、下式により特有度distinc(d k )を求めるステップと、 (d) 前記比較文書Tの各文書セグメントに対して、前記着目文書Dとの類似度sim(D, t k )及び前記比較文書Tとの類似度sim(T, d k )を用いて特有度distinc(t k )を求めるステップと、 (e)Mを着目文書Dの文書セグメントの数とし、Nを前記比較文書Tの文書セグメントの数として、下式に基づいて、用語w j の特有度distinc(w j ) を求めるステップと、 (f) 前記特有度distinc(w j )に基づいて、 着目文書に特有な用語を選択するステップと をコンピュータに実行させる方法。
  6. 6
    (a) 前記比較文書Tと前記着目文書Dとに含まれる前記文書セグメント毎に、前記文書セグメントに出現する用語の出現頻度に関連した値を成分とする文書セグメントベクトルt k ,d k であって、 前記比較文書Tに含まれるk番目の文書セグメントの文書セグメントベクトルt k は、t k =(t k1 ,...,t kJ ) T と表され(Tはベクトルの転置を表わし、Jは前記着目文書Dと前記比較文書Tに現れる用語の種類数の大きいほうを表す)、 前記着目文書Dに含まれるk番目の文書セグメントの文書セグメントベクトルd k は、d k =(d k1 ,...,d kJ ) T と表される 文書セグメントベクトルを生成するステップと、 (b) 前記着目文書Dの各文書セグメントに対して、対応する文書セグメントベクトルd k と着目文書Dとの類似度sim(D, d k )及び比較文書Tとの類似度sim(T, d k )を、下式により求めるステップであって、 前記着目文書Dの平均文ベクトル及び前記比較文書Tの平均文ベクトルそれぞれを、 としたときに、 前記着目文書Dの類似度sim(D, d k )は、下式 により求められ、 前記比較文書Tの類似度sim(T, d k )は、下式 により求められる ステップと、 (c) 前記着目文書Dの各文書セグメントに対して、前記着目文書Dとの類似度sim(D, d k )及び前記比較文書Tとの類似度sim(T, d k )を用いて、下式により特有度distinc(d k )を求めるステップと、 (d) 前記比較文書Tの各文書セグメントに対して、前記着目文書Dとの類似度sim(D, t k )及び前記比較文書Tとの類似度sim(T, d k )を用いて特有度distinc(t k )を求めるステップと、 (e) Mを着目文書Dの文書セグメントの数とし、Nを前記比較文書Tの文書セグメントの数として、下式に基づいて、用語w j の特有度distinc(w j )を求めるステップと、 (f) 前記特有度distinc(w j )に基づいて、 着目文書に特有な用語を選択するステップと をコンピュータに実行させる方法。
Independent claims6