JP2007164635A

Method, device and program for acquiring synonymous vocabulary

Abstract

Problem to be solved.To automatically acquire a synonym of a vocabulary of a specific class from hypertext. According to the present invention, when a keyword and a higher-level conceptual word of the keyword are input, a highly relevant document including the keyword is acquired, and the link destination of the link in which the keyword is included in the anchor text in the document. Identify the document, identify the link that is the link to the document and have the anchor text that contains the keyword, extract the reference string contained in the link to the identified specific document, and put the keyword and the keyword of the same class The anchor text of the link to the referenced document set is analyzed by the link as the anchor text, the frequency of occurrence of the substring contained in the anchor text is calculated, and the frequency of occurrence is used to obtain the anchor text. Analyze and remove common substrings in the anchor text. [Selection diagram] Fig. 1

JP2007164635A, drawing sheet 1
Sheet 1 of 12

Term

Term ended

Projected expiry passed 15 December 2025, 0.8 years ago.

  1. Priority and filed
  2. Published
  3. Projected expiry
  4. Today

7 claims: 3 independent, 4 dependent

  1. 1
    HTMLやXMLを含む電子テキストを解析し、固有名詞の別名や略称を含む同義語彙を獲得する同義語彙獲得方法であって、 キーワード検索手段が、キーワードと該キーワードの上位概念語が入力されると、該上位概念語とそれぞれのキーワードを含み関連性が高い文書を取得するキーワード検索ステップと、 文書特定手段が、前記キーワード検索ステップで取得した文書中で、前記キーワードがアンカーテキスト中に含まれるリンクのリンク先の文書を特定する文書特定ステップと、 リンク検索手段が、前記キーワード検索取得ステップで取得した前記文書に対するリンクであり、前記キーワードをアンカーテキストに含むリンクを特定するリンク検索ステップと、 アンカーテキスト特定手段が、前記リンク検索ステップで特定された文書へのリンクに含まれる参照文字列を抽出するアンカーテキスト特定ステップと、 クラス別アンカーテキスト文字列統計解析手段が、前記キーワードと同じクラスのキーワードをアンカーテキストとするリンクによって、参照されている文書集合へのリンクのアンカーテキストを解析し、該アンカーテキスト中に含まれる部分文字列の出現頻度を算出し、アンカーテキスト解析結果として記憶手段に格納するクラス別アンカーテキスト文字列統計解析ステップと、 アンカー文字列クリーニング手段が、前記記憶手段に格納された前記部分文字列の出現頻度に基づいて、前記アンカーテキストを解析し、該アンカーテキストの中で一般的な部分文字列を除去するアンカー文字列クリーニングステップと、を行うことを特徴とする同義語彙獲得方法。
  2. 2
    前記キーワード検索ステップにおいて、 入力された前記キーワードと前記上位概念語に基づき、該上位概念語が表す概念を含む、つまり、該上位概念語そのものに限らず、該上位概念語の同義語や同様の意味を表現する語彙の集合が含まれている文書で、かつ、キーワードを含み関連性が高い文書を取得する、請求項1記載の同義語彙獲得方法。
  3. 3
    アンカー文字列クリーニングステップにおいて、 前記アンカーテキストの解析をサイト毎に解析を行う、請求項1記載の同義語彙獲得方法。
  4. 4
    HTMLやXMLを含む電子テキストを解析し、固有名詞の別名や略称を含む同義語彙を獲得する同義語彙獲得装置であって、 キーワードと該キーワードの上位概念語が入力されると、該上位概念語とそれぞれのキーワードを含み関連性が高い文書を取得するキーワード検索手段と、 前記キーワード検索手段で取得した文書中で、前記キーワードがアンカーテキスト中に含まれるリンクのリンク先の文書を特定する文書特定手段と、 前記キーワード検索手段で取得した前記文書に対するリンクであり、前記キーワードをアンカーテキストに含むリンクを特定するリンク検索手段と、 前記リンク検索手段で特定された文書へのリンクに含まれる参照文字列を抽出するアンカーテキスト特定手段と、 前記キーワードと同じクラスのキーワードをアンカーテキストとするリンクによって、参照されている文書集合へのリンクのアンカーテキストを解析し、該アンカーテキスト中に含まれる部分文字列の出現頻度を算出し、アンカーテキスト解析結果として記憶手段に格納するクラス別アンカーテキスト文字列統計解析手段と、 前記記憶手段に格納された前記部分文字列の出現頻度に基づいて、前記アンカーテキストを解析し、該アンカーテキストの中で一般的な部分文字列を除去するアンカー文字列クリーニング手段と、を有することを特徴とする同義語彙獲得装置。
  5. 5
    前記キーワード検索手段は、 入力された前記キーワードと前記上位概念語に基づき、該上位概念語が表す概念を含む、つまり、該上位概念語そのものに限らず、該上位概念語の同義語や同様の意味を表現する語彙の集合が含まれている文書で、かつ、キーワードを含み関連性が高い文書を取得する手段を含む請求項4記載の同義語彙獲得装置。
  6. 6
    アンカー文字列クリーニング手段は、 前記アンカーテキストの解析をサイト毎に解析を行う手段を含む請求項4記載の同義語彙獲得装置。
  7. 7
    コンピュータを、 請求項4乃至5記載の同義語彙獲得装置として機能させることを特徴とする同義語彙獲得プログラム。
Independent claims7