ラベル 自然言語 の投稿を表示しています。 すべての投稿を表示
ラベル 自然言語 の投稿を表示しています。 すべての投稿を表示

2007年5月26日土曜日

質問応答技術

質問応答技術は、自然言語で記述された任意の質問に対して大量の組織化されていない情報から答えを得る技術である。例えば「ワールドカップで優勝したのはどこですか」という質問に対して、数年分の新聞記事から答えとなる情報を取り出す技術である。質問応答技術は情報検索、情報抽出、自動要約などの自然言語処理の研究と関連がある。まず、質問応答システムが与えられた質問に答えるためには、質問文中の情報を利用して大量のテキストからある程度の情報まで絞り込む必要がある。これには情報検索技術が不可欠である。さらに、絞り込まれた範囲から答えとなる情報を取り出す技術として情報抽出技術がある。質問応答においては得られた答えが正しいものであるという証拠を示すため、答えが得られた根拠となる情報を提示することも重要である。根拠となる情報としては、答えが得られたテキスト全体を示す方法や、テキスト中の一部を提示する方法が考えられる。しかし根拠となる情報がテキスト中の広範囲に分散している場合には、それを要約して示すことも考えられる。したがって、文書要約技術も質問応答には重要な技術であると考えられる。また、「なぜ」や「どのようにして」などの質問に対する答えを求めている場合など、質問の種類によっては答えをテキスト中からそのまま抽出するだけではなく、要約した形で答える場合も考えられる。この点からも文書要約技術は重要な技術である。またユーザのあいまいな質問内容やシステム側が不十分な回答を返した場合に、質問応答システムに対していくつかの補足的な情報を与える必要がある。これをユーザとシステムとのインタラクションによって実現することも考えられる。またシステム自身がユーザに問い合わせて質問のあいまいな部分を解消することも考えられる。そのような一連の質問応答に対応するためには対話処理技術が必要となる。

質問応答処理の流れ

まず質問表現のパターンから回答が何を尋ねているのかの属性を予測するとともに、特徴的なキーワードを抽出する(質問文解析)、次に文書検索により前記キーワード集合に適合するテキスト集合を知識源であるコーパス(辞書の意味、この場合コーパスとなるのは大量のWebサイトだろう)から抽出する。次に絞り込んだテキストから回答属性に合致する回答候補を見つけ出す(回答候補絞込み)そして得られた回答候補に対してキーワードとの単語間距離などの尺度を用いてスコアを計算し上位のスコアのものを回答として選択する。

質問文解析と固有表現抽出

質問文解析によって質問文が回答として求める情報のタイプとしては、会社名、大臣の名前、商品名や各種の数値情報などの固有表現が多い、これらの固有表現の情報抽出について様々な手法が考案されている。フリーのツールとしては固有表現ツールNExTというものがある。

情報検索

大量のデータから効率よく情報を抽出するには情報検索が必要である。検索システムとしてはNamazuなどフリーで公開されているものもある。

回答候補の絞込み

回答候補が何個か抽出できたら、質問文中のキーワードと回答候補が近い位置にあるほど有力としたり、構文的な類似性を利用したりして回答を絞っている。

質疑応答評価プロジェクト

代表的な質問応答技術評価プロジェクトとしてTREC QA Track とNTCIR QACがある。TREC QA Trackは文書検索から情報検索への技術的発展の目指す研究支援および、文書検索分野と情報検索分野の研究者にアピールすることを目的として設けられた。評価方法は簡単な英語の質問が与えられて、それに対してシステムが自動で回答できるかというものである。検索対象となるデータベースの中には必ず正解が含まれているものとする。さらに回答が複数ある質問に答えるlist task、一連の関連質問に答えるcontext taskも設定された。また事物の定義を答えるdefinition taskも追加され、質問応答技術に対する興味範囲が広がってきている。

質問応答技術の今後

これまでの質問の内容は(固有)名詞を答えさせるものが多かった。例えば「ワールドカップの開催期間は何日ですか?」とか「木製の衛星にはどんな名前が付いていますか?」とか「日本の国鳥は何ですか?」などである。しかし最近では「コリン・パウエルとは誰ですか?」という定義を求める質問や、なぜ?を答える質問にどうやって応じたらよいかの研究が始まっている。また最初に述べたが曖昧性を解消するためにユーザとシステムのインタラクションによって必要な情報を補う研究も必要である。また現在質問応答システムの多くは新聞記事を対象としているが、知識源として百科事典を対象としたものやWebの情報を対象とした研究もあり今後の成果が待たれるところである。

参考文献→IPSJ Magazine Vol.45 No.6 June 2004

情報抽出 -情報を整理して提示するー

今回は情報抽出の技術の解説を行い、いくつかの応用システムを紹介する。情報抽出とは特定のテーマの情報を非構造的な文書の中から抽出し、構造化された形で提示するものである。例えば新聞記事の中から「人名」、「会社名」といった特定の固有名詞を抜き出すといった具合である。特定の情報だけを新聞記事のような決まった情報源から抽出する技術は、テキストマイニングを源流としたWebラッパーと呼ばれる技術であるが、今回はこれまでのMUC型(これは1980年代に米国のMessage Understanding Conferenceというところで始まった情報抽出プロジェクト)の情報抽出を紹介し、現在の情報抽出で用いられている代表的な要素技術、そして、新しい情報抽出の展開を具体例を挙げながら紹介する。


これまでの情報抽出技術

MUCにおける情報抽出とは、新聞記事のようなテキストからあらかじめ指定されたイベントや事柄に関する情報を抽出し、その情報を表形式のデータベースに自動的に入力するという技術である。あらかじめ指定したものが「人名」ならば田中さんや佐藤さんのような名前を自動で抽出することができる。簡単そうであるが書かれたテキストからそれを”名前である”とコンピューターに自動認識させるわけであるからなかなか難しい技術である。これを解決するのがパターンマッチングという技術であり、これは例えば「○○は××を発表した」という文であれば○○はおそらく人名であるだろうということをコンピュータに認識させ、学習させる機械学習の事である。

情報抽出のための要素技術

情報抽出のシステムを実現するためにはいくつかの要素技術が必要である。ここでは特に情報抽出に重要なものとして固有表現抽出、照応解析、パターンの自動作成の3つについて解説する。

名前や重要な表現を特定する固有表現抽出

人名、地名、組織名など数種類の固有名詞を抽出するだけならば先ほどのパターンマッチングによる教師付き学習で十分な精度が期待できるが、新しいタイプの固有名詞も抽出する必要がある場合(例えば生物学ならばたんぱく質やDNAの名前など)には200種類程度の固有表現が必要であり現在の教師付き学習では解決しそうにない。それが今後の課題であり、クラスタリング、未知語処理、人手による辞書、ルールの作成といったことが行われている。

照応関係を特定する

一文目で日本銀行という用語が登場し、二文目からはそれが日銀と略されていたり、または「政府に対して金融政策の説明を行った」というように「日本銀行」のことを言っているにもかかわらず完全に省略されたりするような場合(これはゼロ代名詞と呼ばれている)がある。このように代名詞、省略形などで表された表現でも、それが本来何を指しているのかを特定できなければ、適切に情報を抽出できない場合がある、この問題を解決するのが照応解析のシステムである。関連する技術として「2007年5月5日」「5日」「昨日」「一ヶ月前の今日」といった様々な表現がされているのを同一のものであることを認識するタスクもある。

パターンを自動的に学習する

これは要するにあるトピックでよく使われる、あるいは重要な言い回しを研究してそれをコンピュータに記憶、学習させ情報の抽出に役立てようとするものである。

特定の情報について大量に抽出する

この技術は自然言語処理とは別にテキストマイニングの研究分野からも形成されてWebラッパーと呼ばれる技術として形成されている。米国では実際にこの技術を使って自動的に情報を収集したポータルサイトが存在し大きな注目を集めている。以下に実例を紹介する。

製品情報を抽出する

製品情報を収集しポータルサイトとして公開されている有名なサイトの一つにgoogleがやっているfroogleがある、ここでは、googleによって集められた大量のページの中から製品の名前、値段、写真、概要などの情報を自動的に収集する。そして集められた情報を適切な形で表示することによって、製品に関する巨大なポータルサイトが出来上がることになるのである。

リクルート情報を抽出する

製品情報と同様にリクルート情報を広範なWebページから抽出するという応用が行われている。代表的なものにFlipDogという名前のサイトがある。全世界から約20万のリクルート情報を収集しており、地域、カテゴリー、職種などの情報が抽出され、ユーザは自分の希望する職を検索することができる。

論文情報を抽出する

英文の論文を検索している人は知っている人が多いと思うが、Citeseerというシステムがある。これはキーワード検索、引用のリンクをたどった検索、内容の似た論文の検索などができる便利なシステムである。

幅広い情報を抽出する

ここまでは、特定分野の情報抽出についてみてきたが「オデマンド抽出」という幅広い情報を抽出することも依然重要視されている。この精度を上げるために今文章の意味づけをする、言い換え表現を見破る、などということが注目されている。

参考文献→ISSJ Magajin Vol45 No6 June 2004