There was an error while loading. Please reload this page.
文間類似度はSemEvalのTask1で行われている。 まず全体像をつかむために以下の論文を読む。
具体的な手法については以下の論文を調査してみる。
Quoraによるとこの2つが有望そう。ただし、TF-KLDの方は評価が一つのデータセットでしか行われていない。
State-of-the-artな結果については aclweb に一覧で表示されているので参考にする。
SemEvalのTask1は英語の文間の類似度を求めるタスクを扱っている。具体的なドメインとしては4つある。
学習用データセットには6段階のラベルが付いており、0は全く類似していない、5が完全に同じ内容としている。 評価データセットはクラウドソーシングを使って作っている。 評価は人間が付与したラベルとの間でピアソンの相関係数を使って行われている。
以下でわかりやすく解説してくれている
Python実装