ラベル SEO の投稿を表示しています。 すべての投稿を表示
ラベル SEO の投稿を表示しています。 すべての投稿を表示

2008年7月7日月曜日

Spam Double Funnel

Spam Double Funnel:

サイトにアクセスした時、あるいは広告をクリックした時のデータの流れを探り、そこからスパム活動の傾向を知ろうという研究。米国のサイトを対象とした研究だから分かりにくかった。具体例のサイトとか知らないし。まあともあれこんな内容です。元も論文はこれ→http://www.cs.ucdavis.edu/~hchen/paper/www07.pdf

Abstract

検索エンジンの最適化技術(SEO)を駆使し、Webページの検索結果を上位に上げる事が広く行われている。我々は広く普及したスパム手法である“リダイレクトスパム”に焦点を当てる。リダイレクトスパムはスパムページがトラフィックを第三者のドメインにリダイレクトしていることにより見つけることができる。(リダイレクトスパムは、ユーザがあるスパムページを訪れるとすぐさま広告主である他のページにユーザを飛ばすという手法のスパムであると思ったがどうもこの論文では違うらしい。ググッたところリダイレクトとはプログラムの入力元や出力先を通常とは違うものに変更することとあった。つまりあるページにアクセスあるいはリンクをクリックするとそれが様々なドメインを経由してそのドメインから得た情報をページの一部として表示したり、アクセス情報を記録したりいろいろするらしい。)我々は5層2じょうごモデルをリダイレクトスパムを表現するために用い、層を解析する方法論を提示し、2つの広告キーワードの集合を用いてスパムと思われるドメインを発見する。2つの広告キーワードの一つはスパマーに狙われるキーワードを対象としており、もう一つは広告主に向けて入札額が高いキーワードを対象としている。我々の提案と結果はサーチエンジンがスパムに対して頑健性を増し、サイトの管理人がスパムのドアウェイページを取り除き、広告主がスパムページに広告を載せるような悪い宣伝主を発見するのに有用だろう。


1.Introduction

サーチスパマーとはクオリティの低いページをSEO技術を用いて検索結果上位に引き上げようとする輩を言う。一般的なSEOのテクニックとしてはキーワードの詰め込み、リンクファーム(例えば過度の相互リンク)、Webクローラーとユーザに異なったページを見せる手法(英語でCrawler-browser cloakingという、これはSEOが施されたページをクローラーに見せ、ユーザにはSEOは施されていないが見栄えが良いサイトを見せるという手法。例えばフラッシュで作られたサイトは検索エンジンとの相性が悪いためしばしばこの手法が用いられる。現在でもこの手法が蔓延っているのか分からないが・・・(もう古いテクニックでは?))などがある。最近の手法としては、スパム調査員から逃れるための手法として、click throuth cloakingというものがある。直接URLを入れて入力してきた人に対して偽のコンテンツを見せるというものである。(お気に入りから直接来た人はどうするんだと思ったが、スパムページだとお気に入りに登録する人などいないはずだから良いのだろう)

 

 我々はブラウザーに有名なスパマーによって制御された第3者ドメインを訪れるようにリダイレクトするリダイレクトスパムを扱う。多くのリダイレクトスパムページはシンジケーションを使っており、そこでスパムページの管理者はPay-Per-Clickプログラムに参加し、広告のポータルページを表示する。

 この論文では、我々はシンジケート(アフィリエイト会社やアドセンスのようにPay-per-Clickを行っている仲介業者)が絡んでいるスパムに特に注目して、リダイレクションスパムの活動を総括的に解析する。そして我々は5層2じょうごモデルを提案し、広告をスパムページに表示する流れと広告をクリックした時のトラフィックの流れを表現する。2つの異なった広告の検索用語のベンチマークを構築しStrider Search Ranger system[21]を何万ものスパムリンクを解析するために使い、我々は5層のそれぞれに存在する主要なドメインとドメインの特徴を発見する。

以下2章でSearch Ranger systemを概観し、ダブルファンネルモデルを説明する。3章ではスパマーを対象とした(リダイレクションスパムで良く狙われるターゲットで)検索ベンチマークを作る(スパム対象となる検索語を上から順にピックアップする)。4章ではスパム密度とダブルファンネルを3章で作成したベンチマークを用いて解析する。(どのカテゴリがスパムが多いか、スパム先のサイトはどのサイトが多いかなど)5章では広告主をターゲットとしたベンチマークを作り(入札キーワード額が高い順で検索語をピックアップ)、解析結果を4章の結果と比べる。(広告主が低いクオリティのサイトにリンクをはられて損をしないためにこのような調査も必要?)6章ではリダイレクトのないスパムであるがダブルファンネルモデルと関係するスパムについて討論する。7章では関連研究を述べ、8章では結論を述べる。

  

2.REDIRECTION SPAM

2.1 Definitions:Search Spam and Redirection

リダイレクトスパムは多くのドアウェイページと一つのリダイレクションドメインを結びつけるために大規模なスパマーによって広く使われている。またサーチスパムの中でもRedirectionのスパムはスパムであると決めやすい部類に入るということが書かれている。例えばクローキングや掲示板への大量の書き込みなどを行っている。スパムと適正なSEOとの区別が難しいがドアウェイページはスパムと断定しやすい要素が多くあり扱い易い。

 リダイレクトにはアドセンスのようにセカンドドメインから広告を取ってくる形式のものとセカンドドメインそのものにURLごとページを移動するものの2種類がある。本研究ではその両方を扱う。

2.2 Strider Search Ranger System

Strider Search Ranger Systemは以下のような3つの特徴を持ったスパムを自動で発見するシステムである。

  1. Web Patrol with Search Monkeys[19]

clawler-browser cloakingテクニック(人とクローラーに異なるページを見せるテクニック)を使うスパマーに対してはクライアントサイドも含め全てのスクリプトを実行することによりこれを見破り、click through cloaking テクニック(直接のURL入力に対して異なったページを見せるテクニック、サーチエンジンから来たユーザのみにスパムページを見せる)に対しても、サーチエンジンをクリックしたと見せかけるテクニックによりこれを見破る。

  1. Follow the money through Redirection Tracking

全てのリダイレクトのURLをStrider URL Tracer[20]により盗み出す。

  1. Similarity-based Grouping for Identifying Large-scale Spam

人気のあるクエリから高いスパム密度(high spam density)を得たURLを収集し、その収集したページの類似度(表記はないが恐らくhtmlの構造の類似度)を調べる。調べると、類似度の高いものが同じリダイレクトドメインに繋がっていることが多い。そしてこのように検出されたスパマーは大々的にスパムを行っている場合が多い。次にリダイレクトドメインがスパムコンテンツに対して責任があると確認したのち、そのリダイレクトドメインをシードとして“backward propagation of distrust”[13]を使い他の類似度の高いページを洗い出す。


Search Ranger のスパム発見プロセス

ステップ1:

検索語をサーチエンジンに投げ、Search Monkeyがそれぞれの検索語に対して上位N番目の結果を取り出す。そしてそれぞれのURLをスキャンし全てのURLリダイレクションを記録するXMLファイルを生成する。

ステップ2:

スキャン後、SearchRangerはリダイレクション解析を行う。そして有名なスパマーのリダイレクションドメインにリダイレクトしているURLをスパムと見なす。

ステップ3:

Search Rangerが分類されなかったURL(すなわち有名なスパマーのリダイレクションドメインにリダイレクトしていないURL)を、リダイレクトのトラフィックを受け取った第3者ドメインによってグループ化する。

ステップ4:

Search RangerがサンプルURL(どの辺がサンプルなのか不明??)をそれぞれのグループからスパム検証器に送る、そして検証器はスパムとなりえる要素がないかを調べる。(cloakingや掲示板への大量書き込みなどをチェック)

ステップ5

Search Rangerが分類されなかったURLのグループを出力(この時点でスパムとなり得る要素の値やグループの大きさが一緒に送られる)、人間によってスパムかどうか審査される。スパムだとしたら有名なスパムドメインの集合にそのリダイレクションドメインを加える。


2.3 Spam Double-Funnel

典型的な広告シンジケートビジネスは3つの層からできている。ウェブサイトに魅力的なコンテンツを乗せて集客するサイトオーナー、ウェブサイトに乗せる広告を配信する広告主、広告主とサイトオーナーを繋ぐインフラを提供するシンジケーターである。グーグルアドセンスはシンジケーターの例である。疑わしい広告ビジネスにおいて、スパマーはサイトオーナーの役割と見なす、彼らはクオリティの低いコンテンツを用意し、好ましくないSEOテクニックを使い集客する。スパムが発見されるのを防ぐために、多くのスパマーはオペレーションを2つの層に分断する。最初の層がドアウェイページであり、ドアウェイページのURLはスパマーが検索エンジンの上位に組み込むように努力する。ユーザがドアウェイページへ入ると、ブラウザがスパムコンテンツをリダイレクションドメイン(第2層目)から取ってくるように指示する。スパマーとの結びつきを求めない賢明な広告主のため、多くのシンジケーターは彼らのオペレーションを2つかそれ以上の層に分けている。層は複数のリダイレクトによって結びつけられていて、広告主とスパマーの関係を分かりにくくする。(シンジケーターが広告主を騙す)これらのシンジケーターは大抵小さい会社なので、彼らはしばしば十分なトラフィックのプロバイダーと広告主をひきつけるためにトラフィックアグリゲーションを通じて協力する。

 私たちはこのスパムビジネスを図1のようにモデル化した。広告主はシンジケーターにお金を払い、シンジケーターはアグリゲーターにお金を払いトラフィックを集める。アグリゲーターはシンジケーターと広告主をスパムページから隔離するために仲介役となってトラフィックをスパマーから購入する。スパマーは数百から数千のリダイレクトドメインをセットし何百万ものドアウェイページを設置する。ドアウェイページはリダイレクトドメインから広告を取ってくる。またスパマーは掲示板にドアウェイページのURLを書き込む。


  1. SPAMMER-TARGETED KEYWORDS

リダイレクトスパムで共通の特徴を掴むために、リダイレクトスパムでよく狙われるキーワードとカテゴリを調べた。その結果ほとんどが薬と着メロとギャンブルに関するものであった。以下カテゴリ別にキーワードを示す。

Drugs:phentermine,Viagra,cialis,tramadol,xanax,etc.

Adult:porn,adult dating,sex,etc.

Gambling:casino,poker,roulette,texas holdem,etc.

Ringtone:verizon ringtones,free polyphonic ringtones.etc.

Money:car insurance,debt consolidation,mortgage,etc

・・・残り5カテゴリ

各カテゴリから上位100キーワードをとり1000個のスパマーに狙われる検索語をピックアップした。


4.Redirection-spam analysis

1000個のキーワードでクエリを主要3検索エンジンに投げ、それぞれトップ50のサイトを収集し、リダイレクトスパムを摘出したところ11.6%がスパムであった。我々は最初にカテゴリ別のスパム割合を調べ、その次にダブルファンネルモデルの解析を行う。

4.1 Spam Density Analysis

カテゴリ別のスパムの割合は図2のようになった。薬と、着メロでスパムが多かった。

4.2 Double-Funnel Analysis

我々はダブルファンネルモデルの5層を解析し、それぞれの層にどのようなドメインが関係しているのかを調べ、サーチスパムの傾向を捉えた。

4.2.1 Layer #1 Doorway Domain

図3はドアウェイページへのリンクがどれだけ発見されたかのを表している。また図4は図3のドメインの中でどれくらいの割合でスパムリンクが含まれていたかの割合を示す。


Spam Pages on .gov and .edu Domains

.govや.eduのような商業用でないトップレベルドメインは顕著にスパマーに狙われていた。

図5は.gov/.eduドメインの中で最もスパムの多いURLを持ったドメインを示している。これらは3つの種類に分けられる。それらはUniversal redirectors,Unproteted upload area,Home page-like directoriesである。(ハッキングして何かやってるんだろうが技術的な事はわからない)


4.2.2 Layer #2 Redirection Domains

図6はリダイレクトドメインをドアウェイページにリダイレクトしている数によって上から15個並べた図である。そのうち12個はシンジケートベースであり、テキストベースの広告のポータルページを配信している。2個はポルノ広告を、1個は商業のウェブサイトを配信している。またこれらのドメインの所有者は同じである場合が多く、一握りの主要なスパマーグループが複数のリダイレクトドメインを保持していることがわかった。


4.2.3 The Bottom Three Layers

次に我々はads portalサイト(広告だけをやたらと配信したサイト)のスパムページに焦点を置き12635個のスパムページから5172個のads portalサイトが見つかった。3層と5層に対して、我々はターゲットとなる広告主のURLをads portalサイトから抽出して解析した。4層では、我々はそれぞれのads portalページから一つをランダムに選んで訪問してみて、リダイレクトのトラフィックを記録した。これはシンジケーターのドメイン名が広告ページのコンテンツに現れていないので必要である。

Layer #3 Aggregators

図7はスパムページで広告がクリックされた時、そのトラフィックを受け取るドメインを受け取る広告の数に応じて上から順に並べたものである。

するとトラフィックを受け取るドメインは64.111.のドメインと64.230のドメインの2つでほとんどを占めていることがわかった。


Layer #5: Advertisers(Page analysis)

広告主のドメインネームはしばしばアンカーテキストかマウスオーバーで見ることができる。そのようなドメイン名をads-portalページから取り出し、登場回数順に15位まで並べたところ図8のようになった。ebay.com,orbitz.com等の有名なサイトも見られた。


Layer #4: シンジケーター(click-through analysis)

クリックの解析において、一握りのシンジケーターがリダイレクトの連鎖に含まれている。

Findwhat.com/looksmart.com/7search.comで全体の59%を占めた。彼らはスパムトラフィックアグリゲータと広告主の主要な仲介役のようである。


5.ADVERTISER-TARGETED KEYWORDS

4章では最もスパムの多いキーワード群をベースに5層の解析を行った。しかし、検索する側のユーザや広告主にとって最も関心が高い事は、検索結果にスパムがどれだけ悪影響を及ぼしているかであろう。スパムの多いキーワードであってもあまりユーザや広告主が重視しないようなキーワードであれば問題がない、そこで最も広告の入札額が高い1000個のキーワードについて同様に実験を行った。


5.1 Benchmark of 1000 Most-Spammed Advertiser-Targeted Keyword

入札額上位5000番までのキーワードに対して主要3検索エンジンにクエリをなげスパムの多かった1000キーワードを選択した。するとドラッグやアダルト、ギャンブルの広告が少なくなり他の様々なカテゴリが上がってきた。


5.2 Spam Density Analysis

全体で95753のURLに対して6153個のスパムを発見し、スパム率は5.8%であった。これは前回の実験の半分である。これはスパム率が高いカテゴリが少なかった(ドラッグやアダルトのジャンルのキーワードが少ないのでスパム率が下がるのは当たり前)のと、前回の実験の2週間後に実験を行っており、主要3検索エンジンがスパム除去に乗り出したことが原因として考えられる。(これは微妙だとは思うが)


5.3 Double-Funnel Analysis

我々は5層を解析して、最初のベンチマークと比べた。全ての図で最初のベンチマークで出てきたものと同じものはグレーで表現している。

5.3.1 Layer #1:Doorway Domains

図9はドアウェイページのドメインの上位15個である。スパムが多いキーワードで行った前回の実験(図3参照)との違いは、.infoドメインが増えているという事である。テーブル1から.infoがスパムである確率が.comに比べて異常に高いことが分かる

5.3.2 Layer#2: Redirection Domains

図10は上位15位までのリダイレクションドメインを表している。全てシンジケーションベースとなっていた。ドラッグやアダルトのスパマーがお金に関するサイト(car insurance,mortgage等)のスパマーに入れ替わったのが大きな違いであった。


5.3.3 The Bottom Three Layers

6153のスパムURLのうち2995個の広告のポータルページを抽出した。

Layer #3 Aggregators(Page analysis)

図11は相変わらず66.230と64.111のIPがスパム広告のクリックを受信していた。合計で6153のスパムURLのうち6041個がこのIPを経由していた。

Layer#5

図12は上位15位までのスパム先からたどり着く広告主であり、これは図8のものとかなり違っていた。よく知られたショッピングサイトが多くランキングされるようになった。ここから広告主がターゲットとするキーワードは、スパマーがターゲットとするキーワードよりもショッピングのWebサイトにマッチしているという事が言える。

Layer #4 Syndicators

上位3位のシンジケーターはlooksmart.com、findwhat.com,7search.comであり全体の68%を占めていた。これらのシンジケーターは検索スパム産業に広く深く関わっていることが分かった。


6.OTHER COMMON SPAM

6.1 BLOG FARMS

同じサイトのフォーマット(具体的には良く分からない)で同じブログファームに属しているが、ターゲットとなるキーワードが違うページを発見。

6.2 PARASITE ADS-PORTAL FARMS

既存のサイトに寄生してスパムを逃れる手法。http://(既存のサイトのURL)/(寄生URL)

としてページのアドレスを決定することでスパムを逃れる。


7.RELATED WORK

クローキングに関連する研究

クローキングとリダイレクションを,スパムを隠す戦略であると見なした(Garcia-Molina[8])

クローキングとリダイレクションのWeb検索結果での割合を調べ実態を調査した。また分類機を作成する事でクローキングを発見する方法を提案した。

(Wu and Davison[23],[25])

我々のSearch Monkeysは機械が検索ユーザに成りすますことで、新しいクリッククローキング手法(検索結果以外のクリックに対して他のページを見せるクローキング手法)にも対応できる。


お金とスパムの関係の研究

お金はスパマーにとっての最も大きいインセンティブである。

Jansenはクリック詐欺の問題にも関わらず、スポンサードサーチがスパムの総量を減らすことができたことを観察した。[9](意味不明)

Sarukkaiは検索語の値段(キーワード代の目安のことだと思う)の定量化の手法を提案した。[17]

ChellapillaとChickeringは検索語の上位5000と、キーワード代の高い順の5000を比べ、キーワード代の高いもののサイトの方がスパムが多いという経済的な側面を発見した[5]


リンク関連の研究

スパムをリンクの観点から減らす研究として、不信頼性に基づいたものがある。

スパムサイトのシードからリンクをたどりスパムの度合いを求めていくAnti-Trust Rank(Krishnan and Raj)[12]、似たようなものとして[13],リンクファームについての研究[24]等がある。その他相互リンクに着目した研究[4],[6]、既存のリンク解析技術をスパムの観点から比べた研究[3]等がある。我々の研究ではリンク解析はスパムURLの掲示板への書き込みを解析する事しか行っておらず、リダイレクションの解析に依存してスパム発見を行っている。


コンテンツ関連の研究

ページ内容をアンカーテキストやメタタグから解析して分類器を作りスパムを判定するもの[11],またURL構造や更新期間などからスパムを解析する手法[7],タイトルで使われている言葉や、目に見える割合(恐らくJavascriptなどのプログラムの部分を除いている)に着目したもの[16]、HTML構造の類似性からページ製作者を特定するもの[18],ブログとそれに対するコメントの言語モデルを比較するもの[14](恐らくコメントがスパムなのかそうでないのかを比較する)などがある。


1


2008年1月13日日曜日

クロスレコメンドの効果は?

2006年の春から始まったディレクトリサービスにクロスレコメンドというものがある。これはWebサイトを複数の大手ポータルサイトのディレクトリに登録するサービスである。4万2000円を払い審査に通るとgooやexcite,biglobeなど相当たるサイトのディレクトリに登録される。さてこのサービスにはどれ程のSEO効果があるのだろうか?ちなみに巷ではアクセスアップおよびSEOに対して効果があると様々なメディアで取り上げられていたり、あるサイトではほとんど検索順位が上がらずSEO効果はなかったと書かれていたりと賛否両論である。まあしかし実際にクロスレコメンドに登録して順位が上がったとしても今の検索エンジンは複雑なのでそれがクロスレコメンドへの登録によるものなのか他の要因によるものなのかなどは分かる術はない。そこで検索エンジンのアルゴリズムを考慮してクロスレコメンドの効果について考えたいと思う。
 まず効果があると思われる点が、信用の置ける大手ポータルサイトからのリンクされるという点、それも複数のドメインからのリンクであるという点である。
 質の低いスパムサイトに多数リンクしているようなページからのリンクであればほとんどSEO的には効果がないが、大手ポータルサイトのような質の非常に高いサイトからのリンクは非常に有用なものとなる。さらに複数の大手ポータルサイトからのリンクを受けることになるのでその効果はかなりのものであると言える。また相互リンクではSEO的な効果は半減してしまうが(検索エンジン側でアルゴリズムを公開しているわけではないのでおそらくとしか言えないが常識的に考えればそうだろう)受けるのは一方的な被リンクなわけであるからこれもかなりSEO的にプラスに働いてくるといえる。さらにヤフーディレクトリと比べて登録サイトが少ないのでこの点でもSEO的にプラスである。
 逆に効果が減少してしまうんじゃないかという懸念要素として、検索エンジンの高度化によるクラスタリング機能がまず第一に考えられる。クラスタリング機能とは検索エンジンが内容の似通ったページを類似ページ、ミラーページとしてみなすことである。類似サイトとみなされたページからのリンクはSEO効果が下がるかあるいは全くリンクとしての価値がなくなってしまう恐れがある。ところでこのサービスのリンク集はクロスレコメンドが作っているので、リンク集はgooであってもexciteであってもniftyであってもほとんど同じとなる(リンク先ページとその説明は完全に同じ、サイトのデザイン部分が違うだけ)。すなわちこれらのリンク集は互いに類似ページとみなされてそのSEO価値を失う可能性は大いにある。現在グーグルではクロスレコメンドのディレクトリに対してこのクラスタリングがなされていると思われる節がある。グーグルのバックリンク情報を調べたときにクロスレコメンドと契約しているポータルサイトからのリンクが1つしか出てこない場合が多いからである。(gooからのリンクだけバックリンクとして表示されている場合が多い、ただし実際にクラスタリングされているかどうかはイマイチよくわからない)、YSTに関しては今のところそのような節は見当たらないが、ヤフーディレクトリ側としてはクロスレコメンドは競合サービスといえるのでヤフーディレクトリに登録するよりクロスレコメンドに登録した方がYSTに効果があるなんて事になっては絶対にいけない。だからYSTのアルゴリズムを近々変更してクラスタリング機能を強化してくる可能性は大いにあり得る話だと思う。
 その他のSEO効果が減少する要素としてはリンク集サイトのSEO価値の低下、ディレクトリサービスが始まってから経た年月が少ない(2006年サービス開始、検索エンジンは昔からあるサイトを重視する傾向がある)ということなどが挙げられる。まあこれは最初のクラスタリングに比べたらあまり重要な要素ではないが。
 で、結局総合して考えてクロスレコメンドの効果はどうなんだって事なんですけどグーグルの検索エンジンに対しては割と大きな効果が期待できそうです。クラスタリングに引っかかるとしてもページランクの値の配分に関してはクラスタリングとは何の関係もないです。クラスタリングで他の要因がマイナスになるんでしょうけどそれでもYahooディレクトリに登録するよりはクロスレコメンドに登録したほうが効果が高いと思います。またYSTに関してですけど、こちらはヤフーディレクトリへの登録よりは効果が薄い気はしますがYSTはポータルサイトからのリンクを重視する傾向があるのでそれなりには効果が望めそうです。下手すればヤフーディレクトリを上回る効果が得られるかもしれません(まあ後々上回らないように手を打たれるような気もしますがw)
 まあ複数の大手ポータルサイトがそれぞれ独自にディレクトリを作っていたと仮定してそれに全部登録するよりはSEO効果が薄いけれどもそれなりのSEO効果は十分に望めるのではないかというのが私の見解です。審査もヤフーと比べれば優しく値段も安いので試しにクロスレコメンドに登録してみたらどうかと思います。

 

2007年11月19日月曜日

最新のSEO関連研究 コンテンツスパムの発見法

検索エンジンのコンテンツに関してスパムにならないようにはどうしたら良いか、キーワードが5%が最適とか言っている前に最新の論文を読んだほうが良いだろう。ということでWorld Wide Web Conference2006からそれに該当する論文を読んで要約してみた、これを理解すればどのような行為がスパムになるのかが良くわかるはずである。SEO業者も必見かと思います。

論文はこちら このグラフはこの論文中のものを指しています。 また計算式がみにくいですけどこれも論文中のものを見てもらえれば助かります。

Detecting Spam Web Pages through Content Analysis


  1. Introduction

サイトのクオリティを高める努力をせずに検索エンジンのランキングを外部リンクや人気キーワードのサイトへの埋め込みなどによって不正に上昇させるような行為を検索エンジンスパムという。英語のサイトの13.8%はスパムサイトであるといわれているがこれを看破できないサーチエンジンはリソースの約7分の1を浪費してしまい、更にはサーチエンジンのクオリティの低下でユーザが離れてしまうのでどうにかしなければならない。

これらを防ぐために

  1. Webの大きさを考ると人手を介さず自動でスパムサイトを発見しなければならない

  2. 正統な(スパムでない)サイトをスパムとみなしてはいけない。

  3. クエリーをユーザーが投げる前にはスパムを発見したい(そうすることで無駄なロボット巡回、クエリー処理、インデキシングを省くことができリソースを有効活用できる。)

この論文で我々はスパムを発見する様々な方法、また効率、精度よくスパムサイトを発見するアルゴリズムを作るために、如何に個々の方法を統合する機械学習技術を使ったかを示す。

この論文の構成は次のようになる

§2:実験概要、実世界データセットの紹介

§3:データセット中のスパムの蔓延度合いをドメイン、言語別で比較

§4:スパムの発見する方法を説明

§5:我々の手法の評価

§6:関連研究

§7:結論と将来への展望


2.実験概要とデータセット

データセット:MSNサーチエンジンが収集したサイトデータから105,484,446(約1億)のページをランダムで取ってきたもの。

厳密にはMSNサーチが取り込むデータ自体もスパム排除プログラムを潜り抜けたものであるからランダムとは言えないが。しかし実際にユーザが目にするのはそのようなサイトであるし、我々の実験で得られた結果も、真の意味でランダムでとってきたのよりも悪くなるはずなので控えめな見積もりということができるので十分にこの論文の価値はあるといえる。

  1. どれくらいスパムがあるの?

この章では、どれくらいスパムがWeb上に蔓延しているのかと、トップドメイン名、国などで区切った時あるページの集合が他のページの集合に比べてどれくらいスパムが多いのかを調べていく。Figure2はどのトップレベルドメインにスパムが多いかを調べた結果であり、Figure3は言語によるスパムサイトの割合である。この二つの実験からスパムはかなりの割合でWebに蔓延しており、また特定のドメインはスパムだらけである。これらの調査はスパム発見手法に生かしていく。


  1. 内容に基づいたスパムの発見

我々のWebDBの論文[8]で、我々はスパムの発見手法を数多く説明したが、その中には完全にページの内容と独立したものもある。(リンク構造やDNSレコードを使ったもの)また一方で内容が解釈されていないもの(ページの進化状況、(構造的に?)似たようなものをクラスタリングする)もある。

 この論文では、我々は全てコンテンツに基づいたスパム判定を行う。

 我々は1億のデータから最も多数ある(54%)英語のページをランダムで17168ページ取得してそのそれぞれに対して人手でスパムページかそうでないかを仕分けした。そのうち13.8%がスパムページで86.2%がスパムページでなかった。この章の残りで我々が研究したコンテンツに基づくスパム発見手法を詳細に説明していく。


    1. ページ中の単語数

スパムページは人気キーワードをとかく詰め込む傾向があるので、過剰な数の単語がスパムの指標になるのかを調べ、その結果は図4のようになった。確かにページ数が多いほどスパムの割合は高くなるが全ての範囲でスパム率は50%を切っているのでこれだけでスパムかどうかを判定するわけにはいかない。


    1. ページタイトル中の単語の数

スパムの常套手段のもう一つとしてページタイトル中に単語を詰め込むというものがある。そこで我々はページタイトルに含まれる単語数とスパムの関係を調べ、その結果は図5のようになった。図4と図5を比べると図5のページタイトルに含まれる単語数の方がスパムを判断する上で良い指標となるといえる。


    1. 単語の平均の長さ

クエリを複数語を指定して投げる時にスペースを入れない人がいるのでそれを狙って単語をつなげているページがある。例えば”freepicture”,”freemp3”などなど。そこで単語の平均アルファベット数とスパムの関係を調べてみたところ図6のようになった。単語の長さが8文字をすぎるとかなりスパムの割合が高くなることがわかる。


    1. アンカーテキストの量

リンクはアンカーテキストとなっているが、単に他のページにリンクの渡すためだけのカタログページが存在する。そのようなサイトは大量の初リンクがあるのでアンカーテキストの単語が全単語に占める割合とスパムとの関係を調べた。その結果図7のようになった。ややアンカーテキストの割合が高いほどスパムの確率は上昇するがあまり顕著ではなかった。


    1. 見えているコンテンツの割合

マークアップでない単語の総バイトをページの総バイト数で割ったところ図8のようになった。これからスパムページはマークアップ(スクリプトやスタイルシートなども含む)が普通のサイトより少なく人にサイトを見せるための装飾等を省いているといえる。


    1. 圧縮率

冗長なコンテンツがあるページは圧縮器をかけることによりサイズを縮小できる。例えば同じ単語が何度も使われていたりすると圧縮率は高くなる。そこでGZIP[14]という圧縮器を使って圧縮率とスパムの関係を調査して、その結果が図9のようになった。 


    1. ページ中で一般的に良く使われる単語が含まれる割合

スパムページは検索エンジン対策のため文章が不自然になっている可能性があるので、データセットで上位200位までの頻出単語が全文章中でどれくらいの割合で使われているのかを調べ、それとスパムとの相関を図10に示した。この結果スパムページは一般的に使われている単語をあまり使っておらず偏りがあることがわかる。


    1. 一般的に良く使われる単語の割合

データセットで上位500位までの頻出単語のうち何種類がページ中に含まれているかを求めスパムとの相関を調べた。4.7の場合例えばページ中に”a”とだけ書かれた文字があったとするとスコアは1となるが4.8の場合は1/500となる。うまく4.7の欠点を補う意味で調査をした。その結果図11のようになったが全体的に控えめな結果となった。


    1. 独立したN-gramの可能性

スパムページは文法的におかしい傾向が強いためn-gramにより文書の傾向を調べた。理想的には文法的かつ意味的に正確さを追求したいのだが、計算量が多くなるため統計的な手法であるn-gramを用いることにした。

という式でまずあるn-gramの発生率を求める。分母はngram全体の数、例えばngramはオーバーラッピングするので3gramで5個単語があるとすれば最初の3つ、真ん中の3つ、最後の3つで合計total number of ngram = 3 となる。分子はこれら3つの重複数で最初、真ん中、最後の全てが異なる場合1となるし、最初と最後が同じで真ん中が異なると最初と最後の値が2となり真ん中が1となる。

この式から文書全体のn-gramの発生率のようなもの(文書中にはk個のn-gramを持った文書の確率は個々のPの確率の積であると書かれているがまったく理解できない)を取り、それを文書の長さによる差がでないように正規化すると

となる、これをコンピュータの誤差が出にくいようにさらに変形して

とする。この式からわかることはngramで共起する回数が少ないほどlogPの値が小さくなる、すなわち負の値が大きくなるためIndepLHの値が大きくなる。また逆にngramで共起回数が多いほどlogPの値が大きくなり、すなわち負の値が小さくなるためIndepLHの値は小さくなるということである。(これ以上は理解不能)

図12はこのIndepLHの値とスパムとの関係である。極端にngramでの共起が少ないときと多いところにスパムが集まっている。共起が多いときは同じ表現を繰り返し何度も使っているスパムであると判断できる、また(グラフのどこからその根拠を得ているのかは不明だが)起こりそうにないngramで構成されている文書はよりスパムである確率が高い、おそらく文法的にありえない文書を使っているからであろう。


4.10 条件付ngramの可能性

と条件付確率を定義するとより計算量が増えるかわりに精度が上がるらしい。(どう、または精度が向上するのかはよくわからないがとにかくより良い手法らしい)そして後は4.9と同じようにして計算してスパムとの関係を調べると図13のようになった。大体図12とライングラフが一致している。(結局あまり大差ないやん)。


5.今までのデータを組み合わせて分類器の生成

今までのデータを用いて分類器を生成して、ページがスパムであるかスパムでないのかを求めた。これを行う技術としては決定木、ルールベース技術、ニューラルネット、サポートベクターマシンを使った。そのうちで最も分類精度が良かったのは決定木のC4.5というアルゴリズムである。C4.5は簡単に説明すると最も分類精度が高い順にルートから木を生成していくというアルゴリズムである。分類例は図14のようになり、再現率と精度はテーブル1のようになった。


5.1 分類の正確さの改善

より分類器の正確さを上げるために我々は最も有名な2つの技術「bagging」と「boosting」を使おうと思う。

Baggingの説明

  1. もとのデータセットからN個のデータセットを作る。その時各データセットはもとのデータセットからそれぞれn個のデータをランダムで選んだものとする。(それゆえデータセット間のデータの重複は許される)

  2. N個のデータセットそれぞれについて分類器を作成する

  3. それぞれの分類器を使ってスパムかスパムでないかを判別する。

  4. 最終的な結果は分類器の多数決によって決める。

これがBaggingの概要であるが今回はN=10,n=15453で実験して行ってみたところ結果は表2のようになり正確さは上昇した。

Boostingの説明

  1. 最初に全てのデータに1/nの重みを割り当てる(今回の場合n=15453)この重みはトレーニングセットの中で一つデータを取り出した時に該当するデータである確率である。

  2. この重みを使って分類器を生成する

  3. 分類した際にスパム・ノンスパムの分類を間違えたデータは重みを増やし、正解したデータは重みを減らす(つまり学習例として適しているデータの重みを増やすってことだとは思う)

  4. 2.3を繰り返す(今回の場合10回)

  5. 10個分類器ができるのでスパム・ノンスパムの判定は重み付投票で決める。

これにより分類してみたところ結果は表3のようになりかなり改善が見られた。

6.RELATED WORK

  1. 機械学習の関連研究

C4.5を使ったEmailの分類[16,28]
これは人が読むものに対するスパムだが我々は検索エンジンのロボットが読むためのスパムを発見するという意味で異なる。

  1. スパムの役割やシステムについて

    • Henzingerら[15]はスパムがサーチエンジンにもたらす脅威を認めた

    • Perkins[25]が数多くのスパムテクニックを定義しGyongyiとGarciaMolina[13]がよりそれを詳細に分割した。

    • DeStefano[20]はWebスパムと宣伝の関係を指摘(調べてみたらあるサイトのリンクポピュラリティを故意に上げよう(あるサイトを宣伝しよう)とした時に現れるリンク構造を発見したみたいな内容であった)

スパム手法は一般的にリンクスパム、内容スパム、クローキングに大別できる

  1. リンクスパムについて

  • Davison[7]は早い時期にリンクスパムについて調査しており、縁故主義のリンクについて考察している

  • Amitayら[2]はリンク構造をルールベースの分類器に入れてリンクスパムを発見する手法を提案

  • Baeza-Yateら[3]はページランクを上げるために示し合わせたリンク形態の研究を示し、Adaliら[1]はあるページにリンクを張るためのみにページを生成することが最も効率的なスパムの手段である事を示した。(今では古いと思うが)

  • Zhang[31]らはどうやってページランクを攻撃(スパム)に耐えられるものにするかを示した

  • Gyongyiら[11]は信頼の置けるサイトからのリンクを辿ることによるTrustRankというものをスパムでないページの発見のために用いた。

  • Benzur[4]らは不自然にページランクを上昇させているページに対してどうペナルティーを与えるのかについて示した。

  • Wu と Davison[29]とGyongyi と Garcia-Molina[12]はリンクファームの発見手法について研究した。

  • [8]で我々はリンクスパムを指数法則からの逸脱をもとに発見する方法を示した。

  • Mishneら[21]らはブログのコメントにあるリンクスパムを発見するために単語の使用頻度を用いた確率的な手法を提案した。


4. コンテンツスパム 

  • [8]で我々は長いホスト名、多くのダッシュやドット、数字が入っている、単語に多様性がない、頻繁に広範囲にわたってコンテンツを修正する、ということがスパムであるかどうかの良い指標になることが多いということを示した。

  • [9]で我々は切り取りと貼り付けで作ったようなサイトのスパムを調査して、そのようなページを発見する方法を提案した。

  1. クローキング
    クローキングとはWebサーバに細工をして検索エンジンの巡回ロボットに一般の閲覧者とは異なる内容のWebページを見せる事を言う。(フラッシュ等を多用しているサイトでは検索エンジンとの親和性が低いためそれをカバーするため最適化したHTML構造を巡回ロボットに見せるというパターンが多い)

    • GyongyiとMolina[13]は現在のクローキングテクニックを示した。

    • WuとDavison[30]は3つの別々のページに共通する単語を計算することに基づいたクローキングの発見方法の有効性を示した。(意味不明)注目すべきはクローキングが有益なものを使うということである。例えば帯域幅やストレージコストを減らすためにサーチエンジンに対してクローキングがマークアップなしでページのコピーを返すような感じである。(サーチエンジンに有用な部分だけを見せるということだと思う)


7.結論と先への展望
Webスパムと検索エンジンのいたちごっこは続いていくであろうが我々の技術がより良い検索のために役立てばうれしいと思う。継続的な研究により効果的なスパムを行うよりもコンテンツ作りを充実させたほうがよりリスクが少ないようになるのが我々の願いである。