In this Article
天気予報のような日常的な情報を探す場合でも、SERPでの順位確認のようなビジネス作業を行う場合でも、多くの場合は検索エンジン、特にGoogleから始めます。ただし、最も正確な検索結果を得たり、効果的なSEO戦略を立てたりするには、その仕組みを知っておく必要があります。この記事では、Googleの仕組みを取り上げ、Google API Content Warehouseの流出で明らかになった情報を解説します。
なぜGoogleなのか
Googleは、ワールドワイドウェブ上の情報を見つけやすくする検索エンジンです。では、なぜそれが必要で、なぜGoogleはこれほど人気なのでしょうか?
簡単に言えば、インターネットはコンピューターやサーバーなどのデバイスで構成される広大なネットワークです。すべてのテキストファイル、動画、画像などは、それらのデバイスに保存されています。検索エンジンがなければ、アクセスしたいすべてのウェブページの正確なURLアドレスを知っていなければなりません。考えただけでも、途方もない作業です。検索エンジンはウェブ上の情報をカタログ化し、クエリに応じて必要なページを表示します。このようなソフトウェアのおかげで、ウェブページのURLを覚える必要はなく、データを見つけるのにかかる時間はほんの一瞬です。
データ量が急激に増える中で、検索エンジンが変化するユーザーのニーズに追いつくことは重要です。Googleは関連性の高い検索結果を提供するためにアルゴリズムを常に改善し、新機能を追加し、効果的な収益化モデルを提供しています。その結果、検索エンジン市場で首位を維持しています。これにより、Googleは世界で最も使われている検索エンジンになっており、2024年6月時点で市場シェアは91.05%です。
Google以外にも、YahooやBingなどのよく知られた検索エンジンがあります。また、Baiduのような、より地域密着型の検索エンジンも存在します。こうしたエンジンは通常、特定の市場向けに細かく調整されています。現地の言語、プラットフォーム、オンラインサービスに適応しているため便利です。ただし、こうした検索エンジンは政府の規制やその国の検閲の影響を受けることがあります。そのため、特定の情報をオンラインで探す際に、利用者の選択肢が大きく制限される可能性があります。
この記事は主にGoogleに焦点を当てています。ただし、他の検索エンジンも、基本的には同様の仕組みで動いています。
では、Googleはどのように機能するのでしょうか。
まず、ワールドワイドウェブの検索はリアルタイムで行われているわけではないことを覚えておく必要があります。つまり、検索バーにクエリを入力しても、Googleがウェブ全体から情報をその場で探すのではありません。代わりに、すでにデータベースに登録されているページを表示します。
同時に、Googleはデータベースを拡充し、更新し続けています。
すべては、いわゆるシードURLから始まります。これは、信頼性、関連性、権威性が高い情報源の集合です。Googleのクローラーの出発点として使われるため、信頼性を確保する目的で手動で作成・管理されることもあります。GoogleのクローラーはそれらのURLにアクセスし、ページの完全なHTMLコードをダウンロードします。このコードは、ページコンテンツ、リンク、メタデータなどの重要なデータを提供します。
次にGoogleは、HTMLコードから得たデータを使ってキーワードを特定します。見出しタグやメタキーワード内の単語やフレーズは、ページのトピックに関する情報を提供します。自然言語処理(NLP)の技術を使い、Googleはウェブページのテキストコンテンツを分析して、個々の単語、フレーズ、それらの関係を特定し、意味的な内容を把握します。その後、検索エンジンはアンカーテキスト(ハイパーリンクのテキスト)と、単語やフレーズが使われる頻度を分析します。これらの情報をもとに、どの語がキーワードに当たるのかを推定します。さらにGoogleは、それらの位置、周囲の文脈、トピックとの関連性を詳しく調べます。タイトルで使われるキーワードや、他のキーワードと一緒に使われるキーワードはより関連性が高いと見なされるため、Googleはそれらをより高く評価します。
最後に、GoogleはHTMLコードから得たキーワードやその他のデータを、Google Indexと呼ばれる巨大なデータベースに保存します。
キーワードに加えて、GoogleのクローラーはシードURLをクロールする過程で見つけたリンクにも注目します。
クローラーがまだインデックスされていないページへのリンクを見つけると、そのページも収集してインデックスに登録するため、キューに追加します。
Googleのクローラーは、すでにインデックスされているページにも定期的に再訪問し、データを更新します。Googleが重要だと考えるページほど、検索エンジンはより頻繁に再訪問します。ページの重要性に寄与する主な要因は、ページの権威性、新鮮さ、ユーザーエンゲージメントの水準などです。
まだどこにも言及されていない新しいページはどうなるのでしょうか。
Googleがそうしたページを見つける方法はいくつかあります。
– 集中的なクロール
Googleのクローラーはインターネットを継続的に探索し、新しいURLパターン、IPアドレス、ドメイン登録を探します。これらは新しいウェブページの存在を示すことがあります。
– ソーシャルメディアとフォーラム
オンラインコミュニティのメンバーは、ウェブサイトについて言及し、議論し、共有することがよくあります。これにより、まだインデックスされていない新しい情報源を特定できます。
– データ分析
報告された壊れたリンク、新しいコンテンツの提案、ユーザーエンゲージメント指標、データパターンなどは、まだ強固なバックリンクプロフィールを持たない成長中のウェブサイトを特定する助けになります。このような大量のデータを分析するために、機械学習やAIを活用した技術がよく使われます。
– 特別なツール
ウェブマスター自身が、新しいウェブページについて検索エンジンに通知できます。クローラーはそれらのウェブサイトをキューに追加し、その後インデックスに登録します。
しかし、巨大なデータベースを持つだけでは、ユーザーのニーズを満たすには不十分です。Googleは関連性の高い検索結果を提供するために、あなたが何を望んでいるのかを理解しなければなりません。第一に、同じ単語に何十もの意味があることがあります。第二に、私たちは専門用語や異なる方言を使い、単語を入力するときに間違えることもあり、必要なものを推測しにくくなります。第三に、人々はよく知らないトピックについて情報を探すことが多く、何を探しているのか自分でも分かっていないことがあります。そのため、Googleは検索意図をよりよく理解するために、クエリを絶えず学習し分析しています。
さらに、Googleは私たちの所在地、検索履歴、ブラウザフィンガープリント、好みなどのさまざまな指標に依存し、汎用的ではなくパーソナライズされた検索結果を提供します。たとえば、あなたがLinkin Parkのファンで、その音楽をよく聴いているなら、Googleはそれを知っているでしょう。そのため、検索バーに「クロール」と入力すると、検索エンジンは技術分野でのクロールの定義ではなく、歌詞を掲載したウェブページやYouTubeのカバー動画などへのリンクを提示します。
検索エンジン結果ページ(SERP)に表示される内容について言えば、Googleはどのリンクを最初に表示し、どれをページの末尾に置くかをどのように決めているのでしょうか? 2024年3月までは、Googleのランキングアルゴリズムは厳重な秘密とされていたため、Googleが順位付けの際にどの要因を考慮しているのかは推測するしかありませんでした。しかし、2024年3月から5月の間に、Googleの内部文書であるGoogle API Content Warehouseが流出し、GitHubで公開されました。全2569ページの文書には、Googleがページをどのようにランキングするか、どのSEO施策が有効か、または有効でないかについて、多くの有益な情報が含まれています。たとえば、かつて人気だったLink JuiceやPageRank sculptingの技術はもう使われていません。同時に、GoogleのSEO担当者による一部の公式発言は、文書に書かれている内容と一致しません。たとえば、Gary IlyesはGoogleがページのランキングでクリックを考慮しないと述べましたが、文書にはそれと異なる内容が記載されています。”hostAge”属性は、Googleが新しいウェブサイトにサンドボックスを適用していることを示していますが、Googleは以前これを否定していました。この文書はまた、ページのランキングにChromeのデータが広く使われていることも示しています。これもGoogleの従来の否定と矛盾します。
ほかにも重要な点がいくつかあります。たとえば、ウェブサイトにデスクトップ版とモバイル版の両方があるか、ローカライズ版を提供しているか、ソーシャルメディアで強い存在感を持つ確立されたブランドのウェブサイトかなど、これらすべての要因がランキングに影響します。ビジュアルコンテンツもより重要になっています。特に手順を追って説明するマニュアルのような分野では、高品質で、ページの主要なトピックや要点を強調するビジュアルコンテンツが求められます。
この文書は、Googleが機械学習技術を使い、ソーシャルメディア投稿のような非構造化コンテンツの扱いを改善しようとしていることも確認しています。非構造化コンテンツの割合は常に増えていますが、上で説明した従来のキーワード検索はここではあまり効果的ではありません。全文検索と呼ばれる別の検索概念があります。全文検索とは、キーワードやメタデータだけでなく全文もインデックスされるという意味です。これにより、大きな文書のような非構造化コンテンツを検索し、キーワードが一致しなくても関連性の高い結果を見つけられます。現在、Googleでもある程度は全文検索を利用できます。たとえば、フレーズ検索には引用符、特定ドメイン内の検索には”site:”演算子、「OR」や「AND」のようなブール演算子を使えます。ただし、それで十分でない場合は、AlgoliaやElasticsearchのような専用の全文検索エンジンの利用を検討してください。
結論
Googleの仕組みを知ることで、探しているものをより速く見つける方法、ウェブサイトをSERPで上位に表示させる方法などについて、価値あるアイデアを得られます。同時に、検索エンジンをより効果的に扱うための合法的な補助ツールも数多くあります。プロキシは、パーソナライズの影響を避けたり、別の地域のSERPを確認したりする際に役立ちます。DataImpulseは、適法に取得され、許可リストに登録されたプロキシを手頃な価格で提供しています。画面右上の”今すぐ試す“ボタンをクリックして開始するか、サポート担当者の支援が必要な場合は画面右下のウィジェットを使用してください。
