當前位置:才華齋>計算機>SEO網站優化>

搜尋引擎原理詳解

SEO網站優化 閱讀(2.48W)

搜尋引擎,通常指的是收集了因特網上幾千萬到幾十億個網頁並對網頁中的每一個詞(即關鍵詞)進行索引,建立索引資料庫的全文搜尋引擎。當用戶查詢某個關鍵詞的時候,所有在頁面內容中包含了該關鍵詞的網頁都將作為搜尋結果被搜出來。在經過複雜的演算法進行排序後,這些結果將按照與搜尋關鍵詞的相關度高低,依次排列。根據自己的優化程度,獲得相應的名次。

搜尋引擎原理詳解

  原理概述

在搜尋引擎的後臺,有一些用於蒐集網頁資訊的程式。所收集的資訊一般是能表明網站內容(包括網頁本身、網頁的URL地址、構成網頁的程式碼以及進出網頁的連線)的關鍵詞或者短語。接著將這些資訊的索引存放到資料庫中。

搜尋引擎的系統架構和執行方式吸收了資訊檢索系統設計中許多有價值的經驗,也針對全球資訊網資料和使用者的特點進行了許多修改,如右圖所示的搜尋引擎系統架構。其核心的文件處理和查詢處理過程與傳統資訊檢索系統的執行原理基本類似,但其所處理的資料物件即全球資訊網資料的繁雜特性決定了搜尋引擎系統必須進行系統結構的調整,以適應處理資料和使用者查詢的需要。

  工作原理

  爬行和抓取

搜尋引擎派出一個能夠在網上發現新網頁並抓檔案的程式,這個程式通常稱之為蜘蛛(Spider)。搜尋引擎從已知的資料庫出發,就像正常使用者的瀏覽器一樣訪問這些網頁並抓取檔案。搜尋引擎通過這些爬蟲去爬網際網路上的外鏈,從這個網站爬到另一個網站,去跟蹤網頁中的連結,訪問更多的網頁,這個過程就叫爬行。這些新的網址會被存入資料庫等待搜尋。所以跟蹤網頁連結是搜尋引擎蜘蛛(Spider)發現新網址的最基本的方法,所以反向連結成為搜尋引擎優化的最基本因素之一。搜尋引擎抓取的頁面檔案與使用者瀏覽器得到的完全一樣,抓取的檔案存入資料庫。

  建立索引

蜘蛛抓取的頁面檔案分解、分析,並以巨大表格的形式存入資料庫,這個過程即是索引(index).在索引資料庫中,網頁文字內容,關鍵詞出現的位置、字型、顏色、加粗、斜體等相關資訊都有相應記錄。

  搜尋詞處理

使用者在搜尋引擎介面輸入關鍵詞,單擊“搜尋”按鈕後,搜尋引擎程式即對搜尋詞進行處理,如中文特有的分詞處理,去除停止詞,判斷是否需要啟動整合搜尋,判斷是否有拼寫錯誤或錯別字等情況。搜尋詞的處理必須十分快速。

  排序

對搜尋詞處理後,搜尋引擎程式便開始工作,從索引資料庫中找出所有包含搜尋詞的網頁,並且根據排名演算法計算出哪些網頁應該排在前面,然後按照一定格式返回到“搜尋”頁面。

再好的搜尋引擎也無法與人相比,這就是為什麼網站要進行搜尋引擎優化。沒有SEO的幫助,搜尋引擎常常並不能正確的返回最相關、最權威、最有用的資訊。

  資料結構

搜尋引擎的核心資料結構為倒排檔案(也稱倒排索引),倒排索引是指用記錄的非主屬性值(也叫副鍵)來查詢記錄而組織的'檔案叫倒排檔案,即次索引。倒排檔案中包括了所有副鍵值,並列出了與之有關的所有記錄主鍵值,主要用於複雜查詢。 與傳統的SQL查詢不同,在搜尋引擎收集完資料的預處理階段,搜尋引擎往往需要一種高效的資料結構來對外提供檢索服務。而現行最有效的資料結構就是“倒排檔案”。倒排檔案簡單一點可以定義為“用文件的關鍵詞作為索引,文件作為索引目標的一種結構(類似於普通書籍中,索引是關鍵詞,書的頁面是索引目標)。

  全文搜尋引擎

在搜尋引擎分類部分我們提到過全文搜尋引擎從網站提取資訊建立網頁資料庫的概念。搜尋引擎的自動資訊蒐集功能分兩種。一種是定期搜尋,即每隔一段時間(比如Google一般是28天),搜尋引擎主動派出“蜘蛛”程式,對一定IP地址範圍內的網際網路站進行檢索,一旦發現新的網站,它會自動提取網站的資訊和網址加入自己的資料庫。

另一種是提交網站搜尋,即網站擁有者主動向搜尋引擎提交網址,它在一定時間內(2天到數月不等)定向向你的網站派出“蜘蛛”程式,掃描你的網站並將有關資訊存入資料庫,以備使用者查詢。由於搜尋引擎索引規則發生了很大變化,主動提交網址並不保證你的網站能進入搜尋引擎資料庫,因此目前最好的辦法是多獲得一些外部連結,讓搜尋引擎有更多機會找到你並自動將你的網站收錄。

當用戶以關鍵詞查詢資訊時,搜尋引擎會在資料庫中進行搜尋,如果找到與使用者要求內容相符的網站,便採用特殊的演算法——通常根據網頁中關鍵詞的匹配程度,出現的位置/頻次,連結質量等——計算出各網頁的相關度及排名等級,然後根據關聯度高低,按順序將這些網頁連結返回給使用者。