搜索引擎索引系統(tǒng)的內(nèi)涵
發(fā)布時(shí)間:2013-12-07 瀏覽:244打印字號(hào):大中小
我們都知道搜索引擎的主要工作過(guò)程包括:抓取、存儲(chǔ)、頁(yè)面分析、索引、檢索等幾個(gè)主要過(guò)程。抓取以?xún)|為單位的網(wǎng)頁(yè)庫(kù)中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時(shí)間內(nèi)可以完成查找,但是用戶(hù)等不起,從用戶(hù)體驗(yàn)角度我們必須在毫秒級(jí)別給予用戶(hù)滿(mǎn)意的結(jié)果,否則用戶(hù)只能流失。怎樣才能達(dá)到這種要求呢?
如果能知道用戶(hù)查找的關(guān)鍵詞都出現(xiàn)在哪些頁(yè)面中,那么用戶(hù)檢索的處理過(guò)程即可以想象為包含了query中切詞后不同部分的頁(yè)面集合求交的過(guò)程,而檢索即變成了頁(yè)面名稱(chēng)之間的比較、求交。這樣,在毫秒內(nèi)以?xún)|為單位的檢索成為了可能。這就是通常所說(shuō)的倒排索引及求交檢索的過(guò)程。如下為建立倒排索引的基本過(guò)程:
(1)頁(yè)面分析的過(guò)程實(shí)際上是將原始頁(yè)面的不同部分進(jìn)行識(shí)別并標(biāo)記。
(2)分詞的過(guò)程實(shí)際上包括了切詞分詞同義詞轉(zhuǎn)換同義詞替換等等,以對(duì)某頁(yè)面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類(lèi)、詞性等等。
(3)之前的準(zhǔn)備工作完成后,接下來(lái)即是建立倒排索引。
只有每步有規(guī)劃的進(jìn)行才能帶來(lái)想要的流量。
如果能知道用戶(hù)查找的關(guān)鍵詞都出現(xiàn)在哪些頁(yè)面中,那么用戶(hù)檢索的處理過(guò)程即可以想象為包含了query中切詞后不同部分的頁(yè)面集合求交的過(guò)程,而檢索即變成了頁(yè)面名稱(chēng)之間的比較、求交。這樣,在毫秒內(nèi)以?xún)|為單位的檢索成為了可能。這就是通常所說(shuō)的倒排索引及求交檢索的過(guò)程。如下為建立倒排索引的基本過(guò)程:
(1)頁(yè)面分析的過(guò)程實(shí)際上是將原始頁(yè)面的不同部分進(jìn)行識(shí)別并標(biāo)記。
(2)分詞的過(guò)程實(shí)際上包括了切詞分詞同義詞轉(zhuǎn)換同義詞替換等等,以對(duì)某頁(yè)面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類(lèi)、詞性等等。
(3)之前的準(zhǔn)備工作完成后,接下來(lái)即是建立倒排索引。
只有每步有規(guī)劃的進(jìn)行才能帶來(lái)想要的流量。
最新文章
- 1網(wǎng)站內(nèi)容收錄后被刪除的解決方法
- 2北京網(wǎng)站設(shè)計(jì)公司哪家好
- 3網(wǎng)站優(yōu)化如何提高關(guān)鍵詞排名
- 4北京網(wǎng)站設(shè)計(jì)公司:企業(yè)網(wǎng)站忽視十大重要優(yōu)化重點(diǎn)
- 5北京網(wǎng)站建設(shè):SEO優(yōu)化對(duì)企業(yè)營(yíng)銷(xiāo)的重要性
- 6北京網(wǎng)站制作公司談網(wǎng)站草圖設(shè)計(jì)
- 7北京網(wǎng)站制作公司-Robots協(xié)議到底要不要寫(xiě)
- 8北京電商網(wǎng)站建設(shè)公司
- 9企業(yè)網(wǎng)站關(guān)鍵詞優(yōu)化方法
- 10如何設(shè)置網(wǎng)站標(biāo)題更利于SEO優(yōu)化


