激情五月四方色播在线观看-免费一区二区三区四区-亚洲欧美日韩在线观看a三区-国产一区二区射精精品视频

logo

Internet Development

12年專注網(wǎng)站建設&網(wǎng)站設計制作

新聞中心

新聞中心

這里有最新的行業(yè)信息與相關公司信息。

建立符合搜索抓取習慣的網(wǎng)站

發(fā)布時間:2013-11-19 16:33:43 瀏覽次數(shù):

眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統(tǒng),以億為單位的網(wǎng)頁庫中查找特定的某些關鍵詞猶如大海里面撈針,也許一定的時間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

如果能知道用戶查找的關鍵詞(query切詞后)都出現(xiàn)在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內(nèi)以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:

(1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記,例如:title、keywords、content、link、anchor、評論、其他非重要區(qū)域等等;

(2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類、詞性等等;

(3)之前的準備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應用【doc->term】呢?

上述即是索引系統(tǒng)中的倒排索引過程,是搜索引擎實現(xiàn)毫秒級檢索非常重要的一個環(huán)節(jié)。


相關新聞

logo

我們很樂意傾聽您的聲音
即刻與我們?nèi)〉寐?lián)絡,成為日后肩并肩合作的伙伴

聯(lián)系我們

400-876-0532

公司地址:青島市北區(qū)昆山路17號7080中心廣場

售前咨詢:0532-86217711

售后服務:0532-86217700

電子郵箱:weidongli@532qd.com

魯ICP備12021464號 | 魯公網(wǎng)安備 37020302370744號

友情鏈接 :青島網(wǎng)站建設

滕州市| 新河县| 全南县| 咸丰县| 酉阳| 麻江县| 呈贡县| 乌拉特前旗| 宣武区| 修水县| 浑源县| 西丰县| 日照市| 阳江市| 旺苍县| 武乡县| 行唐县| 汽车| 临西县| 青龙| 昂仁县| 奈曼旗| 图木舒克市| 平泉县| 陵水| 虎林市| 城步| 武乡县| 当雄县| 济宁市| 泗洪县| 休宁县| 凉山| 凤阳县| 六盘水市| 宣武区| 铁岭县| 南阳市| 天门市| 稻城县| 霍林郭勒市|