這期內容當中小編將會給大家帶來有關SogouQ中如何計算查詢詞URL最優 Rank,文章內容豐富且以專業的角度為大家分析和敘述,閱讀完這篇文章希望大家可以有所收獲。
PS1: 日志原格式是GB2312編碼, 一定要記得轉成UTF-8
PS2: 日志格式和格式說明:
訪問時間\t用戶ID\t[查詢詞]\t該URL在返回結果中的排名\t用戶點擊的順序號\t用戶點擊的URL,
這個格式有坑, 深坑:
"該URL在返回結果中的排名\t用戶點擊的順序號"這兩個字段之間的分割符并不是制表符\t, 而是空格
val sogouQRdd = sc.textFile("hdfs://node1:9000/sogouQ/input") sogouQRdd.cache # 在下一次Action操作時, 將日志文件緩存到內存中
求出日志文件條目總數
val itemCountRdd = sogouQRdd.count itemCountRdd: Long = 1724264
對于每一個查詢詞, 求出該 URL 在返回結果中的排名為1, 且用戶點擊的順序號為1的條目總數
這說明此次搜索結果的 URL 的 Rank 最優
val suitableRankRdd = sogouQRdd.filter(_.split('\t').length == 5).map(_.split('\t')) .filter(_(3).split(' ')(0).toInt == 1).filter(_(3).split(' ')(1).toInt == 1).count suitableRankRdd: Long = 279859
計算查詢詞 URL 最優 Rank 的頻率:
最優Rank頻率 = URL最優Rank次數 / 條目總數
suitableRankRdd / itemCountRdd = 0.1623
所以查詢詞 URL最優Rank 的頻率為 16.23%
上述就是小編為大家分享的SogouQ中如何計算查詢詞URL最優 Rank了,如果剛好有類似的疑惑,不妨參照上述分析進行理解。如果想知道更多相關知識,歡迎關注億速云行業資訊頻道。
免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。