成人免费在线观看视频-国产绿帽子多p交换视频-精品国产一区av-免费xx视频-人妻熟妇乱又伦精品视频中文字幕-特级毛片内射www无码

TF-IDF算法及其對關鍵詞布局方面的權重分布

2014/6/26 14:16:39   閱讀:10494    發布者:10494
概念
TF-IDF(term frequency–inverse document frequency)是一種用于資訊檢索與資訊探勘的常用加權技術。TF-IDF是一種統計方法,用以評估一字詞對于一個文件集或一個語料庫中的其中一份文件的重要程度。字詞的重要性隨著它在文件中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。TF-IDF加權的各種形式常被搜尋引擎應用,作為文件與用戶查詢之間相關程度的度量或評級。除了TF-IDF以外,因特網上的搜尋引擎還會使用基于連結分析的評級方法,以確定文件在搜尋結果中出現的順序。

原理
在一份給定的文件里,詞頻 (term frequency, TF) 指的是某一個給定的詞語在該文件中出現的次數。這個數字通常會被歸一化(分子一般小于分母 區別于IDF),以防止它偏向長的文件。(同一個詞語在長文件里可能會比短文件有更高的詞頻,而不管該詞語重要與否。)
逆向文件頻率 (inverse document frequency, IDF) 是一個詞語普遍重要性的度量。某一特定詞語的IDF,可以由總文件數目除以包含該詞語之文件的數目,再將得到的商取對數得到。
某一特定文件內的高詞語頻率,以及該詞語在整個文件集合中的低文件頻率,可以產生出高權重的TF-IDF。因此,TF-IDF傾向于過濾掉常見的詞語,保留重要的詞語。
TFIDF的主要思想是:如果某個詞或短語在一篇文章中出現的頻率TF高,并且在其他文章中很少出現,則認為此詞或者短語具有很好的類別區分能力,適合用來分類。TFIDF實際上是:TF * IDF,TF詞頻(Term Frequency),IDF反文檔頻率(Inverse Document Frequency)。TF表示詞條在文檔d中出現的頻率(另一說:TF詞頻(Term Frequency)指的是某一個給定的詞語在該文件中出現的次數)。IDF的主要思想是:如果包含詞條t的文檔越少,也就是n越小,IDF越大,則說明詞條t具有很好的類別區分能力。如果某一類文檔C中包含詞條t的文檔數為m,而其它類包含t的文檔總數為k,顯然所有包含t的文檔數n=m+k,當m大的時候,n也大,按照IDF公式得到的IDF的值會小,就說明該詞條t類別區分能力不強。(另一說:IDF反文檔頻率(Inverse Document Frequency)是指果包含詞條的文檔越少,IDF越大,則說明詞條具有很好的類別區分能力。)但是實際上,如果一個詞條在一個類的文檔中頻繁出現,則說明該詞條能夠很好代表這個類的文本的特征,這樣的詞條應該給它們賦予較高的權重,并選來作為該類文本的特征詞以區別與其它類文檔。這就是IDF的不足之處.
在一份給定的文件里,詞頻(term frequency,TF)指的是某一個給定的詞語在該文件中出現的頻率。這個數字是對詞數(term count)的歸一化,以防止它偏向長的文件。(同一個詞語在長文件里可能會比短文件有更高的詞數,而不管該詞語重要與否。)對于在某一特定文件里的詞語
主站蜘蛛池模板: 久久亚洲精品情侣| 天堂va欧美va亚洲va好看va| 狠狠综合久久av一区二区| 久久综合给合综合久久| 欧美大胆老熟妇乱子伦视频| 亚洲男女内射在线播放| 国语国产精精品国产国语清晰对话| 欧美日韩免费做爰大片人| 亚洲高清Aⅴ| 精品久久人人爽天天玩人人妻| 一本丁香综合久久久久不卡网站 | 免费人妻无码不卡中文视频| 天天做天天躁天天躁| 国产aⅴ视频免费观看| 欧洲精品99毛片免费高清观看| 成人无码潮喷在线观看| 少妇真人直播免费视频| 日韩人妻无码精品久久免费一 | 人妻出轨av中文字幕| 色窝窝无码一区二区三区| 欧美自拍嘿咻内射在线观看| 男人扒开女人腿做爽爽视频| 国产伦精品一区二区三区妓女| 国产精品va在线观看老妇女| 日本护士毛茸茸| 国产美女裸身网站免费观看视频| 日本真人做爰免费的视频| 亚洲中文字幕高清有码在线| 无码爆乳护士让我爽| 国产免费艾彩sm调教视频| 亚欧美日韩香蕉在线播放视频| 久久久久无码国产精品不卡| 久久视频这里只精品| 国产乱码精品一区二区三区中文| 亚洲精品gv天堂无码男同| 亚洲国产美国国产综合一区二区| 亚洲精品一区二区久久| 97人洗澡人人澡人人爽人人模 | 久久久久国产精品人妻aⅴ果冻| 免费国精产品wnw2544| 无遮掩60分钟从头啪到尾|