欧美日一区二区三区精品,欧美区一区视频在线观看,国产精品黄色av,亚洲av色香蕉一区二区,色七七日本亚洲综合视频,免费在线观看国产一区二区三区

優(yōu)惠活動 - 12周年慶本月新客福利
優(yōu)惠活動 - 12周年慶本月新客福利
優(yōu)惠活動 - 12周年慶本月新客福利

行業(yè)動態(tài)Python進(jìn)行網(wǎng)頁文本處理

       Python進(jìn)行網(wǎng)頁文本處理。

       網(wǎng)頁文本中的中英文處理的區(qū)別在于中文需要額外加入分詞處理過程。所謂分詞就是將一段文本文字分成一個個詞組的過程。

       具體處理流程為:加載jieba分詞包進(jìn)行中文分詞;將分詞后的詞組去掉停用詞及一個字符的詞后, 輸出訓(xùn)練文本中的常用分詞和熟悉的詞組;在訓(xùn)練文本的數(shù)據(jù)訓(xùn)練及情感詞典的歸檔中將爬取獲得的網(wǎng)頁數(shù)據(jù)的客觀性文本分詞后放入變量中, 主觀類情感文本放入另一變量中;為自動得到網(wǎng)頁文本中重要的關(guān)鍵詞組, 過濾掉對網(wǎng)頁文本意義貢獻(xiàn)不大的常用詞組, 在chi2模塊的特征選擇下, 采用詞頻-逆文本頻率 (TF-IDF) 概念將分詞詞組變量轉(zhuǎn)換為tf-idf向量形式, 輸出分詞向量矩陣, 為下一階段的網(wǎng)頁文本情感分析做準(zhǔn)備。

本文地址:http://www.dramabay.com//article/20623.html
相關(guān)文章:
最新文章:
色达县| 米脂县| 门头沟区| 新民市| 西峡县| 开封县| 海丰县| 武陟县| 沈丘县| 大余县| 铁岭县| 甘孜县| 墨脱县| 南充市| 左贡县| 漾濞| 三门峡市| 上思县| 寻乌县| 兴安盟| 巴南区| 潼关县| 女性| 丰顺县| 汾阳市| 黄石市| 宝丰县| 来宾市| 南雄市| 巴林右旗| 寻甸| 茌平县| 岳普湖县| 宾阳县| 葫芦岛市| 永新县| 宝兴县| 黄陵县| 报价| 杭州市| 洛宁县|