`

【绝对原创】个人用Java编写中文网页自动分类

阅读更多
运行界面如图所示:


牵扯的技术有:分词,统计词频,踢出网页中一些特殊字符(用正则表达式),还有需要提取培训集等等!!
结果分析的思想:就是把得到的词频与建立的词库里每一类进行比较,如果存在一个最大匹配程度,就去这个类作为结果,如果存在多个最大值,那么就去词库里特征词最少的一个!!

源程序下载地址:
本帖隐藏的内容
中文网页自动分类

说明:开发集成软件NetBeans6.5
原帖地址:http://www.phpjava.org/forum.php?mod=redirect&tid=13&goto=lastpost#lastpost

本文来自: PHP&Java论坛|技术交流社区[www.phpjava.org]
0
1
分享到:
评论
2 楼 wcl85610 2012-03-27  
下载地址在哪里
1 楼 mlsoftware 2011-04-18  
最近在帮别人搞一个文本分类的程序
希望这个网页的能拍上用场
嘿嘿

相关推荐

Global site tag (gtag.js) - Google Analytics