生成文本聚类java实现 (2)
?? 呵呵,继续。
本节的学习内容:
?
语料分类腐化? "生活作风"? "女色"? "情妇"?? "权色"?? "生活糜烂"?? "生活堕落"生活作风"东城" "西城" "崇文" "宣武" "朝阳" "海淀" "丰台" "石景山" "房山" "通州" "顺义" "大兴" "昌平
" "平谷" "怀柔" "门头沟" "密云" "延庆"
北京
上访? 信访? 举报? 揭发? 揭露? "买官"? "卖官"上访举报李刚? "河大撞人" 撞人我爸是李刚"送钱短信" OR ( 驾校 AND 交警 )送钱短信"乐东县" "保亭县" "陵水县" "琼中县" "白沙县" "昌江县" "屯昌县" "定安县" "澄迈县" "临高县"
"儋州" "东方" "五指山" "万宁" "琼海" "文昌" "三亚" "海口"
海南?
训练结果就是跟上面语料和分类的有极高的相似度。
?
下面是基本的KNN算法。KNN.java
? datafile.txt文件内容:
测试元组: 1.0 1.1 1.2 2.1 0.3 2.3 1.4 0.5 类别为: 1测试元组: 1.7 1.2 1.4 2.0 0.2 2.5 1.2 0.8 类别为: 1测试元组: 1.2 1.8 1.6 2.5 0.1 2.2 1.8 0.2 类别为: 1测试元组: 1.9 2.1 6.2 1.1 0.9 3.3 2.4 5.5 类别为: 0测试元组: 1.0 0.8 1.6 2.1 0.2 2.3 1.6 0.5 类别为: 1测试元组: 1.6 2.1 5.2 1.1 0.8 3.6 2.4 4.5 类别为: 0?下面的工作就是如何让汉字也成为如上的Long类型的数字呢,我们现在使用词频的空间向量来代替这些文字。
?
1 楼 zhzhl202 2011-05-12 楼主 这个系列文章怎么没有更新了,大家都等着看呢?楼主 加油呀 2 楼 liuxueyuyong 2011-06-02 多谢楼主, 正在研究分类聚类,学习了! 3 楼 luobo525 2012-01-29 怎么没有后续了呢,非常期待啊 4 楼 lands2 2012-03-26 楼主牛人啊,正需这方面内容,楼主能不能介绍一下这些知识在哪里学的吗?还有就是真心希望楼主能更新下一篇文章:
4.从剩余的词中提取文本特征,即最能代表文本的词
5.用空间向量表示文本,空间向量需标准化,即将数值映射到-1到1之间
6.利用所获取的空间向量进行聚类分析
7.交叉验证