[00004351]一种基于Hadoop的文档分类方法
交易价格:
面议
所属行业:
分析仪器
类型:
发明专利
技术成熟度:
正在研发
专利所属地:中国
专利号:CN201210072522.3
交易方式:
完全转让
许可转让
技术入股
联系人:
许尔杰
进入空间
所在地:
江苏南京市
- 服务承诺
- 产权明晰
-
资料保密
对所交付的所有资料进行保密
- 如实描述
技术详细介绍
本发明公开了一种基于Hadoop的文档分类方法,包括如下步骤:对训练用文档集进行预处理,将原始的文档转化成向量形式;将向量形式的数据上传至集群文件系统;所述集群文件系统对向量形式的数据进行分块处理;对分块处理后的数据进行map-reduce处理过程得到统计信息;根据统计信息训练分类器;利用得到的分类器对测试用的文档进行分类。本发明能够利用大量无标记的文本提高分类器的分类准确度;能够利用集群和并行计算模型提高训练分类器的速度。