收录:
摘要:
在文本分类研究中,向量空间模型具有表示形式简单的特点,但只能表示特征词的词频信息而忽视了特征词间的结构信息和语义语序信息,所以可能导致不同文档被表示为相同向量.针对这种问题,本文采用图结构模型表示文本,把文本表示成一个有向图(简称文本图),可有效解决结构化信息缺失的问题.本文将图核技术应用于文本分类,提出适用于文本图之间的相似度计算的图核算法——间隔通路核,然后利用支持向量机对文本进行分类.在文本集上的实验结果表明:与向量空间模型相比,间隔通路核相比于其他核函数的分类准确率更高,所以间隔通路核是一种很好的图结构相似性计算算法,能广泛应用于文本分类中.
关键词:
通讯作者信息:
电子邮件地址: