一种用于舆情文本分析的半监督方法和装置
公开
摘要

本发明提供了一种用于舆情文本分析的半监督方法和装置,针对标注样本、未标注样本采用半监督方法提高舆情文本分析的分类准确率,首先获取舆情数据集,对数据集进行预处理;预处理后的样本使用数据增强算法生成数据增强样本;使类别标签无监督抽取聚类方式为数据集中未标注的样本生成类别标签;采用词向量隐语义空间,计算相似度与线性插值运算,运算结果生成相似度插值样本;构建最终训练样本集;采用半监督方法并使用预训练语言模型,输入最终训练样本集,对模型进行训练得到分类模型,使用分类模型对测试集预测得出分类结果。对比传统文本分类实验表明,使用该方法和装置在少量标注舆情样本、未标注舆情样本情况下提高舆情文本分类的准确率。

基本信息
专利标题 :
一种用于舆情文本分析的半监督方法和装置
专利标题(英):
暂无
公开(公告)号 :
CN114595333A
申请号 :
CN202210447550.2
公开(公告)日 :
2022-06-07
申请日 :
2022-04-27
授权号 :
暂无
授权日 :
暂无
发明人 :
王宏升廖青鲍虎军陈光
申请人 :
之江实验室
申请人地址 :
浙江省杭州市余杭区之江实验室南湖总部
代理机构 :
北京志霖恒远知识产权代理事务所(普通合伙)
代理人 :
奚丽萍
优先权 :
CN202210447550.2
主分类号 :
G06F16/35
IPC分类号 :
G06F16/35  G06F40/169  G06K9/62  
IPC结构图谱
G
G部——物理
G06
计算;推算或计数
G06F
电数字数据处理
G06F16/35
••聚类;分类
法律状态
2022-06-07 :
公开
注:本法律状态信息仅供参考,即时准确的法律状态信息须到国家知识产权局办理专利登记簿副本。
文件下载
暂无PDF文件可下载
  • 联系电话
    电话:023-6033-8768
    QQ:1493236332
  • 联系 Q Q
    电话:023-6033-8768
    QQ:1493236332
  • 关注微信
    电话:023-6033-8768
    QQ:1493236332
  • 收藏
    电话:023-6033-8768
    QQ:1493236332