国内刊号:51-1267/TN
国际刊号:1001-893X
发布日期:
作者:成磊峰,罗吉,王磊,朱敏,陶思彤
单位:(1.四川大学 计算机学院,成都 610065;2.西南电子技术研究所,成都 610036;3.中电信数智科技有限公司,北京 100001)
关键词:开源情报分析;网页信息提取;生成式大语言模型;检索增强生成;
针对开源情报分析中网页信息提取问答问题,提出一种融合生成式大语言模型(Large Language Model,LM)、XPath与检索增强生成(Retrieval-Augmented Generation,RAG)的方法,涉及动态模板化提示策略与多粒度语义检索。动态模板基于情报类型生成领域知识约束提示,提升实体提取精度;多粒度检索构建文档-段落-实体三级体系,结合BERT-Top玨算法优化长文本信息定位。通过OpenKG知识库对齐实体构建属性-关系-事件三维网络,增强复杂事件逻辑分析。该方法在ClueWeb22与TAC-KBP2022数据集上的提取率为0.85,回答准确率为0.78,相比传统RAG,性能提升18%~31%。实际应用中,热点事件简报关键事实准确率达92%,综合成本仅为GPT-4的12%。
来源:2025年第10期
《电讯技术》期刊编辑部