公司动态

把一摞新闻变成知识图谱:零基础用DeepKE开源框架跑通全流程

📅 2026/8/13 19:57:02
把一摞新闻变成知识图谱:零基础用DeepKE开源框架跑通全流程
把一摞新闻变成知识图谱零基础用DeepKE开源框架跑通全流程【免费下载链接】DeepKE[EMNLP 2022] An Open Toolkit for Knowledge Graph Extraction and Construction项目地址: https://gitcode.com/gh_mirrors/de/DeepKE假设你手上有几百篇行业新闻想抽出里面的人名、机构名和事件关系拼成一张属于自己的知识图谱。纯靠人工阅读加表格整理一周都未必干得完自己写正则规则又会不断被各种反常识的句式打败。DeepKE正是为这个场景而生的开源知识抽取框架——它基于深度学习把命名实体识别、关系抽取、属性抽取甚至事件抽取收进同一套体系训练、预测一条龙直接服务于知识图谱构建。这篇文章是我自己从零跑通的实战手记不堆概念只讲步骤和踩过的坑。读完你也能搭出第一张图谱。出发前先看清这套框架的全貌DeepKE的定位一句话就能讲清给知识图谱的抽取环节提供开箱即用的深度学习方案。它由浙江大学团队维护相关论文入选了EMNLP 2022系统展示轨道。最打动我的是它对场景的覆盖相当完整任务 \ 场景标准少样本文档级多模态实体识别✅✅—✅关系抽取✅✅✅✅属性抽取✅✅——事件抽取✅———标准场景适合标注充足的项目少样本场景Few-shot面向数据稀缺的低资源任务文档级支持跨句子抽取长文本关系多模态则让图片与文本联合发力。后面你会在实战中一个个遇到它们。第一步10分钟把环境跑起来环境搭建最劝退新手但DeepKE给了两条退路任选其一。路线A源码安装我更推荐git clone https://gitcode.com/gh_mirrors/de/DeepKE conda create -n deepke python3.8 conda activate deepke cd DeepKE pip install -r requirements.txt python setup.py develop路线BDocker一键起docker pull zjunlp/deepke:latest docker run -it zjunlp/deepke:latest /bin/bash我选了路线A全程没碰到依赖冲突。一个小提醒项目默认面向LinuxWindows用户记得把配置文件里的路径分隔符换成\\否则容易在读取数据时报错。第二步看一眼数据格式不用重新造轮子训练前先搞懂数据长什么样。以实体识别为例原始输入就是一个文本文件一句话一行如上图再配一个同结构的标签文件即可关系抽取则支持JSON、CSV、XLSX等常见格式示例数据都放在 example 目录下。就算你的数据和示例长得不一样也别慌——仓库里既有数据预处理脚本也有弱监督自动标注脚本先让程序打一批粗糙标签你再人工校正能省下大量标注时间。第三步跑通第一个实体识别模型进入示例目录直接开训cd example/ner/standard python run.py所有可调参数都在 conf 文件夹里想换模型只需改一行配置就能在 BERT、BiLSTM-CRF、W2NER 之间切换。我用轻量的 BiLSTM-CRF 在CPU上先跑通了流程再换成 W2NER在人民日报中文语料上F1能到96以上识别效果相当能打。想盯着训练过程开启 wandb 就能实时看到loss曲线和各项指标。第四步拿新文本做预测训练收尾后把 predict.yaml 里的模型路径改成刚才的checkpoint运行python predict.py几秒钟后输入文本里的人名、地名、机构名就被逐个框出来。看到自己的数据被模型读懂的那一刻成就感是真实的。同样的套路切到 example/re/standard 就能做关系抽取——输入换成实体对句子输出是实体之间的关系类型。数据不够它的后路比你想的多很多人做知识图谱卡住不是因为不会用模型而是没数据。DeepKE在这里给足了兜底方案少样本模型LightNER、KnowPrompt 这类模型专为低资源场景设计几十条标注也能出不错的效果数据增强example/re/few-shot/DA 目录提供了中英文数据增强脚本帮你把有限的标注变多大模型兜底example/llm 下的 DeepKE-LLM 支持调用 GPT 系列、ChatGLM、LLaMA 等大模型做抽取和数据生成还开源了 OneKE 抽取大模型配合 IEPile 指令数据集可以自己微调一套抽取能力。上面这张雷达图是 OneKE 与 GPT-4 等多个大模型在中文文实体、关系、事件抽取任务上的对比——不依赖外部API你也能自己部署一整套抽取能力。三个新手高频疑问Q没有GPU能跑吗能。BiLSTM-CRF这类轻量模型在CPU上就能训练只是慢一些想上BERT或W2NER建议备一张消费级显卡训练时间能差出十几倍。Q和手写正则比深度学习抽取强在哪规则只对格式规整的文本有效换个说法立刻失效模型则能泛化到没见过的表达而且同一套框架改改配置就能适配不同任务不必为每个任务重写一遍解析逻辑。Q想快速上线验证有现成模型吗有。example/triple/cnschema 提供了基于中文知识体系cnSchema的现成抽取模型下载即用特别适合先跑产品Demo、再谈优化。写在最后知识图谱的构建难不在算法而在怎么把流程干净地串起来。DeepKE已经把安装、数据、训练、预测、评估这条链路铺好了你要做的只是决定抽取什么然后跑一遍。想深入的话仓库里的 docs/ 目录有完整文档example/ 下每个任务都有可运行的示例pretrained/ 目录整理了预训练模型的下载指引。这篇文章里的每一步我都实际跑通过。现在轮到你动手了——从 clone 仓库开始把属于你的第一张知识图谱建出来。【免费下载链接】DeepKE[EMNLP 2022] An Open Toolkit for Knowledge Graph Extraction and Construction项目地址: https://gitcode.com/gh_mirrors/de/DeepKE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考