
把长文本变成“概念地图”用 knowledge_graph 本地搭建知识图谱指南【免费下载链接】knowledge_graphConvert any text to a graph of knowledge. This can be used for Graph Augmented Generation or Knowledge Graph based QnA项目地址: https://gitcode.com/gh_mirrors/kn/knowledge_graph如果你曾想从一份长 PDF 或一堆报告里梳理出“哪些概念彼此相关、哪个概念是核心”多半体会过这种痛点向量检索只能帮你找到段落却回答不了概念之间的结构。这正是 knowledge_graph 想解决的问题——它把任意文本语料转换成可查询、可可视化的知识图谱整条管线在本地跑面向的是想在文档上实验图谱增强生成GRAG或知识图谱问答的数据工程师和研究人员。一句话定位knowledge_graph 是一套 Python 工具链把长文切成块用本地大模型抽取概念对及其语义关系输出节点、边和权重供你分析或作为检索层使用。用概念抽取代替实体识别流程的起点是一个 LLM 提示词见 helpers/prompts.py让模型从每个文本块中提取“原子级概念”归类为事件、地点、组织等类型并给出 1~5 的重要性打分。它刻意区分了概念与实体——“班加罗尔”是实体“班加罗尔天气宜人”才是概念作者认为后者构成的图谱更能反映文本的真实结构。每条边都能溯源到原文边有两个来源一是 LLM 在同一文本块内输出的语义关系权重 W1二是“上下文邻近”——同一块里一起出现的概念也视为相关权重 W2。两份表按节点对聚合、权重求和后合并每条边保留来源文本块的 chunk_id。关系存疑时能翻回原文核对比纯模型推断更好验证。技术要点速览给非深度开发者本地模型Ollama Mistral 7B OpenOrca不调用 GPT 接口生成成本基本为零存储形式pandas 数据框图结构落地为管道分隔的 graph.csv、chunks.csv随时可用表格工具检查图运算与渲染networkx 计算节点度、社区pyvis 渲染成交互式 HTMLdocs/graph.html文档读取langchain 搭配 pypdf / unstructured 处理 PDF要求 Python 3.11什么时候用什么时候别用适合中等篇幅文档单份 PDF、一本书需要概念化梳理数据必须留在本地实验 GRAG 或图谱问答。 不适合语料非常大每个文本块都要走一次 LLM 调用速度慢需要精确实体识别的场景本管线面向概念而非 NER生产级实时图查询目前输出是 CSV 加静态页面没有内置图数据库。最短上手路径推荐 Docker 方式。克隆仓库后构建并启动容器即可在 JupyterLab 里打开 extract_graph.ipynb 分步运行git clone https://gitcode.com/gh_mirrors/kn/knowledge_graph cd knowledge_graph docker build -t knowledge-graph . docker run -p 8888:8888 knowledge-graph把 notebook 里 regenerate 置为 True 会调用本地模型重新抽取并写出 CSV置为 False 则直接复用已有输出适合先跑通可视化。样例产物已放在 data_output/cureus/ 与 data_output/OrfPathHealth/ 下可对照阅读。收尾建议如果你手头正有一份想理清脉络的 PDF不妨先按上面的路径克隆仓库从 extract_graph.ipynb 跑一遍样例看懂 graph.csv 里节点和边的含义后再换入自己的语料改动只是几个目录路径。【免费下载链接】knowledge_graphConvert any text to a graph of knowledge. This can be used for Graph Augmented Generation or Knowledge Graph based QnA项目地址: https://gitcode.com/gh_mirrors/kn/knowledge_graph创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考