ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

基于mineru搭建个人知识库经验分享

2026/8/18 12:21:48 拓冰建站 浏览量
基于mineru搭建个人知识库经验分享 文章目录概要整体架构流程技术细节概要最近想学习新知识为了便于资料查找和关联所以想搭建个人知识库。开源可能有错误认知个人很难辨别个人知识库资料则可以控制所以再三思量决定自动动手。搭建知识库的工具有很多因人而异也和个人熟悉程度相关自己把握就好这里只是基于个人探索而选择的不一定最优。其实内容提取工具很多网上也有很多介绍这里就不介绍了我只从我个人实地搭建体验发表一下个人感受。由于我没有深入研究源码只是从目前网上资源和个人探索而得的经验告知其中可能存在错误望指正。一开始决定用docling于是就开始动手搭建中间还和引擎easyocr杠上了有些资源是外网不能直接下来比较费劲。由于本人搭建的环境没有GPU也没有调优源码的经验发现一是有些格式不支持还需要额外安装一些插件还有就是很慢很慢。尤其的大的pdf几乎看不到动静尤其是大于20M的文件解析异常的慢。tika容错性好支持格式多但是解析内容精确度比较插尤其面对带有公示和图片表格的。经过反复折腾发现实在没有招后就果断放弃转向mineru。整体架构流程此知识库用到的工具主要有ollamaopen webuioikbmineru知识库构建主要流程是oikb负责将你的文件定时同步到open webuiopen webui将上传的文件调用mineru进行解析mineru解析后获得结果回传给open webuiopen webui再调用配置的内嵌模型生成知识库。技术细节这里就不赘述mineru具体安装细节网上一堆资源可以参考。只是提一下python安装可以用虚拟环境这样就可以避免处理各种版本冲突问题还有就是机器配置要好最好有GPU。一下主要讲一下实际安装测试过程遇到的坑以及解决方案。1 没有GPU在没有GPU环境下运行会报错。可以通过配置让程序运行在CPU之上有俩处配置可以修改如下1环境变量export MINERU_DEVICEcpuexport MINERU_DEVICE_MODEcpu2) mineru程序的应用配置文件mineru.jsondevice: cpu,device-type: cpu,2 在没有GPU情况下backend无法使用默认值改为pipeline即可3 内存调优如果内存充足可以在mineru.json中修改pipeline配置max_memory_usage此处我修改为12G。pipeline_config: {max_memory_usage: 12288,batch_size: 1,enable_formula: true,enable_table: true,ocr_optimization: {det_batch_size: 4,rec_batch_size: 16}},system_optimization: {memory_recycling: true,gpu_memory_fraction: 0.8}4 解析内容后需要嵌入模型进行向量化这一步在没有GPU情况下巨慢。所以贪心的话设置可以异步的常常只能第一能导入在这里最好取消异步。还有一个就是嵌入模型一开始也贪心认为大就好所以选qwen的结果半天出不来这里还是用了比较通用的。