ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

让 275 万篇古籍“听懂人话“:开源古籍检索引擎 WebSearch1 使用指南

2026/10/4 1:05:28 拓冰建站 浏览量
让 275 万篇古籍“听懂人话“:开源古籍检索引擎 WebSearch1 使用指南 查一句茶税什么时候开始的它能在《食货志》《通典》里把原文段落端到你面前你喊一声六祖坛经它知道你要的是藏内正名完全不同的那几部书它还能给 AI 一个长期记忆让每次研究的结论都沉淀下来、随取随用。这一切纯本地运行不联网、不调用任何外部大模型。一、为什么要有它做文史研究、内容创作或者考据写作的人大概都遇到过这些场景明明记得某部史书里写过某项制度翻遍全文检索却找不到——因为古籍里的说法是榷茶“茶引”而你搜的是茶税想查一部佛经喊它的俗名六祖坛经却搜不到——因为藏内的正名是另一个样子语料散落在几百个目录、几千个文件里没有一个统一的入口让 AI 帮忙做研究它每次都是金鱼记忆上次考证的结论这次全忘了。WebSearch1就是为解决这些问题而写的一个开箱即用的古籍全文检索服务 AI 记忆库一套 HTTP API 全部搞定。二、它有什么能力一句话说明275 万篇古籍全文检索殆知阁开源语料 15 大类史藏/子藏/集藏/儒藏/佛藏诸藏……覆盖率约 92%命中即返回原文段落口语化语义检索支持近义表达与旁义问法服务重启后第一次写入会卡住这类大白话也能召回相关内容书名别名“六祖坛经”“道德经”庄子这类俗名自动映射到藏内正名俗名正名都能查书内范围检索书名里/中/论把结果锁死在一本书内通鉴纪事本末里 榷茶不再混入全书库噪声分类直查查询以分类名开头即进入该集合史藏 茶课等价于只在史藏里搜茶课引号精确匹配茶马司逐篇验证相邻性精确语义不打折层级目录树根 → 分类 → 书 → 章节四级目录在线浏览像翻一套影印大丛书AI 记忆库给 AI 的长期记忆存结论、查结论、修订留痕跨会话不丢几个设计取向也是它和拿 Elasticsearch 灌一遍语料的区别纯本地、零外部依赖检索全程在本机完成不调用任何在线大模型 API——语料和查询记录都留在自己手里为古籍而生从分词到排序都针对文言文做了适配俗名、异名、无标点长串都能处理毫秒级响应热态查询几十毫秒返回批量研究跑起来不卡顿。三、五分钟上手1. 启动服务gitclone仓库地址websearch1cdwebsearch1 pipinstallfastapi uvicorn# 首次部署用仓库自带脚本从殆知阁语料构建索引一次性约十几分钟量级python3 build_full.py殆知阁语料目录index.dat python3 app.py# 默认端口 9205服务起来后浏览器打开http://127.0.0.1:9205即可使用网页界面程序化调用走 HTTP API。2. 第一次查询curl-XPOST http://127.0.0.1:9205/search\-HContent-Type: application/json\-d{query: 茶税, top_k: 5}返回节选{results:[{doc_id:史藏_政书_清朝通志_line_5187,title:清朝通志,content:……茶税之课其目有二曰茶课曰茶引……,highlights:[……茶税之课……],category:史藏,score:2.85}],total:5,took:0.03}content就是原文段落全文highlights是含关键词的片段doc_id可以回溯定位。3. Python 一把梭importjson,urllib.requestdefsearch(query,top_k5):requrllib.request.Request(http://127.0.0.1:9205/search,datajson.dumps({query:query,top_k:top_k}).encode(),headers{Content-Type:application/json})returnjson.loads(urllib.request.urlopen(req,timeout30).read())forhitinsearch(榷茶)[results]:print(hit[title],::,hit[highlights][0][:50])四、查询方式全解按你想干什么选写法这是日常使用 cheatsheet你想干什么怎么写例子一般主题检索直接写词茶税、榷茶、盐铁只查某个分类分类名开头史藏 茶课浏览一个分类只写分类名儒藏按书序返回锁死在一本书里书名 里/中/论通鉴纪事本末里 榷茶找某本书裸书名郁离子用俗名找书俗名直接写六祖坛经、道德经、庄子精确短语引号括起茶马司几个真实效果六祖坛经里说佛性—— 俗名 硬范围直接命中大藏经里《六祖大师法宝坛经》讲佛性的章节全书库噪声为零道德经里论水—— 命中《道德经》各注本论水的章节不会把《荀子》论水的段落混进来旁义问法也认查服务重启后第一次写入会卡住记忆库里关于重启死锁的记录照样被召回——哪怕原文里一个相同的词都没有。五、研究工作流顺藤摸瓜查古籍最有效的方法论是顺藤摸瓜WebSearch1 把每一步都支撑起来了术语扩展从用户的词找到历史术语。茶税 → 榷茶 → 茶引 → 贴射法每个术语各查一轮看分类分布定位主战场茶的话题大多在史藏政书类深读原文命中结果的content是全文挑三五篇读透别只看摘要引文追链古籍互相引用——《长编拾补》自注出自《纪事本末》卷百三十七顺着引用跳过去再查邻章扩展古籍同书相邻章节常是同主题连续记载用命中书名再查一轮即可扩容语料。一轮茶文化研究下来从茶政制度、贡茶、宗教茶到市民茶生活23 篇核心引证就是这么摸出来的。六、AI 记忆库给 AI 一个不会失忆的脑子这是它最有想象力的部分。/memories是一个独立的记忆索引专为 AI或人跨会话沉淀知识设计存一条记忆curl-XPOST http://127.0.0.1:9205/memories\-HContent-Type: application/json\-HX-Write-Token: 你的写令牌\-d{ domain: 茶文化研究, project: 榷茶制度, title: 榷茶始自唐建中三年, content: 榷茶之制始自唐德宗建中三年税天下茶漆竹木十取其一充两税军费。, memory_type: 结论, confidence: 0.95, tags: [茶税, 唐代], sections: [{kind: 出处, text: 《旧唐书·食货志》}] }查回来——大白话也行curl-XPOST http://127.0.0.1:9205/memories/search\-HContent-Type: application/json\-d{query: 唐朝什么时候开始收茶税的, top_k: 3}哪怕查询和原文一个词都不重合语义通道也能把这条记忆端回来。修订留痕结论更新了两种姿势版本链要保留演化历史再存一条新记忆并声明supersedes: [旧记忆doc_id]——旧版软删留痕新旧关系永久记录在元数据里随时可查这条结论是被哪条取代的原地编辑改错别字/补标签PUT /memories/{doc_id}创建日期保留最后编辑日自动盖章。为什么要给 AI 用把 WebSearch1 挂成 AI比如 Claude/Cursor 这类编码助手的检索工具后AI 每次开工先查记忆库不重复研究研究结论随手入库下次会话直接取回保存天然幂等——AI 重复提交同一条内容不会产生垃圾副本配合古籍检索AI 就有了考证 记忆的完整研究能力。七、典型应用场景场景用法文史论文/专著写作引文出处核查制度、职官、地理、人物一键定位原文历史经济研究茶政盐铁、赋役漕运跨分类顺藤摸瓜内容创作考据写历史小说/剧本前查典章名物避免穿越硬伤古籍点校整理目录树浏览 精确短语定位版本比对辅助AI Agent 工具接入一套 REST API检索 记忆两件套给 Agent 装上藏书楼 笔记本八、部署须知一台普通多核机器即可无需 GPU、无需外部服务Python 3.9 与 FastAPI/uvicorn索引构建一次、之后只读服务语料基于开源的殆知阁古代文献daizhige可按需增删分类检索类接口无需鉴权即可本机使用写接口含记忆库保存通过部署时配置的写令牌保护。九、写在最后WebSearch1 的野心不止于一个能用的搜索框它想证明中文古籍 本地检索 AI 记忆可以组成一套完整的数字化研究基础设施——查得到、记得住、越用越顺手。如果你也在和古籍打交道或者想给你的 AI 配一个藏书楼欢迎试用、提 issue、交流检索心得。下一篇计划写《顺藤摸瓜实战从一句茶税摸出 23 篇核心引证》感兴趣的点个关注。项目持续演进中当前版本特性以仓库 README 与 API 文档为准。