ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

OntologyRAG: Better and Faster Biomedical Code Mapping with Retrieval-Augmented Generation (RAG) Lev

2026/9/8 18:04:22 拓冰建站 浏览量
OntologyRAG: Better and Faster Biomedical Code Mapping with Retrieval-Augmented Generation (RAG) Lev 研究问题生物医学本体代码映射如将ICD-9-CM代码映射到ICD-10-CM是一项耗时费力的工作现有流程依赖语言模型生成候选映射后由编码专家手动验证且本体需定期更新导致LM需频繁重训成本高昂。核心解决方案提出OntologyRAG管道将本体知识图谱与大型语言模型的检索增强生成RAG能力相结合使编码专家能通过自然语言提问获得带有映射邻近性评估和推理依据的可解释结果从而更快、更准地完成代码映射。一、研究背景与动机生物医学代码映射的重要性不同本体如疾病本体、药物本体对同一概念有不同的描述方式和层级结构映射这些等价或相似概念是构建统一生物医学知识库的关键步骤。现有流程的痛点自动生成候选映射后需编码专家手动验证缺乏推理依据本体定期更新LM需频繁重训数据整理和计算成本高昂纯LLM直接映射准确率极低实验中GPT-4仅8.38%。LLM与KG的互补性LLM擅长自然语言理解与生成但存在幻觉和知识陈旧问题知识图谱能结构化存储最新本体信息但查询需专业技能且结果难解释。两者结合RAG可优势互补。二、OntologyRAG管道架构管道包含三大模块1. 索引模块Indexing功能将本体源文件如ICD-9-CM、ICD-10-CM的CMS/CDC官方文件及未精炼映射GEM文件转换为标准RDF格式存储为知识图谱使用Oxigraph图数据库。关键技术ETL流程提取→转换→加载支持多种源格式表格、XML、纯文本等。2. 检索模块Retrieval / NL2SPARQL功能接收自然语言问题NLQ自动生成SPARQL查询并从知识图谱中检索相关子图。实现方式利用LLM进行NLQ到SPARQL的转换包含提示工程任务指令图源列表示例和自验证检查点确保查询语法正确且实体关系存在。实验结果GPT-3.5-Turbo、GPT-4、Meta-Llama-3-8B均能在两次尝试内生成有效查询。3. 推理与摘要模块Reasoning Summarization功能对检索到的代码对进行映射邻近性评估输出三个映射级别A完全一致B部分相关/不确定C部分冲突并提供自然语言推理摘要。实现方式两步提示策略——先独立预测映射级别再基于级别生成推理最后汇总所有结果。评估数据集500对疾病描述及人工标注映射级别的金标准数据集。三、实验与结果实验1纯LLM直接映射消融研究任务零样本提示LLM将ICD-9-CM代码直接映射到ICD-10-CM。结果最佳模型GPT-4仅达8.38%准确率说明纯LLM无法胜任此任务。实验2NL2SPARQL检索能力模型GPT-3.5-Turbo、GPT-4、Meta-Llama-3-8B。结果所有模型均能在两次尝试内生成有效SPARQL查询GPT系列输出格式更规范Llama-3需轻量后处理。实验3映射级别预测核心评估模型四种LLMGPT-3.5-Turbo、GPT-4、Meta-Llama-3-8B、Google-Flan-T5-XXL。提示策略零样本、少样本16例、增强少样本21例B类更多、思维链CoT。主要发现少样本学习显著提升所有模型性能CoT对GPT和Llama-3有效但对Flan-T5编码器-解码器结构效果不佳Meta-Llama-3-8B表现接近GPT-4是优秀的开源替代方案在C级别明确冲突预测上GPT-4和Llama-3均达95%精确率CoT策略下Llama-3在A级别精确率甚至超过GPT-4近83%A与B的区分是最大难点但少样本和CoT策略能显著改善。实验4推理质量因推理输出的生成性质未采用自动评估如ROUGE-L而是人工检查。发现推理质量与映射级别预测准确率高度相关级别预测结果足以反映模块有效性。四、主要贡献提出OntologyRAG管道首个将本体知识图谱与LLM-RAG结合用于生物医学代码映射的完整解决方案。降低技术门槛通过NL2SPARQL模块允许用户用自然语言查询复杂本体图谱。提供可解释性输出包含映射级别和自然语言推理帮助编码专家聚焦于模糊/复杂案例B级别加速验证流程。无需重训LLM本体更新只需更新知识图谱避免频繁模型重训的成本。开源与可复现提供两个金标准数据集、代码、提示模板及演示视频。模块化与灵活索引、检索、推理模块松耦合可灵活替换不同LLM或本体来源。五、局限性及未来工作局限性推理输出的自动评估尚未建立金标准目前为研究原型尚未达到生产级应用。未来方向将原型扩展为生产级系统支持快速、鲁棒的大规模本体映射探索更完善的推理质量自动评估方法进一步优化A/B级别区分能力。OntologyRAG通过知识图谱提供最新、结构化的本体知识通过LLM提供自然语言理解、查询生成和推理能力有效解决了传统代码映射中重训成本高、结果不可解释、专家负担重三大痛点。实验证明该管道在映射邻近性评估上表现优异尤其Meta-Llama-3-8B等开源模型在特定策略下可达接近GPT-4的水平具备实际应用潜力。该工作为生物医学本体管理与代码映射提供了一种高效、可扩展、可解释的新范式。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要。生物医学本体论全面定义了生物医学实体的概念和关系对于构建和形式化特定领域的信息表示至关重要。生物医学代码映射旨在识别不同本体论中概念之间的相似性或等价性。获得高质量的映射通常依赖于使用经过本体领域微调的语言模型LM自动生成未精炼的映射然后由编码专家进行手动选择或修正这些专家拥有广泛的领域专业知识和对本体系模式的熟悉度。语言模型通常以候选列表的形式提供未精炼的代码映射建议而不附带推理或支持证据因此编码专家仍然需要对照本体来源验证每个建议的候选者以挑选出最佳匹配。由于本体来源会定期更新以纳入新的研究发现这也是一项重复性任务。因此语言模型的定期再训练和手动精炼的需求使得代码映射既耗时又耗费人力。在这项工作中我们创建了 OntologyRAG一种本体增强的检索增强生成RAG方法该方法利用本体知识图谱中的归纳偏差用于大型语言模型LLM的上下文学习ICL。我们的解决方案将LLM与包含本体间未精炼映射的知识图谱相结合并通过生成一组可解释的结果来处理问题这些结果包括带有映射邻近性评估的预测依据。我们的解决方案不需要重新训练LM因为所有本体更新都可以通过标准流程更新知识图谱来反映。在我们自策金标准数据集上的评估结果显示使用我们的方法有望使编码专家能够更好、更快地进行代码映射。关键词生物医学代码映射 检索增强生成 大型语言模型 本体知识图谱。1 引言生物医学本体论以结构化和层次化的形式表示领域特定概念的语义定义和关系[1]。在不同的本体论中等价概念通常被描述为具有不同的关联关系或层次结构以捕捉不同概念背后的临床细微差别——例如对于1型糖尿病疾病本体论会包括其父类别如自身免疫性疾病和/或糖尿病的关系而药物本体论则会将其与胰岛素关联[2][3]。跨本体论映射这些语义上相似或等价的概念——通常被称为代码映射——是构建生物医学知识库整体形式化表示的重要一步。[4][5][6]。值得注意的是生成、存储和更新代码映射极具挑战性——原因在于本体论模式和源格式的多样性、理解生物医学细微差别所需的领域专业知识以及需要跟上定期本体更新的需求这些更新通常包含同义词和层次结构的变化[3][7]。为了实现高质量的代码映射现有流程通常涉及两个主要步骤使用诸如专门针对本体感知进行微调的语言模型LM等方法生成未精炼的映射作为建议候选列表然后依靠编码专家进行验证和手动精炼以选择最佳匹配项[8][9][10]。手动精炼步骤非常必要因为大多数语言模型难以正确映射语义相似但生物医学上不同的概念——例如急性肾脏疾病可以映射到肾脏疾病但反之则不然。但手动精炼通常耗时且费力。这是因为通常没有关于映射邻近性的指示或推理因此即使提供了顶级匹配候选列表编码专家仍然需要对照本体来源和相关材料验证每个案例[11][12]。此外本体提供者为将最新研究成果纳入本体而进行的定期本体更新使得在维护存储映射代码的数据库期间重新训练LM和重新验证选定候选者成为一项高要求且重复性的任务。近来大型语言模型LLM在各种与文本相关的生成式任务中显示出巨大潜力这些模型最突出的特点是其通用的自然语言理解能力和模型泛化性。然而与所有模型一样LLM在处理外部或未见知识以及过时的内部知识方面存在困难。此外定期重新训练或微调LLM以适应本体来源的变化将成本高昂且耗费人力——因为这需要频繁的培训数据整理、昂贵的计算设置以及模型处理专家。[13] 另一方面知识图谱KG在存储本体中丰富的语义和层次信息方面已显示出有效性并且更新存储在KG中的信息也 straightforward [14][15]。然而访问存储的信息需要了解查询语言和特定的图元数据同时检索到的图通常难以解释。研究表明当LLM和KG结合使用时例如在检索增强生成RAG系统中它们可以互补各自的局限性其中LLM可用于检索、推理和词汇化知识图谱中编码的信息以增强图谱的可访问性和可解释性[16][17][18]提供可靠且最新的外部知识从而在众多应用中提供卓越的便利性。[19][20]在这项工作中我们提出了一个定制的本体增强检索增强生成管道OntologyRAG它通过注入本体知识图谱利用现成LLM的上下文推理能力使编码专家能够更好、更快地执行代码映射。该管道包含三个部分索引将本体源文件转换为标准格式生成未精炼的映射并将信息作为知识图谱存储在数据库中、检索生成SPARQL查询以从数据库中检索子图以及对检索结果进行推理提供映射邻近性和摘要。通过对专家策展的金标准数据集进行评估我们展示了OntologyRAG通过联合利用本体知识图谱中编码的结构化信息和LLM的语言生成能力有潜力显著提高代码映射的质量和效率。图1. 我们提出的用于代码映射的本体增强检索增强生成OntologyRAG工作流程示意图。2 方法我们提出的方法以LLM为核心。在我们的工作中我们首先进行了一项消融研究评估LLM直接进行代码映射预测的能力然后转向RAG管道的构建和评估。最终的OntologyRAG原型在索引过程中将本体信息如代码描述、关系和本体间的未精炼映射存储到RDF知识图谱中并通过一种LLM支持的方法检索这些信息该方法允许用户使用自然语言问题NLQ查询数据库。原型的响应是一个包含检索结果、代码映射级别和相关推理的文本摘要图1。2.1 无知识图谱的LLM代码映射消融研究为了了解LLM在执行代码映射任务时的开箱即用能力我们策展了一个包含从ICD-9-CM到2018年4 H. Feng, Y. Yin, E. Reynares and J. Nanavati版ICD-10-CM的500个映射的金标准数据集。通过使用选定的LLM在默认温度下进行零样本实验来进行消融研究提示中的任务指令为“任务摘要您是一名临床编码员正在为现有的ICD9CM代码分配ICD10CM代码。指令请根据2018年版本为提供的ICD9CM代码分配相应的ICD10CM代码。如果可以映射多个ICD10CM代码请全部列出。”如果LLM的响应包含正确的映射代码我们认为预测正确。如果金标准数据集中列出了多个ICD-10-CM代码我们对模型的每个正确预测给予积分并且不因返回额外代码而惩罚。例如如果金标准数据集标注的代码是[代码A 代码B]而LLM预测的代码是[代码A 代码C 代码D]我们认为代码A的预测正确代码B的预测不正确因此该预测的准确率为50%。评估了两个OpenAI模型GPT-3.5-Turbo 和 GPT-4[21] 和两个开源模型Meta-Llama-3-8B [22] 和 Google-Flan-T5-XXL [23]这些模型已被证明在生物医学语言理解与推理基准BLURB任务上表现良好[24]。每个实验重复三次使用所有数据点的平均准确率作为评估指标。2.2 本体知识图谱生成与索引对于每个感兴趣的本体使用该管道的先决条件是构建一个知识图谱该图谱捕获新本体和现有本体的层次结构化信息特征、关系和未精炼映射。我们通过应用ETL提取、转换、加载处理模式来构建这样的知识图谱。在提取阶段我们根据源文件执行各种任务从解压文件到执行专用SQL脚本来获取原始格式的数据。例如我们检索了国际疾病分类临床修订版第九次和第十次修订ICD-9-CM和ICD-10-CM。ICD-9-CM诊断和程序代码及标签从美国医疗保险和医疗补助服务中心CMS官方网站[25]检索。ICD-9-CM文件以两列表格形式提供诊断和程序的代码及标签。ICD-10-CM诊断和程序代码及标签从美国疾病控制与预防中心CDC官方网站[26]检索。ICD-10-CM文件以专有模式下的XML文件形式提供诊断和程序的代码及标签。ICD-9-CM到ICD-10-CM的映射——称为通用等价映射GEM文件——从CMS官方网站[27]检索。GEM文件通常以纯文本格式提供每行代表一个映射条目。每个条目包括源代码、目标代码以及任何相关的标志或属性例如一对一、一对多或多对一关系以及指示映射是近似还是精确的标志。然后执行每个源特定的定制转换器从提取的数据生成基于RDF的表示。RDF是由万维网联盟W3C开发的一种标准模型提供了一种结构化的方式来描述和链接数据[28]。RDF数据组织为三元组每个三元组包含主体、谓词和客体形成一个有向图其中节点表示资源边表示它们之间的关系。三元组结构允许以一种灵活且可扩展的方式表示信息这使得RDF在我们这样需要集成和共同使用来自不同来源的数据的用例中特别有用。在撰写本工作时我们尚未完成开放源代码转换器阶段代码库的内部流程尽管此类过程的输出可以在提到的GitHub存储库中找到。最后我们将RDF数据加载到Oxigraph [29]中。Oxigraph是一个用Rust编写的开源图数据库基于RocksDB键值存储[30]。它提供了一组用于读取、写入和处理RDF文件的实用函数。可以通过使用SPARQL协议和RDF查询语言SPARQL[31]编写的查询来操作和检索此RDF数据。SPARQL是W3C开发的一项标准其查询语法类似于SQL并基于对RDF数据的三元组模式匹配。SPARQL支持四种主要类型的查询SELECT CONSTRUCT ASK和DESCRIBE。SELECT查询检索特定数据元素并返回一个结果表类似于SQL。CONSTRUCT查询检索数据元素并从这些元素生成一个新的RDF图。ASK查询检查数据中是否存在特定模式并返回一个布尔值指示是否找到了该模式。最后DESCRIBE查询检索一个RDF图该图描述特定资源或一组资源提供关于它们的详细信息。图2. 在NLP2SPARQL模块中生成SPARQL查询的提示包括输入NLQ、图源和NLQ到SPARQL的示例。2.3 子图检索一旦本体图准备就绪如2.2节所述就需要SPARQL查询从数据库中检索与本体相关问题相关的子图。然而构建有效且正确的SPARQL查询以检索结果既需要专业的SPARQL查询构建技能也需要对知识图谱的熟悉程度。为了消除这一技术障碍我们在OntologyRAG管道中创建了NL2SPARQL模块该模块接收自然语言问题NLQ并返回一个SPARQL查询从而可以直接使用NLQ从本体图数据库中检索信息。NL2SPARQL模块接收一个NLQ作为输入然后将其作为输入参数添加到一个提示模板中该模板详细说明了任务指令、图源列表以及一些NLQ到SPARQL的示例以为LLM创建一个实时提示来生成SPARQL查询图2。SPARQL生成过程还包括一个自我验证检查点以检查生成的SPARQL的有效性。除了验证输出是否具有正确的SPARQL语法外它还验证查询描述的图源、实体和关系是否存在于本体图数据库中。如果生成的SPARQL查询无效它将自动重复SPARQL生成过程直到查询有效并可用于从图数据库中检索信息。2.4 映射邻近性评估与摘要生成如2.2节所述KG数据库中本体间的索引映射是未精炼的映射这意味着代码之间可能存在不正确的映射并且需要编码专家验证和更新这些映射以获得可用于其他生物医学或临床任务的高质量精炼映射。为辅助验证过程我们创建了推理与摘要模块该模块接收NLQ和代码对NLQ中查询的代码和NL2SPARQL检索到的代码作为输入根据语义相似性和逻辑推理分配表1中三个映射级别之一然后返回自然语言摘要作为输出图3。表1. 代码对映射级别的定义。在推理步骤中我们使映射级别预测任务独立于推理以提高LLM对本体的预测性能。提示LLM两次以1预测检索到的代码对的两个疾病描述之间的映射级别2基于上述预测的映射级别给出推理图3。最后将输入NLQ、检索到的代码对、预测的映射级别以及推理再次输入LLM总结所有代码映射结果。为了比较推理与摘要模块中不同模型的映射级别预测能力创建了一个包含500对疾病描述及其对应映射级别的金标准数据集。在创建金标准数据集时我们首先使用GPT-3.5-Turbo根据常见的疾病分类系统生成了500对疾病描述并根据表1所述基于语义相似性预测了这些疾病描述对的映射级别然后由领域专家进行手动修订。金标准数据集中的每条记录包含两个疾病描述和一个描述语义邻近性的映射级别。图3. 推理与摘要模块推理步骤中用于1映射级别预测和2推理的提示。针对2.1节中提到的所有模型比较了四种不同的提示策略1零样本无示例2少样本16个示例3示例增强少样本21个示例其中为映射级别B增加了5个示例因为B代表部分语义相似或不确定的情况其覆盖的组合比A或C更多样4带有示例增强少样本的思维链基于示例增强少样本21个示例。每个实验重复三次并使用不同LLM和提示策略的平均准确率和每个映射级别的精确率作为评估指标。3 结果与讨论3.1 无知识图谱的LLM代码映射消融研究如表2所示对于使用我们金标准数据集的消融研究当使用零样本提示直接要求LLM返回映射代码时所选模型均未达到超过10%的整体准确率表现最佳的模型GPT-4仅达到8.38%。除了LLM固有的幻觉局限性外这种糟糕的表现可能还与大多数本体源文件是专有数据——意味着大多数LLM可能未接受过此类数据的训练——以及每个本体代码背后编码的领域特定语义复杂性有关。我们的消融研究不仅显示了本体代码映射任务的复杂性也揭示了仅使用LLM执行此类任务的巨大差距。表2. 使用不同LLM直接进行代码映射的准确率(%)3.2 SPARQL查询生成与子图检索对于NL2SPARQL模块我们实验了三种SOTA指令微调LLMGPT-3.5-Turbo GPT-4 Meta-Llama-3-8B。这些LLM未经过进一步微调结果显示所有三个模型都能够在两次尝试内生成准确的SPARQL查询以从正确的知识图谱中检索信息。然而LLM返回的响应格式略有不同。虽然提示指示模型仅输出生成的SPARQL查询而不附带任何无关文本但只有GPT-3.5-Turbo和GPT-4能够按请求提供指定响应输出开箱即用、无需进一步后处理的SPARQL查询。相比之下Meta-Llama-3-8B倾向于在其输出中包含额外的对话或对提示的回复这需要一些轻量级的后处理工作来提取嵌入在响应中的SPARQL查询。3.3 映射邻近性评估与推理评估对于推理与摘要模块我们收集并策展了一个包含500条记录的金标准数据集用于性能评估每条数据点包含两个疾病描述和一个手动分配的映射级别。评估了模型选择、提示策略和温度对映射级别预测整体准确率相对于金标准数据集的影响。我们发现与零样本学习相比少样本学习有助于提高所有测试模型的性能。尽管CoT提示对GPT模型和Meta-Llama-3-8B-Instruct都产生了更好的性能但对Google-Flan-T5-XXL却产生了较差的性能。这可能是因为Google-Flan-T5-XXL是唯一一个编码器-解码器模型而其他三个是仅解码器模型。我们还注意到Meta-Llama-3-8B-Instruct在两种少样本提示策略下的性能都超过了GPT-3.5-Turbo和Google-Flan-T5-XXL并接近GPT-4表3考虑到模型的参数量这令人印象深刻使其成为执行此任务的有前途的开源候选模型。表3. 使用不同提示策略进行代码映射级别预测的准确率(%)由于这些映射级别旨在帮助编码专家关注模糊或复杂的案例我们需要考虑每个映射级别对人类审查员的影响。例如在A和C级别上的高精度预测表明有可能引入自动生成的分组过滤器允许审查员直接接受或拒绝这些语义上更明显的映射结果。这可能使这些编码专家能够只关注那些被归类为B级别的映射结果即困难和模糊的案例从而加速代码映射过程。图4. 使用不同提示方法在每个级别上的生物医学代码映射精确率鉴于需要对三个映射级别进行不同权衡LLM的整体准确率不应是评估其映射级别分配性能的唯一指标。为了帮助衡量更适合此模块的模型我们将每个映射级别预测的精确率作为另一个评估指标并优先考虑能够为A和C级别提供更高精确率的模型。所有测试的LLM和提示方法的组合在C级别预测上都达到了相对较高的精确率(80%)。值得注意的是GPT-4和Meta-Llama-3-8B的所有组合都达到了95%的精确率。思维链CoT提示策略——要求LLM在进行级别预测之前进行推理——在映射级别A上为两个开源LLM都产生了最高的预测精确率Meta-Llama-3-8B甚至以近83%的得分超过了GPT-4图4。区分A和B级别对LLM来说似乎更具挑战性。这可以看作模型认为两个代码密切相关且一致但仍难以确定它们是否完全匹配。我们深入研究了这些模型的结果并使用混淆矩阵来帮助更好地理解错误分类的细节图5。从矩阵中我们可以看到提示工程对预测映射级别C的影响远小于对其他两个级别的影响。我们还可以看到在零样本方法下Meta-Llama-3-8B和Google-Flan-T5-XXL倾向于预测映射级别A和C多于映射级别B同时将许多B级别案例错误分类为A级别而GPT-3.5-Turbo和GPT-4在所有三个映射级别上具有更好的预测平衡。然而令人鼓舞的是少样本、增强少样本和CoT方法都有效地帮助Meta-Llama-3-8B“理解”区分映射级别A和B的细微差别从而显著提高了其在这两个级别上的预测精确率。这些提示工程策略也进一步增强如2.4节所述为了帮助编码专家理解决预测映射级别背后的原理所有LLM还被要求提供自然语言推理来支持预测。为了评估生成的推理输出我们考虑了使用诸如rouge-L等指标进行自动评估。然而由于LLM的生成性质极难预测自然语言响应的构建方式。因此很难生成一个公平的金标准包含预期的推理答案以自动评估自然语言推理输出的质量。尽管我们认为拥有一个稳健的方法来构建用于自动评估推理输出的金标准数据集可能是一项有趣的工作但它超出了本研究的范围但可能是我们未来感兴趣的方向。在本研究中我们手动检查了推理响应发现推理的总体质量与映射级别预测密切相关。因此我们认为呈现映射级别预测的结果足以展示不同LLM在执行与推理与摘要模块相关任务中的有效性。4 结论在这项工作中我们创建了OntologyRAG一个利用本体知识图谱和LLM的上下文学习能力使编码专家能够更好、更快地进行生物医学代码映射的管道。我们工作的主要贡献是创建了OntologyRAG一个基于LLM的RAG管道用于本体代码映射。展示了其在索引和检索复杂本体相关信息方面的有效性并展示了其辅助代码映射精炼的前景。提供了两个金标准数据集一个用于评估模型直接进行代码映射能力的准确率另一个用于评估模型进行代码映射邻近性预测能力的有效性。评估了几种最先进的LLM相对于我们金标准数据集的有效性并提供了研究结果。OntologyRAG管道具有可扩展性和通用性。它包含一个即用型索引模块可以将大多数本体源文件和映射文件转换并存储到知识图谱数据库中一个检索模块以自然语言问题作为输入自动生成有效的SPARQL查询从图数据库中检索与问题相关的信息以及一个推理与摘要模块评估检索信息与输入问题的相关性然后输出带有自然语言推理的相关性邻近性。我们管道中LLM的选择是灵活的。我们提供的金标准数据集和评估方法可以帮助决定在管道维护期间是否需要升级LLM。我们的结果显示将诸如Meta-Llama-3-8B和GPT-4等现成LLM纳入其中以增强本体知识图谱中编码的复杂信息的可访问性和可解释性具有巨大潜力。通过接受自然语言问题并提供包含检索结果和预先分析的映射级别及推理的输出该管道允许编码专家将精力集中在最模糊和复杂的映射案例上而不是所有案例从而提高映射效率和质量。该研究原型展示了将LLM与KG集成以辅助代码映射精炼的良好前景。该管道便于未来性能增强的LLM的快速灵活适应并确保在更新知识图谱以反映本体变化时具有快速响应能力。未来的研究将侧重于探索如何将此原型扩展和增强为生产级应用以促进快速且稳健的本体映射。