
Knowledge Table让非结构化文档秒变结构化数据的终极开源工具【免费下载链接】knowledge-tableKnowledge Table is an open-source package designed to simplify extracting and exploring structured data from unstructured documents.项目地址: https://gitcode.com/gh_mirrors/kn/knowledge-tableKnowledge Table是一款强大的开源工具专为简化从非结构化文档中提取和探索结构化数据而设计。它通过自然语言查询界面帮助用户轻松创建表格和图形等结构化知识表示让复杂的文档数据处理变得简单高效。 为什么选择 Knowledge Table在当今数据驱动的世界更好的 RAG检索增强生成系统依赖于将非结构化数据转化为表格或图形等结构化格式。Knowledge Table 作为 WhyHow.AI 开发的核心工具在这一过程中发挥着关键作用。它直观的界面使技术和非技术用户都能轻松探索和管理数据同时作为开源项目它完全可定制以满足您的特定需求。无论是集成自己的模型、工作流还是提取规则Knowledge Table 的灵活性都能支持创新并适应您的独特要求。通过以正确的格式组织正确的数据它帮助您简化数据提取过程轻松解锁非结构化信息中的宝贵见解。 核心功能亮点Knowledge Table 提供了一系列强大功能让文档数据处理变得前所未有的简单自然语言提取使用自然语言查询从非结构化文档中提取结构化数据无需复杂的编程知识。自定义提取规则定义规则来指导提取过程并确保数据质量支持列级和全局级规则设置。目前支持的规则类型包括May Return为 LLM 提供答案示例指导提取方向Must Return指定允许返回的答案列表提供严格限制Allowed # of Responses限制返回结果数量确保精准性Resolve Entity将不同表述解析为统一实体如将 blackrock、Blackrock, Inc. 统一为 Blackrock多样化格式支持控制提取数据的输出格式目前支持文本、文本列表、数字、数字列表和布尔值格式。数据追溯与过滤通过 UI 中显示的来源信息实现数据可追溯性并可基于元数据或提取的数据过滤文档。灵活导出选项支持将提取的数据导出为 CSV 或图形三元组满足不同场景的数据使用需求。链式提取能力使用 符号引用先前的列实现复杂的链式提取例如What are the treatments fordisease? 核心概念解析表格Tables与电子表格类似表格是存储结构化数据的行列集合。每行代表一个文档每列代表一个通过问题提取和格式化的实体。文档Documents每个文档都是上传到 Knowledge Table 的非结构化数据源如合同、文章或报告。上传文档时它会被分割成块这些块会被嵌入并标记元数据然后存储在向量数据库中。问题Question问题是指导提取的核心机制它定义了您想要从文档中提取的数据内容。 快速开始指南使用 Docker 运行推荐前提条件DockerDocker Compose启动应用docker-compose up -d --build停止应用docker-compose down访问项目前端可在http://localhost:3000访问后端可在http://localhost:8000访问。本地运行前提条件Python 3.10Bun用于前端后端设置克隆仓库git clone https://gitcode.com/gh_mirrors/kn/knowledge-table进入后端目录cd knowledge-table/backend/创建并激活虚拟环境python3 -m venv venv source venv/bin/activate # Windows 使用 venv\Scripts\activate安装依赖pip install .启动后端cd src/ python -m uvicorn app.main:app后端将在http://localhost:8000可用。前端设置进入前端目录cd ../frontend/安装 Bun如未安装curl https://bun.sh/install | bash安装依赖bun install启动前端bun start前端将在http://localhost:5173可用。环境配置将.env.sample重命名为.env在.env文件中添加您的 OpenAI API 密钥在.env中配置向量存储目前支持 Milvus 和 Qdrant 实际应用场景Knowledge Table 适用于多种业务场景帮助您轻松处理各类文档数据合同管理提取关键信息如当事人名称、生效日期和续期日期简化合同审查流程。财务报告分析从年度报告或收益报表中提取财务数据快速获取关键财务指标。研究信息提取通过关键问题从一系列研究报告中提取信息加速文献综述过程。元数据生成通过对文件运行有针对性的问题如此电子邮件线程是关于什么项目的对文档和文件的信息进行分类和标记。 导出为三元组为了创建三元组的模式我们使用 LLM 考虑列的实体类型、用于生成单元格的问题以及值本身以创建模式和三元组。文档名称被插入为节点属性。向量块 ID 也包含在三元组的 JSON 文件中并与创建的三元组相关联。 可选集成Unstructured APIKnowledge Table 提供与 Unstructured API 的可选集成以增强文档处理能力。此集成允许从各种文档类型进行更高级的解析和提取。要使用 Unstructured API 集成在 Unstructured.io 注册 API 密钥在.env文件中设置UNSTRUCTURED_API_KEY环境变量安装带有 Unstructured 支持的项目pip install .[unstructured]当设置UNSTRUCTURED_API_KEY时Knowledge Table 将自动使用 Unstructured API 进行文档处理。如果未设置密钥或 Unstructured API 出现问题系统将回退到默认文档加载器。注意使用 Unstructured API 可能会根据您的 Unstructured.io 计划产生费用。 扩展项目Knowledge Table 设计灵活且可定制允许您对其进行扩展以适应您的工作流与自己的数据库集成创建自定义问题和规则连接您的模型使用自定义嵌入扩展以处理更大的工作负载️ 发展路线图Knowledge Table 正在不断发展以下是即将推出的功能更多 LLM 集成Azure OpenAI、Llama3、GPT-4、Anthropic 等更多向量数据库支持Weaviate、Chroma、Pinecone 等后端数据存储PostgreSQL、MongoDB、MySQL、Redis 等其他功能云部署脚本、自定义嵌入支持等 贡献指南我们欢迎社区贡献来改进 Knowledge Table。如果您有任何想法、错误报告或功能请求请在仓库上打开 issue。贡献步骤Fork 仓库为您的功能或错误修复创建新分支进行更改并使用描述性消息提交将更改推送到您的 forked 仓库向主仓库打开 pull request 许可证本项目采用 MIT 许可证。详情请参见 LICENSE 文件。 支持与联系WhyHow.AI 正在构建工具帮助开发人员使用图形结构为其 RAG 管道带来更多确定性和控制力。如果您正在将知识图谱整合到 RAG 中欢迎通过 teamwhyhow.ai 与我们交流或在 WhyHow.AI 关注我们的 newsletter。加入我们的 Discord 讨论。【免费下载链接】knowledge-tableKnowledge Table is an open-source package designed to simplify extracting and exploring structured data from unstructured documents.项目地址: https://gitcode.com/gh_mirrors/kn/knowledge-table创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考