ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

RAG - 文档怎么切才能有最好的效果

2026/8/8 4:20:32 拓冰建站 浏览量
RAG - 文档怎么切才能有最好的效果 RAG现在已然是企业知识库的首选方案但很多公司费了九牛二虎之力搭建好一套RAG之后实际用起来却发现经常十问九不中。最后排查下来的原因多半都不是模型不行而是文档被切坏了。RAG 这条链路里加载、切分、向量化、检索、增强生成每一步都可能出错。其中最容易被忽视、却往往决定上限的环节就是切分。它直接影响了检索时能不能把正确答案所在的那段文字干净、完整地送到大模型手里。RAG 完整链路切分是关键环节不过切分策略远不止固定长度切一刀那么简单。下面就一个一个说清楚。01为什么切分决定 RAG 成败很多人入门时做的第一件事就是给切分器设一个固定长度比如 500 字然后让程序按这个长度把文档切成片段。这个做法看起来省事但它常常把语义单元直接腰斩。比如一段讲Transformer 注意力机制的三个变体的文字第一部分在某个 chunk 的末尾第二部分在下一个 chunk 的开头。检索时向量相似度只能匹配到其中一个 chunk另一个 chunk 里关键的信息就彻底丢了。最终大模型拿到的上下文残缺不全回答自然驴唇不对马嘴。这里面更深层的问题是RAG 的检索模型是在连续的向量空间里工作它理解的相似是语义上的而不是位置上的。你切出来的每一个片段都独立成为一个检索单元。如果这个单元本身语义就不完整向量表达也会失真排序时很容易被挤到后面去。所以切分这个环节本质是在决定哪些文字会作为一个整体被检索和喂给模型。它不但影响检索召回率还直接影响最终答案的准确与连贯。把切分做好往往比换一个更强的嵌入模型收益更大。02七种经典切分策略在讨论最新进展之前有必要先把业界已经摸索出来的七种主流方案梳理清楚。每一种都有自己的适用场景和软肋了解它们才能在做技术选型时心中有数。七种 RAG 切分策略对比2.1 固定长度滑窗切分这是最朴素的方法。设定一个固定大小比如 512 个 token然后从头按这个窗口往后滑两个窗口之间可以稍有重叠避免边界处语义割裂。优点很简单实现成本几乎为零处理速度快适合对实时性要求很高的初步实验。缺点也摆在明面上不管句子、段落、标题、表格统统按长度一刀切语义完整性完全靠运气。适用场景更多是临时验证原型的时候或者处理那种本身就没结构、纯流式的短文本比如聊天记录、日志。2.2 句子窗口检索既然固定长度会切断句子那很自然的改进就是以句子为单位切分然后取若干句子作为一个窗口窗口之间同样可以有重叠。具体实现通常是先用分句工具把文档拆成句子列表再按固定句数滑窗。一个窗口里至少能保证每个句子是完整的不容易出现半个句子的悲剧。比纯粹固定长度好一截但它仍然不知道文档的结构层次不知道哪里是标题、哪里是段落。遇到表格或代码块可能也会被拆得乱七八糟。比较适合处理结构简单的长文本如新闻稿、博客文章这类连续叙述性内容。2.3 文档结构感知切分这一步开始真正考虑文档本身的层级关系。很多文档本身就是有结构的一级标题、二级标题、段落、列表、代码块。结构感知切分就是利用这些已有信息在标题边界等自然断层处切分并且把标题信息保留下来作为这个片段的一部分。举个例子一段关于梯度下降优化器的文字会在切分时带上祖先标题“机器学习 / 模型训练 / 优化器”。这样即使把它从原文档里抽出来读者也就是大模型也能知道这段内容属于哪个大主题。优点非常明显检索出来的片段自带上下文坐标不容易跑偏。而且切分边界天然合理不会切断高层次的语义块。缺点是需要文档本身有良好结构如果是杂乱的 PDF 转换后的文本这套做法可能根本无从下手。2.4 语义切分前面几种方法都依赖人为设定的规则或现成结构而语义切分则让模型去判断这里该不该切。原理是用嵌入模型把整篇文档的每一小段都编码成向量然后计算相邻片段之间的语义相似度。当相似度突然大幅下降时就认为语义发生变化是一个合理的切分点。这一步本质上是在找出文档中主题切换的地方。相比固定长度语义切分能更好地保持每个片段内部的话题一致性检索时噪声会明显减少。但它依然有局限切分颗粒度受模型对相似度陡降的敏感度影响而且对于没有明显主题过渡的叙述性段落效果会打了折扣。2.5 层级 / 父子切分这一策略把切分和检索拆成两步来处理。简单说就是先用较大的粒度做初步检索再用更细的粒度去喂给大模型。大块的父块包含较完整的上下文比如一整节用来在检索阶段做向量匹配它的语义描述更全面不容易漏召。小块的子块则是父块内部进一步切细的段落或句子。检索时匹配到父块后实际送给大模型的是其对应的子块或者直接送整个父块但把检索重点标出来。这种两阶段的设计让检索和生成分别使用了最合适的粒度能同时兼顾召回率和最终上下文的质量。当然代价是存储和索引的复杂度上来了毕竟要多维护一层父子关系。2.6 智能体切分前面这些策略要么靠规则要么靠模型输出一个断点位置。能不能把切分这件事交给大模型自己来做呢这就是智能体切分也叫 LLM 驱动切分。它可以输出两种形态的结果。第一种是输出自然断点位置。你把文档给 LLM让它分析内容后直接告诉你在第 3 段末尾切一刀在第 5 段末尾再切一刀。LLM 会结合语义、结构、话题完整性给出最优的拆解方案相当于一个高级版的语义切分。第二种是抽取独立事实命题。也就是把一大段文字里隐含的每一条独立知识都抽出来变成一句句自包含的陈述句。比如 “Transformer 由 Vaswani 等人在 2017 年提出”“自注意力机制计算的是序列内所有位置的加权和”每一条都不依赖上下文就可以独立理解。这些命题就是最小粒度的检索单元检索精度极高。智能体切分的上限非常高但慢也是真的慢而且每一次调用都会有额外消耗。目前更适合对质量要求极高、可以接受离线处理的场景直接拿来做实时索引还有一定距离。2.7 多模态与表格保留切分很多企业文档里表格是信息密度最高的部分。传统的文本切分往往把表格转成行不成行、列不成列的纯文本检索时几乎没有招架之力。多模态表格保留切分不会粗暴地把表格拍成文字。它的核心机制是两阶段处理。索引阶段会用 LLM 为表格生成一个精炼的摘要比如该表格列出了近年各模型的参数规模与训练成本把这个摘要进行向量化参与检索匹配。这样一来语义搜索可以轻松定位到这张表。但生成阶段喂给大模型的不是摘要而是原始的 Markdown 或 HTML 格式的表格本身。这时候模型读到的是完整的行列结构、数字、表头意味着它可以精确回答哪个模型参数最大训练成本是多少之类的问题。这种做法把结构化数据的检索匹配精度和最终答案的准确度同时保住了非常适合财报、论文、技术手册这类文档。03PixelRAG2026 年最新进展干脆跳过切分本身这周刚发布的 PixelRAG直接把前面所有讨论的文档切分这个大前提给绕开了。UC Berkeley、Princeton、EPFL 和 Databricks 的研究团队提出只要把网页渲染成截图用视觉语言模型直接看图就不再需要任何 HTML 转文本、解析、清洗、切分这些步骤。在回答为什么会这样时他们给出了一个很清晰的失败归因分析。基于 Wikipedia 的 SimpleQA 基准测试RAG 回答出错大致有三个来源第一是Parser loss占比 36.6%。这是 HTML 转纯文本的过程中结构化信息被破坏得如此彻底以至于索引里根本没有包含答案的 chunk。第二是Rank loss占比 55.2%。答案其实还在文档里但因为维基百科页面里那些关键词密集的 infobox 信息框向量匹配得分极高把真正包含答案的段落挤到了排名 20 以外检索阶段就名落孙山。第三是Reader loss占比 8.2%。正确答案确实被检索出来喂给模型了但由于结构丢失、上下文扭曲模型把信息归属或细节给理解错了。RAG 出错的三个来源PixelRAG 2026PixelRAG 的解决方法非常直接用 Playwright 把页面渲染成固定宽度截图切成小图块向量化存储检索时把匹配到的图块直接送给视觉语言模型。整个过程不需要理解 HTML、不需要设计切分规则。在 SimpleQA 上它的准确率达到 78.8%而最强的文本方法只有 71.6%表格类查询上则是 48.8% 对 42.5%虽然领先但差距其实比纯文本任务要小一些。论文给出的总体结论是PixelRAG 相对文本 RAG 最多能提升 18.1% 的准确率。成本方面也很吸引人一次搜索用到的 prompt token 从千万级骤降到 360 万而文本检索用了 3750 万成本能降低 2 到 4 倍。这种方法目前要依赖 Qwen3-VL-4B 级别及以上的视觉语言模型才能发挥优势小模型反而会落后文本检索超过 12.5 个百分点。另外像素级别固定高度切片会不会把表格或段落直接切碎也是一个待解决的开放问题。结尾回头看看RAG 切分这件事从最初的固定 500 字一刀切到一步步发展到语义感知、父子分离、LLM 自主决策再到如今跳出文本桎梏直接看页面这条路走得比想象中要远。但所有这些进步最终都指向一个很朴素的原则你要喂给模型的那一段上下文必须是语义完整、结构清晰、边界自然的。不管用哪种策略只要这个原则守住了RAG 的表现就不会太差。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】