本地知识库 RAG 实战:文档切分那一步才是成败关键
搭了三个知识库之后我发现,决定效果的不是模型,而是切分与召回。这篇给出可复用的切分策略与评测方法。
很多人第一次搭知识库,都是被「效果不佳」劝退的:明明资料都喂进去了,回答却答非所问。

先排除模型的问题
换成更大的模型,效果往往只提升一点点。真正的问题通常出在检索环节——检索到的内容不对,再强的模型也只能基于错误材料作答。
三个最容易犯的错
- 按固定字数硬切。一句话被切成两半,语义直接断裂;
- 切得太大。一个块里混了好几个主题,检索出来噪声很多;
- 只做向量检索。专有名词、编号、代码这类内容,关键词检索往往更准。

正确的思路
按文档结构切分(标题层级、段落),再补充重叠窗口;对表格与代码单独处理;最后用「向量 + 关键词」混合检索,并加重排序。这套组合拳通常能把命中率提高一大截。
免费部分就到这里
上面的原则能让你避开最大的坑。但要让知识库真正可用,还需要具体的切分参数、评测集搭建方法、以及召回效果差时怎么逐层排查——这些我写在付费内容里。