返回列表

本地知识库 RAG 实战:文档切分那一步才是成败关键

AI实战 深夜冲浪选手 2025-11-01 2843 次阅读 55 条评论 0 次点赞 编辑于 2026-09-12
搭了三个知识库之后我发现,决定效果的不是模型,而是切分与召回。这篇给出可复用的切分策略与评测方法。

很多人第一次搭知识库,都是被「效果不佳」劝退的:明明资料都喂进去了,回答却答非所问。

本地知识库 RAG 实战:文档切分那一步才是成败关键

先排除模型的问题

换成更大的模型,效果往往只提升一点点。真正的问题通常出在检索环节——检索到的内容不对,再强的模型也只能基于错误材料作答。

三个最容易犯的错

  1. 按固定字数硬切。一句话被切成两半,语义直接断裂;
  2. 切得太大。一个块里混了好几个主题,检索出来噪声很多;
  3. 只做向量检索。专有名词、编号、代码这类内容,关键词检索往往更准。

三个最容易犯的错

正确的思路

按文档结构切分(标题层级、段落),再补充重叠窗口;对表格与代码单独处理;最后用「向量 + 关键词」混合检索,并加重排序。这套组合拳通常能把命中率提高一大截。

免费部分就到这里

上面的原则能让你避开最大的坑。但要让知识库真正可用,还需要具体的切分参数、评测集搭建方法、以及召回效果差时怎么逐层排查——这些我写在付费内容里。

以下内容需要付费解锁

本文剩余内容需 45 积分, 当前你有 0 积分。

登录后购买
登录后可收藏

评论 (55)

当前按点赞数排序
登录后即可参与评论。 去登录