博客 / 主题

企业知识库怎么建:从分块、检索到评测

技术负责人搭企业知识库,真正难的不是把文档接进去,而是回答三个连环问题:检索质量好不好,怎么知道?分块策略要不要换、什么时候换?长上下文越来越强,RAG 这套还要不要投入?这三个问题有一个共同的错误解法——靠观感和行业共识拍板——和一个共同的正确起点:先给检索系统造一把尺子。

这个主题的三篇文章来自给开源知识库 琅嬛 做检索评测的完整实录:先建一套零人工标注、同指纹可复现的评测体系,再用它做判决性实验——量出「完美语义分块」的理论上限只有 ±2 个百分点,把一个热门方向干净地关掉;最后回到行业之争:长上下文替代不掉的,是人工的知识清洗和持续评测。

按顺序读:先看尺子怎么造,再看它怎么量出结论,最后看这些结论在企业场景里意味着什么。

  1. 支撑给检索系统造一把尺子

    第一步:零人工标注、可回归的检索评测怎么建——它抓出过一条零召回的死通道,证伪过一轮调优假设。

  2. 支柱方法论:给「完美语义分块」量理论上限,边界增益 ±2 个百分点——先量天花板,再决定盖不盖楼。

  3. 行业视角:长上下文替代不掉的是人工的知识清洗——新旧规则谁作数、矛盾谁发现、知识库靠什么评测。