LIBRE / 知识 有证据的检索 明确设计的边界

知识

知道答案来自哪里。

Libre 将你有权访问的文档变成可用的聊天上下文,同时让答案始终与来源相连。精确术语仍可搜索,语义匹配扩展覆盖范围,引用位置则在对话中保持可见。

默认关键词搜索
BM25
启用时使用向量 + 词法
混合
页面、幻灯片、工作表、章节
来源级
01 摄取

有用的格式会保留其在来源中的位置。

当摘录仍能说明自己原本位于何处时,文档才更有用。Libre 在提取过程中保留结构化来源信息,并避免在同一范围内重复处理内容未变化的上传。

01.1 文档

PDF、Office、Markdown、HTML、文本和代码。

上传基于文本的 PDF、Word 文档、演示文稿、电子表格、CSV 或 TSV 数据、Markdown、HTML、日志和常见源代码格式。

01.2 来源溯源

保留页面、幻灯片、工作表或章节。

提取过程会记录来源片段,让检索到的摘录和 Sources 面板能够指出某项陈述来自哪里,而不只是文件名。

01.3 受限处理

无需原生文档 runtime 即可解析 Office 文件。

DOCX、PPTX 和 XLSX 由 repository 中受限的解析器解包。相同字节再次上传到同一范围时会被去重。

02 检索

既找到标识符,也找到概念。

关键词检索和语义检索解决不同的遗漏。Libre 始终保留词法路径,并在配置 embeddings 后将其与向量排名融合。

02.1 关键词

BM25 始终可用。

精确标识符、名称和罕见术语无需 embedding 模型即可排名。如果 embedding 生成失败或被禁用,文档搜索仍会继续使用词法检索。

02.2 混合

融合向量和词法排名。

启用 embeddings 后,倒数排名融合将语义相似度与 BM25 结合,避免模糊的语义近邻自动压过强精确匹配。

02.3 加密内容

密文旁不保存明文全文索引。

词法评分在进程内对请求者有权访问的已解密片段运行。Libre 明确避免为加密文档片段持久保存明文 token 索引。

03 答案

使用恰当数量的来源上下文。

检索是高效的默认方式。当任务确实依赖整个文件时,对话可以选择全文档上下文。

03.1 引用

将来源位置带入回答。

检索到的摘录包含来源名称、片段、分数和结构化位置。Sources 面板会按文档归组引用位置。

03.2 全文档模式

在容量允许时读取完整提取文档。

聊天可以发送全部提取内容,而不是选定段落。当附件材料过大并将超过可配置的 token 保护限制时,系统会退回检索模式。

03.3 知识工具

让模型在一轮中进行搜索和读取。

内置工具可以列出范围内文档、搜索带引用的段落并读取受限窗口,让模型逐步调查文件,而不是一开始就接收全部内容。

查看工具循环
04 共享上下文

访问权限取决于提问者。

知识集合可以共享而无需公开。检索和直接读取执行相同授权,撤销权限会影响下一次查询。

04.1 授权感知检索

共享集合立即加入搜索。

授予用户或群组的集合会参与两种排名。其访问列表在向量搜索内部执行,共享或撤销时无需重新生成 embeddings。

04.2 配置文件

将助手限定到特定集合。

助手配置文件可绑定一个知识工作集。该绑定会缩小搜索范围,同时仍会重新检查发起者的当前权限。

助手配置文件
04.3 笔记

在来源材料旁保留持久思考。

笔记支持修订、附件、置顶、Markdown 导出、共享,以及在应用建议更改前对旧版本建立快照的 AI 编辑预览。