PDF、Office、Markdown、HTML、文本和代码。
上传基于文本的 PDF、Word 文档、演示文稿、电子表格、CSV 或 TSV 数据、Markdown、HTML、日志和常见源代码格式。
当摘录仍能说明自己原本位于何处时,文档才更有用。Libre 在提取过程中保留结构化来源信息,并避免在同一范围内重复处理内容未变化的上传。
上传基于文本的 PDF、Word 文档、演示文稿、电子表格、CSV 或 TSV 数据、Markdown、HTML、日志和常见源代码格式。
提取过程会记录来源片段,让检索到的摘录和 Sources 面板能够指出某项陈述来自哪里,而不只是文件名。
DOCX、PPTX 和 XLSX 由 repository 中受限的解析器解包。相同字节再次上传到同一范围时会被去重。
关键词检索和语义检索解决不同的遗漏。Libre 始终保留词法路径,并在配置 embeddings 后将其与向量排名融合。
精确标识符、名称和罕见术语无需 embedding 模型即可排名。如果 embedding 生成失败或被禁用,文档搜索仍会继续使用词法检索。
启用 embeddings 后,倒数排名融合将语义相似度与 BM25 结合,避免模糊的语义近邻自动压过强精确匹配。
词法评分在进程内对请求者有权访问的已解密片段运行。Libre 明确避免为加密文档片段持久保存明文 token 索引。
检索是高效的默认方式。当任务确实依赖整个文件时,对话可以选择全文档上下文。
检索到的摘录包含来源名称、片段、分数和结构化位置。Sources 面板会按文档归组引用位置。
聊天可以发送全部提取内容,而不是选定段落。当附件材料过大并将超过可配置的 token 保护限制时,系统会退回检索模式。
内置工具可以列出范围内文档、搜索带引用的段落并读取受限窗口,让模型逐步调查文件,而不是一开始就接收全部内容。
查看工具循环