PDF, Office, Markdown, HTML, texto e código.
Envie PDFs baseados em texto, documentos Word, apresentações, planilhas, dados CSV ou TSV, Markdown, HTML, registros e formatos comuns de código-fonte.
Conhecimento
O Libre transforma os documentos aos quais você tem acesso em contexto útil para o chat sem separar a resposta da fonte. Termos exatos continuam pesquisáveis, correspondências semânticas ampliam o alcance e os locais citados permanecem visíveis na conversa.
Um documento é mais útil quando um trecho ainda pode informar onde estava. O Libre preserva a procedência estruturada durante a extração e evita reprocessar uploads inalterados no mesmo escopo.
Envie PDFs baseados em texto, documentos Word, apresentações, planilhas, dados CSV ou TSV, Markdown, HTML, registros e formatos comuns de código-fonte.
A extração registra segmentos da fonte para que os trechos recuperados e o painel Sources identifiquem de onde veio uma afirmação, não apenas o nome do arquivo.
DOCX, PPTX e XLSX são descompactados por um analisador limitado incluído no repositório. Bytes idênticos enviados novamente ao mesmo escopo são desduplicados.
A recuperação por palavras-chave e a semântica resolvem ausências diferentes. O Libre mantém o caminho lexical sempre disponível e o combina à classificação vetorial quando embeddings estão configurados.
Identificadores exatos, nomes e termos raros podem ser classificados sem um modelo de embeddings. Se a geração de embeddings falhar ou estiver desabilitada, a pesquisa documental continua lexicalmente.
Com embeddings habilitados, a fusão de classificação recíproca combina similaridade semântica e BM25 para que uma correspondência semântica vaga não supere automaticamente uma correspondência exata forte.
A pontuação lexical é executada no processo sobre trechos descriptografados aos quais o solicitante pode acessar. O Libre evita deliberadamente persistir um índice de tokens em claro para trechos criptografados.
A recuperação é o padrão eficiente. Quando a tarefa realmente depende do arquivo inteiro, a conversa pode optar pelo contexto do documento completo.
Os trechos recuperados incluem nome da fonte, trecho, pontuação e localização estruturada. O painel Sources agrupa os locais citados sob seus documentos.
Um chat pode enviar todo o conteúdo extraído em vez de passagens selecionadas. Uma proteção configurável de tokens retorna à recuperação quando o material anexado é grande demais.
Ferramentas integradas podem listar documentos no escopo, pesquisar trechos citados e ler janelas limitadas para que o modelo investigue um arquivo iterativamente em vez de receber tudo de uma vez.
Ver o loop de ferramentas