PDF, Office, Markdown, HTML, text och kod.
Ladda upp textbaserade PDF:er, Word-dokument, presentationer, kalkylblad, CSV- eller TSV-data, Markdown, HTML, loggar och vanliga källkodsformat.
Kunskap
Libre gör dokument du får åtkomst till användbar chattkontext utan att kapa svaret från källan. Exakta termer förblir sökbara, semantiska träffar ökar räckvidden och hänvisade platser syns i samtalet.
Ett dokument är mer användbart när ett utdrag fortfarande kan ange var det fanns. Libre bär strukturerat ursprung genom extraktionen och undviker att bearbeta oförändrade uppladdningar igen inom samma omfattning.
Ladda upp textbaserade PDF:er, Word-dokument, presentationer, kalkylblad, CSV- eller TSV-data, Markdown, HTML, loggar och vanliga källkodsformat.
Extraktionen registrerar källsegment så att hämtade utdrag och panelen Källor kan ange platsen för ett påstående, inte bara filnamnet.
DOCX, PPTX och XLSX packas upp med en begränsad parser i projektet. Identiska byte som laddas upp igen inom samma omfattning dedupliceras.
Nyckelords- och semantisk hämtning löser olika missar. Libre håller den lexikala vägen tillgänglig och förenar den med vektorrangordning när embeddings konfigureras.
Exakta identifierare, namn och sällsynta termer kan rangordnas utan embeddingmodell. Om genereringen misslyckas eller stängs av fortsätter dokumentsökningen lexikalt.
Med embeddings aktiverade kombinerar reciprocal-rank fusion semantisk likhet med BM25 så att en vag semantisk granne inte automatiskt slår en stark exakt träff.
Lexikal poängsättning körs i processen över dekrypterade delar som frågeställaren får läsa. Libre sparar avsiktligt inget tokenindex i klartext för krypterade dokumentdelar.
Hämtning är den effektiva standarden. När uppgiften verkligen beror på hela filen kan samtalet välja heldokumentkontext.
Hämtade utdrag innehåller källnamn, del, poäng och strukturerad plats. Panelen Källor grupperar hänvisade platser under dokumenten.
En chatt kan skicka fullständigt extraherat innehåll i stället för valda passager. En inställbar tokengräns faller tillbaka på hämtning när materialet är för stort.
Inbyggda verktyg kan lista dokument inom omfattningen, söka källhänvisade passager och läsa begränsade fönster så att modellen undersöker filen stegvis.
Se verktygsslingan