PDF, Office, Markdown, HTML, tekst en code.
Upload tekst-PDF’s, Word-documenten, presentaties, spreadsheets, CSV- of TSV-data, Markdown, HTML, logboeken en gangbare broncodeformaten.
Kennis
Libre maakt van toegankelijke documenten bruikbare chatcontext zonder het antwoord van de bron los te maken. Exacte termen blijven vindbaar, semantische overeenkomsten vergroten het bereik en aangehaalde locaties blijven zichtbaar in het gesprek.
Een document is nuttiger wanneer een fragment nog kan aangeven waar het stond. Libre bewaart gestructureerde herkomst tijdens extractie en voorkomt herverwerking van ongewijzigde uploads in hetzelfde bereik.
Upload tekst-PDF’s, Word-documenten, presentaties, spreadsheets, CSV- of TSV-data, Markdown, HTML, logboeken en gangbare broncodeformaten.
Extractie registreert bronsegmenten, zodat gevonden fragmenten en het paneel Bronnen de locatie van een bewering kunnen aanwijzen, niet alleen de bestandsnaam.
DOCX, PPTX en XLSX worden uitgepakt met een begrensde parser in de repository. Identieke bytes die opnieuw in hetzelfde bereik worden geüpload, worden gededupliceerd.
Zoeken op trefwoorden en semantisch zoeken lossen verschillende gemiste resultaten op. Libre houdt het lexicale pad altijd beschikbaar en voegt het bij ingestelde embeddings samen met vectorrangschikking.
Exacte identificaties, namen en zeldzame termen kunnen zonder embeddingmodel rangschikken. Als embeddings genereren mislukt of is uitgeschakeld, blijft documentzoeken lexicaal werken.
Met ingeschakelde embeddings combineert reciprocal-rank fusion semantische gelijkenis met BM25, zodat een vage semantische buur niet automatisch een sterke exacte overeenkomst verslaat.
Lexicale scoring draait in het proces op ontsleutelde fragmenten waartoe de aanvrager toegang heeft. Libre bewaart bewust geen platte tokenindex voor versleutelde documentfragmenten.
Zoeken is de efficiënte standaard. Wanneer de taak echt van het hele bestand afhangt, kan een gesprek volledige-documentcontext kiezen.
Gevonden fragmenten bevatten de bronnaam, het fragment, de score en gestructureerde locatie. Het paneel Bronnen groepeert aangehaalde locaties onder hun documenten.
Een chat kan volledige geëxtraheerde inhoud verzenden in plaats van geselecteerde passages. Een instelbare tokenlimiet valt terug op zoeken wanneer het bijgevoegde materiaal te groot is.
Ingebouwde tools kunnen documenten in het bereik opsommen, aangehaalde passages zoeken en begrensde vensters lezen, zodat het model een bestand iteratief onderzoekt in plaats van alles vooraf te ontvangen.
Bekijk de tool-lus