PDF, Office, Markdown, HTML, text a kód.
Nahrávejte textová PDF, dokumenty Word, prezentace, tabulky, data CSV nebo TSV, Markdown, HTML, protokoly a běžné formáty zdrojového kódu.
Znalosti
Libre mění dostupné dokumenty na použitelný kontext chatu, aniž by oddělilo odpověď od zdroje. Přesné termíny zůstávají vyhledatelné, sémantické shody rozšiřují dosah a citovaná místa zůstávají viditelná.
Dokument je užitečnější, když úryvek stále dokáže určit své umístění. Libre přenáší strukturovaný původ extrakcí a nezpracovává znovu nezměněné soubory ve stejném rozsahu.
Nahrávejte textová PDF, dokumenty Word, prezentace, tabulky, data CSV nebo TSV, Markdown, HTML, protokoly a běžné formáty zdrojového kódu.
Extrakce zaznamenává segmenty zdroje, aby nalezené úryvky a panel Zdroje určily místo původu tvrzení, nejen název souboru.
DOCX, PPTX a XLSX rozbaluje omezený parser v repozitáři. Stejné bajty znovu nahrané do stejného rozsahu se deduplikují.
Klíčové a sémantické vyhledávání řeší jiné typy opomenutí. Libre udržuje lexikální cestu vždy dostupnou a po nastavení embeddingů ji slučuje s vektorovým hodnocením.
Přesné identifikátory, názvy a vzácné termíny lze řadit bez embeddingového modelu. Pokud tvorba embeddingů selže nebo je vypnutá, dokumenty se dál hledají lexikálně.
Se zapnutými embeddingy slučuje fúze reciprokých pořadí sémantickou podobnost s BM25, aby neurčitý sémantický soused automaticky nepřekonal silnou přesnou shodu.
Lexikální hodnocení běží v procesu nad dešifrovanými úryvky dostupnými žadateli. Libre záměrně neukládá tokenový index v otevřeném textu pro šifrované úryvky.
Vyhledávání je efektivní výchozí stav. Když úkol skutečně závisí na celém souboru, konverzace může použít kontext celého dokumentu.
Nalezené úryvky obsahují název zdroje, úryvek, skóre a strukturované místo. Panel Zdroje seskupuje citovaná místa pod dokumenty.
Chat může odeslat úplný extrahovaný obsah místo vybraných pasáží. Nastavitelný limit tokenů se vrátí k vyhledávání, když je příloha příliš velká.
Vestavěné nástroje mohou vypsat dokumenty v rozsahu, hledat citované pasáže a číst omezená okna, aby model zkoumal soubor postupně místo přijetí všeho předem.
Zobrazit smyčku nástrojů