PDF, Office, Markdown, HTML, testo e codice.
Carica PDF basati su testo, documenti Word, presentazioni, fogli di calcolo, dati CSV o TSV, Markdown, HTML, log e comuni formati di codice sorgente.
Conoscenza
Libre trasforma i documenti a cui puoi accedere in contesto utile per la chat senza separare la risposta dalla fonte. I termini esatti restano ricercabili, le corrispondenze semantiche ampliano la portata e le posizioni citate rimangono visibili nella conversazione.
Un documento è più utile quando un estratto può ancora dire dove si trovava. Libre conserva la provenienza strutturata durante l’estrazione ed evita di rielaborare caricamenti invariati nello stesso ambito.
Carica PDF basati su testo, documenti Word, presentazioni, fogli di calcolo, dati CSV o TSV, Markdown, HTML, log e comuni formati di codice sorgente.
L’estrazione registra segmenti della fonte affinché gli estratti recuperati e il pannello Sources possano identificare il punto da cui proviene un’affermazione, non soltanto il nome del file.
DOCX, PPTX e XLSX vengono decompressi da un parser limitato incluso nel repository. Byte identici caricati di nuovo nello stesso ambito vengono deduplicati.
Il recupero per parole chiave e quello semantico risolvono lacune diverse. Libre mantiene sempre disponibile il percorso lessicale e lo fonde con la classifica vettoriale quando sono configurati gli embeddings.
Identificatori esatti, nomi e termini rari possono essere classificati senza un modello di embeddings. Se la generazione degli embeddings fallisce o è disattivata, la ricerca nei documenti continua in modo lessicale.
Con gli embeddings abilitati, la fusione reciproca delle classifiche combina la somiglianza semantica con BM25, così una corrispondenza semantica vaga non supera automaticamente una forte corrispondenza esatta.
Il punteggio lessicale viene eseguito nel processo sui frammenti decifrati accessibili al richiedente. Libre evita volutamente di memorizzare un indice di token in chiaro per i frammenti cifrati dei documenti.
Il recupero è l’impostazione efficiente predefinita. Quando l’attività dipende davvero dall’intero file, una conversazione può usare il contesto del documento completo.
Gli estratti recuperati includono nome della fonte, frammento, punteggio e posizione strutturata. Il pannello Sources raggruppa le posizioni citate sotto i relativi documenti.
Una chat può inviare tutto il contenuto estratto invece dei passaggi selezionati. Un limite configurabile di token torna al recupero quando il materiale allegato è troppo grande.
Gli strumenti integrati possono elencare i documenti nell’ambito, cercare passaggi citati e leggere finestre limitate, così il modello può indagare un file progressivamente invece di ricevere tutto in anticipo.
Vedi il ciclo degli strumenti