PDF, Office, Markdown, HTML, Text und Code.
Laden Sie textbasierte PDFs, Word-Dokumente, Präsentationen, Tabellen, CSV- oder TSV-Daten, Markdown, HTML, Protokolle und gängige Quellcodeformate hoch.
Wissen
Libre verwandelt die Dokumente, auf die Sie zugreifen können, in nutzbaren Chatkontext, ohne die Antwort von ihrer Quelle zu trennen. Exakte Begriffe bleiben durchsuchbar, semantische Treffer erweitern die Reichweite und zitierte Stellen bleiben im Gespräch sichtbar.
Ein Dokument ist nützlicher, wenn ein Auszug weiterhin seinen ursprünglichen Ort benennen kann. Libre führt strukturierte Herkunftsdaten durch die Extraktion und vermeidet die erneute Verarbeitung unveränderter Uploads im selben Geltungsbereich.
Laden Sie textbasierte PDFs, Word-Dokumente, Präsentationen, Tabellen, CSV- oder TSV-Daten, Markdown, HTML, Protokolle und gängige Quellcodeformate hoch.
Die Extraktion erfasst Quellsegmente, damit abgerufene Auszüge und die Quellenleiste den Ursprungsort einer Aussage identifizieren können – nicht nur den Dateinamen.
DOCX, PPTX und XLSX werden durch einen begrenzten Parser im Repository entpackt. Identische Bytes, die erneut in denselben Geltungsbereich hochgeladen werden, werden dedupliziert.
Schlüsselwort- und semantische Suche beheben unterschiedliche Lücken. Libre hält den lexikalischen Pfad jederzeit verfügbar und verbindet ihn mit der Vektorrangfolge, sobald Embeddings konfiguriert sind.
Exakte Kennungen, Namen und seltene Begriffe können ohne Embedding-Modell eingestuft werden. Wenn die Embedding-Erzeugung fehlschlägt oder deaktiviert ist, wird die Dokumentensuche lexikalisch fortgesetzt.
Bei aktivierten Embeddings kombiniert Reciprocal Rank Fusion semantische Ähnlichkeit mit BM25, damit ein ungenauer semantischer Nachbar nicht automatisch einen starken exakten Treffer übertrifft.
Die lexikalische Bewertung läuft im Prozess über entschlüsselte Abschnitte, auf die die anfragende Person zugreifen darf. Libre vermeidet bewusst die dauerhafte Speicherung eines Klartext-Tokenindex für verschlüsselte Dokumentabschnitte.
Die Suche ist die effiziente Standardeinstellung. Wenn eine Aufgabe tatsächlich von der gesamten Datei abhängt, kann ein Gespräch stattdessen den Ganzdokumentkontext verwenden.
Abgerufene Auszüge enthalten Quellenname, Abschnitt, Bewertung und strukturierten Ort. Die Quellenleiste gruppiert zitierte Stellen unter ihren Dokumenten.
Ein Chat kann den vollständigen extrahierten Inhalt anstelle ausgewählter Passagen senden. Ein konfigurierbarer Token-Schutz fällt auf die Suche zurück, wenn das angehängte Material zu groß ist.
Integrierte Werkzeuge können Dokumente im Geltungsbereich auflisten, zitierte Passagen suchen und begrenzte Fenster lesen, sodass das Modell eine Datei schrittweise untersuchen kann, statt alles vorab zu erhalten.
Werkzeugschleife ansehen