PDF, Office, Markdown, HTML, texte et code.
Importez des PDF textuels, documents Word, présentations, feuilles de calcul, données CSV ou TSV, fichiers Markdown, HTML, journaux et formats de code source courants.
Connaissances
Libre transforme les documents auxquels vous avez accès en contexte utile pour le chat sans séparer la réponse de sa source. Les termes exacts restent recherchables, les correspondances sémantiques élargissent la portée et les emplacements cités restent visibles dans la conversation.
Un document est plus utile lorsqu’un extrait peut encore indiquer où il se trouvait. Libre conserve une provenance structurée pendant l’extraction et évite de retraiter un envoi inchangé dans la même portée.
Importez des PDF textuels, documents Word, présentations, feuilles de calcul, données CSV ou TSV, fichiers Markdown, HTML, journaux et formats de code source courants.
L’extraction enregistre les segments de la source afin que les extraits retrouvés et le volet Sources identifient l’emplacement d’une affirmation, et pas seulement le nom du fichier.
Les fichiers DOCX, PPTX et XLSX sont décompressés par un analyseur limité inclus dans le dépôt. Des octets identiques renvoyés dans la même portée sont dédupliqués.
La recherche par mots-clés et la recherche sémantique corrigent des absences différentes. Libre garde la voie lexicale toujours disponible et la fusionne avec le classement vectoriel lorsque des embeddings sont configurés.
Les identifiants exacts, noms et termes rares peuvent être classés sans modèle d’embeddings. Si leur génération échoue ou est désactivée, la recherche documentaire continue lexicalement.
Lorsque les embeddings sont activés, la fusion par rang réciproque combine la similarité sémantique avec BM25 afin qu’un voisin sémantique vague ne dépasse pas automatiquement une correspondance exacte forte.
Le score lexical est calculé dans le processus sur les fragments déchiffrés accessibles à la personne qui effectue la requête. Libre évite volontairement de conserver un index de jetons en clair pour les fragments chiffrés.
La recherche est le choix efficace par défaut. Lorsque la tâche dépend réellement du fichier entier, une conversation peut utiliser le contexte du document complet.
Les extraits retrouvés incluent le nom de la source, le fragment, le score et l’emplacement structuré. Le volet Sources regroupe les emplacements cités sous leurs documents.
Un chat peut envoyer l’ensemble du contenu extrait à la place de passages sélectionnés. Une limite de jetons configurable revient à la recherche lorsque les pièces jointes sont trop volumineuses.
Les outils intégrés peuvent lister les documents dans la portée, rechercher des passages cités et lire des fenêtres limitées afin que le modèle examine un fichier progressivement plutôt que de tout recevoir immédiatement.
Voir la boucle d’outils