PDF, Office, Markdown, HTML, texto y código.
Sube PDF basados en texto, documentos de Word, presentaciones, hojas de cálculo, datos CSV o TSV, Markdown, HTML, registros y formatos comunes de código fuente.
Conocimiento
Libre convierte los documentos a los que tienes acceso en contexto útil para el chat sin separar la respuesta de su fuente. Los términos exactos siguen siendo localizables, las coincidencias semánticas amplían el alcance y las ubicaciones citadas permanecen visibles en la conversación.
Un documento es más útil cuando un fragmento puede indicar dónde estaba. Libre conserva la procedencia estructurada durante la extracción y evita volver a procesar cargas sin cambios en el mismo ámbito.
Sube PDF basados en texto, documentos de Word, presentaciones, hojas de cálculo, datos CSV o TSV, Markdown, HTML, registros y formatos comunes de código fuente.
La extracción registra segmentos de la fuente para que los fragmentos recuperados y el panel Sources puedan identificar de dónde procede una afirmación, no solo el nombre del archivo.
DOCX, PPTX y XLSX se descomprimen mediante un procesador limitado incluido en el repositorio. Los mismos bytes, subidos de nuevo al mismo ámbito, se deduplican.
La recuperación por palabras clave y la semántica resuelven ausencias distintas. Libre mantiene siempre disponible la ruta léxica y la combina con el ranking vectorial cuando hay embeddings configurados.
Los identificadores exactos, nombres y términos poco frecuentes pueden clasificarse sin un modelo de embeddings. Si la generación de embeddings falla o está deshabilitada, la búsqueda documental continúa por vía léxica.
Con embeddings habilitados, la fusión por rango recíproco combina la similitud semántica con BM25 para que una coincidencia semántica vaga no supere automáticamente a una coincidencia exacta fuerte.
La puntuación léxica se ejecuta en el proceso sobre fragmentos descifrados a los que puede acceder el solicitante. Libre evita deliberadamente guardar un índice de tokens en claro para los fragmentos cifrados.
La recuperación es la opción eficiente predeterminada. Cuando la tarea depende realmente del archivo entero, la conversación puede usar el contexto del documento completo.
Los fragmentos recuperados incluyen el nombre de la fuente, el fragmento, la puntuación y la ubicación estructurada. El panel Sources agrupa las ubicaciones citadas bajo sus documentos.
Un chat puede enviar todo el contenido extraído en lugar de fragmentos seleccionados. Una protección configurable de tokens vuelve a la recuperación cuando el material adjunto es demasiado grande.
Las herramientas integradas pueden listar documentos dentro del ámbito, buscar fragmentos citados y leer ventanas limitadas para que el modelo investigue un archivo de forma iterativa en lugar de recibirlo todo de una vez.
Ver el bucle de herramientas