PDF, Office, Markdown, HTML, текст и код.
Загружайте текстовые PDF, документы Word, презентации, таблицы, данные CSV или TSV, Markdown, HTML, журналы и распространённые форматы исходного кода.
Знания
Libre превращает доступные вам документы в полезный контекст чата, не отделяя ответ от источника. Точные термины остаются доступными для поиска, семантические совпадения расширяют охват, а процитированные места видны в разговоре.
Документ полезнее, когда фрагмент по-прежнему может указать своё расположение. Libre переносит структурированное происхождение через извлечение и не обрабатывает повторно неизменённые загрузки в той же области.
Загружайте текстовые PDF, документы Word, презентации, таблицы, данные CSV или TSV, Markdown, HTML, журналы и распространённые форматы исходного кода.
Извлечение записывает сегменты источника, чтобы найденные фрагменты и панель Sources указывали место происхождения утверждения, а не только имя файла.
DOCX, PPTX и XLSX распаковываются ограниченным анализатором из repository. Повторная загрузка одинаковых байтов в ту же область устраняется как дубликат.
Поиск по ключевым словам и семантический поиск восполняют разные пробелы. Libre всегда сохраняет лексический маршрут и объединяет его с векторным рейтингом, когда настроены embeddings.
Точные идентификаторы, имена и редкие термины могут ранжироваться без модели embeddings. Если их создание завершилось ошибкой или отключено, поиск по документам продолжает работать лексически.
При включённых embeddings взаимное ранговое слияние объединяет семантическую близость с BM25, чтобы расплывчатый семантический сосед не вытеснял автоматически сильное точное совпадение.
Лексическая оценка выполняется в процессе над расшифрованными фрагментами, доступными запрашивающему пользователю. Libre намеренно не сохраняет открытый индекс токенов для зашифрованных фрагментов документов.
Поиск — эффективный вариант по умолчанию. Если задача действительно зависит от всего файла, разговор может перейти в режим контекста полного документа.
Найденные фрагменты включают имя источника, фрагмент, оценку и структурированное расположение. Панель Sources группирует процитированные места по документам.
Чат может отправить всё извлечённое содержимое вместо выбранных фрагментов. Настраиваемое ограничение токенов возвращает к поиску, если прикреплённый материал слишком велик.
Встроенные инструменты могут перечислять документы в области, искать процитированные фрагменты и читать ограниченные окна, чтобы модель исследовала файл постепенно, а не получала всё сразу.
Посмотреть цикл инструментов