PDF, Office, Markdown, HTML, tekst i kod.
Przesyłaj tekstowe pliki PDF, dokumenty Word, prezentacje, arkusze kalkulacyjne, dane CSV lub TSV, Markdown, HTML, dzienniki i popularne formaty kodu źródłowego.
Wiedza
Libre zamienia dokumenty, do których masz dostęp, w użyteczny kontekst czatu bez odrywania odpowiedzi od źródła. Dokładne terminy pozostają wyszukiwalne, dopasowania semantyczne poszerzają zasięg, a cytowane miejsca są widoczne w rozmowie.
Dokument jest bardziej użyteczny, gdy fragment nadal wskazuje swoje położenie. Libre przenosi ustrukturyzowane informacje o pochodzeniu przez ekstrakcję i nie przetwarza ponownie niezmienionych plików w tym samym zakresie.
Przesyłaj tekstowe pliki PDF, dokumenty Word, prezentacje, arkusze kalkulacyjne, dane CSV lub TSV, Markdown, HTML, dzienniki i popularne formaty kodu źródłowego.
Ekstrakcja zapisuje segmenty źródłowe, dzięki czemu pobrane fragmenty i panel Źródła wskazują miejsce pochodzenia twierdzenia, a nie tylko nazwę pliku.
DOCX, PPTX i XLSX są rozpakowywane przez ograniczony parser w repozytorium. Ponownie przesłane identyczne bajty w tym samym zakresie są deduplikowane.
Wyszukiwanie słów kluczowych i semantyczne rozwiązują inne rodzaje braków. Libre zawsze zachowuje ścieżkę leksykalną, a po skonfigurowaniu embeddingów łączy ją z rankingiem wektorowym.
Dokładne identyfikatory, nazwy i rzadkie terminy mogą być klasyfikowane bez modelu embeddingów. Jeśli generowanie embeddingów zawiedzie lub jest wyłączone, wyszukiwanie dokumentów działa dalej leksykalnie.
Po włączeniu embeddingów fuzja rang wzajemnych łączy podobieństwo semantyczne z BM25, aby niejasny sąsiad semantyczny nie wygrywał automatycznie z mocnym dokładnym dopasowaniem.
Ocena leksykalna działa w procesie na odszyfrowanych fragmentach dostępnych dla pytającego. Libre celowo nie utrwala indeksu tokenów w tekście jawnym dla zaszyfrowanych fragmentów dokumentów.
Wyszukiwanie jest wydajnym ustawieniem domyślnym. Gdy zadanie rzeczywiście zależy od całego pliku, rozmowa może zamiast tego użyć kontekstu pełnego dokumentu.
Pobrane fragmenty zawierają nazwę źródła, numer fragmentu, wynik i ustrukturyzowane położenie. Panel Źródła grupuje cytowane miejsca pod ich dokumentami.
Czat może wysłać pełną wyodrębnioną treść zamiast wybranych fragmentów. Konfigurowalny limit tokenów wraca do wyszukiwania, gdy załączony materiał jest zbyt duży.
Wbudowane narzędzia mogą listować dokumenty w zakresie, wyszukiwać cytowane fragmenty i czytać ograniczone okna, dzięki czemu model bada plik iteracyjnie zamiast otrzymywać wszystko z góry.
Zobacz pętlę narzędzi