PDF, Office, Markdown, HTML, teks dan kod.
Muat naik PDF berteks, dokumen Word, pembentangan, hamparan, data CSV atau TSV, Markdown, HTML, log dan format kod sumber biasa.
Pengetahuan
Libre menukar dokumen yang boleh anda akses menjadi konteks sembang berguna tanpa memutuskan jawapan daripada sumber. Istilah tepat kekal boleh dicari, padanan semantik meluaskan capaian dan lokasi petikan kekal kelihatan.
Dokumen lebih berguna apabila petikan masih boleh menyatakan lokasinya. Libre membawa asal berstruktur melalui pengekstrakan dan mengelakkan pemprosesan semula muat naik tidak berubah dalam skop sama.
Muat naik PDF berteks, dokumen Word, pembentangan, hamparan, data CSV atau TSV, Markdown, HTML, log dan format kod sumber biasa.
Pengekstrakan merekod segmen sumber supaya petikan dan panel Sumber dapat mengenal pasti lokasi dakwaan, bukan sekadar nama fail.
DOCX, PPTX dan XLSX dinyahbungkus melalui penghurai terbatas dalam repositori. Byte serupa yang dimuat naik semula ke skop sama dinyahgandakan.
Dapatan kata kunci dan semantik menyelesaikan keciciran berbeza. Libre sentiasa menyediakan laluan leksikal dan menggabungkannya dengan kedudukan vektor apabila embedding dikonfigurasi.
Pengecam tepat, nama dan istilah jarang boleh diberi kedudukan tanpa model embedding. Jika penjanaan gagal atau dimatikan, carian dokumen diteruskan secara leksikal.
Dengan embedding aktif, gabungan kedudukan timbal balik menyatukan kesamaan semantik dengan BM25 supaya jiran semantik kabur tidak mengatasi padanan tepat yang kukuh.
Pemarkahan leksikal berjalan dalam proses pada cebisan dinyahsulit yang boleh diakses peminta. Libre sengaja tidak menyimpan indeks token teks biasa untuk cebisan dokumen disulitkan.
Dapatan ialah lalai yang cekap. Apabila tugas benar-benar bergantung pada seluruh fail, perbualan boleh memilih konteks dokumen penuh.
Petikan diperoleh mengandungi nama sumber, cebisan, skor dan lokasi berstruktur. Panel Sumber mengumpulkan lokasi dipetik di bawah dokumen.
Sembang boleh menghantar kandungan diekstrak penuh dan bukannya petikan dipilih. Had token boleh konfigurasi kembali kepada dapatan apabila bahan terlalu besar.
Alat terbina dalam boleh menyenaraikan dokumen dalam skop, mencari petikan dan membaca tetingkap terbatas supaya model menyiasat fail secara berulang.
Lihat gelung alat