PDF, Office, Markdown, HTML, teks, dan kode.
Unggah PDF berbasis teks, dokumen Word, presentasi, spreadsheet, data CSV atau TSV, Markdown, HTML, log, dan format kode sumber umum.
Pengetahuan
Libre mengubah dokumen yang dapat Anda akses menjadi konteks percakapan yang berguna tanpa memisahkan jawaban dari sumbernya. Istilah persis tetap dapat dicari, kecocokan semantik memperluas jangkauan, dan lokasi yang disitasi tetap terlihat dalam percakapan.
Dokumen lebih berguna ketika cuplikan masih dapat menunjukkan lokasi asalnya. Libre membawa asal-usul terstruktur selama ekstraksi dan menghindari pemrosesan ulang unggahan yang tidak berubah dalam cakupan yang sama.
Unggah PDF berbasis teks, dokumen Word, presentasi, spreadsheet, data CSV atau TSV, Markdown, HTML, log, dan format kode sumber umum.
Ekstraksi mencatat segmen sumber agar cuplikan yang diambil dan panel Sumber dapat mengidentifikasi lokasi asal suatu klaim—bukan hanya nama berkasnya.
DOCX, PPTX, dan XLSX dibongkar melalui pengurai terbatas di dalam repositori. Byte identik yang diunggah lagi ke cakupan yang sama dideduplikasi.
Pengambilan kata kunci dan semantik mengatasi jenis kegagalan yang berbeda. Libre selalu menyediakan jalur leksikal, lalu menggabungkannya dengan peringkat vektor saat embedding dikonfigurasi.
Pengenal persis, nama, dan istilah langka dapat diberi peringkat tanpa model embedding. Jika pembuatan embedding gagal atau dinonaktifkan, pencarian dokumen tetap berjalan secara leksikal.
Saat embedding diaktifkan, penggabungan peringkat timbal balik memadukan kemiripan semantik dengan BM25 agar tetangga semantik yang samar tidak otomatis mengalahkan kecocokan persis yang kuat.
Penilaian leksikal berjalan dalam proses pada potongan terdekripsi yang boleh diakses pemohon. Libre sengaja menghindari penyimpanan indeks token plaintext untuk potongan dokumen terenkripsi.
Pengambilan merupakan pilihan default yang efisien. Jika tugas benar-benar bergantung pada seluruh berkas, percakapan dapat memilih konteks dokumen penuh.
Cuplikan yang diambil mencakup nama sumber, potongan, skor, dan lokasi terstruktur. Panel Sumber mengelompokkan lokasi yang disitasi di bawah dokumennya.
Percakapan dapat mengirim seluruh konten hasil ekstraksi alih-alih bagian terpilih. Pembatas token yang dapat dikonfigurasi kembali ke pengambilan saat materi terlampir terlalu besar.
Alat bawaan dapat mencantumkan dokumen dalam cakupan, mencari bagian bersitasi, dan membaca jendela terbatas agar model dapat menyelidiki berkas secara bertahap alih-alih menerima semuanya di awal.
Lihat siklus alat