PDF, Office, Markdown, HTML, ข้อความ และโค้ด
อัปโหลด PDF แบบข้อความ เอกสาร Word งานนำเสนอ สเปรดชีต ข้อมูล CSV หรือ TSV, Markdown, HTML, log และรูปแบบซอร์สโค้ดทั่วไป
ความรู้
Libre เปลี่ยนเอกสารที่คุณเข้าถึงได้ให้เป็นบริบทแชตที่ใช้งานได้ โดยไม่ตัดคำตอบออกจากแหล่งที่มา คำที่ตรงยังค้นหาได้ ความหมายที่เกี่ยวข้องช่วยขยายขอบเขต และตำแหน่งที่อ้างอิงยังมองเห็นได้ในบทสนทนา
เอกสารมีประโยชน์ยิ่งขึ้นเมื่อข้อความตัดตอนยังบอกได้ว่าเดิมอยู่ที่ใด Libre รักษาที่มาแบบมีโครงสร้างระหว่างการแยกข้อมูล และไม่ประมวลผลการอัปโหลดที่ไม่เปลี่ยนแปลงซ้ำในขอบเขตเดียวกัน
อัปโหลด PDF แบบข้อความ เอกสาร Word งานนำเสนอ สเปรดชีต ข้อมูล CSV หรือ TSV, Markdown, HTML, log และรูปแบบซอร์สโค้ดทั่วไป
การแยกข้อมูลบันทึกส่วนของแหล่งที่มา เพื่อให้ข้อความที่ค้นคืนและแผง Sources ระบุตำแหน่งของข้อความอ้างอิงได้ ไม่ใช่เพียงชื่อไฟล์
DOCX, PPTX และ XLSX ถูกแตกด้วย parser แบบจำกัดใน repository ไบต์ที่เหมือนกันซึ่งอัปโหลดซ้ำในขอบเขตเดียวกันจะถูกตัดรายการซ้ำ
การค้นคืนด้วยคำสำคัญและเชิงความหมายแก้ปัญหาคนละแบบ Libre รักษาเส้นทางแบบคำศัพท์ไว้เสมอ แล้วรวมกับอันดับเวกเตอร์เมื่อกำหนดค่า embeddings
ตัวระบุ ชื่อ และคำหายากที่ตรงสามารถจัดอันดับได้โดยไม่ใช้โมเดล embedding หากการสร้าง embedding ล้มเหลวหรือถูกปิด การค้นหาเอกสารยังทำงานแบบคำศัพท์ต่อไป
เมื่อเปิด embeddings การรวมอันดับแบบส่วนกลับจะผสานความคล้ายเชิงความหมายกับ BM25 เพื่อไม่ให้ความหมายที่คลุมเครือแซงการตรงคำที่แข็งแรงโดยอัตโนมัติ
การให้คะแนนแบบคำศัพท์ทำงานในโปรเซสกับส่วนที่ถอดรหัสแล้วซึ่งผู้ขอมีสิทธิ์เข้าถึง Libre ตั้งใจไม่เก็บดัชนี token แบบไม่เข้ารหัสสำหรับส่วนเอกสารที่เข้ารหัส
การค้นคืนเป็นค่าเริ่มต้นที่มีประสิทธิภาพ เมื่อภารกิจต้องใช้ไฟล์ทั้งฉบับจริง ๆ บทสนทนาเลือกบริบทเอกสารเต็มได้
ข้อความที่ค้นคืนมีชื่อแหล่งข้อมูล ส่วน คะแนน และตำแหน่งแบบมีโครงสร้าง แผง Sources จัดกลุ่มตำแหน่งที่อ้างอิงไว้ใต้เอกสาร
แชตส่งเนื้อหาที่แยกแล้วทั้งหมดแทนข้อความบางส่วนได้ ตัวป้องกัน token ที่กำหนดค่าได้จะกลับไปใช้การค้นคืนเมื่อไฟล์แนบใหญ่เกินไป
เครื่องมือในตัวแสดงรายการเอกสารในขอบเขต ค้นหาข้อความที่อ้างอิง และอ่านช่วงแบบจำกัดได้ เพื่อให้โมเดลสำรวจไฟล์ทีละส่วนแทนการรับทั้งหมดตั้งแต่แรก
ดูลูปเครื่องมือ