PDF, Office, Markdown, HTML, 텍스트, 코드.
텍스트 기반 PDF, Word 문서, 프레젠테이션, 스프레드시트, CSV 또는 TSV 데이터, Markdown, HTML, 로그, 일반적인 소스 코드 형식을 업로드하세요.
발췌문이 원래 위치를 알려 줄 수 있으면 문서가 더 유용합니다. Libre는 추출 과정에서 구조화된 출처 정보를 유지하고 같은 범위에 변경되지 않은 파일이 다시 업로드되면 재처리를 피합니다.
텍스트 기반 PDF, Word 문서, 프레젠테이션, 스프레드시트, CSV 또는 TSV 데이터, Markdown, HTML, 로그, 일반적인 소스 코드 형식을 업로드하세요.
추출 과정에서 출처 구간을 기록하므로 검색된 발췌문과 출처 패널이 파일 이름뿐 아니라 주장의 원래 위치까지 식별할 수 있습니다.
DOCX, PPTX, XLSX는 저장소 안의 제한된 파서로 압축을 풉니다. 같은 범위에 동일한 바이트가 다시 업로드되면 중복을 제거합니다.
키워드 검색과 의미 검색은 서로 다른 누락을 보완합니다. Libre는 어휘 경로를 항상 사용할 수 있게 유지하고 임베딩이 구성되면 벡터 순위와 결합합니다.
정확한 식별자, 이름, 드문 용어는 임베딩 모델 없이도 순위를 매길 수 있습니다. 임베딩 생성이 실패하거나 비활성화되어도 문서 검색은 어휘 방식으로 계속됩니다.
임베딩을 활성화하면 상호 순위 결합이 의미상 유사성과 BM25를 합쳐 모호한 의미적 이웃이 강한 정확 일치를 자동으로 앞서지 못하게 합니다.
어휘 점수 계산은 요청자가 액세스할 수 있는 복호화된 청크를 대상으로 프로세스 안에서 실행됩니다. Libre는 암호화된 문서 청크의 평문 토큰 인덱스를 의도적으로 영속화하지 않습니다.
효율적인 검색이 기본값입니다. 작업이 실제로 전체 파일에 의존하면 대화에서 전체 문서 컨텍스트를 선택할 수 있습니다.
검색된 발췌문에는 출처 이름, 청크, 점수, 구조화된 위치가 포함됩니다. 출처 패널은 인용된 위치를 해당 문서 아래에 묶습니다.
채팅은 선택한 구절 대신 추출된 전체 콘텐츠를 전송할 수 있습니다. 첨부 자료가 너무 크면 구성 가능한 토큰 가드가 검색 방식으로 돌아갑니다.
기본 제공 도구는 범위 안의 문서를 나열하고, 인용된 구절을 검색하고, 제한된 창을 읽어 모델이 모든 내용을 처음부터 받는 대신 파일을 단계적으로 조사하게 합니다.
도구 루프 보기