PDF、Office、Markdown、HTML、テキスト、コード。
テキストベースの PDF、Word 文書、プレゼンテーション、スプレッドシート、CSV または TSV データ、Markdown、HTML、ログ、一般的なソースコード形式をアップロードできます。
ナレッジ
Libre は、アクセスできるドキュメントを、回答と出典のつながりを切らずに、使いやすいチャットコンテキストへ変換します。完全一致する語句を検索でき、意味的な一致が対象を広げ、引用した場所は対話内に表示され続けます。
抜粋が元の場所を示せれば、ドキュメントはさらに役立ちます。Libre は抽出を通じて構造化された出典情報を引き継ぎ、同じスコープに変更のないファイルが再アップロードされた場合は再処理を避けます。
テキストベースの PDF、Word 文書、プレゼンテーション、スプレッドシート、CSV または TSV データ、Markdown、HTML、ログ、一般的なソースコード形式をアップロードできます。
抽出時に出典の区切りを記録するため、取得した抜粋と出典パネルは、ファイル名だけでなく、主張の元になった場所まで特定できます。
DOCX、PPTX、XLSX は、リポジトリ内の制限付きパーサーで展開されます。同一のバイト列を同じスコープへ再アップロードすると重複が除かれます。
キーワード検索と意味検索は、それぞれ異なる見落としを補います。Libre は字句検索を常に利用できるようにし、埋め込みが設定されている場合はベクトル順位と融合します。
完全一致する識別子、名前、まれな語句は、埋め込みモデルなしでも上位にできます。埋め込み生成が失敗または無効になっても、ドキュメント検索は字句方式で続行します。
埋め込みを有効にすると、相互順位融合が意味的な類似度と BM25 を組み合わせるため、曖昧な意味上の近似が強い完全一致を自動的に上回ることはありません。
字句スコアは、リクエストした人がアクセスできる復号済みチャンクに対してプロセス内で計算されます。Libre は暗号化されたドキュメントチャンクの平文トークン索引を意図的に永続化しません。
効率的な検索がデフォルトです。タスクが本当にファイル全体を必要とする場合は、対話で全文書コンテキストを選べます。
取得した抜粋には、出典名、チャンク、スコア、構造化された場所が含まれます。出典パネルは、引用した場所を各ドキュメントの下にまとめます。
チャットは選択した箇所の代わりに、抽出したコンテンツ全体を送信できます。添付資料が大きすぎる場合は、設定可能なトークンガードが検索へ切り替えます。
組み込みツールは、スコープ内のドキュメント一覧、引用箇所の検索、範囲を限定した読み取りに対応します。最初にすべてを渡すのではなく、モデルがファイルを段階的に調べられます。
ツールループを見る