LIBRE / ज्ञान प्रमाण सहित पुनर्प्राप्ति सोच-समझकर तय सीमाएँ

ज्ञान

जानें कि उत्तर कहाँ से आया।

Libre आपके पहुँच योग्य दस्तावेज़ों को उपयोगी चैट संदर्भ में बदलता है, पर उत्तर को स्रोत से अलग नहीं करता। सटीक शब्द खोज योग्य रहते हैं, अर्थ-संबंधी मेल दायरा बढ़ाते हैं और संदर्भित स्थान बातचीत में दिखाई देते हैं।

डिफ़ॉल्ट रूप से कीवर्ड खोज
BM25
सक्षम होने पर वेक्टर + शब्द-आधारित
हाइब्रिड
पृष्ठ, स्लाइड, शीट, अनुभाग
स्रोत स्तर
01 अंतर्ग्रहण

उपयोगी फ़ॉर्मेट स्रोत में अपना स्थान बनाए रखते हैं।

दस्तावेज़ तब अधिक उपयोगी होता है जब उसका अंश बता सके कि वह कहाँ था। Libre निष्कर्षण के दौरान संरचित उत्पत्ति बनाए रखता है और उसी scope में बिना बदले upload को फिर process नहीं करता।

01.1 दस्तावेज़

PDF, Office, Markdown, HTML, पाठ और कोड।

पाठ-आधारित PDF, Word दस्तावेज़, प्रस्तुति, स्प्रेडशीट, CSV या TSV डेटा, Markdown, HTML, log और सामान्य source-code फ़ॉर्मेट अपलोड करें।

01.2 उत्पत्ति

पृष्ठ, स्लाइड, शीट या अनुभाग बनाए रखें।

निष्कर्षण स्रोत खंड दर्ज करता है ताकि पाए गए अंश और Sources पैनल केवल फ़ाइल नाम नहीं, बल्कि दावे का स्थान भी बता सकें।

01.3 सीमित प्रक्रिया

मूल दस्तावेज़ runtime के बिना Office फ़ाइलें parse करें।

DOCX, PPTX और XLSX repository के सीमित parser से खोले जाते हैं। उसी scope में फिर अपलोड किए गए समान bytes को duplicate के रूप में हटाया जाता है।

02 पुनर्प्राप्ति

पहचानकर्ता और विचार दोनों खोजें।

कीवर्ड और semantic पुनर्प्राप्ति अलग-अलग छूटे परिणामों को संभालती हैं। Libre lexical मार्ग हमेशा उपलब्ध रखता है और embeddings configured होने पर उसे vector ranking से मिलाता है।

02.1 कीवर्ड

BM25 हमेशा उपलब्ध है।

सटीक पहचानकर्ता, नाम और दुर्लभ शब्द embedding मॉडल के बिना भी rank हो सकते हैं। embedding generation विफल या बंद हो तो दस्तावेज़ खोज lexical रूप से जारी रहती है।

02.2 हाइब्रिड

वेक्टर और lexical ranking मिलाएँ।

embeddings सक्षम होने पर reciprocal-rank fusion semantic similarity को BM25 से जोड़ता है, ताकि अस्पष्ट अर्थ-संबंधी पड़ोसी मजबूत सटीक मेल को अपने-आप पीछे न कर दे।

02.3 एन्क्रिप्ट की गई सामग्री

ciphertext के पास plaintext full-text index नहीं।

Lexical scoring प्रक्रिया में उन decrypted chunks पर चलता है जिन्हें अनुरोधकर्ता पढ़ सकता है। Libre एन्क्रिप्ट किए गए document chunks के लिए plaintext token index को स्थायी रूप से रखने से जानबूझकर बचता है।

03 उत्तर

स्रोत संदर्भ की सही मात्रा उपयोग करें।

पुनर्प्राप्ति कुशल डिफ़ॉल्ट है। जब कार्य वास्तव में पूरी फ़ाइल पर निर्भर हो, बातचीत पूर्ण-दस्तावेज़ संदर्भ चुन सकती है।

03.1 संदर्भ

स्रोत स्थान उत्तर तक ले जाएँ।

पाए गए अंश में स्रोत नाम, chunk, score और संरचित स्थान होते हैं। Sources पैनल संदर्भित स्थानों को उनके दस्तावेज़ के अंतर्गत समूहित करता है।

03.2 पूर्ण-दस्तावेज़ मोड

जगह होने पर पूरा निकाला गया दस्तावेज़ पढ़ें।

चैट चुने अंशों के बजाय पूरी निकाली गई सामग्री भेज सकता है। संलग्न सामग्री बहुत बड़ी होने पर configurable token guard पुनर्प्राप्ति पर वापस जाता है।

03.3 ज्ञान टूल

मॉडल को एक चरण में खोजने और पढ़ने दें।

अंतर्निहित टूल scope के दस्तावेज़ सूचीबद्ध कर सकते हैं, संदर्भित अंश खोज सकते हैं और सीमित विंडो पढ़ सकते हैं, ताकि मॉडल पूरी सामग्री पहले पाने के बजाय फ़ाइल की क्रमिक जाँच करे।

टूल लूप देखें
04 साझा संदर्भ

पहुँच प्रश्न पूछने वाले व्यक्ति के अनुसार होती है।

ज्ञान संग्रह को सार्वजनिक किए बिना साझा किया जा सकता है। पुनर्प्राप्ति और सीधा पठन समान grants लागू करते हैं और अनुमति वापस लेने से अगली query बदल जाती है।

04.1 Grant-सचेत पुनर्प्राप्ति

साझा संग्रह तुरंत खोज में जुड़ते हैं।

उपयोगकर्ता या समूह को दिया संग्रह दोनों ranking में भाग लेता है। उसकी access list vector search के अंदर लागू होती है, साझा या revoke करते समय re-embedding की आवश्यकता नहीं।

04.2 प्रोफ़ाइल

सहायक को विशिष्ट संग्रह तक सीमित करें।

सहायक प्रोफ़ाइल ज्ञान के कार्य समूह को बाँध सकती है। यह बंधन खोज क्षेत्र को घटाता है और बुलाने वाले व्यक्ति की वर्तमान अनुमति फिर भी जाँचता है।

सहायक प्रोफ़ाइल
04.3 नोट्स

स्रोत सामग्री के साथ स्थायी विचार रखें।

नोट्स में revision, attachment, pinning, Markdown export, sharing और AI edit preview शामिल हैं, जो सुझाया बदलाव लागू करने से पहले पुराने संस्करण का snapshot रखता है।