LIBRE / জ্ঞান প্রমাণসহ পুনরুদ্ধার সুচিন্তিত সীমা

জ্ঞান

উত্তর কোথা থেকে এসেছে জানুন।

Libre আপনার প্রবেশযোগ্য ডকুমেন্টকে উৎস থেকে উত্তর বিচ্ছিন্ন না করে ব্যবহারযোগ্য chat context-এ বদলে দেয়। নির্দিষ্ট শব্দ খোঁজা যায়, semantic match পরিধি বাড়ায় এবং উদ্ধৃত স্থান কথোপকথনে দৃশ্যমান থাকে।

ডিফল্টভাবে keyword search
BM25
সক্রিয় হলে vector + lexical
হাইব্রিড
পৃষ্ঠা, স্লাইড, sheet, অংশ
উৎস স্তর
01 অন্তর্গ্রহণ

উপযোগী format উৎসে নিজের স্থান ধরে রাখে।

একটি উদ্ধৃত অংশ কোথায় ছিল তা বলতে পারলে ডকুমেন্ট আরও উপযোগী হয়। Libre extraction-এর সময় structured provenance বহন করে এবং একই scope-এ অপরিবর্তিত upload আবার process করে না।

01.1 ডকুমেন্ট

PDF, Office, Markdown, HTML, লেখা ও কোড।

text-based PDF, Word ডকুমেন্ট, presentation, spreadsheet, CSV বা TSV data, Markdown, HTML, log এবং সাধারণ source-code format upload করুন।

01.2 উৎস পরিচয়

পৃষ্ঠা, স্লাইড, sheet বা অংশ ধরে রাখুন।

Extraction source segment record করে, যাতে পাওয়া অংশ ও Sources panel শুধু file name নয়, দাবিটি কোথা থেকে এসেছে সেই অবস্থানও দেখাতে পারে।

01.3 সীমিত process

নিজস্ব document runtime ছাড়াই Office file parse করুন।

DOCX, PPTX এবং XLSX repository-এর সীমিত parser দিয়ে unpack হয়। একই scope-এ আবার upload করা একই bytes deduplicate হয়।

02 পুনরুদ্ধার

পরিচয়সূচক ও ধারণা দুটোই খুঁজুন।

Keyword এবং semantic retrieval ভিন্ন ধরনের বাদ পড়া ফল সামলায়। Libre lexical পথ সবসময় রাখে এবং embeddings configured হলে vector ranking-এর সঙ্গে মেশায়।

02.1 মূল শব্দ

BM25 সবসময় পাওয়া যায়।

নির্দিষ্ট identifier, নাম ও দুর্লভ শব্দ embedding model ছাড়াই rank করতে পারে। embedding generation ব্যর্থ বা বন্ধ হলে document search lexicalভাবে চলতে থাকে।

02.2 হাইব্রিড

Vector ও lexical ranking একত্র করুন।

embeddings সক্রিয় হলে reciprocal-rank fusion semantic similarity ও BM25 মিলিয়ে দেয়, যাতে অস্পষ্ট semantic neighbor শক্তিশালী exact match-কে স্বয়ংক্রিয়ভাবে ছাড়িয়ে না যায়।

02.3 এনক্রিপ্ট করা বিষয়বস্তু

ciphertext-এর পাশে plaintext full-text index নেই।

Lexical scoring process-এর ভেতরে requestকারী যে decrypted chunk পড়তে পারে তার ওপর চলে। Libre encrypted document chunk-এর plaintext token index স্থায়ীভাবে রাখা ইচ্ছাকৃতভাবে এড়ায়।

03 উত্তর

উৎস context-এর সঠিক পরিমাণ ব্যবহার করুন।

Retrieval কার্যকর default। কাজটি সত্যিই পুরো file-এর ওপর নির্ভর করলে conversation full-document context বেছে নিতে পারে।

03.1 উদ্ধৃতি

উৎসের অবস্থান উত্তর পর্যন্ত নিয়ে যান।

পাওয়া অংশে source name, chunk, score এবং structured location থাকে। Sources panel উদ্ধৃত স্থানগুলো তাদের document-এর নিচে group করে।

03.2 পূর্ণ-ডকুমেন্ট ধরন

জায়গা হলে পুরো extracted document পড়ুন।

Chat বাছাই করা passage-এর বদলে পুরো extracted content পাঠাতে পারে। attached material বেশি বড় হলে configurable token guard retrieval-এ ফিরে যায়।

03.3 জ্ঞান টুল

মডেলকে একটি ধাপে খুঁজতে ও পড়তে দিন।

অন্তর্নির্মিত টুল scope-এর document list করতে, উদ্ধৃত passage search করতে এবং সীমিত window পড়তে পারে, যাতে মডেল সবকিছু একবারে পাওয়ার বদলে file ধাপে ধাপে পরীক্ষা করে।

টুল লুপ দেখুন
04 ভাগ করা প্রসঙ্গ

প্রশ্নকারীর সঙ্গে প্রবেশাধিকার বদলায়।

জ্ঞান সংগ্রহ public না করেও share করা যায়। retrieval এবং direct read একই grant প্রয়োগ করে এবং revoke পরবর্তী query বদলে দেয়।

04.1 অনুমতি-সচেতন পুনরুদ্ধার

ভাগ করা সংগ্রহ সঙ্গে সঙ্গে search-এ যোগ হয়।

ব্যবহারকারী বা group-কে দেওয়া collection দুই ranking-এ অংশ নেয়। তার access list vector search-এর ভেতরে প্রয়োগ হয়, share বা revoke-এর সময় re-embedding ছাড়াই।

04.2 প্রোফাইল

সহায়ককে নির্দিষ্ট collection-এ সীমিত করুন।

সহায়ক profile জ্ঞানের work set বাঁধতে পারে। এই binding search space ছোট করে এবং আহ্বানকারী ব্যক্তির বর্তমান permission আবার যাচাই করে।

সহায়ক প্রোফাইল
04.3 নোট

উৎস উপকরণের পাশে স্থায়ী ভাবনা রাখুন।

নোটে revision, attachment, pinning, Markdown export, sharing এবং AI edit preview থাকে, যা প্রস্তাবিত পরিবর্তন প্রয়োগের আগে আগের version-এর snapshot রাখে।