Sabbir Amin

Writings · 14 May 2026

RAG and Grounding

#RAG and #Grounding

আগের কথনে ছিল Orchestration, কীভাবে agent কাজ করে ( how-এর Answer ) এই কথনে লিখতেসি Grounding ( What - এর Answer ) নিয়ে ।

তো RAG-এর জন্যে Toughest Challenge কোনটা ? এইটা কিন্তু retrieval না। তাইলে কি ??

ধরেন ৫টা আলাদা source থেকে information আনলেন , সেগুলোর মধ্যে ২টা conflict করে, আর ১টা outdated, synthesize করার সময় LLM কী করবে ? পুরনোটা ignore করবে ? দুইটাকে side-by-side রাখবে? নাকি user কে বলবে information inconsistent? এই Conflict Resolution এর পুরাটাই - Grounding ।

কিন্তু RAG শুধু grounding না। RAG agentic হতে পারে, কিন্তু agentic হওয়া mandatory না। একটা simple query থেকে Retrieve করে তারপরে Pipeline Generate করাও RAG।

আর এখন যারা knowledge base build করতেসেন , internal document সার্চ বানাইতেসেন , তাদের বেশিরভাগের Tension ই এইটা নিয়ে ।

তো প্রচলিত সমাধান কী কী ? একটা সমাধান হইতে পারে Vector DB ব্যবহার করা । vector DB তে document embed করেন । খারাপ result পাইসেন? OKay , embedding model change করেন। এই system এর major Components একটা query, একটা similarity search, আর top-k filter।

কিন্তু কাহিনী যদি multiple Source নিয়ে RAG হয়, তাহলে বেশ ঝামেলা আছে । যেমন ধরেন:

  • ২টা source থেকে ২টা আলাদা answer আসলে, synthesizer কি stronger source-এর দিকে bias দেখাবে?
  • একটা source-এ information আছে কিন্তু ৬ মাস পুরনো, আরেকটায় নতুন কিন্তু incomplete, LLM কি timestamp weight দিতে পারবে?
  • পুরো pipeline শেষে উত্তর সুন্দর পাইসেন, কিন্তু ৩টা source-এর মধ্যে ২টা contradict করে, ইউজার কে জানাবেন কীভাবে ?

এগুলো knowledge synthesis এর সমস্যা। retrieval-এর সমস্যা না। আর retriever আরও স্মার্ট হলেও এই সমস্যা শেষ হয়ে যায় না ।

এর মাঝে hybrid search এখন স্ট্যান্ডার্ড হিসেবে ব্যবহার হইতেসে । reranking ব্যবহার করে। graph RAG spawn করে। multi-hop reasoning চালায়ে । Coverage আর contradiction handling - এই দুইটাই বহুগুণে বেড়ে গেসে ।

কিন্তু এই যে information access আর সেইটার জন্যে যে synthesis challenge, কোনোটারই কমতি নাই এই RAG-এ। 😄 ।

#এআইকথন-002 #AI #RAG #Retrieval #Synthesis #KnowledgeBase

Originally on LinkedIn