#এআইকথন - 003
আগের কথনে ছিল Orchestration (কীভাবে agent কাজ করে। এটা how-এর answer।) তারপর ছিল Grounding । এটা what-এর answer। এই কথনে Evals বা Eval Design ( বাংলা meaning Testing বলা যাবে কিনা আমি শিউর না )
Evals এর কঠিন অংশটা Benchmark না।
কঠিন হলো ৫০টা test case pass করলে, কিন্তু production-এ ৫১তম scenario-এ user-এর সামনে ভুল উত্তর দিলে system কী করবে সেটা ঠিক করা। ignore করবে? new test add করবে? নাকি architecture change করবে? মোটা দাগে এটা Evaluation Design ।
কিন্তু Evals শুধু benchmark score না। High accuracy থাকতে পারে, কিন্তু user-এর কাছে still unusable। automated হতে পারে, কিন্তু mandatory না। একটা simple dataset দিয়ে accuracy measure করা - এটাও Evals।
যারা AI system deploy করতেসে, demo ভালো গেসে বলে ship করতেসে, তাদের বেশিরভাগের Concern ই এইটা।
একটা Deterministic software test করার surface ছোট। Bug পাইসেন ? fix করেন। input দিবেন , expected output পাবেন ( অথবা পাবেন না ) , কিন্তু pass হলে Done । বলে রাখি Deterministic software মানে এমন একটা system যেখানে same input দিলে সবসময় same output আসবে, 100% predictable, 100% repeatable। মানে , Deterministic = এইখানে আপনি জানেন কী হবে। LLM = আপনি অনুমান করতে পারেন কী হতে পারে।
কিন্তু LLM system eval এত সহজ বেপার না । অনেক সমস্যা । যেগুলা অনেক দিকে থেকে আসতে থাকে : যেমন ধরেন
- Same prompt-এ গতকাল যা দিসে আজ আলাদা দিতেসে - কোনটাকে ground truth ধরবেন?
- Eval করতে আরেকটা LLM ব্যবহার করলেন, সেই judge-ও hallucinate করতে পারে - কে judge-কে judge করবে?
- Edge case এ system fail করে কিন্তু standard eval-এ cover করে না , কে decide করবে কোন edge case important?
- Full eval run শেষে সব pass করলো, কিন্তু production-এ ভুল উত্তর পাইতেসেন, eval কি overfit হইতেসে নাকি reality shift হইতেসে?
এগুলো কিন্তু এগুলো evaluation design-এর সমস্যা। benchmark-এর সমস্যা না।
Last কয়েক বছরে আসলে কিন্তু অনেক কিছুই বদলাইসে। Automated evals এখন স্ট্যান্ডার্ড - মানে আগে eval করতে হইতো manually । একটা একটা করে human দেখতো output ঠিক কিনা। এখন CI/CD pipeline-এ evals automatic run হয়। PR create করলেই eval suite চলে, pass না করলে deploy block হয়ে যায়। এইটা software engineering এর mature practice এখন AI তেও চলে আসতেসে।
LLM-as-judge ব্যবহার করা এখন Norm । কারণ Human evaluator দিয়ে ১০,০০০টা output grade করা expensive আর slow। red teaming spawn করা হইতেসে সাথে অ্যাড হইসে eval-driven development ( TDD এর মত ভাবতে পারেন ) । এগুলা নিয়া Details নেক্সট পোস্ট গুলোতে লিখবো ইনশাল্লাহ ।
তো Coverage যেমন বহুগুণ বেড়ে গেছে, ঠিক eval decay ও বহুগুণ বেড়ে গেছে, দিন শেষে production system যে monitor করছে, তার দায়িত্ব বেড়ে গেছে বহুগুণ। ( Last দুইটা পোস্টেও এইটা mention করসি , হয়ত খেয়াল করসেন 😄) তাই এই খানে দরকার ভালো Benchmark । সাথে clear metric এখনও Really Impactful ।
কিন্তু এই যে system-এর confidence আর সেইটার জন্যে যে Verification challenge কোনওটারই কমতি নাই এই Evals এ। 😄
#এ আই কথন-003 #AI #Evals - #Benchmark #EvaluationDesign #LLMasJudge