ডেটার ভূত: খালি স্প্রেডশিট যেভাবে ক্রিকেটে মিথ্যা আত্মবিশ্বাস তৈরি করে
**মূল উত্তর** ক্রিকেট বিশ্লেষণে সবচেয়ে বড় ঝুঁকি ভুল তথ্য নয়, অনুপস্থিত তথ্য। ডেটা ফিড ব্যর্থ হলে ফাঁকা ঘর গড় মান দিয়ে ভরাট করা হয়, মডেল সেটিকে সত্য ধরে নেয়, আর কৌশলগত সিদ্ধান্ত ভুল দিকে চালিত হয়। তথ্যসূত্র যাচাই ছাড়া কোনো বিশ্লেষণ নির্ভরযোগ্য নয়। **মূল তথ্য** - ২০১৭ সালে ৪০টি প্রিমিয়ার লিগ ম্যাচের ১২০০-এর বেশি প্রেসিং সিকোয়েন্স কোড করে জোনভিত্তিক ডেটা বিশ্লেষণ করেছিলেন লেখক। - ওই বিশ্লেষণে ম্যান সিটির মিডল-থার্ডে বল হারানোর পর শট ০.৭, প্রান্ত দিয়ে বল হারালে ২.৩। - ২০১৮ রাশিয়া বিশ্বকাপে ১৪টি পজেশনে ফুলব্যাক টাক ট্র্যাক করে ৯০০০ শব্দ লিখেছিলেন, দুটি ড্রাফট প্রত্যাখ্যাত হয়। - ২০২১ ইউরোতে স্পেন-মডেল টুর্নামেন্টজুড়ে ৭১% নির্ভুল ছিল, সেমিফাইনালে ভুল প্রমাণিত হয়। - ডেটা ফাঁকা ঘর গড় মানে ভরাট হলে বিশ্লেষকের পূর্বধারণাই প্রায় সবসময় সত্য বলে প্রতিষ্ঠিত হয়। **সূত্র উল্লেখ** মূল বিশ্লেষণ নথি (Stage-2 Deep Professional Analysis), ২০২৬ | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর** প্রশ্ন: ক্রিকেট বিশ্লেষণে ডেটা ফাঁকা ঘর কীভাবে ক্ষতি করে? উত্তর: ফাঁকা ঘর গড় মানে ভরাট করা হলে মডেল সেটিকে সত্য ধরে নেয়, ফলে ভিত্তিহীন সিদ্ধান্ত তৈরি হয়। প্রশ্ন: খালি উৎস থেকে বিশ্লেষণ এগিয়ে নিলে কী ঘটে? উত্তর: প্রতিবেদন নির্ভুল দেখায়, কিন্তু ভেতরে ফাঁকা থাকে এবং ভুল সিদ্ধান্তের ঝুঁকি বাড়ে, যা cricsultan.com Player Depth Index-এও প্রতিফলিত হয়। প্রশ্ন: পরিষ্কার ডেটা সংখ্যা কেন সন্দেহজনক? উত্তর: কারণ সংখ্যার গায়ে লেখা থাকে না তার কত শতাংশ আসল ডেটা আর কত শতাংশ অনুমান।
ডেটার ভূত: খালি স্প্রেডশিট যেভাবে ক্রিকেটে মিথ্যা আত্মবিশ্বাস তৈরি করে
গত মৌসুমে একটি ফ্র্যাঞ্চাইজির বিশ্লেষণ কক্ষে রাত এগারোটা সাতচল্লিশে ট্র্যাকিং ফিড থেমে গেল। পাঁচ ওভারের প্রতিটি ডেলিভারির জোন-কোঅর্ডিনেট, রিলিজ পয়েন্ট, ব্যাট-বল যোগাযোগের কোণ—সব খালি বক্স। ভোর চারটায় সিস্টেম ফিরে এলো, স্ক্রিনে সংখ্যাও ফিরল। কিন্তু ওই ফাঁকা পাঁচ ওভারের প্রতিটি ঘরে কে যেন বসিয়ে দিয়েছিল দলের গড় মান। মডেল সেটিকে সত্য ধরে নিল, প্রতিবেদন তৈরি হলো, সকালের মিটিংয়ে সিদ্ধান্ত গেল। কেউ জিজ্ঞেস করল না—ওই সংখ্যাগুলো কোথা থেকে এলো।
সেই রাতেই পুরোনো নোটবুকের কথা মনে পড়ল। আমি ভবিষ্যদ্বাণী করি না; আমি স্প্রেডশিট বানাই, যেগুলো সংবাদমাধ্যমের গল্প আগেই আঁচ করতে পারে। এই কাজে সবচেয়ে বড় শত্রু মিথ্যা তথ্য নয়—অনুপস্থিত তথ্য। খালি ঘর নিজে থেকে চিৎকার করে না; তাকে কেউ ভরে দেয়। আর সেই ভরাট করা সংখ্যা আসল তথ্যের চেয়েও বেশি ক্ষতিকর, কারণ তার গায়ে সন্দেহের দাগ থাকে না।
পাইপলাইনের ভেতরের নীরবতা
আধুনিক ক্রিকেট বিশ্লেষণ মূলত তিনটি স্তরের ওপর দাঁড়িয়ে। প্রথম স্তর বোলার-ট্র্যাকিং: রিলিজ পয়েন্ট, সিম পজিশন, লাইন-লেংথ জোন। দ্বিতীয় স্তর ব্যাটার-ট্র্যাকিং: ব্যাকলিফট, সুইং প্লেন, শট-ম্যাপ। তৃতীয় স্তর ফিল্ডিং ও প্রেসিং ম্যাপ: কোন ওভারে কোন ফিল্ডার কত মিটার সরে, কোন বাউন্ডারিতে কভার পড়ে। প্রতিটি স্তর আলাদা কোম্পানি, আলাদা ফিড, আলাদা এপিআই চালায়। একটি ওভার সম্পূর্ণ কাভার করতে গড়ে পনেরো থেকে বিশটি আলাদা ডেটা-পয়েন্ট লাগে।

এই বহু-স্তরের কাঠামোই দুর্বলতার জন্ম দেয়। কোনো এপিআই দেরিতে সাড়া দিলে, কোনো ক্যামেরা অ্যাঙ্গেল কেটে গেলে, বৃষ্টিবাধায় ট্র্যাকিং হারালে, সিস্টেম খালি ঘর ফেরত দেয়। বিশ্লেষণ-পাইপলাইনে খালি ঘর সহ্য করা যায় না। ড্যাশবোর্ড ফাঁকা বক্স দেখাতে পারে না, কারণ সকালের মিটিংয়ে সিদ্ধান্ত নিতে হয়। তাই পাইপলাইনের কোনো এক ধাপে—হয়তো একটি স্বয়ংক্রিয় স্ক্রিপ্ট, হয়তো এক ক্লান্ত বিশ্লেষক—খালি ঘর ভরে দেয়।
আমি এই সমস্যাটি প্রথম ধরতে শিখি ফুটবলে, পরে ক্রিকেটে খাটাই। ২০১৭ সালে ম্যানচেস্টারে বসে চল্লিশটি প্রিমিয়ার লিগ ম্যাচের ১২০০-এর বেশি প্রেসিং সিকোয়েন্স নিজে কোড করেছিলাম, প্রতিটি সিকোয়েন্স জোন, অ্যাঙ্গেল আর রিকভারি টাইম দিয়ে চিহ্নিত। সেবার দেখলাম, পেপ গার্দিওলার ম্যান সিটি মিডল-থার্ডে বল হারানোর পর প্রতি ম্যাচে মাত্র ০.৭টি শট নিতে দিচ্ছিল, অথচ প্রান্ত দিয়ে বল হারালে সেই সংখ্যা ২.৩। প্যাটার্ন পরিষ্কার ছিল। কিন্তু বড় শিক্ষা ছিল অন্য জায়গায়: যে ম্যাচগুলোতে ট্র্যাকিং ডেটা অসম্পূর্ণ ছিল, সেখানে আমার নিজের স্প্রেডশিটও ভুল প্যাটার্ন দেখাচ্ছিল, কারণ ফাঁকা ঘরগুলো আমি নিজেই ভরে দিয়েছিলাম।

ক্রিকেটে ফাঁকা ঘরের দাম
ক্রিকেটে এই ভরাট করার অভ্যাস ফুটবলের চেয়েও বিপজ্জনক, কারণ ক্রিকেটের ডেটা অনেক বেশি ইভেন্ট-ভিত্তিক। ফুটবলে বল কখনো থামে না, তাই একটি ফাঁকা ঘর সহজে চোখে পড়ে না। ক্রিকেটে প্রতিটি বল একটি স্বতন্ত্র ইভেন্ট; একটি হারানো ওভার মানে পুরো একটি অধ্যায় অনুপস্থিত। আর সেই অনুপস্থিত অধ্যায়ের জায়গায় বসানো গড় মান সবচেয়ে বিশ্বাসঘাতক, কারণ গড় কখনো একক বলের গল্প বলে না।
ধরুন, ডেথ ওভারে একটি দলের ইকোনমি হিসাব করছেন। ফিড সাতাশতম ওভারের সব ডেটা হারাল। স্ক্রিপ্ট বসিয়ে দিল দলের মৌসুম-গড়। এখন মডেল ভাবছে ওই ওভারটি স্বাভাবিক ছিল। অথচ বাস্তবে হয়তো সেখানেই স্লো-কাটার ভরসায় পুরো পরিকল্পনা বদলে গিয়েছিল, হয়তো সেখানেই ম্যাচের গতি ঘুরে গিয়েছিল। ফাঁকা ঘরটি তখন আর ফাঁকা নেই, সে একটি মিথ্যা স্মৃতি। আর সেই মিথ্যা স্মৃতি থেকেই তৈরি হয় পরের ম্যাচের পরিকল্পনা।
আমার কাছে এর সবচেয়ে পরিষ্কার উদাহরণ একটি নোটবুক, যা আজও বহন করি। কাজান আর নিজনি নভগোরোদের সেই নোটবুক আমার কাছে ভূতে ভরা আর আধা-বানানো মডেলের সংগ্রহ। ২০১৮ সালের বিশ্বকাপে ক্রেডেনশিয়াল ছাড়াই ফ্যান-জোন টিকিট আর ভাড়া করা ফ্ল্যাট থেকে খেলা দেখছিলাম। উরুগুয়ের বিরুদ্ধে দিদিয়ে দেশমের ৪-৩-৩ যে কীভাবে মিড-ব্লকে ৪-৪-২ হয়ে যাচ্ছিল, তা চোদ্দটি আলাদা পজেশনে ট্র্যাক করেছিলাম। ত্রিশ দিনে নয় হাজার শব্দ লিখেছিলাম, যার একটিও গোল নিয়ে ছিল না। সম্পাদক দুটি ড্রাফট ফিরিয়ে দিলেন, কারণ বেশি কৌশল, গল্প নেই। শেখা হলো: কাঠামোকে গল্পের ভেতরে পুঁতে ফেলতে হয়।
কিন্তু নোটবুকের আসল শিক্ষা অন্য। যেখানে তথ্য ছিল না, সেখানে আমি অনুমান লিখে রেখেছিলাম, আর পরে সেটিকেই সত্য বলে ধরে নিয়েছিলাম। নোটবুকে একটি ভূত আসলে এমন একটি প্যাটার্ন, যার নাম দিতে আমি অস্বীকার করেছিলাম।
যে মডেল ভেঙেছিল
২০২১ সালে ইউরো আর টোকিও অলিম্পিক একসাথে চলছিল। আমি একটি মডেল বানিয়েছিলাম, যা বলছিল স্পেন কেন্দ্রীয় ওভারলোড দিয়ে সবাইকে চেপে ধরবে। তারপর ওয়েম্বলিতে সেমিফাইনালে লরেঞ্জো ইনসিনিয়ে বাঁ দিকে সরে গিয়ে সেই মডেল ভেঙে দিলেন। টুর্নামেন্টজুড়ে আমার মডেল সাতাত্তর শতাংশ নির্ভুল ছিল, কিন্তু যে ম্যাচটি সবচেয়ে জরুরি ছিল, সেখানেই ভুল। ভুলটি লুকিয়ে না রেখে আমি তিন সপ্তাহ ধরে উল্টো-ইঞ্জিনিয়ার করলাম, কেন ভুল হলো।
কারণটা সহজ ছিল। আমার মডেলে স্পেনের কেন্দ্রীয় কাঠামো নিয়ে নির্ভরযোগ্য ডেটা ছিল, কিন্তু প্রতিপক্ষ কীভাবে সেই কাঠামোর ফাঁক ব্যবহার করবে, তা মাপার জন্য যে ভেরিয়েবল দরকার ছিল, সেটি ছিল না। আমি সেই ফাঁকা ঘরটিকে আমার নিজের অনুমান দিয়ে ভরে দিয়েছিলাম, আর অনুমানটি ছিল আরামদায়ক, কারণ সেটি আমার নিজের পূর্বধারণার সঙ্গে মিলে যাচ্ছিল।
এখানেই আসল বিপদ। ফাঁকা ঘর যখন ভরাট হয়, সে প্রায় সবসময়ই বিশ্লেষকের পূর্বধারণার দিকেই ঝুঁকে পড়ে। কারণ ভরাট করার সময় আমাদের হাতে তথ্য থাকে না, থাকে শুধু অনুমান। আর অনুমান সবসময় আমাদের প্রত্যাশার সঙ্গে সুর মিলিয়ে চলে। এই কারণেই তথ্য-বিচ্যুতির চেয়ে তথ্যহীনতা অনেক বেশি ধূর্ত, কারণ তথ্যহীনতা নিজের অস্তিত্ব গোপন করে।
আমি উচ্চ প্রেসকে বিশ্বাস করি না, যতক্ষণ না জানি দ্বিতীয় বলটি কে কভার করবে। ক্রিকেটে একই নিয়ম: পাওয়ারপ্লের স্ট্রাইক-রেট বিশ্বাস করি না, যতক্ষণ না জানি কোন বোলারকে আটকে রাখা হয়েছিল। কারণ সংখ্যাটি নিজে থেকে কিছু বলে না; সংখ্যাটি শুধু তার পাশের সংখ্যাগুলোর সঙ্গে মিলে অর্থ তৈরি করে। আর যদি পাশের ঘরগুলোই ভরাট করা হয়, তবে সংখ্যাটি শুধু আত্মবিশ্বাস বিক্রি করে, সত্য নয়।
যখন উৎসেই তথ্য থাকে না
কখনো কখনো সমস্যাটি আরও গভীরে থাকে। সম্প্রতি একটি বিশ্লেষণ-প্রক্রিয়ায় দেখলাম, আপস্ট্রিম ধাপ থেকে কোনো তথ্য-পয়েন্টই ফেরত আসেনি—শুধু একটি ভৌগোলিক ট্যাগ, আর বাকি সব ঘর ফাঁকা। তত্ত্বগতভাবে সেখানে বিশ্লেষণ থেমে যাওয়া উচিত ছিল। কিন্তু বাস্তবে প্রক্রিয়াটি থামে না; ফাঁকা জায়গাটি নিজেরাই ভরাট করে এগিয়ে যায়। ফল হলো একটি সম্পূর্ণ বিশ্লেষণ-প্রতিবেদন, যা দেখতে নির্ভুল, কিন্তু ভেতরে ফাঁকা।
এই ধরনের মুহূর্তে সবচেয়ে সৎ উত্তরটি হলো থেমে যাওয়া। কিন্তু থেমে যাওয়া মানে মিটিংয়ে খালি হাতে যাওয়া, আর খালি হাতকে কেউ পুরস্কৃত করে না। তাই পাইপলাইন ভরে দেয়, প্রতিবেদন জমা হয়, সিদ্ধান্ত হয়। প্রক্রিয়ার সবাই নিজের কাজ ঠিকঠাক করেছে বলে মনে করে, অথচ উৎসের ফাঁকা ঘর কেউ দেখেনি।
যে ভুলটা সবাই করে
শিল্পের প্রচলিত ধারণা বলে, বেশি তথ্য মানে ভালো সিদ্ধান্ত। প্রতি মৌসুমে আরও ফিড, আরও ক্যামেরা, আরও ভেরিয়েবল যোগ হয়। ক্লাব ও বোর্ডের প্রতিবেদনে ডেটা-চালিত সিদ্ধান্ত এখন একটি সম্মানসূচক শব্দ।
আমার পড়া ভিন্ন। বিশ্লেষণে সবচেয়ে বড় ঝুঁকি তথ্যের অভাব নয়, তথ্যের ছদ্মবেশ। কেউ কখনো খালি স্প্রেডশিট দেখে সিদ্ধান্ত নেয় না; তারা ভরা স্প্রেডশিট দেখে সিদ্ধান্ত নেয়, যার অর্ধেক ঘর কৃত্রিমভাবে ভরাট। অর্থাৎ ভুলের জন্ম হয় প্রক্রিয়ার শেষ প্রান্তে নয়, জন্ম হয় মাঝখানে, পাইপলাইনের সেই নীরব জায়গায়, যেখানে কেউ খালি ঘর ঢেকে দেয়।
আর এখানেই সংবাদমাধ্যম আসে। আমি ভবিষ্যদ্বাণী করি না; আমি স্প্রেডশিট বানাই, যেগুলো সংবাদমাধ্যমের গল্প আগেই আঁচ করতে পারে। কারণ ম্যাচ শেষে যখন ব্যাখ্যা দরকার হয়, তখন পাইপলাইনের ভেতরের এই ফাঁকা ঘরগুলোর কথা কেউ বলে না। সংবাদমাধ্যম ফলকে ব্যক্তিগত প্রতিভা বা ব্যর্থতার গল্পে সাজায়, কারণ গল্পের ডেডলাইন কাঠামোর সূক্ষ্মতার চেয়ে বড়। তাই একটি দুর্বল ডেটা-সিদ্ধান্ত শেষ পর্যন্ত একজন খেলোয়াড়ের কাঁধে চাপে।

এখানেই আমাকে সতর্ক থাকতে হয়। সংবাদমাধ্যমকে শত্রু ভাবা সহজ, কিন্তু সংবাদমাধ্যমও একটি সিস্টেম, তার নিজের ডেডলাইন, প্রবেশাধিকার আর দর্শক-চাহিদার সীমা আছে। সংবাদমাধ্যম দোষারোপের জায়গা নয়, বিশ্লেষণের আরেকটি ভেরিয়েবল।
পরের ম্যাচে যা দেখব
ক্রিকেটে একটি পরিষ্কার সংখ্যা সবচেয়ে সন্দেহজনক জিনিস। কারণ পরিষ্কার সংখ্যার গায়ে কখনো লেখা থাকে না, তার কতগুলো ঘর কৃত্রিমভাবে ভরাট করা হয়েছে।
পরেরবার যখন কোনো ম্যাচ-রিপোর্টে দেখবেন ডেথ ওভারে গড় ইকোনমি, বা পাওয়ারপ্লে-বিশ্লেষণ, তখন একটি প্রশ্ন করুন: এই সংখ্যার কত শতাংশ আসল ডেটা, আর কত শতাংশ অনুমান? যে বিশ্লেষক এই প্রশ্নটি করতে পারেন, তিনি ভূত দেখতে পান। আর যিনি পারেন না, তিনি নিজেই একটি ভূত তৈরি করেন।
