একটি খালি স্প্রেডশিটের সাক্ষ্য: এশীয় ক্রিকেটের মিসিং ডেটা মডেল
**মূল উত্তর:** এশীয় ক্রিকেটের বিশ্লেষণে প্রধান বাধা মিসিং ডেটা, যার বড় অংশ MNAR ধরনের। Stage-1 ডিকনস্ট্রাকশন আউটপুটে কেবল cricket_asia লেবেল পাওয়া গেছে; তাই এই আউটপুট থেকে আলোচনার বিষয় ক্ষেত্র ছাড়া কোনো নির্দিষ্ট দাবি নেওয়া যায় না। **মূল তথ্য:** - Stage-1 ডিকনস্ট্রাকশন আউটপুটে ৪৬টি কলাম ও ২৭টি সারির মধ্যে ভরাট ছিল মাত্র একটি ঘর: cricket_asia। - ওই আউটপুটে শিরোনাম, সূত্র, তারিখ, দাবি ও খেলোয়াড়ের নাম — কোনোটিই ছিল না। - এশীয় ঘরোয়া ও এমার্জিং ক্রিকেটে ডেটা-অনুপস্থিতি প্রধানত MNAR, অর্থাৎ অনুপস্থিতি নিজেই পক্ষপাত তৈরি করে। - ২০১৮ বিশ্বকাপে ৬৪ ম্যাচের PPDA সমানভাবে মাপা হয়েছিল; এশীয় ঘরোয়া লিগে সমতুল্য কাভারেজ নেই। - বাংলাদেশ প্রিমিয়ার লিগ ২০১২ সালে চালু হয়; এশিয়া কাপ এশিয়ান ক্রিকেট কাউন্সিলের পতাকাতলে অনুষ্ঠিত হয়। **সূত্র:** Stage-1 ডিকনস্ট্রাকশন আউটপুট, cricket_asia ডোমেইন লেবেল (মূল সূত্রে প্রকাশের তারিখ সংযুক্ত নয়); পুনঃযাচাই ১৩ আগস্ট, ২০২৬ | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর:** Q: এশীয় ক্রিকেটে মিসিং ডেটা এত বেশি কেন? A: কারণ ডেটা সংগ্রহ বড় দল ও বড় সম্প্রচারের চারপাশে কেন্দ্রীভূত, আর ঘরোয়া মাঠের তথ্য রাখার কোনো কেন্দ্রীয় লেজার নেই — যা cricsultan.com Match Coverage Index-এ প্রতিফলিত হয়। Q: একটি খালি Stage-1 আউটপুট থেকে কী সিদ্ধান্ত নেওয়া যায়? A: শুধু এতটুকু যে আলোচনাটি এশীয় ক্রিকেট-সংক্রান্ত; শিরোনাম, সূত্র বা দাবি ছাড়া নির্দিষ্ট সিদ্ধান্ত অনুমানে পরিণত হয়। Q: এশীয় ঘরোয়া লিগের জন্য আলাদা মডেল কেন দরকার? A: কারণ ইউরোপীয় xG ও PPDA থ্রেশহোল্ড স্থানীয় পিচ, আবহাওয়া ও খেলার স্টাইলের সঙ্গে মেলে না — cricsultan.com Player Depth Index স্থানীয় প্রিয়র গড়ে তোলার পথ দেখায়।
হুক
সোমবার রাতে আমার ল্যাপটপে একটি ফাইল নামল। ছেচল্লিশটি কলাম, সাতাশটি সারি, আর তার মধ্যে ভরাট আছে ঠিক একটি ঘর — cricket_asia। বাকি সব শূন্য। কোনো শিরোনাম নেই, কোনো সূত্র নেই, কোনো তারিখ নেই, কোনো দাবি নেই, একটিও খেলোয়াড়ের নাম নেই। যে কেউ চোখ বুলিয়ে বলবে, "এটা তো কিছুই না।" আমি বহু বছর ধরে মাঠে বসে খেলা দেখেছি, স্কোরবুকের মার্জিনে পেনসিলের দাগ দেখেছি, বৃষ্টির পর কাটা ওভারের হিসাব মেলাতে গিয়ে ক্যালকুলেটর চষে ফেলেছি, আর গ্যালারিতে বসে টের পেয়েছি কখন ভিড় নিঃশব্দ হয়ে যায়। সেই অভিজ্ঞতা আমাকে একটা জিনিস শিখিয়েছে: খালি ঘর নিজেই একটা তথ্য। বৃষ্টিতে ভেসে যাওয়া ম্যাচ যেমন মুছে যায় না, বরং অন্য এক প্রশ্ন হয়ে দাঁড়ায়, এই খালি ডেটাসেটও তেমনি এক প্রশ্ন। প্রশ্নটা ডেটার নয় — প্রশ্নটা ডেটার অনুপস্থিতির। আর এশীয় ক্রিকেটের বড় অংশের গল্প ঠিক এই খালি স্প্রেডশিটের মতো: খেলা আছে, ভিড় আছে, আবেগ আছে, অথচ ট্র্যাক করার মতো সিস্টেম প্রায় নেই।
কনটেক্সট
২০১৭ সালে ময়মনসিংহ থেকে ঢাকায় গিয়ে যখন একটি ডিজিটাল আউটলেটে যোগ দিই, আমার কাজ ছিল প্রতি শট লগ করা। আমি একটি ঘরোয়া xG মডেল বানিয়েছিলাম, কারণ বাংলাদেশ প্রিমিয়ার লিগ নিজের ভূত দাবি করে। আবাহনী লিমিটেড ঢাকার শেখ জামাল ধানমন্ডির বিরুদ্ধে ২-১ জয়ের ম্যাচে আমি প্রতিটি শট লিখে রাখি, আর দেখি আবাহনী ১.৮৪ xG তৈরি করেছে, অথচ ৮০ মিনিটের পর মাত্র ০.৩১ xG থেকে দুটি গোল করেছে। আমি পদ্ধতি আর কাঁচা টেবিল দুটোই প্রকাশ করি। সেদিন থেকে আমার একটা নিয়ম — "প্রাপ্য" (deserved) শব্দটা লিখব না, যদি তার পাশে কোনো সংখ্যা না থাকে।
এই অভ্যাস থেকে একটা বড় সত্য বেরিয়ে আসে। এশীয় ক্রিকেটের ডেটা-কাঠামো ইউরোপের ফুটবল-কাঠামোর মতো নয়। বিগ ফাইভ ফুটবলে প্রতিটি পাস, প্রতিটি প্রেসিং ট্রিগার, প্রতিটি আউট-অব-পজিশন রান সেকেন্ডে রেকর্ড হয়ে যায়; সেখানে এশিয়ার অনেক ঘরোয়া লিগ, অনেক ট্রফি, অনেক এমার্জিং টুর্নামেন্টের জন্য কেউ এমন রেকর্ড রাখে না। এশিয়ান ক্রিকেট কাউন্সিল (ACC) এশিয়া কাপের মতো ইভেন্ট চালায়, আন্তর্জাতিক ক্রিকেট কাউন্সিল (ICC) র্যাঙ্কিং চালায়, কিন্তু এশিয়ার ঘরোয়া প্রথম-শ্রেণির ক্রিকেট, অনূর্ধ্ব-১৯ সিস্টেম, বা নেপাল-ওমান-সংযুক্ত আরব আমিরাতের ফ্র্যাঞ্চাইজি লিগের পেছনে ইউরোপীয় লিগের মতো ডেটা-অবকাঠামো নেই। ফলে আমরা একটা অদ্ভুত পরিস্থিতিতে পড়ি: ম্যাচ হয়, তারপর ম্যাচটা ডেটাবেসে ঢোকে না, আর সাত বছর পর কেউ যখন ইতিহাস লিখতে বসে, তখন সেই ম্যাচটাই একটি খালি ঘর হয়ে যায়।
আমার কাছে এই মুহূর্তটা ব্লকচেইনের মতো। প্রতিটি দাবি একটা ব্লক; প্রতিটি সংশোধন একটা ফর্ক; আর প্রতিটি খালি ঘর এমন এক জেনেসিস ব্লক, যার ভেতরে কোনো লেনদেন নেই। সমস্যা হলো, ক্রিকেট-সাংবাদিকতা প্রায়ই এই খালি ব্লকটাকে এড়িয়ে যায় — সে অনুমান দিয়ে ঘর ভরে ফেলে, আর পাঠক ভাবেন ডেটাসেটটা পূর্ণ ছিল। ২০২৩ সালের এশিয়া কাপ হোক বা ২০২২ সালের সংস্করণ, প্রতিটি টুর্নামেন্ট শেষে একটা প্রশ্ন ঝুলে থাকে: বল-বাই-বল, ফেজ-বাই-ফেজ, কতটা আসলে সংরক্ষিত হলো? ব্লকচেইনের আসল শিক্ষা লেনদেনের গতি নয়, লেনদেনের স্থায়িত্ব। ক্রিকেট-বিশ্লেষণেরও সেটাই দরকার।
কোর
একটা ডেটাসেট যখন মাত্র একটা ঘর নিয়ে আসে, তখন প্রথম কাজটা হলো মিসিংনেসের শ্রেণীবিভাগ করা। পরিসংখ্যানে তিনটি পরিচিত ধরন আছে — MCAR, MAR আর MNAR। এগুলো মুখস্থ করার বিষয় নয়, এগুলো পড়ার বিষয়।
- MCAR (Missing Completely At Random) — ডেটা সম্পূর্ণ দৈবভাবে হারিয়েছে। যেমন কোনো একটা ম্যাচে স্কোরার অসুস্থ হয়ে পড়ায় দ্বিতীয় ইনিংসের ক্যাচ-তথ্য ওঠেনি। এখানে ক্ষতি কম, কারণ যা হারিয়েছে তা অন্য ম্যাচ দিয়ে ভরানো যায়।
- MAR (Missing At Random) — হারানোর কারণ অন্য একটা লক্ষণীয় চলকের সঙ্গে যুক্ত, কিন্তু চলকটা রেকর্ড করা আছে। যেমন ছোট ভেন্যুতে ক্যামেরা কম, তাই রিভার্স-সুইং ডেটা কম; কিন্তু কোন ম্যাচ ছোট ভেন্যুতে হয়েছে, সেটা আমরা জানি।
- MNAR (Missing Not At Random) — আর এটাই বিপদ। এখানে হারানোর কারণটা নিজেই গোপন। ধরুন, কেউ কেবল বড় দলগুলোর ইনিংসের ডেটা রেখেছে; তাহলে অনুপস্থিতি নিজেই একটা পক্ষপাত, আর সেটা আপনি দেখতে পাবেন না, কারণ যেটা নেই সেটা নেই বলেই চোখে পড়ে না।
এশীয় ক্রিকেটের সবচেয়ে বড় অসুবিধা হলো, তার বেশিরভাগ মিসিংনেস MNAR ধরনের। কেন? কারণ ডেটা সংগ্রহে পক্ষপাতটা ইচ্ছাকৃত নয়, কিন্তু সিস্টেমগত। বড় দল, বড় তারকা, বড় সম্প্রচার — এই তিনটা জিনিসের চারপাশে ডেটা জমে; বাকিটা ছিটকে পড়ে। তাই আপনি যদি শুধু স্কোরকার্ড-ডেটাবেসের দিকে তাকান, আপনার কাছে মনে হবে এশীয় ক্রিকেট মানে কয়েকটা দল আর কয়েকজন তারকা — শাকিব আল হাসান, মুশফিকুর রহিম, তামিম ইকবাল, রশিদ খান, বিরাট কোহলি, বাবর আজম, রোহিত শর্মা, শাহিন আফ্রিদি। কিন্তু এটা খেলার ছবি নয়, এটা ডেটার ছবি। তারকা ডেটা আকর্ষণ করে, আর ডেটা তারকাকে আরও বড় করে — এটা একটা ফিডব্যাক লুপ, এবং এই লুপটাই MNAR তৈরি করে।

আমি যখন ২০১৮ সালে রাশিয়া বিশ্বকাপের ৬৪টি ম্যাচের PPDA ট্র্যাক করি, তখন বুঝলাম একটা মেট্রিক শুধু মাপে না, সে ব্যাকরণ শেখায়। ৬৪ ম্যাচ জুড়ে PPDA ট্র্যাক করা প্রেসিংকে আমার কাছে পড়ার মতো এক ব্যাকরণে বদলে দিয়েছিল। ফ্রান্সের ৪-২ ফাইনাল জয়ে ফ্রান্সের PPDA ছিল ১৮.৭, ক্রোয়েশিয়ার ৮.৯ — এবং আমি তর্ক করেছিলাম, ফ্রান্সের কম প্রেস ছিল পরিকল্পিত ফাঁদ, দুর্বলতা নয়। কিন্তু এই ব্যাকরণ শেখার একটা শর্ত আছে: মেট্রিকটা যদি ৬৪ ম্যাচে সমানভাবে মাপা না হয়, তবে ব্যাকরণটা ভুয়া। এশিয়ার ঘরোয়া ক্রিকেটে সেই সমান-মাপা ডেটা নেই। তাই এখানে PPDA-র থ্রেশহোল্ড হুবহু আমদানি করা যায় না।
এইখানেই আমি মেট্রিক-আমদানি বা colonial metric import নিয়ে সাবধান হই। ইউরোপীয় লিগের xG বা PPDA-র যে সংখ্যাগুলো পাকা, সেগুলো সেই লিগের ডেটা-গুণ, খেলার স্টাইল আর প্রতিযোগিতার ঘনত্বের ফসল। এশীয় ঘরোয়া লিগে যদি আপনি হুবহু সেই থ্রেশহোল্ড বসান, তবে আপনি মাপছেন না — আপনি অপমান করছেন। প্রতিটি ডেটাসেটের একটা প্রিয়র দরকার। সেই প্রিয়র স্থানীয় মাঠ, স্থানীয় পিচ, স্থানীয় আবহাওয়া আর স্থানীয় সংস্কৃতি থেকে জন্মায়। একটা ঢাকার পিচের স্পিন-গ্রিপ, একটা মিরপুরের শিশির, একটা শারজার ফ্ল্যাট ডেক — এগুলো সংখ্যায় ধরা পড়ে না, কিন্তু সংখ্যাকে বদলে দেয়।
Grassroots ফুটবল আমাকে শিখিয়েছে, ডেটা ড্যাশবোর্ড থেকে নয়, কাদা থেকে জন্মায়। এশীয় ক্রিকেটের ক্ষেত্রেও সেটা সত্য। নেপাল, ওমান, সংযুক্ত আরব আমিরাত, বা বাংলাদেশের ঘরোয়া মাঠ থেকে যে ডেটা ওঠে, তার গঠন আলাদা। সেটা আমদানি করা মডেলে বসালে আপনি ভুল মাপবেন, আর সেই ভুলটা এত সূক্ষ্ম হবে যে পাঠক ধরতে পারবেন না।
আমার দৈনন্দিন কাজের একটা বড় অংশ হলো মিসিং ডেটা ডকুমেন্ট করা। প্রতিটি টেবিলের পাশে আমি লিখে রাখি: কোন ম্যাচ থেকে কী বাদ পড়েছে, কেন বাদ পড়েছে, আর সেই বাদ পড়া ফলাফলকে কোন দিকে ঠেলতে পারে। এটা একঘেয়ে কাজ, কিন্তু এই লেজারটাই আমার সবচেয়ে দামি সম্পদ। একটা রেসিডুয়াল হলো এমন এক গল্প, যা মডেল প্রত্যাশা করেনি; আমি তা ধীরে পড়ি। এশীয় ক্রিকেটে রেসিডুয়ালের সংখ্যা বেশি নয়, কারণ আমাদের কাছে মডেলই কম; কিন্তু যেখানে একটুখানি ডেটা জমে, সেখানে রেসিডুয়াল হঠাৎ করে অনেক বড় কথা বলে।

ভাবুন একটা উদাহরণ। ধরুন, একটি আন্তর্জাতিক টুর্নামেন্টের ২০টি ম্যাচের মধ্যে আমরা কেবল ৯টির বল-বাই-বল ডেটা রাখতে পারলাম। যদি আমরা সেই ৯টি ম্যাচ দিয়ে একটা ফেজ-প্রোগ্রেশন মডেল বানাই এবং তা দিয়ে বাকি ১১টি ম্যাচের ভবিষ্যদ্বাণী করি, তাহলে আমাদের আত্মবিশ্বাসের ব্যবধান এত চওড়া হবে যে সেই ভবিষ্যদ্বাণী কার্যত অকেজো। কিন্তু সাংবাদিকতায় প্রায়ই সেই চওড়া ব্যবধানটা সরিয়ে ফেলা হয়, আর আমরা পড়ি নিশ্চিত একটি সংখ্যা। এই সরিয়ে ফেলার অভ্যাসটাই আমার মতে এশীয় ক্রিকেট-বিশ্লেষণের সবচেয়ে বড় সিস্টেমিক দুর্বলতা।
দ্বিতীয় সমস্যাটা হলো নামের ভূগোল। এশীয় ক্রিকেটে একই খেলোয়াড়ের নাম তিন রকম বানানে ঘোরে — শাকিব, সাকিব, Shakib; মুশফিক, Mushfiqur, Mushfiq; রশিদ, Rashid। যখন দুটি আলাদা ডেটাসেট জোড়া লাগে, তখন এই বানান-ভিন্নতা একটাই খেলোয়াড়কে দুজন বানিয়ে ফেলে, আর মডেল ভুল গণনা করে। এটাকে বলে entity resolution, এবং এশীয় ক্রিকেটে এটা ইউরোপের চেয়ে অনেক কঠিন, কারণ লিপ্যন্তরের কোনো একক মান নেই। একটি ছোট কিন্তু বাস্তব উদাহরণ: যদি এক সূত্রে "শাকিব আল হাসান" আর অন্য সূত্রে "সাকিব আল হাসান" আলাদা এন্ট্রি হয়, তবে আপনার অলরাউন্ডার-লোড মডেল প্রতিটি ইনিংস দুবার গুনতে পারে — এবং আপনার সব সিদ্ধান্ত ভুল দিকে চলে যায়।
আর একটা দিক — ভূগোল। এশীয় ক্রিকেটের ম্যাচ ছড়িয়ে আছে চেন্নাই থেকে কাঠমান্ডু, দুবাই থেকে ঢাকা, কলম্বো থেকে মাসকাট। প্রতিটি ভেন্যুর নিজস্ব ডেটা-পরিবেশ আছে। ভারতীয় প্রিমিয়ার লিগের (IPL) পেছনে যে বিশাল ট্র্যাকিং আছে, পাকিস্তান সুপার লিগ (PSL) বা লঙ্কা প্রিমিয়ার লিগ (LPL) তার কয়েক ধাপ পিছিয়ে, আর বাংলাদেশ প্রিমিয়ার লিগ (BPL) ২০১২ সালে চালু হওয়ার পরও তার বল-বাই-বল সংরক্ষণে ধারাবাহিকতা নেই। এই অসম কাভারেজ মানে, যখন কেউ বলে "এশীয় ঘরোয়া ক্রিকেট", তখন সে আসলে একটা গড়ের কথা বলছে, যার ভেতরে কিছু অংশ খুব ভালো মাপা, আর কিছু অংশ প্রায় অন্ধকার।
নারীর ক্রিকেটে এই ফাঁক আরও গভীর। এশিয়ার মহিলা ক্রিকেটাররা দ্রুত উন্নতি করছেন, কিন্তু তাঁদের ম্যাচ-ডেটার ঘনত্ব পুরুষদের তুলনায় অনেক কম। ফলে বিশ্লেষণে একটা অনিচ্ছাকৃত পক্ষপাত ঢুকে পড়ে — কম ডেটা মানে কম দৃশ্যমানতা, কম দৃশ্যমানতা মানে কম বিশ্লেষণ, আর কম বিশ্লেষণ আবার কম ডেটা তৈরি করে। এটা ঠিক সেই ব্লকচেইন-সমস্যা: যে লেজারে কিছু লেখা হয়নি, সেটা ভবিষ্যতে অস্তিত্বহীন।
২০২০ সালে, যখন বিশ্বজুড়ে খেলা বন্ধ, আমি বুন্দেসলিগার দর্শকশূন্য ম্যাচ নিয়ে কাজ করি। ইউনিয়ন বার্লিনসহ ক্লাবগুলোর ডেটা দেখে পাই, হোম অ্যাডভান্টেজ ম্যাচপ্রতি ০.৪৫ গোল থেকে ০.২২ গোলে নেমে এসেছে, আর ইউনিয়নের কভার করা দূরত্ব ৩.২ কিলোমিটার বেড়েছে। খালি স্টেডিয়াম ছিল একটি ল্যাবরেটরি, যেখানে হোম অ্যাডভান্টেজ অবশেষে অভিনয় বন্ধ করে দিয়েছিল। এশীয় ক্রিকেটের জন্য এর পাঠ স্পষ্ট: যখন পরিবেশ বদলায়, খেলার ব্যাকরণও বদলায়, আর সেই পরিবর্তন ধরতে হলে আগে-পরে সমান মানের ডেটা লাগে। আমাদের ঘরোয়া ক্রিকেটে সেই সমান-মানের আগে-পরে ডেটা নেই বলেই আমরা জানি না, স্পিন-বান্ধব পিচের প্রভাব কতটা দর্শক-চাপ, আর কতটা পিচের নিজস্ব চরিত্র।

২০১৮ বিশ্বকাপ ছিল ৬৪টি তর্ক, আর PPDA তার একটিও মীমাংসা করেনি। এশীয় ক্রিকেটের ম্যাচগুলো তার চেয়েও বেশি তর্ক, কারণ এখানে তর্কের পাশাপাশি একটা প্রশ্ন ঝুলে থাকে — "আমরা কি যথেষ্ট ডেটা রেখেছি তর্কটা করার?" এই প্রশ্নটা স্বীকার করা দুর্বলতা নয়, শক্তি। একটা মডেল যে সীমা স্বীকার করতে পারে, সেটাই তার পরিপক্বতা।
আর একটা দিক ভাবা দরকার — সময়-সংবেদনশীলতা। এশীয় ক্রিকেটে অনেক ঘটনা দ্রুত আসে আর দ্রুত মুছে যায়: একটা টুর্নামেন্ট, একটা বোর্ড-সিদ্ধান্ত, একটা কোচ-পরিবর্তন, একটা ইনজুরি-আপডেট। যদি ডেটা-লেজার না থাকে, তবে প্রতি নতুন ঘটনায় আমরা শূন্য থেকে শুরু করি। এর ফলে একজন সাংবাদিক পাঁচ বছর আগের ম্যাচকে নতুন ম্যাচের মতো করে বিশ্লেষণ করতে বাধ্য হন — কারণ পুরোনো ডেটা খুঁজে পাওয়া যায় না। ব্লকচেইনের শিক্ষা এখানে সরল: যা হ্যাশ করে রাখা হয়নি, তা একদিন হারিয়ে যাবে, আর হারানোর পর তার অস্তিত্ব প্রমাণ করা প্রায় অসম্ভব।
এশিয়ার অনূর্ধ্ব-১৯ ও তরুণ ক্রিকেটে এই মিসিংনেসের দাম সবচেয়ে বেশি। অল্প বয়সের বোলারকে বড় লোডে ঠেলে দেওয়া হয়, কিন্তু তার লোড-ডেটা কেউ রাখে না। ফলে দুই বছর পর ইনজুরি এলে কেউ বলতে পারে না, কারণটা ছিল কতটা ওয়ার্কলোড, কতটা বায়োমেকানিক্স, কতটা বিশ্রামের অভাব। ডেটা-অনুপস্থিতি এখানে নিছক রিপোর্টিং-সমস্যা নয়, এটা খেলোয়াড়ের ভবিষ্যতের সমস্যা। বাংলাদেশের অনূর্ধ্ব-১৯ দল ২০২০ সালে বিশ্বকাপ জিতেছিল, কিন্তু সেই দলের খেলোয়াড়দের দীর্ঘমেয়াদি ওয়ার্কলোড-ইতিহাস কতটা সংরক্ষিত আছে? প্রশ্নটা অস্বস্তিকর, আর ঠিক সেই কারণেই জরুরি।
কনট্রারিয়ান
এখানে একটা আরামদায়ক বিভ্রান্তি আছে, যেটা পরিহার করা জরুরি। খালি ঘর দেখে কেউ বলবেন, "যেহেতু ডেটা নেই, তাই বিশ্লেষণও হবে না।" এটা পরাজয় স্বীকার, আর একই সঙ্গে বাহানা। উল্টো দিকে আরেক দল বলবে, "নেই-এর জায়গায় গল্প বসিয়ে দিই।" দুটোই ভুল। পার্থক্য হলো, একটা সীমা স্বীকার করে থামে, অন্যটা সীমাটাকে অনুমান দিয়ে ঢেকে দেয়।
আমার INTJ মন খালি ঘর দেখলে ঘরটা ভরে ফেলতে চায় — এটাই আমার সবচেয়ে বড় ফাঁদ। একে বলা যায় model worship, অর্থাৎ মডেলের প্রতি অন্ধ ভক্তি। আমি যদি cricket_asia লেবেল থেকে সোজা সিদ্ধান্তে লাফ দিই, তাহলে আমি নিজের লেজারটাকেই অস্বীকার করছি। করিলেশন কখনো কার্যকারণ নয়; আর একটা লেবেল কখনো একটা ম্যাচ নয়।
২০১৮ সালের বিশ্বকাপে আমি যে ব্যাকরণ শিখেছিলাম, সেটা কাজে লাগাতে আমার ৬৪টি ম্যাচ দরকার ছিল — একটিও কম হলে ব্যাকরণ ভাঙত। এশীয় ক্রিকেটের ক্ষেত্রে আমাদের সেই ৬৪টি নেই। তাই সৎ উত্তরটা হলো: এই খালি ডেটাসেট থেকে আমরা কেবল এতটুকু জানি যে আলোচনাটা এশীয় ক্রিকেট নিয়ে; এর বেশি কিছু দাবি করা মানে অনুমানকে ডেটা বলে চালিয়ে দেওয়া। আর একটা সৎ "জানি না" কখনো একটা আত্মবিশ্বাসী ভুলের চেয়ে ভালো।
এখানে আরেকটা ফাঁদ আছে, যেটা প্রায়ই দেখা যায় — অনুপস্থিতিকে "নিরপেক্ষ" ভাবা। অনুপস্থিতি কখনো নিরপেক্ষ নয়; অনুপস্থিতি সবসময় কারও পক্ষে। যে দলের ম্যাচ সম্প্রচার হয় না, সে দল ডেটায় থাকে না; আর ডেটায় না থাকা দলকে ইতিহাস ভুলে যায়। এটাই সবচেয়ে শান্ত, সবচেয়ে ধীর পক্ষপাত — এবং এশীয় ক্রিকেটে এটাই সবচেয়ে বেশি।
টেকঅ্যাওয়ে
খালি ঘর আমাকে হারায় না, খালি ঘর আমাকে কাজ দেয়। আগামী মৌসুমে আমি ঠিক এটাই করতে চাই — এশীয় ঘরোয়া ও এমার্জিং ক্রিকেটের জন্য একটা ন্যূনতম লেজার দাঁড় করানো, যেখানে প্রতিটি ম্যাচের পাশে লেখা থাকবে আমরা কী মাপিনি আর কেন। এটা পূর্ণ মডেল নয়, এটা v0.1 — ইচ্ছাকৃতভাবে অসম্পূর্ণ, তবু প্রকাশযোগ্য। প্রশ্নটা আর নেই, "ডেটা কতটা আছে?" প্রশ্নটা এখন, "অনুপস্থিতি কতটা সৎভাবে লিখেছি?" পরের রাউন্ডের আসল সংকেত লুকিয়ে আছে ওই সাতাশটি খালি ঘরে — যেখানে খেলা ছিল, অথচ কেউ লিখে রাখেনি।
