লেবেল ভুল করেছিল, পাইপলাইন ভাঙেনি — 'ফুটবল' ফাইলের ভেতরে যে পিট ডেভিডসনকে পাওয়া গেল
**মূল উত্তর:** স্টেজ-২ বিশ্লেষণে দেখা গেছে, 'ফুটবল' লেবেলযুক্ত একটি ফাইলের সব ষোলোটি তথ্যবিন্দুই মার্কিন কৌতুকাভিনেতা পিট ডেভিডসনকে নিয়ে; ফুটবলের কোনো উপাদান নেই। তাই নয়টি বিশ্লেষণ-মাত্রার প্রতিটিতে 'এন/এ' লেখা হয়েছে। মূল সিদ্ধান্ত — এটি আপস্ট্রিম ডেটা-শ্রেণীবিন্যাসের ত্রুটি, ফুটবল বিশ্লেষণ নয়। **মূল তথ্য:** - ফাইলের ডোমেইন লেবেল ছিল 'ফুটবল', কিন্তু বিষয়বস্তু সম্পূর্ণ বিনোদন-শিল্প। - ষোলোটি তথ্যবিন্দুর একটিতেও ক্লাব, খেলোয়াড়, কোচ বা ট্রান্সফার উল্লেখ নেই। - নয়টি বিশ্লেষণ-মাত্রাই 'এন/এ' ফিরিয়েছে; কারণ — মিথ্যা তথ্য তৈরি না করার শৃঙ্খলা। - বিশ্লেষকের চিহ্নিত একমাত্র প্রকৃত ঝুঁকি ডেটা-পাইপলাইনের দূষণ। - সুপারিশ: স্টেজ-২-এর আগে ডোমেইন-ভ্যালিডেশন গেট বসানো। **সূত্র:** স্টেজ-১ ডিকনস্ট্রাকশন রিপোর্ট ও স্টেজ-২ ডিপ অ্যানালাইসিস রিপোর্ট, ২০২৬ | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর:** প্রশ্ন: ভুল লেবেল কীভাবে ফুটবল বিশ্লেষণকে ক্ষতি করে? উত্তর: দূষিত ইনপুট মডেলকে ভুল শেখায়, আর সেই ভুল ব্রডকাস্ট গ্রাফিক্স, প্রিভিউ ও বাজারের প্রত্যাশায় ছড়িয়ে পড়ে। প্রশ্ন: এই ফাইল থেকে কি কোনো ফুটবল সিদ্ধান্ত নেওয়া সম্ভব? উত্তর: না — cricsultan.com ডেটা-ইনডেক্সের মানদণ্ড অনুযায়ী শূন্য যাচাইযোগ্য ফুটবল এনটিটি থাকলে কোনো সিদ্ধান্ত টানা যায় না। প্রশ্ন: বিশ্লেষকের পরবর্তী পদক্ষেপ কী হওয়া উচিত? উত্তর: ফাইলটি ফুটবল পাইপলাইনে পাঠানোর আগে আপস্ট্রিম ফিড রাউটিং ও স্ক্র্যাপ কনফিগারেশন অডিট করা।
শুরুতেই একটা দৃশ্য। গতকাল রাতে লন্ডনের বাড়িতে কফি হাতে একটা স্টেজ-টু বিশ্লেষণ ফাইল খুললাম। ফাইলের মাথায় লেখা — ডোমেইন লেবেল: ফুটবল। ভেতরে ষোলোটা তথ্যবিন্দু। একটাও ক্লাবের নাম নেই। একটাও ট্রান্সফার ফি নেই। একটাও এক্সজি, পিপিডিএ বা পজেশনের অঙ্ক নেই। যা আছে, তা হলো পিট ডেভিডসন — স্যাটারডে নাইট লাইভ ছাড়ার গল্প, সম্পর্কের তালিকা, মাদকমুক্তির লড়াই, পিতৃত্ব, আসন্ন সিনেমা। মার্কিন এক কৌতুকাভিনেতার ক্যারিয়ার-প্রোফাইল। আর তার উপরে সিল মারা হয়েছে: ফুটবল।
তেত্রিশ বছর ধরে আমি খেলা দেখি, মাইক্রোফোনের পেছনে দাঁড়াই, কাগজ লিখি। ১৯৯৩ সালে বাংলাদেশ বেতারে ঢোকার প্রথম সপ্তাহে আমাকে শেখানো হয়েছিল একটাই কথা — যা দেখনি, তা বলবে না। এই নিয়মটা এখনো আমার নোটবুকের প্রথম পাতায় বসে আছে। কিন্তু এবারের ঘটনাটা উল্টো দিকের। কেউ খারাপ বিশ্লেষণ করেনি। কেউ বানানো তথ্য দেয়নি। কেউ একটা ভুল কাগজ আমার ডেস্কে রেখে তার উপরে সঠিক নামের সিল মেরে গেছে। সিলটা নির্ভুল। কাগজটা নয়।

ব্যাপারটা বুঝতে হলে পাইপলাইনের গঠনটা জানা দরকার। প্রতিদিন হাজার হাজার প্রতিবেদন স্ক্র্যাপ হয়, প্রতিটার উপরে একটা ডোমেইন লেবেল বসানো হয়, তারপর সেটা সংশ্লিষ্ট বিশ্লেষকের টেবিলে যায়। লেবেলটাই গেটকিপার। লেবেল সঠিক হলে বিশ্লেষক ঠিক প্রশ্ন করেন। লেবেল ভুল হলে তিনি হয় ভুল প্রশ্ন করেন, নয়তো একেবারে প্রশ্ন করতে অস্বীকার করেন। এই ফাইলটা দ্বিতীয় দলটায় পড়েছে। যে বিশ্লেষক এটা হাতে পেয়েছেন তিনি নয়টা মাত্রার প্রতিটিতে লিখেছেন একই বাক্য — অপর্যাপ্ত তথ্য, মূল্যায়ন করা সম্ভব নয়।
এই সত্যটা আমি নিজে চিনি, কারণ আমি একবার উল্টো পথে হেঁটেছিলাম। ২০১৭ সালের আগস্টে নেইমারের ইউরো ২২২ মিলিয়ন ট্রান্সফার নিয়ে আমি চোদ্দো টুইটের একটা থ্রেড লিখেছিলাম, যেখানে যুক্তি ছিল — ফি-টা যুক্তিসঙ্গত। চল্লিশ হাজার রিটুইট। প্রোডিউসার আমাকে বলেছিলেন টুইটার করা বন্ধ করতে। আমি সোমবার চাকরি ছাড়লাম। কিন্তু তারপর যে শিক্ষাটা পেলাম সেটা হলো: আমি ইউরো ২২২ মিলিয়নকে তাড়া করেছিলাম যতক্ষণ না সংখ্যাগুলো স্বীকারোক্তি দিল। মূল সংখ্যাটা কেউ পড়েনি — সবাই পড়েছিল অ্যামোর্টাইজেশন শিডিউল, যা কেউ প্রকাশ করেনি। লুকানো অর্থনীতিই আসল গল্প, উঁচু ফিগারটা নয়।
২০২০ সালের ১৭ জুনের কথা মনে আছে? প্রিমিয়ার লিগ ফেরার প্রথম ম্যাচ, অ্যাস্টন ভিলা শূন্য-শূন্য শেফিল্ড ইউনাইটেড। বল স্পষ্ট লাইন পার করেছে, হকআই নড়েনি। সেদিন রাতে আমি কুড়ি মিনিটের একটা রেকর্ডিং করেছিলাম — টেকনোলজি ভাঙেনি, প্রোডাক্ট ভেঙেছে। ছয় বছর পরে আজ আমি একই বাক্য ঘুরিয়ে লিখছি। এখানে টেকনোলজি ভাঙেনি। মডেল ভাঙেনি। স্ক্র্যাপার ভাঙেনি। লেবেলটা ভেঙেছে।
এখন আসল কাজে আসি। রিপোর্টের সবচেয়ে বড় আবিষ্কার এই নয় যে ফাইলটায় ফুটবল নেই — সেটা এক নজরেই ধরা পড়ে। বড় আবিষ্কার হলো, বিশ্লেষক নয়টা মাত্রার প্রতিটিতে ভিন্নভাবে 'এন/এ' লিখতে পারেন, অথচ পুরো ছবিটা একসঙ্গে পড়লে সেটাই সবচেয়ে তীক্ষ্ণ বিশ্লেষণ হয়ে ওঠে। ট্যাকটিকাল মাত্রা এন/এ, ফিনান্স এন/এ, ফলাফল ও জনমত চক্র এন/এ, লিগ ল্যান্ডস্কেপ এন/এ, শাসনব্যবস্থা এন/এ, ড্রেসিংরুম এন/এ, ঝুঁকি এন/এ, মিডিয়া ন্যারেটিভ এন/এ, শিল্প-সঞ্চালন এন/এ। নয়টাই শূন্য। শূন্যের এই সারিবদ্ধতা নিজেই একটা ডেটা পয়েন্ট।
ভাবুন, একজন অলস বিশ্লেষক এই ফাইল দিয়ে কী করতে পারতেন। তিনি লিখতে পারতেন, 'ডেভিডসন' নামের একজন তরুণ আক্রমণভাগের খেলোয়াড় বুকে চোট নিয়ে মাঠের বাইরে, তাই দলের প্রেসিং স্ট্রাকচার ভেঙে পড়েছে। নামটা বিদেশি শোনায়, বয়সটা ত্রিশের কোটায়, গল্পটা দুঃখজনক — পাঠক বিশ্বাস করতেন। আমি নিজে এই ফাঁদে পড়েছি। ছয় বছর আগে রাশিয়ায় নিজের টাকায় গিয়ে আমি ১৭ জুন লুঝনিকিতে জার্মানির ১-০ হার দেখেছিলাম মেক্সিকোর কাছে, তারপর দশ দিন আগেই লিখে ফেলেছিলাম — চ্যাম্পিয়নরা ২০ জুনের মধ্যেই বিদায় নিয়ে ফেলেছে। সংখ্যা, নাম, বয়স — তিনটে জিনিস আগে থেকে লিখে রাখার অভ্যাসটাই আমাকে রক্ষা করেছে। এই ফাইলে সেই তিনটের একটাও নেই। তাই এখানে অনুমান করার অধিকার আমার নেই।

যে ঝুঁকিটা রিপোর্টে ধরা পড়েছে সেটা ফুটবল-ঝুঁকি নয়, ডেটা-পাইপলাইন ঝুঁকি। টেবিলে স্পোর্টিং, ফিনান্সিয়াল, পার্সোনেল, রুলস — সব ঘর ফাঁকা। কিন্তু একটা ঘর ভরা: সিস্টেমিক। বিশ্লেষক লিখেছেন, এই মিসলেবেলটা একবার ঘটলে সেটা বিচ্ছিন্ন দুর্ঘটনা নাও হতে পারে; পুনরাবৃত্তি ঘটলে ফুটবল মডেলগুলো আবর্জনা খেতে শুরু করবে। আমি এই কথাটা আরও এগিয়ে নেব। মডেলের আউটপুট যেখানে যায়, সেটা শুধু সম্পাদকীয় সিদ্ধান্ত নয়। সেটা ব্রডকাস্টার গ্রাফিক্স, প্রিভিউ ব্লগ, প্রি-ম্যাচ স্ট্যাট প্যাক, এবং বাজারের গতি। একটা ভুল লেবেল একটা ভুল বাক্যে পরিণত হয়, সেই ভুল বাক্য একটা ভুল প্রত্যাশায় পরিণত হয়, আর সেই প্রত্যাশা ম্যাচের আগেই গল্পটা লিখে ফেলে।
অর্থনীতিটার দিকটা ভাবুন। একটা ডোমেইন-ভ্যালিডেশন গেট বসানো মানে কীওয়ার্ড আর এনটিটি চেকের একটা স্তর — নাম, ক্লাব, প্রতিযোগিতা, কোচ, ট্রান্সফার। খরচ এককালীন, একবার লিখে দিলে বারবার চলে। আর দূষণের খরচ চক্রবৃদ্ধি হারে বাড়ে, কারণ মডেল ভুল শেখে এবং সেই ভুল পরের মৌসুমেও বয়ে বেড়ায়। ফুটবলে আমরা এই অঙ্কটা চিনি — একজন খেলোয়াড়ের বেতন আর তার অ্যামোর্টাইজড ফি আলাদা করে দেখতে শিখেছি বলেই ক্লাবগুলোর হিসাব বুঝতে পারি। ডেটা পাইপলাইনেও একই নিয়ম। আগমনী খরচ ছোট, বহন খরচ বড়।
আরেকটা জিনিস লক্ষ্য করার মতো। রিপোর্টে বিশ্লেষক স্পষ্ট লিখেছেন, এই লেখাটার আসল উদ্দেশ্য বিনোদন-প্রচার, খেলাধুলার তথ্য নয়। এটা কোনো লুকোচুরি নয়, এটা একটা ফিচার। যে সিস্টেম নিজের সীমা স্বীকার করতে পারে, সে সিস্টেমই নির্ভরযোগ্য। যে সিস্টেম প্রতিটা ফাঁকা ঘরে গল্প ভরে দেয়, সে সিস্টেম কখনো ভুল স্বীকার করে না — কারণ তার কাছে ভুল বলে কিছু থাকে না।
এখন সেই অংশ, যেখানে আমাকে আমার নিজের যুক্তির বিরুদ্ধে দাঁড়াতে হবে। সমালোচনার সবচেয়ে শক্তিশালী রূপটা এই — লেবেল হলো সস্তা মেটাডেটা, একটা ভুল লেবেল মানে বিশটা ফাইলের মধ্যে একটার ছোটখাটো বিভ্রান্তি, আর এর জন্য আলাদা চেক বসানো মানে গতি হারানো। দৈনিক হাজারো আইটেমের পাইপলাইনে প্রতিটা গেট মানে দেরি, আর দেরি মানে ফুটবল-সাংবাদিকতায় মৃত্যু। এই যুক্তি ফেলনা নয়।
আরেকটা সম্ভাবনা খোলাখুলি বলি। 'ফুটবল' শব্দটা হয়তো কনটেন্ট ট্যাগ ছিল না, ছিল ফিডের নাম। অর্থাৎ যে সোর্স থেকে ফাইলটা এসেছে তার চ্যানেল-নাম ফুটবল, কিন্তু ভেতরের আইটেম কখনো কখনো বিনোদন। সেক্ষেত্রে দোষটা শ্রেণীবিন্যাসকারীর নয়, রাউটিং কনফিগারেশনের। রিপোর্টও ঠিক এই জায়গাটা আঙুল দিয়ে দেখিয়েছে — আপস্ট্রিম ফিড কনফিগারেশন, স্ক্র্যাপ ও সোর্স রাউটিং পরীক্ষা করা দরকার।
আমি স্বীকার করি, আমার নিজের একটা রোগ আছে। ইউরো ২২২ মিলিয়নের থ্রেডের পর আমাকে বলা হয়েছিল থামতে। তারপর থেকে প্রতিটা অসংগতির ভেতরে আমি সিস্টেমিক ব্যর্থতা খুঁজতে শুরু করেছি। তাই প্রশ্নটা ন্যায্য: আমি কি একটা ফাইলের অস্বস্তিকে পুরো পাইপলাইনের সংকট বানিয়ে ফেলছি? হতে পারে। কিন্তু পার্থক্যটা এখানে স্পষ্ট — আমি সংখ্যা ছাড়া দাবি করছি না। রিপোর্টে লেখা আছে, মিসলেবেল সিস্টেমিক হলে ডাউনস্ট্রিম মডেল দূষিত হবে, এবং পরবর্তী ডেটা-অডিট চক্রে সেটা ধরা পড়বে। এটা অনুমান নয়, এটা যাচাইযোগ্য প্রস্তাব।
তাই আমার সিদ্ধান্ত, তারিখসহ, আগাম লিখে রাখছি। যদি ১ নভেম্বর ২০২৬-এর মধ্যে কোনো ডোমেইন-ভ্যালিডেশন গেট না বসে, এবং ফিড রাউটিং অডিট না হয়, তাহলে আমি ভবিষ্যদ্বাণী করছি — পরের পাঁচশো আইটেমের নমুনায় অন্তত তিনটি অ-ফুটবল প্রতিবেদন 'ফুটবল' লেবেল নিয়ে ঘুরবে। আমি সেই গণনা প্রকাশ করব, ফল যা-ই হোক। আর যদি সংখ্যাটা শূন্য হয়, আমি আমার ভুল স্বীকার করে লিখব। ফুটবলে যেমন, পাইপলাইনেও তেমন — প্রমাণ ছাড়া কেউ কারও হয়ে ক্ষমা চায় না, কেউ কারও হয়ে দাবিও করে না।
