থেরানোস থেকে ফুটবল ডেটা: একটি ভুল লেবেল কীভাবে বিশ্লেষণের ভিত্তি কাঁপায়
**মূল উত্তর:** থেরানোস-সংক্রান্ত একটি অ-ফুটবল প্রতিবেদন ভুলভাবে ‘ফুটবল’ ডোমেইনে লেবেল করা হয়েছিল, এবং ২২টি তথ্যবিন্দুর একটিতেও সোর্স ছিল না। ফলে ফুটবল বিশ্লেষণের প্রতিটি মাত্রিকাই ‘তথ্য অপর্যাপ্ত’ হিসেবে চিহ্নিত হয়েছে—লেবেল ভুল হলে বিশ্লেষণ নয়, ডেটা-দূষণ তৈরি হয়। **মূল তথ্য:** - নথিতে ২২টি তথ্যবিন্দু, প্রতিটির সোর্স ফিল্ডে লেখা ছিল ‘নেই’। - ঘোষিত ডোমেইন লেবেল ‘ফুটবল’, অথচ ভেতরে একটিও ফুটবল সত্তা নেই। - বিষয়বস্তু এলিজাবেথ হোমসের কারাগার-বার্তা, ১,২১৬ দিনের হিসাব ও ১১ বছরের ফেডারেল সাজা। - এ২৪-এর ডকুমেন্টারি ‘ইউ ক্যান সি এভরিথিং’ মুক্তি ১৬ অক্টোবর, পরিচালনায় নাথান ফিল্ডার ও ল্যান্স ওপেনহাইম। - সময়-সংবেদনশীলতা ও সোর্সের গুণমান—দুটি মেটাডেটা ক্ষেত্রই অনুল্লিখিত রাখা হয়েছিল। **সূত্র উল্লেখ:** Stage-2 ফুটবল ডোমেইন বিশ্লেষণ নথি (ডোমেইন-মিসম্যাচ ফ্ল্যাগ সহ), ডকুমেন্টারি মুক্তির তারিখ ১৬ অক্টোবর | Cross-checked: cricsultan.com **সম্ভাব্য পরবর্তী প্রশ্ন:** প্রশ্ন: এই ভুল লেবেল কি ফুটবল ডেটা মডেলে দূষণ ঘটাতে পারে? উত্তর: হ্যাঁ—একটি ভুল-লেবেল ইনপুট নমুনার আকার বাড়ায় এবং ফলাফলের ধারাবাহিকতা নীরবে বিকৃত করে। প্রশ্ন: শ্রেণিবিন্যাস ত্রুটি আটকানোর সবচেয়ে সহজ উপায় কী? উত্তর: প্রি-ফ্লাইট গেট, যা যাচাই করে নথির সত্তাগুলো ঘোষিত ডোমেইনের সত্তা-ক্ষেত্রের সঙ্গে মেলে কি না। প্রশ্ন: বিশ্লেষণে ‘তথ্য অপর্যাপ্ত’ লেখা কী ইতিবাচক সংকেত? উত্তর: হ্যাঁ, ফাঁকা ইনপুটে বানানো উপসংহারের বদলে স্পষ্ট অস্বীকৃতি ডেটার বিশ্বাসযোগ্যতা বাঁচায়।
গত সপ্তাহে রাত ৩টার পরে একটা ডেটা রেকর্ড হাতে এল। লেবেলে স্পষ্ট লেখা—ডোমেইন: ফুটবল। খুলে বসে দেখলাম, ভেতরে একটাও ক্লাব নেই, কোচ নেই, ফর্মেশন নেই, ট্রান্সফার ফি নেই। ভেতরে আছে এলিজাবেথ হোমস, বিলুপ্ত রক্ত-পরীক্ষা সংস্থা থেরানোস, একটি আসন্ন ডকুমেন্টারি, আর একটা বাক্য—‘১,২১৬ দিন, একটানা দিন আর রাত।’ ২২টি তথ্যবিন্দু, প্রতিটির পাশে সোর্সের ঘরে লেখা: নেই।
বছরের পর বছর ম্যাচ দেখা আমার অভিজ্ঞতা থেকে একটা অভ্যাস তৈরি হয়েছে—ভুল হলে সেটা চোখে ধরা পড়ে। একটা ভুল তীর, একটা ভুল টাইমস্ট্যাম্প, না হয় একটা মিস-অ্যাট্রিবিউটেড পাস। ২০১৮ সালে ফ্রান্স বনাম আর্জেন্টিনার লাইভ থ্রেডে একটা তীর ভুল জায়গায় বসেছিল, সেটা ঠিক করতে ছয়বার ম্যাচ রিওয়াচ করেছি। কিন্তু এই রেকর্ডটা অন্য ধরনের ভুল। এখানে ভুলটা ডেটার ভেতরে নেই; ভুলটা ডেটার গায়ে সাঁটা লেবেলে। লেবেল ভুল হলে বিশ্লেষণ ভুল হয় না—বিশ্লেষণ অসম্ভব হয়ে পড়ে, অথচ পুরোটাই দেখতে দিব্যি বৈধ লাগে।

রেকর্ডটির অভ্যন্তরে যা ছিল, সেটি গোছানো, স্পষ্ট, এমনকি সংবেদনশীলও। হোমসের কারাগার থেকে পাঠানো বার্তা; ১,২১৬ দিন বন্দিত্বের হিসাব; যুক্তরাষ্ট্রের ফেডারেল আদালতে প্রতারণার দায়ে ১১ বছরের সাজা; এ২৪ স্টুডিওর আগামী ডকুমেন্টারি ‘ইউ ক্যান সি এভরিথিং’; পরিচালনায় নাথান ফিল্ডার ও ল্যান্স ওপেনহাইম; টেলুরাইড ফিল্ম ফেস্টিভ্যালে প্রদর্শনী; নিউ ইয়র্ক ফিল্ম ফেস্টিভ্যালে ‘এই সপ্তাহের’ স্ক্রিনিং; ১৬ অক্টোবরের মুক্তি; সঙ্গী বিলি ইভান্স; ২০২২ সাল থেকে চালানো সোশ্যাল মিডিয়া অ্যাকাউন্ট; নিজের নির্দোষতার দাবি।
এর কোনোটিই ফুটবল নয়। একটা ক্লাব নেই, একটা লিগ নেই, একজন কোচ নেই, ফিফা বা উয়েফার নিয়ন্ত্রক প্রশ্ন নেই, ফিন্যান্সিয়াল ফেয়ার প্লে নেই। তারপরও লেবেল বলছে—ফুটবল।

একই রেকর্ডের মেটাডেটা স্তরে আরও দুটো ফাঁক চোখে পড়ল। সময়-সংবেদনশীলতার মূল্যায়ন করা হয়নি। সোর্সের গুণমান মূল্যায়ন করা হয়নি। অর্থাৎ যে দুটো তথ্য দিয়ে বোঝা যেত বিষয়টি কোন ঘড়ির কাঁটায় চলছে আর কতটা বিশ্বাসযোগ্য, সেগুলো ফাঁকা। ফাঁকা থাকা মানে ‘নেই’—এটা পরিষ্কার করে লেখা হয়েছে, বানানো তথ্য দিয়ে ভরা হয়নি। সেটা অন্তত একটা সৎ সিদ্ধান্ত।
এখন প্রশ্ন, এমন রেকর্ড ফুটবল বিশ্লেষণের পাইপলাইনে কী করে ঢোকে। উত্তরটা বিরক্তিকরভাবে সহজ। এক-পাস শ্রেণিবিন্যাস, একটা শিরোনামে থাকা কিছু শব্দ, একটা কীওয়ার্ড স্কোর—আর রেকর্ডটা চলে যায় ভুল ডেস্কে। কোনো প্রি-ফ্লাইট গেট নেই, যেটা জিজ্ঞেস করবে: নথিতে যে সত্তাগুলোর নাম আছে, তাদের সঙ্গে ঘোষিত ডোমেইনের সম্পর্ক কী? এলিজাবেথ হোমস, থেরানোস, এ২৪, টেলুরাইড—এই চারটি নামের একটিও ফুটবলের মহাবিশ্বে পড়ে না। এই জিজ্ঞাসাটা করলে রেকর্ডটা প্রথম লাইনে আটকে যেত।
আমি যেহেতু ২০১৭ সাল থেকে ম্যাচকে জ্যামিতিক সিস্টেম হিসেবে ম্যাপ করি—মনাকোর ৪-৪-২ দিয়ে শুরু, এমবাপের ১৮ বছর বয়সী ইচ্ছাকৃত ডান-চ্যানেল থেকে বাঁ-চ্যানেলে ঢোকার ১১টি মুভমেন্ট, ফাবিনিয়োর প্রতি ম্যাচে ৪.২ ট্যাকল—তাই আমি জানি, একটা লেবেল সাজসজ্জা নয়, একটা রাউটিং সিদ্ধান্ত। লেবেল নির্ধারণ করে দেয় কোন মডেল টেক্সটটা পড়বে, কোন মেট্রিক্স বেরোবে, কার সঙ্গে তুলনা বসবে। লেবেল ভুল হলে পরের প্রতিটি ধাপ আত্মবিশ্বাসের সঙ্গে ভুল হয়।
একটা ডোমেইন লেবেল ভুল মানে কেবল একটা ট্যাগ ভুল নয়, বরং কার্যকারণ শৃঙ্খলের ডান প্রান্তে ভুল উপসংহার।
ফুটবলে এই রোগটার চেনা নাম আছে—পিপিডিএ। দুবছর আগে আমি যে দলটাকে ফলো করছিলাম, তাদের প্রেসিং কার্ভ বানিয়েছিলাম। কার্ভটা দেখতে ফ্লিক-যুগের বায়ার্নের পাঠ্যপুস্তক-আকৃতি। তারপর আন্ডারলাইং ম্যাচগুলোর বিপক্ষের বলদখল চেক করলাম। পাঁচটার মধ্যে দুটো ম্যাচে প্রতিপক্ষ ৬৫ শতাংশের ওপরে বল রেখেছিল। ওই দুটো ম্যাচে যাকে প্রেসিং ভাবছিলাম, সেটা আসলে বলের পেছনে দৌড়। সংখ্যাগুলো দশমিকের পরে পর্যন্ত সঠিক ছিল। ভুলটা ছিল সংখ্যার গায়ে বসানো লেবেলে: ‘উচ্চ প্রেসিং তীব্রতা’।
এখানেই আসল শিক্ষাটা। দুর্বল ডেটা চোখে পড়ে, তাই সাবধান করে দেয়। বিপদটা আসে ভুল ফোল্ডারে রাখা ভালো-দেখতে ডেটা থেকে, কারণ সে নিজের পরিচয় চিৎকার করে জানায় না—সে চুপচাপ নমুনার আকার বাড়ায়।
সোর্সহীনতার স্তরটাও আমার কাছে পরিচিত। ২২টি তথ্যবিন্দুর একটিতেও সোর্স নেই। আর যে দু-তিনটি সরাসরি উদ্ধৃতি আছে, সেগুলো হোমসের নিজের ভাষ্য—অর্থাৎ স্বার্থসংশ্লিষ্ট প্রাথমিক সূত্র, যার পাশে স্বাধীন corroboration ছাড়া কিছুই দাঁড় করানো যায় না। ফুটবলে এই জিনিসটির নাম ভিন্ন: এজেন্টের ফাঁস করা ট্রান্সফার রটনা, ক্লাবের ছাড়া ইনজুরি টাইমলাইন, ‘হেয়ার উই গো’ স্তরের রিপোর্টিং।
২০২৩ সালের জানুয়ারিতে চেলসির এনজো ফের্নান্দেসের ১০৬.৮ মিলিয়ন পাউন্ডের চুক্তিগতাটা আমি ম্যাপ করেছিলাম। তার ৯২ শতাংশ পাস-অ্যাকুরেসি সংখ্যাটা সত্যি। কিন্তু কোন প্রতিযোগিতা, মাঠের কোন জোন, ম্যাচের কোন অবস্থা—এই তিনটা না জানলে সেই ৯২ শতাংশ বলে দেয় না সে কোন পিভটে বসবে। তাই আমি প্রোফাইলটা সিস্টেমের সঙ্গে মিলিয়ে দেখেছিলাম, রেপুটেশনের সঙ্গে নয়। কাঠামোগত দাবি টিকে থাকে; রেপুটেশন-নির্ভর দাবি রিসাইকেল হয়।
এই জোড়াটাই সবচেয়ে বিপজ্জনক: সংখ্যাটা সত্যি, কিন্তু তার উৎস স্বার্থসংশ্লিষ্ট। তখন সংখ্যাটা আর প্রমাণ নয়, অলংকার।
গত তিন বছরে আমি যেটা দেখেছি, তাতে এই ফাঁদটা ফুটবল-ট্রান্সফার মার্কেটে সবচেয়ে বেশি কাজ করে। জানুয়ারির উইন্ডোতে যখন কোনো এজেন্ট তার ক্লায়েন্টকে বড় ক্লাবে বসাতে চায়, তখন সে যে তথ্য ছাড়ে সেটা প্রায়ই দশমিক পর্যন্ত সঠিক হয়—গোল, অ্যাসিস্ট, পাস-নির্ভুলতা। শুধু প্রেক্ষাপটটা বাদ যায়। মরক্কোর ২০২২ বিশ্বকাপ-অভিযানে আমাকে এটা উল্টো করে ভাবতে শিখিয়েছিল। রেগরাগির ৫-৪-১, সোফিয়ান আমরাবাতের পর্তুগালের বিপক্ষে ৫টি ট্যাকল, সেমিফাইনালের আগে খোলা খেলা থেকে মাত্র একটি গোল হজম—এই সেটটায় প্রতিটি সংখ্যার পেছনে একটা নির্দিষ্ট ম্যাচ-পরিস্থিতি আছে, তাই দাবিটা দাঁড়ায়।
কিন্তু আমার কাছে এই বিশ্লেষণের সবচেয়ে মূল্যবান লাইনটি কোনো সংখ্যা নয়—বারবার ফিরে আসা ‘তথ্য অপর্যাপ্ত, মূল্যায়ন সম্ভব নয়’।
একটা ফ্রেমওয়ার্ক যখন ফাঁকা ইনপুট পেয়ে বানানো বিশ্লেষণ হাজির না করে ‘পারি না’ বলে, তখন সেটা সবচেয়ে বিশ্বাসযোগ্য আচরণ করে। ফুটবল-পণ্ডিত্যবৃত্তিতে এই আচরণটার অভাব প্রকট। বল-দখলের সংখ্যাটা চমৎকারভাবে বর্ণনা করা হয়; শূন্য দশমিক চার এক্সজি-কে বলা হয় ‘আধিপত্য’। সংখ্যাটা সত্যি, বাক্যটা মিথ্যা।
এখানে আর একটা সমান্তরাল টানতে ইচ্ছে করে—স্টেডিয়ামের বড় পর্দা। ভিএআর সিদ্ধান্ত দেখায়, কিন্তু সিদ্ধান্তের যুক্তিটা দেখায় না। দর্শক একটা আউটপুট পায়, সেটা অডিট করার কোনো উপায় পায় না। একই দায়সারা আচরণ ডেটার ক্ষেত্রে ঘটে: সোর্সহীন সংখ্যাটা ব্যাখ্যাহীন সিদ্ধান্তের মতোই, শ্রোতাকে অন্ধ বিশ্বাসের দিকে ঠেলে দেয়। এখানে কেউ ঘোষণা দিতে বসেনি, ফুটবল নিজেই সেটা বলে দিয়েছে।
যে পদ্ধতিতে আমি ভরসা করি, সেটা অনেক কম চমকপ্রদ আর অনেক বেশি সময়সাপেক্ষ। লিসবনের খালি স্টেডিয়ামে বায়ার্ন বনাম বার্সেলোনার ৮-২ ম্যাচটার কথা ধরুন। দর্শক নেই। সম্প্রচার অডিওতে ফ্লিকের নির্দেশ শোনা যাচ্ছিল। ইমানুয়েল কিমিখের ৬টি লাইন-ব্রেকিং পাস; বল হারানোর ৭.২ সেকেন্ড পর সক্রিয় করা প্রেসিং ট্র্যাপ; আক্রমণ-তৃতীয়াংশে ১৪টি বল পুনরুদ্ধার। তিন ধরনের সিগন্যাল—অডিও, পুনঃপ্রচারের বডি-ওরিয়েন্টেশন, আর ইভেন্ট ডেটা। তিনটাই মিলেছে, তাই দাবিটা টিকেছে। এটাই আমার নিয়ম: প্রতিটি সিদ্ধান্তের পেছনে অন্তত তিনটি স্বাধীন সিগন্যাল থাকতে হবে—একটি শব্দ, একটি ভঙ্গি, একটি সংখ্যা। যেখানে তিনটি নেই, সেটা বিশ্লেষণ নয়, ছাপ।
বাংলাদেশের রাতজাগা দর্শকদের জন্য এই ব্যাপারটা বিশেষভাবে প্রাসঙ্গিক। আমরা ম্যাচ দেখি স্ক্রিন আর শব্দের মধ্য দিয়ে—স্টেডিয়ামের ভিজ্যুয়াল প্রসঙ্গটা আমাদের হাতে থাকে না, কিন্তু Commentaryয়ের স্বর, গ্যালারির ঢেউ, বল-হাতের ঘর্ষণ শব্দ—এই অডিও-স্তরটা পুরোপুরি আমাদের হাতেই থাকে। জাতীয় দলের ম্যাচে কোচের নির্দেশ, ‘স্ক্রিনটি হোল্ড করো’ চিৎকার, বল ক্লিয়ার করার আগে পজ—এইগুলো সবই সিগন্যাল। কিন্তু অডিও একা সাক্ষী হতে পারে না। ২০২০ সালে খালি স্টেডিয়াম যেটা শিখিয়েছিল, তা হলো: নীরব পরিবেশ অডিও-সিগন্যালকে শক্তিশালী করে, কিন্তু সেটাকে ডেটা বা ভিডিও দিয়ে ক্রস-চেক না করলে সেটা মিথ্যা নিশ্চিন্ততাও তৈরি করতে পারে। অডিও-সিগন্যালের ওপর অতিরিক্ত ভরসা আমার নিজের একটা পরিচিত ঝুঁকি, এবং প্রতি সপ্তাহে আমি নিজের বিরুদ্ধে লড়ি।
২০২৬ সালের প্রস্তুতি হিসেবে আমি ৩২ দলের প্রেসিং মডেল বানাচ্ছি, ৪০ পাতার ডসিয়ার, যার মধ্যে তাপমাত্রা, উচ্চতা আর ভ্রমণ-দূরত্ব দিয়ে গড়া একটা ফ্যাটিগ ইনডেক্স আছে। এমন একটা ইনডেক্সে একটি মাত্র ভুল-লেবেলড ইনপুট ঢুকে পড়লে ত্রুটিটা কোনোদিন নিজের উপস্থিতি ঘোষণা করবে না। সে চুপচাপ সারিটা বিকৃত করবে, আর আমি বাইরে থেকে দেখব একটা পরিষ্কার গ্রাফ। রদ্রির সেপ্টেম্বর ২০২৪-এর এসিএল ইনজুরির পর ম্যানচেস্টার সিটির tujuh ম্যাচে পাঁচ হার আমার জন্য একটা পরীক্ষা-কেস ছিল। ২০২৫ ক্লাব বিশ্বকাপ ফাইনালে চেলসির ৩-০ জয় আরেকটা। দুটোই পরিষ্কার ছিল, কারণ ইনপুটগুলো পরিষ্কার ছিল।
তাই প্রতিটি মডেলে একটা জায়গা ফাঁকা রাখা দরকার—একটা ভ্যারিয়েন্স বক্স, যেখানে মডেল যা দেখছে না সেটা নাম ধরে লেখা থাকবে। ইনডেক্স বাইরে রদ্রির ইনজুরির মতো আঘাত, ইন-গেম পজিশনাল অদলবদল, রেফারির সিদ্ধান্তের রহস্য। এই বক্সটা মডেলকে দুর্বল করে না; বক্সটা মডেলকে সৎ রাখে।
এখন আমি যেখানে পৌঁছেছি, সেটা ব্যাকরণে ছোট, কিন্তু পদ্ধতিগতভাবে বড়। তিন বছর আগে আমি ফিড থেকে একটা ভুল-লেবেল রেকর্ড পেলে প্রথমে ডেটাটা ঠিক করার চেষ্টা করতাম, তারপর লেখা ছাপাতাম। এখন আমি আগে রেকর্ডটা সরিয়ে ফেলি, তারপর প্রশ্ন করি: এটা একবার ঘটেছে নাকি এটা অভ্যাস? একবারের মিসম্যাচ কোলাহল। বারবার মিসম্যাচ সিস্টেম। একটা পরীক্ষায় ধরা পড়া ত্রুটির উত্তর একটা সংশোধিত ডায়াগ্রাম নয়, একটা ফিড অডিট।
এবং এই জায়গায় আমাকে নিজের একটা স্বভাব স্বীকার করতে হয়। আমি এমন লোক যে একটা ভুল তীরের জন্য লেখা কয়েক ঘণ্টা দেরি করাতে রাজি, দিন নয়। সেই পারফেকশনিজম ঠেলে দেয় দ্রুত সবকিছু নিজের হাতে সারিয়ে ফেলতে। এখানে সেটা ভুল প্রতিক্রিয়া। কারণ যে রেকর্ডে ২২টি তথ্যবিন্দুর ২২টিতেই সোর্স ‘নেই’ লেখা, সেটা ঠিক করার দায়িত্ব আমার একটা ডায়াগ্রাম-এডিটরে শেষ হয় না।
আরও একটা ব্যাপার আমি পরিষ্কার মনে রাখতে চাই। ফুটবলের মূল্যায়নের সবচেয়ে বড় ফাঁকটা প্রায়ই সংখ্যায় নয়, সংখ্যার সোর্সচেইনে। দলের ফলাফলের ধারা, প্রেসিং প্যাটার্ন, ডেডবল-কনট্রাক্ট, ছোট রিপোর্ট—সবকিছুর পেছনে একটা সূত্র-শৃঙ্খল থাকে, যা পণ্ডিত্যবৃত্তি কখনো লাগায় না। আমাদের কাজটা ট্রান্সফার মার্কেট থেকে স্কাউটিং ডিপার্টমেন্ট পর্যন্ত এই শৃঙ্খলটা দৃশ্যমান করা, যেন কেউ প্রশ্ন করতে পারে: এই সংখ্যাটা কে বলছে, আর বলার বিনিময়ে সে কী পাচ্ছে।
সামনের ফিড অডিটে জানা যাবে এক জিনিস—এটা একটা বিচ্ছিন্ন শ্রেণিবিন্যাস-দুর্ঘটনা, নাকি অনেক দিন ধরে চুপচাপ চলতে থাকা একটা অভ্যাস। উত্তরটা আমার মডেলের আকারের চেয়ে আমার উপসংহারের বিশ্বাসযোগ্যতার জন্য বেশি জরুরি।

পরেরবার রাত ৩টায় ফিড থেকে রেকর্ড নামার আগে আমি ফর্মেশন দেখব না, আগে লেবেল দেখব। প্রশ্নটা সরল থাকবে: ২০২৬ সালের ৪০ পাতার ডসিয়ারের প্রতিটি ইনপুট আমি নাম ধরে বলতে পারব? যে ইনপুটের নাম বলতে পারি না, সেটি বিশ্লেষণে থাকবে না।
