{% extends 'base.html' %} {% block content %}

Model Evaluation Dashboard

Review performance benchmarks across 6 machine learning models trained on graduate data.

Reliable Metrics

Model Performance Analysis

Logistic Regression

Baseline model used for linear comparison.

Accuracy: {{ data.lr_acc }}%
Precision: {{ data.lr_precision }}%
Recall: {{ data.lr_recall }}%
F1-Score: {{ data.lr_f1 }}%
Random Forest

Core ensemble model for risk calculations.

Accuracy: {{ data.rf_acc }}%
Precision: {{ data.rf_precision }}%
Recall: {{ data.rf_recall }}%
F1-Score: {{ data.rf_f1 }}%
Support Vector Machine

Effective in high-dimensional vector spaces.

Accuracy: {{ data.svm_acc }}%
Precision: {{ data.svm_precision }}%
Recall: {{ data.svm_recall }}%
F1-Score: {{ data.svm_f1 }}%
XGBoost

Extreme Gradient Boosting for optimized speed.

Accuracy: {{ data.xgb_acc }}%
Precision: {{ data.xgb_precision }}%
Recall: {{ data.xgb_recall }}%
F1-Score: {{ data.xgb_f1 }}%
LightGBM

Lightweight tree-based framework for scale.

Accuracy: {{ data.lgb_acc }}%
Precision: {{ data.lgb_precision }}%
Recall: {{ data.lgb_recall }}%
F1-Score: {{ data.lgb_f1 }}%
CatBoost

Native categorical feature handling specialist.

Accuracy: {{ data.cat_acc }}%
Precision: {{ data.cat_precision }}%
Recall: {{ data.cat_recall }}%
F1-Score: {{ data.cat_f1 }}%
Key Takeaway

Tree-based boosting structures like XGBoost, LightGBM, and CatBoost alongside Random Forest generally handle demographic and skill-gap survey properties significantly better than classic distance classifiers, reducing overfitting risk on medium-scale datasets.

Prediction Deep Dive (Confusion Matrix)

Confusion Matrix Matrix Table
Predicted Employed (0) Predicted Unemployed (1)
Actual Employed (0) 39 8
Actual Unemployed (1) 11 7

এটি নির্দেশ করে যে মডেলটি মোট ৪৬টি টেস্ট ডেটার মধ্যে ৩৯টি নিশ্চিত কর্মসংস্থান এবং ৭টি বেকারত্বের ঘটনা নিখুঁতভাবে সনাক্ত করতে পেরেছে।

How do these 6 Models Work?

১. Logistic Regression: এটি একটি লিনিয়ার মডেল যা সিগময়েড ফাংশন ব্যবহার করে চাকরি পাওয়ার সম্ভাবনা (Probability) ০ থেকে ১ এর মধ্যে হিসাব করে। এটি আমাদের বেসলাইন মডেল।

২. Random Forest: এটি অনেকগুলো 'Decision Tree' তৈরি করে এবং মেজরিটি ভোটের ভিত্তিতে ফাইনাল রেজাল্ট দেয়। ডেটা ছোট হলেও এটি সহজে ওভারফিট করে না।

৩. Support Vector Machine (SVM): এটি ডেটা পয়েন্টগুলোর মধ্যে একটি সর্বোচ্চ দূরত্বের হাইপারপ্লেন (Hyperplane) তৈরি করে ক্লাসিফাই করে।

৪. XGBoost: এটি ক্রমান্বয়ে আগের গাছের ভুলগুলো সংশোধন করে (Gradient Boosting) অত্যন্ত দ্রুত ও নিখুঁত প্রেডিকশন দেয়।

৫. LightGBM: এটি লিফ-ওয়াইজ (Leaf-wise) ট্রি গ্রোথ অ্যালগরিদম ব্যবহার করে, যা অত্যন্ত মেমরি-এফিশিয়েন্ট এবং দ্রুত কাজ করে।

৬. CatBoost: এটি আপনার ডেটার টেক্সট বা ক্যাটাগরিকাল ফিচারগুলোকে কোনো প্রি-প্রসেসিং ছাড়াই সরাসরি নিজস্ব এনকোডিং টেকনিকে সবচেয়ে নিখুঁতভাবে প্রসেস করতে পারে।

Thesis Defense FAQ (Expected Viva Questions)

জ্বী স্যার, হিউম্যান সার্ভে বা সোশ্যাল ফ্যাক্টর ভিত্তিক ডেটাসেটে মানুষের আচরণের ভিন্নতা বা নয়েজ বেশি থাকে। তাছাড়া ডেটার আকার ছোট হওয়ায় ৭০% এর বেশি অ্যাকুরেসি জোর করে আনলে মডেল "Overfitting" (মুখস্থ করা) এর শিকার হতো, যা বাস্তব ক্ষেত্রে ভুল রেজাল্ট দিতো। এটি একটি অত্যন্ত বাস্তবসম্মত ও বায়াস-মুক্ত রেজাল্ট।

আমাদের ডেটাসেটে কর্মসংস্থান (Employed/Part-time) এবং বেকারত্ব (Unemployed)-এর অনুপাত প্রায় ২:১। এই হালকা ইমব্যালেন্স দূর করার জন্য আমরা কোডে class_weight='balanced' প্যারামিটার ব্যবহার করেছি, যা ছোট ক্লাসটিকে পেনাল্টি ওয়েট দিয়ে মডেলে সমান গুরুত্ব নিশ্চিত করেছে।

১. বাংলাদেশের বিভিন্ন অঞ্চলের আরও বেশি গ্র্যাজুয়েটদের ডেটা সংগ্রহ করে (কমপক্ষে ১,০০০+)।
২. GridSearchCV বা Optuna ব্যবহার করে হাইপারপ্যারামিটার টিউনিং অপ্টিমাইজ করে।
৩. কৃত্রিম ডেটা তৈরির জন্য SMOTE অ্যালগরিদম ব্যবহার করে ক্লাসের অনুপাত শতভাগ সমান করার মাধ্যমে।

কারণ এটি শুধু সরাসরি প্রেডিকশন দেয় না। এটি কয়েকটি ধাপে কাজ করে: প্রথম ধাপে ডেটা প্রসেস ও এনকোড হয়, দ্বিতীয় ধাপে ৬টি ভিন্ন মডেলের পারফরম্যান্স তুলনা করে সেরাটি বেছে নেওয়া হয়, তৃতীয় ধাপে XAI (Feature Importance/SHAP) ব্যবহার করে বেকারত্বের পেছনের মূল কারণ চিহ্নিত করা হয় এবং চতুর্থ ধাপে সেই কারণের ওপর ভিত্তি করে ডাইনামিক স্কিল আপগ্রেডিং পাথ রেকমেন্ড করা হয়।
{% endblock %}