{% extends 'base.html' %} {% block content %}
Review performance benchmarks across 6 machine learning models trained on graduate data.
Baseline model used for linear comparison.
Core ensemble model for risk calculations.
Effective in high-dimensional vector spaces.
Extreme Gradient Boosting for optimized speed.
Lightweight tree-based framework for scale.
Native categorical feature handling specialist.
Tree-based boosting structures like XGBoost, LightGBM, and CatBoost alongside Random Forest generally handle demographic and skill-gap survey properties significantly better than classic distance classifiers, reducing overfitting risk on medium-scale datasets.
| Predicted Employed (0) | Predicted Unemployed (1) | |
|---|---|---|
| Actual Employed (0) | 39 | 8 |
| Actual Unemployed (1) | 11 | 7 |
এটি নির্দেশ করে যে মডেলটি মোট ৪৬টি টেস্ট ডেটার মধ্যে ৩৯টি নিশ্চিত কর্মসংস্থান এবং ৭টি বেকারত্বের ঘটনা নিখুঁতভাবে সনাক্ত করতে পেরেছে।
১. Logistic Regression: এটি একটি লিনিয়ার মডেল যা সিগময়েড ফাংশন ব্যবহার করে চাকরি পাওয়ার সম্ভাবনা (Probability) ০ থেকে ১ এর মধ্যে হিসাব করে। এটি আমাদের বেসলাইন মডেল।
২. Random Forest: এটি অনেকগুলো 'Decision Tree' তৈরি করে এবং মেজরিটি ভোটের ভিত্তিতে ফাইনাল রেজাল্ট দেয়। ডেটা ছোট হলেও এটি সহজে ওভারফিট করে না।
৩. Support Vector Machine (SVM): এটি ডেটা পয়েন্টগুলোর মধ্যে একটি সর্বোচ্চ দূরত্বের হাইপারপ্লেন (Hyperplane) তৈরি করে ক্লাসিফাই করে।
৪. XGBoost: এটি ক্রমান্বয়ে আগের গাছের ভুলগুলো সংশোধন করে (Gradient Boosting) অত্যন্ত দ্রুত ও নিখুঁত প্রেডিকশন দেয়।
৫. LightGBM: এটি লিফ-ওয়াইজ (Leaf-wise) ট্রি গ্রোথ অ্যালগরিদম ব্যবহার করে, যা অত্যন্ত মেমরি-এফিশিয়েন্ট এবং দ্রুত কাজ করে।
৬. CatBoost: এটি আপনার ডেটার টেক্সট বা ক্যাটাগরিকাল ফিচারগুলোকে কোনো প্রি-প্রসেসিং ছাড়াই সরাসরি নিজস্ব এনকোডিং টেকনিকে সবচেয়ে নিখুঁতভাবে প্রসেস করতে পারে।
class_weight='balanced' প্যারামিটার ব্যবহার করেছি, যা ছোট ক্লাসটিকে পেনাল্টি ওয়েট দিয়ে মডেলে সমান গুরুত্ব নিশ্চিত করেছে।
GridSearchCV বা Optuna ব্যবহার করে হাইপারপ্যারামিটার টিউনিং অপ্টিমাইজ করে।