-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathtrain_model.py
More file actions
38 lines (29 loc) · 1.24 KB
/
Copy pathtrain_model.py
File metadata and controls
38 lines (29 loc) · 1.24 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
# train_model.py
# Run: python train_model.py
import pandas as pd
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import LabelEncoder
import joblib
df = pd.read_csv('career_data.csv')
# encode academic_level (10th->0, 12th->1)
df['academic_level_flag'] = df['academic_level'].map({'10th':0,'12th':1})
# encode top_interest with LabelEncoder
le_interest = LabelEncoder()
df['top_interest_enc'] = le_interest.fit_transform(df['top_interest'])
# target career encode
le_target = LabelEncoder()
df['target_enc'] = le_target.fit_transform(df['target_career'])
features = ['percentage','academic_level_flag','num_selected_interests','quiz_average','top_interest_enc']
X = df[features]
y = df['target_enc']
X_train, X_test, y_train, y_test = train_test_split(X,y,test_size=0.2,random_state=42)
clf = RandomForestClassifier(n_estimators=200, random_state=42)
clf.fit(X_train, y_train)
print("Train accuracy:", clf.score(X_train, y_train))
print("Test accuracy:", clf.score(X_test, y_test))
# save model and encoders
joblib.dump(clf, 'career_model.pkl')
joblib.dump(le_interest, 'le_interest.pkl')
joblib.dump(le_target, 'le_target.pkl')
print("Saved career_model.pkl and encoders")