Python 机器学习 scikit-learn 怎么用?Pipeline 是什么?
sklearn 统一 API:estimator.fit(X, y) / predict(X) / score;数据划分 train_test_split;预处理 StandardScaler/MinMaxScaler/OneHotEncoder;模型:LinearRegression、RandomForestClassifier、SVC、KMeans;评估:cross_val_score、classification_report、confusion_matrix;超参:GridSearchCV/RandomizedSearchCV。Pipeline:把预处理+模型串联成一条流水线——pipeline = Pipeline([('scaler', StandardScaler()), ('clf', SVC())]),fit/predict 自动按序执行,避免数据泄漏(交叉验证时预处理只在训练折上拟合)。
一起交流
分享经验,让问题更进一步
讨论,从你的观点开始
还没有回复,欢迎补充经验或分享不同的思路。