# BostonHousePrice **Repository Path**: dutcbv/boston ## Basic Information - **Project Name**: BostonHousePrice - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2025-09-17 - **Last Updated**: 2025-09-18 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 安装 ```powershell conda install pandas numpy scikit-learn matplotlib seaborn xgboost jupyter -y ``` # 要点 ## 数据集划分 步骤1: 准备数据 X = 特征矩阵 (房间数、犯罪率等) y = 目标变量 (房价) 想象四个象限 - 第二个象限最大,为X_train-绿色 - 第一象限为y_train-绿色 上半平面为训练集_train,model.fit(X_train, y_train) 下半平面为测试评估集 - 第三象限为X_test-橙色(仅在测试阶段使用,y_pred = model.predict(X_test)) - 第四象限为y_test-红色-不能接触(考题答案,仅最后评估性能 y_test VS y_pred),否则就是数据泄露了 步骤2: 分割数据 train_test_split -> X_train, X_test, y_train, y_test 步骤3: 训练模型 X = 特征矩阵 (房间数、犯罪率等) y = 目标变量 (房价) model.fit(X_train, y_train) # 学习阶段,全部用_train 步骤4: 预测测试 y_pred = model.predict(X_test) # 预测阶段,全部用_test 步骤5: 评估性能 评估 y_test(真实值) vs y_pred(预测值) # 比较真实值和预测值 ## 归一化or标准化操作(针对特征) 针对距离类的算法,比如svm,必须做归一化 ```python X_train_scaled = sc.fit_transform(X_train) # 计算后转换 X_test_scaled = sc.transform(X_test) # 转换 ``` 不同模型使用不同版本 线性回归、随机森林、XGBoost → 使用原始划分的 X_train, X_test SVM → 使用 X_train_scaled, X_test_scaled