Pipeline ngăn leakage khi scale
Biến khái niệm data leakage thành một so sánh có số liệu.
Tiến độ của tôi ở bài này
Điểm được lưu vào tài khoản sau khi chấm bài.
Đang tải điểm của bạn…
Kiến thức và chủ đề
Kiến thức tiên quyết: StandardScaler train-only, logistic pipeline, holdout.
Nội dung đề bài
Mục tiêu kiến thức
Biến khái niệm data leakage thành một so sánh có số liệu.
Mô tả bài toán
Đây là bài số 377 trong tầng Đánh giá và chọn model. Bài dùng thư viện Pipeline + StandardScaler + LogisticRegression trên dữ liệu nhỏ, cố định và chạy CPU; mục tiêu là hiểu workflow chứ không bắt học viên tự viết lại thư viện.
Yêu cầu
Báo mean của scaler an toàn fit train và scaler leaky fit gộp train/test, cùng accuracy của hai workflow.
def compare_leaky_and_safe_pipeline(X_train, y_train, X_test, y_test):Input
Train/test classification có thể khác phân phối.
Output
Dictionary safe_train_mean, leaky_train_mean, safe_accuracy, leaky_accuracy.
Ràng buộc
Workflow safe phải là Pipeline fit trên train; workflow leaky chỉ để minh họa lỗi, không phải pattern triển khai.
Ví dụ
Giải thích
Test outlier 100 không được làm mean safe của train [-2,-1,1,2] đổi khỏi 0.
Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.
Góp ý & báo lỗi bài tập
Đề bài chưa rõ, test có vấn đề hay bạn có ý tưởng giúp bài tốt hơn? Gửi cho đội ngũ AI Empire nhé — mỗi góp ý đều được đọc.
