Xây dựng scikit-learn Pipeline Khép kín Chống Rò rỉ Dữ liệu
Trong các dự án AI thực tế, mã nguồn tiền xử lý thường bị phân tán rời rạc, dẫn đến nguy cơ rò rỉ dữ liệu khi triển khai phục vụ (serving). Đóng gói thành Pipeline chuẩn mực là yêu…
Tiến độ của tôi ở bài này
Điểm được lưu vào tài khoản sau khi chấm bài.
Đang tải điểm của bạn…
Kiến thức và chủ đề
Kiến thức tiên quyết: pandas-data-cleaning-pipeline, data-leakage-detector-scaler.
Nội dung đề bài
Mục tiêu kiến thức
- Sử dụng
ColumnTransformerđể xử lý song song các đặc trưng số (StandardScaler) và đặc trưng phân loại (OneHotEncoder). - Đóng gói toàn bộ quá trình biến đổi và mô hình ước lượng (
LogisticRegression) vào một đối tượngPipelineduy nhất. - Đảm bảo tính khép kín: Tập Test chỉ được gọi
predict(), tuyệt đối không tham gia vào quá trìnhfit.
Mô tả bài toán
Trong các dự án AI thực tế, mã nguồn tiền xử lý thường bị phân tán rời rạc, dẫn đến nguy cơ rò rỉ dữ liệu khi triển khai phục vụ (serving). Đóng gói thành Pipeline chuẩn mực là yêu cầu bắt buộc của kỹ sư MLOps.
Yêu cầu
Viết hàm build_and_evaluate_pipeline(df_train: pd.DataFrame, df_test: pd.DataFrame, num_cols: list[str], cat_cols: list[str], target_col: str) -> dict[str, Any]:
- Tạo một
ColumnTransformer: - Nhánh số: áp dụng
StandardScalertrên các cộtnum_cols. - Nhánh phân loại: áp dụng
OneHotEncoder(handle_unknown='ignore', sparse_output=False)trên các cộtcat_cols. - Tạo một
Pipeline: - Bước 1:
"preprocessor"làColumnTransformerở trên. - Bước 2:
"classifier"làLogisticRegression(random_state=42). - Tách đặc trưng X và nhãn y từ
df_trainvàdf_test. - Gọi
pipeline.fit(X_train, y_train)chỉ trên tập train. - Tính độ chính xác
train_accuracytrên tập train vàtest_accuracytrên tập test. - Trả về dictionary:
{"pipeline": pipeline, "train_accuracy": float, "test_accuracy": float}.
import pandas as pd
from typing import Any
def build_and_evaluate_pipeline(df_train: pd.DataFrame, df_test: pd.DataFrame, num_cols: list[str], cat_cols: list[str], target_col: str) -> dict[str, Any]:
passInput
- Hàm
build_and_evaluate_pipeline(df_train,df_test,num_cols,cat_cols,target_col): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng.
Output
- Hàm
build_and_evaluate_pipeline: Trả về kết quả kiểudict[str, Any]theo đúng đặc tả kỹ thuật và kích thước quy định.
Ràng buộc
- Thời gian chạy tối đa: 3000ms.
- Giới hạn bộ nhớ: 512MB.
- Dữ liệu đầu vào hợp lệ theo đúng kiểu dữ liệu và miền giá trị được mô tả.
Ví dụ 1
Input
train_df = pd.DataFrame({'income': [1000.0, 2000.0, 5000.0, 6000.0], 'tier': ['low', 'low', 'high', 'high'], 'label': [0, 0, 1, 1]})
test_df = pd.DataFrame({'income': [1500.0, 5500.0], 'tier': ['low', 'high'], 'label': [0, 1]})
res = build_and_evaluate_pipeline(train_df, test_df, num_cols=['income'], cat_cols=['tier'], target_col='label')Output
{
'pipeline': Pipeline(steps=[('preprocessor',
ColumnTransformer(transformers=[('num', StandardScaler(),
['income']),
('cat',
... (truncated),
'train_accuracy': 1,
'test_accuracy': 1
}Giải thích
Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.
Ví dụ 2
Input
train_df = pd.DataFrame({'val': [1.0, 2.0, 3.0], 'cat': ['A', 'B', 'A'], 'target': [0, 1, 0]})
test_df = pd.DataFrame({'val': [1.5], 'cat': ['UNKNOWN_CATEGORY'], 'target': [0]})
res = build_and_evaluate_pipeline(train_df, test_df, ['val'], ['cat'], 'target')Output
{
'pipeline': Pipeline(steps=[('preprocessor',
ColumnTransformer(transformers=[('num', StandardScaler(),
['val']),
('cat',
... (truncated),
'train_accuracy': 0.666667,
'test_accuracy': 1
}Giải thích
Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.
Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.
Góp ý & báo lỗi bài tập
Đề bài chưa rõ, test có vấn đề hay bạn có ý tưởng giúp bài tốt hơn? Gửi cho đội ngũ AI Empire nhé — mỗi góp ý đều được đọc.
