Tự động Căn chỉnh Chỉ số & Đối soát Số liệu Đa nguồn
Trong hệ thống tài chính và kế toán doanh nghiệp, số liệu báo cáo thường được xuất từ hai nguồn độc lập: Sổ cái chính (primary_df) và Hệ thống đối soát ngân hàng/đối tác (secondary…

Làm chủ thư viện xử lý dữ liệu số 1 trong Data Science và Machine Learning: làm sạch dữ liệu nhiễu, biến đổi bảng, pivot và thống kê chỉ số kinh doanh.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Đọc dữ liệu CSV/JSON, kiểm tra cấu trúc info(), describe() và chọn cột.
Sử dụng .loc[], .iloc[] và các điều kiện lọc logic đa biến.
Phát hiện và xử lý giá trị NaN (dropna, fillna), khử trùng lặp và ép kiểu dữ liệu.
GroupBy nhiều cấp, kết hợp hàm tổng hợp agg(), transform() và pivot table.
Cảnh báo SettingWithCopyWarning do gán dữ liệu trên một lát cắt slice thay vì copy.
Quên kiểm tra giá trị null/khuyết thiếu trước khi thực hiện các phép tính toán thống kê.
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Trong hệ thống tài chính và kế toán doanh nghiệp, số liệu báo cáo thường được xuất từ hai nguồn độc lập: Sổ cái chính (primary_df) và Hệ thống đối soát ngân hàng/đối tác (secondary…
Dùng một kỹ thuật quen thuộc: sắp xếp, tìm kiếm, đếm, ngăn xếp.
Viết hàm build_sales_pivot(df: pd.DataFrame) -> pd.DataFrame:
Viết hàm extract_contact_info(df: pd.DataFrame, text_col: str) -> pd.DataFrame:
Viết hàm compute_partition_ranks(df: pd.DataFrame, group_col: str, order_col: str) -> pd.DataFrame:
Khi nạp các tệp CSV dung lượng lớn (hàng triệu bản ghi) vào bộ nhớ, pandas mặc định phân bổ int64 (8 bytes) cho số nguyên, float64 (8 bytes) cho số thực và object (con trỏ Python t…
Viết hàm compute_bollinger_and_ema(df: pd.DataFrame, window: int = 20, span: int = 12) -> pd.DataFrame:
Viết hàm melt_and_clean_quarterly_reports(df: pd.DataFrame) -> pd.DataFrame:
Phối hợp hai kỹ thuật trong cùng một lời giải.
Viết hàm resample_to_business_days(df: pd.DataFrame) -> pd.DataFrame:
Một tập đoàn bán lẻ quản lý dữ liệu bán hàng dưới dạng DataFrame với MultiIndex 3 tầng trên trục dòng (Rows): ['Region', 'StoreType', 'Date']. Bảng chứa hai cột số liệu: 'revenue'…
Trong hệ thống giám sát IoT công nghiệp, các cảm biến gửi dữ liệu đo đạc (nhiệt độ, áp suất, độ rung) định kỳ. Tuy nhiên, sự cố mất mạng có thể gây ra hiện tượng khuyết dữ liệu (Na…
Trong phân tích tăng trưởng (Cohort Analysis), hành vi người dùng thường được phân tích theo từng nhóm đăng ký hoặc phân khúc khách hàng (cohort_col). Để so sánh công bằng giữa các…
Trong hệ thống giao dịch thuật toán (Algorithmic Trading), các lệnh khớp thị trường diễn ra ở các mốc thời gian ngẫu nhiên. Để đưa vào mô hình dự báo giá hoặc quản trị rủi ro, dữ l…
Sc = nc · yc + m · ync + m
Viết hàm reconcile_transactions(ledger_a: pd.DataFrame, ledger_b: pd.DataFrame, key: str = "txn_id", amount_col: str = "amount", tolerance: float = 0.01) -> dict:
Trong các hệ thống Data Lakehouse hiện đại, dữ liệu thô (Raw Data) từ nhiều nguồn thứ ba gửi về thường chứa lỗi: thiếu trường, sai định dạng email/SĐT, số âm vô lý, hoặc trùng lặp…
Trong tài chính định lượng cao tần (High-Frequency Trading), các thay đổi trên sổ lệnh (Quotes: giá chào mua bid_price, giá chào bán ask_price) và các giao dịch thực tế (Trades: lệ…