Đếm nhãn dương và âm
Đếm số nhãn 1 và số nhãn 0.

Hiểu thấu đáo bản chất toán học đằng sau các thuật toán học máy kinh điển bằng cách tự lập trình forward, loss và gradient từ đầu không dựa dẫm vào thư viện đen.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Nghiệm giải tích Normal Equation và nghiệm xấp xỉ bằng Gradient Descent.
Hàm kích hoạt Sigmoid, Binary Cross-Entropy Loss và tối ưu hóa trọng số.
Tính chỉ số Gini Impurity, Entropy và tìm điểm chia nhánh tối ưu.
Khởi tạo trọng tâm, gán cụm khoảng cách Euclidean và cập nhật tâm cụm lặp.
Tính ma trận hiệp phương sai, tìm vector riêng và trực giao hóa không gian.
Quên thêm cột hệ số tự do (bias column) gồm toàn số 1 vào ma trận đặc trưng X.
Hiện tượng bùng nổ gradient do không chuẩn hóa thang đo (feature scaling) trước khi chạy Gradient Descent.
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Nhập xuất, biến, rẽ nhánh và các bước suy luận đơn giản.
Đếm số nhãn 1 và số nhãn 0.
Tính tỉ lệ nhãn 1 trên tổng số nhãn.
Tính giá trị trung bình của các đặc trưng.
Tìm giá trị nhỏ nhất trong dãy đặc trưng.
Tìm giá trị lớn nhất trong dãy đặc trưng.
Tính khoảng biến thiên bằng giá trị lớn nhất trừ giá trị nhỏ nhất.
Tính sai số tuyệt đối giữa giá trị thật và giá trị dự đoán.
Phân loại một điểm thành 0 hoặc 1 bằng cách so sánh với ngưỡng.
Tính tỉ lệ dự đoán đúng trên tổng số dự đoán.
Tính precision: trong các dự đoán dương, có bao nhiêu dự đoán đúng.
Tính recall: trong các mẫu dương thật, mô hình tìm đúng được bao nhiêu mẫu.
Tính specificity: trong các mẫu âm thật, mô hình nhận đúng được bao nhiêu mẫu.
Tính F1 từ precision và recall bằng trung bình điều hòa.
Tính MAE bằng trung bình của các sai số tuyệt đối.
Tính MSE bằng trung bình của bình phương sai số.
Tính RMSE bằng căn bậc hai của MSE.
Tính dự đoán tuyến tính theo công thức y = w nhân x cộng b.
Chia dãy dữ liệu thành phần train và test theo tỉ lệ được cho.
Tính độ lệch trung bình giữa dự đoán và giá trị thật.
Vòng lặp, mảng một chiều, chuỗi và hàm ở mức cơ bản.
Đếm số vị trí mà hai dãy dự đoán có cùng nhãn.
Số phần tử khác 0 quyết định chi phí lưu trữ và tính toán của vector thưa. Trong biểu diễn one-hot hoặc bag-of-words, phần lớn thành phần bằng 0 nên định dạng thưa tiết kiệm rất nh…
Tổng có trọng số chính là phép tính của một nơ-ron tuyến tính: đầu vào nhân với trọng số rồi cộng lại. Đây là đơn vị tính nhỏ nhất của mọi mạng nơ-ron.
One-hot mã hoá lớp thành vector chỉ có một phần tử 1. Khi mô hình trả về vector như vậy, bước cuối là tìm vị trí của phần tử 1 để biết lớp dự đoán.
Ngưỡng quyết định quyết định bao nhiêu mẫu bị xếp vào lớp dương. Hạ ngưỡng làm tăng số dự đoán dương, đổi lại tăng dương tính giả — đây là đánh đổi precision/recall quen thuộc.
Accuracy đếm cả hai loại dự đoán đúng: dương tính thật và âm tính thật. Vì nó gộp cả bốn ô, accuracy gây hiểu nhầm khi dữ liệu mất cân bằng.
One-hot mã hoá lớp rời rạc thành vector chỉ có một phần tử 1. Cách này loại bỏ quan hệ thứ tự giả tạo giữa các lớp mà mã hoá bằng số nguyên mắc phải.
Trung vị là chỉ số trung tâm ít bị ảnh hưởng bởi giá trị ngoại lai hơn trung bình cộng, nên rất hay dùng khi khảo sát phân bố của một feature trước khi huấn luyện.
FPR đo tỉ lệ mẫu âm bị mô hình báo nhầm là dương. Cùng với recall, nó tạo nên đường ROC nên là chỉ số bắt buộc khi chọn ngưỡng phân loại.
Sau khi mô hình dự đoán trên dữ liệu đã chuẩn hoá, ta phải đưa kết quả về đơn vị gốc mới diễn giải được. Công thức nghịch đảo của min-max chỉ là một phép nhân cộng.
Kẹp giá trị là bước tiền xử lý chuẩn để loại ngoại lai cực đoan hoặc chặn tràn số trước khi đưa dữ liệu vào mô hình. Nó giữ lại thông tin thay vì xoá cả điểm dữ liệu.
Đếm giá trị 0 giúp nhận biết feature thưa hoặc dữ liệu bị điền khuyết bằng 0. Đây là kiểm tra đầu tiên trước khi quyết định có nên giữ feature hay không.
Số bước cập nhật trong một epoch bằng số batch. Batch cuối thường lẻ nên phải làm tròn lên, nếu không mô hình sẽ bỏ sót một phần dữ liệu.
Tỷ lệ lỗi là phần bù của độ chính xác. Nhiều tài liệu báo cáo lỗi thay vì độ chính xác vì con số nhỏ dễ so sánh giữa các mô hình.
Với mô hình tuyến tính, quy tắc dự đoán nhị phân đơn giản nhất là lấy dấu của điểm số: dương thành lớp 1, còn lại thành lớp 0. Điểm đúng bằng 0 nằm trên ranh giới nên theo quy ước…
Chia train/test theo tỉ lệ phần trăm luôn để lại phần dư, và quy ước là làm tròn xuống để không bao giờ vượt quá số mẫu hiện có. Phần dư thuộc về tập test.
Trong Tiền xử lý dữ liệu (Data Preprocessing) của Học máy (Machine Learning), các thuật toán dựa trên khoảng cách (như KNN, SVM, K-Means) hoặc Gradient Descent (như Hồi quy, Neural…
Trong các bài toán Học có giám sát dạng Hồi quy (Regression), hàm mất mát Bình phương Trung bình (Mean Squared Error - MSE Loss) là hàm mục tiêu phổ biến nhất để định lượng sai lệc…
Bài tổng hợp nhẹ, sẵn sàng bước sang mức trung bình.
Phương sai đo mức độ phân tán của một feature quanh trung bình. Nó là nền tảng của chuẩn hoá, kiểm tra phương sai và phân tích thành phần chính.
Độ lệch chuẩn là căn bậc hai của phương sai, nên nó cùng đơn vị với dữ liệu gốc. Nhờ vậy nó dễ diễn giải hơn khi báo cáo mức phân tán của một feature.
Chuẩn hoá z đưa một feature về trung bình 0 và độ lệch chuẩn 1, giúp nhiều thuật toán học máy hội tụ nhanh và không bị chi phối bởi đơn vị đo.
Bốn ô của ma trận nhầm lẫn là nền tảng của mọi chỉ số phân loại: accuracy, precision, recall, F1 đều được suy ra từ chúng. Đếm đúng bốn ô là bước đầu tiên khi đánh giá mô hình.
Chia cho giá trị tuyệt đối lớn nhất đưa feature về đoạn [-1, 1] mà không dịch chuyển gốc toạ độ. Cách này giữ nguyên dấu và vị trí của 0, khác với min-max scaling.
MAPE đo sai số tương đối nên so sánh được giữa các chuỗi có đơn vị khác nhau. Đổi lại, nó không dùng được khi giá trị thật bằng 0.
Trung bình trượt làm mượt chuỗi thời gian bằng cách lấy trung bình một cửa sổ trượt. Đây là bộ lọc đơn giản nhất để giảm nhiễu trong tín hiệu cảm biến và trong theo dõi đường cong…
Biết đọc schema của một DataFrame trước khi đưa dữ liệu vào mô hình.
Tách dữ liệu đầu vào X và nhãn y mà không làm mất thứ tự cột hay index.
Khi dữ liệu mất cân bằng, accuracy thường gây ảo giác tốt vì mô hình chỉ cần đoán lớp đa số. Balanced accuracy lấy trung bình của recall và specificity nên đánh giá công bằng cho c…
Hiệp phương sai cho biết hai feature biến thiên cùng chiều hay ngược chiều. Ma trận hiệp phương sai là đầu vào của PCA và phân tích thành phần độc lập.
R2 cho biết mô hình giải thích được bao nhiêu phần phương sai của dữ liệu thật. Giá trị 1 là hoàn hảo, 0 là chỉ ngang dự đoán bằng trung bình, và âm nghĩa là mô hình còn tệ hơn cả…
Hiểu fit encoder một lần trên train và xử lý category lạ mà không làm vỡ pipeline.
Hiểu vì sao classification cần chia train/test giữ tỷ lệ nhãn.
Phân biệt fit trên train với transform trên test để tránh data leakage.
Đưa feature về thang đo theo min/max của train và nhận ra test có thể nằm ngoài [0, 1].
Biết chia dữ liệu bằng API chuẩn và khóa random_state để kết quả có thể tái lập.
Biết fit bộ điền thiếu trên train rồi chỉ transform dữ liệu mới.
Dùng một kỹ thuật quen thuộc: sắp xếp, tìm kiếm, đếm, ngăn xếp.
Nhiều kỹ sư mới thường chuẩn hóa toàn bộ tập dữ liệu trước khi chia train/test, hoặc gọi scaler.fit_transform(X_test). Điều này tạo ra kết quả kiểm thử ảo tưởng rất cao trong phòng…
Khi số lượng đặc trưng D > 100,000 hoặc tập dữ liệu có hàng triệu mẫu, phép nghịch đảo ma trận OLS O(D3) trở nên bất khả thi về mặt tính toán. Lúc này, Gradient Descent…
Trong các bài toán mất cân bằng nhãn (ví dụ 99% ca âm tính), chỉ số Accuracy có thể đạt 99% dù mô hình hoàn toàn không phát hiện được ca dương tính nào. Việc tính toán đồng thời cả…
Trong hệ thống cảnh báo xâm nhập mạng, nếu dùng ngưỡng 0.5, mô hình có thể bỏ lọt các vụ tấn công nghiêm trọng vì xác suất dự đoán chỉ đạt 0.35. Bằng cách hạ ngưỡng xuống 0.30, ta…
Dữ liệu người dùng thu thập từ ứng dụng thực tế luôn chứa lỗi: trùng lặp mã định danh, thiếu tuổi, sai định dạng ngày tháng. Một pipeline dữ liệu không chuẩn mực làm rò rỉ dữ liệu…
Trong kinh tế lượng và khoa học dữ liệu, Ordinary Least Squares (OLS) là phương pháp hồi quy cơ bản nhất. Việc hiểu cách giải hệ phương trình chuẩn tắc từ gốc giúp kỹ sư nắm rõ bản…
Trong phân loại nhị phân (spam/non-spam, gian lận/hợp lệ), hồi quy Logistic là giải pháp đường cơ sở (baseline) mạnh mẽ và có tính diễn giải cao. Kỹ sư AI cần cài đặt chính xác để…
K-Means là thuật toán phân nhóm khách hàng, nén ảnh và phân đoạn dữ liệu phổ biến nhất. Hiểu cơ chế hội tụ của nó giúp kỹ sư chọn số cụm K tối ưu (Elbow Method).
Trong các bài toán xử lý ảnh, gene di truyền hoặc vector embedding 1536 chiều, chiều dữ liệu quá lớn gây ra hiện tượng "Lời nguyền số chiều" (Curse of Dimensionality). PCA là phươn…
Biết tạo baseline để không đánh giá model phức tạp trong khoảng không.
Chọn đúng metric và hiểu MAE, MSE, RMSE, R2 đo những góc khác nhau.
Phân biệt nhãn dự đoán với xác suất để hiểu model confidence.
Biết đọc đúng hàng thật/cột dự đoán và normalize theo hàng.
Mở rộng baseline tuyến tính từ một feature sang nhiều feature mà vẫn giữ đúng shape.
Trong các dự án AI thực tế, mã nguồn tiền xử lý thường bị phân tán rời rạc, dẫn đến nguy cơ rò rỉ dữ liệu khi triển khai phục vụ (serving). Đóng gói thành Pipeline chuẩn mực là yêu…
Hiểu prediction nhị phân là một decision rule trên probability và threshold không luôn là 0.5.
Hiểu ROC-AUC đánh giá ranking của probability qua mọi threshold.
Đánh giá ranking theo precision-recall phù hợp hơn khi positive hiếm.
Phân biệt encoding target với one-hot feature và biết giải mã ngược.
Phối hợp hai kỹ thuật trong cùng một lời giải.
Tạo cổng kiểm tra input trước khi gọi model để lỗi dữ liệu hiện ra sớm.
Biết đọc residual để nhìn bias và lỗi theo từng mẫu, không chỉ một con số.
Hiểu KNN k=1 dựa trực tiếp vào mẫu train gần nhất.
Có một mốc đơn giản để biết model thật có học được gì hay chưa.
Đọc được coef/intercept và dùng model đã fit để dự đoán mẫu mới.
Huấn luyện classifier đầu tiên bằng thư viện và dùng nó để dự đoán nhãn mới.
Đọc precision/recall/F1 đúng ngữ cảnh thay vì chỉ nhìn accuracy.
Hiểu KNN k=3 khác k=1 ở việc bỏ phiếu trên nhiều láng giềng.
Làm quen với một classifier thư viện khác logistic và đọc posterior probability.
Biết random_state và n_init ảnh hưởng khả năng tái lập của clustering.
Đóng gói scaling và regularization vào cùng pipeline để train/inference nhất quán.
Dùng khoảng cách train/test để nhận ra cây quá sâu có thể overfit.
Dùng một model cây thật và đọc feature_importances thay vì chỉ nhìn prediction.
Đóng gói preprocessing và classifier để cùng một logic chạy ở train lẫn inference.
Dùng cây phân loại và đọc feature importance để hiểu model non-linear.
Hiểu PCA fit hướng chính của dữ liệu rồi transform sang không gian ít chiều hơn.
Kiểm tra trực tiếp StratifiedKFold có giữ tỷ lệ lớp ở từng validation fold hay không.
Ghép các transformer thành schema feature ổn định cho dữ liệu mixed.
Gộp nhiều bước preprocessing thành một object có thể tái sử dụng.
Bài dài hơn, cần chọn đúng cấu trúc dữ liệu.
Nhìn thấy regularization làm co nhỏ hệ số và biết alpha là hyperparameter.
Hiểu L1 regularization có thể đẩy hệ số về 0 và dùng đó để chọn feature.
Thấy feature expansion giúp linear model biểu diễn đường cong mà vẫn giữ workflow pipeline.
Đánh giá regression trên nhiều split thay vì tin một lần chia duy nhất.
Mở rộng logistic từ hai lớp sang nhiều lớp và đọc ma trận xác suất.
Thấy threshold làm precision và recall đổi qua lại, rồi chọn threshold theo F1.
Thấy class_weight balanced tác động đến lớp hiếm và recall.
Thấy khoảng cách KNN bị feature có đơn vị lớn chi phối nếu không scale.
Quan sát độ sâu model làm thay đổi train accuracy và test accuracy.
Chuyển từ supervised sang unsupervised: KMeans học centroid và gán điểm mới vào cụm.
Biến khái niệm data leakage thành một so sánh có số liệu.
Chọn hyperparameter k bằng validation thay vì nhìn accuracy trên train.
Đo một classifier bằng nhiều metric trên cùng các fold.
Dùng GridSearchCV để chọn hyperparameter mà không rò rỉ validation vào train.
Thực hiện tuning KNN đúng pipeline, đặc biệt scale phải nằm trong từng fold.
Chọn decision threshold trên validation mà không nhìn test.
Kết thúc ML tabular bằng quy trình train → validation chọn → refit → test một lần.
Tập chọn model bằng metric trên holdout thay vì chọn theo cảm giác hoặc lỗi train.
Trong mạng nơ-ron hiện đại, mô hình thường quá tự tin (overconfident): một dự đoán với độ tin cậy 90\% chỉ có độ chính xác thực tế 60\%.
Khi huấn luyện mô hình phát hiện gian lận hoặc chẩn đoán y tế, số ca gian lận chỉ chiếm 1% dữ liệu. Nếu chia ngẫu nhiên thông thường, tập test có thể hoàn toàn không chứa ca gian l…
Cây quyết định (Decision Tree / Random Forest) là xương sống của các giải pháp tabular data hàng đầu (như XGBoost, LightGBM). Trọng tâm của việc xây dựng cây là thuật toán tham lam…
Hầu hết các bài toán thị giác máy tính và phân loại tài liệu đều có ≥ 3 lớp nhãn. Hồi quy Softmax là tầng tuyến tính cuối cùng (linear classification head) của hầu hết các mô hìn…