AI Empire Academy
CHUYÊN ĐỀ AI THỰC CHIẾN

Bài tập Machine Learning thực chiến – Tự cài đặt thuật toán từ số 0

Hiểu thấu đáo bản chất toán học đằng sau các thuật toán học máy kinh điển bằng cách tự lập trình forward, loss và gradient từ đầu không dựa dẫm vào thư viện đen.

115

bài tập có chấm code

Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.

55

cơ bản

Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.

56

trung bình

Kết hợp nhiều bước suy luận để vận dụng kiến thức.

4

nâng cao

Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.

Lộ trình thực hành đề xuất

Bước 1

Linear Regression (Hồi quy tuyến tính)

Nghiệm giải tích Normal Equation và nghiệm xấp xỉ bằng Gradient Descent.

Bước 2

Logistic Regression (Phân loại nhị phân)

Hàm kích hoạt Sigmoid, Binary Cross-Entropy Loss và tối ưu hóa trọng số.

Bước 3

Cây quyết định (Decision Tree CART)

Tính chỉ số Gini Impurity, Entropy và tìm điểm chia nhánh tối ưu.

Bước 4

K-Means & Phân cụm

Khởi tạo trọng tâm, gán cụm khoảng cách Euclidean và cập nhật tâm cụm lặp.

Bước 5

PCA & Giảm chiều dữ liệu

Tính ma trận hiệp phương sai, tìm vector riêng và trực giao hóa không gian.

Lỗi thường gặp & Cách phòng tránh

•

Quên thêm cột hệ số tự do (bias column) gồm toàn số 1 vào ma trận đặc trưng X.

•

Hiện tượng bùng nổ gradient do không chuẩn hóa thang đo (feature scaling) trước khi chạy Gradient Descent.

Danh sách bài tập thực hành (115 bài)

Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.

Cơ bản 55 bài

Khởi động

Nhập xuất, biến, rẽ nhánh và các bước suy luận đơn giản.

ai-268Bước 11Cơ bản

Độ bao phủ Recall

Tính recall: trong các mẫu dương thật, mô hình tìm đúng được bao nhiêu mẫu.

ai-270Bước 13Cơ bản

Điểm F1

Tính F1 từ precision và recall bằng trung bình điều hòa.

ai-271Bước 14Cơ bản

Sai số MAE

Tính MAE bằng trung bình của các sai số tuyệt đối.

ai-272Bước 15Cơ bản

Sai số MSE

Tính MSE bằng trung bình của bình phương sai số.

Làm quen

Vòng lặp, mảng một chiều, chuỗi và hàm ở mức cơ bản.

ai-301Bước 21Cơ bản

Đếm số phần tử khác 0 (độ thưa)

Số phần tử khác 0 quyết định chi phí lưu trữ và tính toán của vector thưa. Trong biểu diễn one-hot hoặc bag-of-words, phần lớn thành phần bằng 0 nên định dạng thưa tiết kiệm rất nh…

ai-302Bước 22Cơ bản

Tổng có trọng số của một feature

Tổng có trọng số chính là phép tính của một nơ-ron tuyến tính: đầu vào nhân với trọng số rồi cộng lại. Đây là đơn vị tính nhỏ nhất của mọi mạng nơ-ron.

ai-305Bước 23Cơ bản

Giải mã vector one-hot về chỉ số lớp

One-hot mã hoá lớp thành vector chỉ có một phần tử 1. Khi mô hình trả về vector như vậy, bước cuối là tìm vị trí của phần tử 1 để biết lớp dự đoán.

ai-316Bước 24Cơ bản

Đếm số mẫu vượt ngưỡng quyết định

Ngưỡng quyết định quyết định bao nhiêu mẫu bị xếp vào lớp dương. Hạ ngưỡng làm tăng số dự đoán dương, đổi lại tăng dương tính giả — đây là đánh đổi precision/recall quen thuộc.

ai-320Bước 26Cơ bản

Mã hoá một lớp thành vector one-hot

One-hot mã hoá lớp rời rạc thành vector chỉ có một phần tử 1. Cách này loại bỏ quan hệ thứ tự giả tạo giữa các lớp mà mã hoá bằng số nguyên mắc phải.

ai-280Bước 27Cơ bản

Trung vị của một feature

Trung vị là chỉ số trung tâm ít bị ảnh hưởng bởi giá trị ngoại lai hơn trung bình cộng, nên rất hay dùng khi khảo sát phân bố của một feature trước khi huấn luyện.

ai-291Bước 28Cơ bản

Tỷ lệ dự đoán dương sai (FPR)

FPR đo tỉ lệ mẫu âm bị mô hình báo nhầm là dương. Cùng với recall, nó tạo nên đường ROC nên là chỉ số bắt buộc khi chọn ngưỡng phân loại.

ai-310Bước 29Cơ bản

Khôi phục giá trị gốc sau chuẩn hoá Min-Max

Sau khi mô hình dự đoán trên dữ liệu đã chuẩn hoá, ta phải đưa kết quả về đơn vị gốc mới diễn giải được. Công thức nghịch đảo của min-max chỉ là một phép nhân cộng.

ai-294Bước 30Cơ bản

Kẹp giá trị vào một khoảng (clip)

Kẹp giá trị là bước tiền xử lý chuẩn để loại ngoại lai cực đoan hoặc chặn tràn số trước khi đưa dữ liệu vào mô hình. Nó giữ lại thông tin thay vì xoá cả điểm dữ liệu.

ai-306Bước 33Cơ bản

Tỷ lệ lỗi (error rate)

Tỷ lệ lỗi là phần bù của độ chính xác. Nhiều tài liệu báo cáo lỗi thay vì độ chính xác vì con số nhỏ dễ so sánh giữa các mô hình.

ai-315Bước 34Cơ bản

Dự đoán nhãn theo dấu của điểm số

Với mô hình tuyến tính, quy tắc dự đoán nhị phân đơn giản nhất là lấy dấu của điểm số: dương thành lớp 1, còn lại thành lớp 0. Điểm đúng bằng 0 nằm trên ranh giới nên theo quy ước…

Vững nền tảng

Bài tổng hợp nhẹ, sẵn sàng bước sang mức trung bình.

ai-283Bước 40Cơ bản

Chuẩn hoá z cho một giá trị

Chuẩn hoá z đưa một feature về trung bình 0 và độ lệch chuẩn 1, giúp nhiều thuật toán học máy hội tụ nhanh và không bị chi phối bởi đơn vị đo.

ai-290Bước 41Cơ bản

Đếm TP, FP, TN, FN của một bộ dự đoán

Bốn ô của ma trận nhầm lẫn là nền tảng của mọi chỉ số phân loại: accuracy, precision, recall, F1 đều được suy ra từ chúng. Đếm đúng bốn ô là bước đầu tiên khi đánh giá mô hình.

ai-322Bước 44Cơ bản

Trung bình trượt trên chuỗi tín hiệu

Trung bình trượt làm mượt chuỗi thời gian bằng cách lấy trung bình một cửa sổ trượt. Đây là bộ lọc đơn giản nhất để giảm nhiễu trong tín hiệu cảm biến và trong theo dõi đường cong…

ai-292Bước 47Cơ bản

Độ chính xác cân bằng (balanced accuracy)

Khi dữ liệu mất cân bằng, accuracy thường gây ảo giác tốt vì mô hình chỉ cần đoán lớp đa số. Balanced accuracy lấy trung bình của recall và specificity nên đánh giá công bằng cho c…

ai-308Bước 49Cơ bản

Hệ số xác định $R^2$

R2 cho biết mô hình giải thích được bao nhiêu phần phương sai của dữ liệu thật. Giá trị 1 là hoàn hảo, 0 là chỉ ngang dự đoán bằng trung bình, và âm nghĩa là mô hình còn tệ hơn cả…

Trung bình 56 bài

Vận dụng

Dùng một kỹ thuật quen thuộc: sắp xếp, tìm kiếm, đếm, ngăn xếp.

Kết hợp kỹ thuật

Phối hợp hai kỹ thuật trong cùng một lời giải.

Thành thạo

Bài dài hơn, cần chọn đúng cấu trúc dữ liệu.

Nâng cao 4 bài