Bộ phân loại K láng giềng gần nhất Vectorized (Vectorized K-NN Classifier)
dist(A, B)2 = ∑ Ai2 + ∑ Bj2 - 2 A BT

Đưa mô hình học máy từ lý thuyết vào dự án thực tế. Xây dựng quy trình xử lý dữ liệu chuẩn không rò rỉ (no data leakage) với Scikit-Learn.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Scale dữ liệu với StandardScaler và mã hóa One-Hot Encoding.
Huấn luyện Linear Regression, Logistic Regression, Random Forest.
Đo lường độ chính xác qua Accuracy, Precision, Recall, F1-Score và ROC-AUC.
Gói gọn quy trình thành Pipeline tái sử dụng và chống data leakage.
Fit dữ liệu scaler trên toàn bộ tập dữ liệu trước khi chia train/test gây ra data leakage nghiêm trọng.
Chỉ nhìn vào Accuracy khi tập dữ liệu mất cân bằng lớp (imbalanced dataset).
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
dist(A, B)2 = ∑ Ai2 + ∑ Bj2 - 2 A BT
log P(c | x) ∝ log P(c) + ∑j=1D [ -12 log(2π σc, j2) - (xj - μc, j)22σc, j2 ]
Thuật toán chuyên sâu: quy hoạch động, đồ thị, cây.
Sim(i, j) = frac{∑u ∈ Ui, j (Ru, i - Ru)(Ru, j - Ru)}{√(∑u ∈ Ui, j (Ru, i - Ru)2) sqrt{∑u ∈ Ui, j (Ru, j -…
L(w) = 12N |y - X w|2 + α · ρ |w|1 + 12 α (1 - ρ) |w|22
Cài đặt lớp GradientBoostingRegressorScratch(n_estimators=10, learning_rate=0.1):
P(zi = k | z-i, w, d) ∝ nd, k-i + α∑k' (nd, k'-i + α) × vk, wi-i + β∑w' (vk, w'-i + β)
Trong các hệ thống Tìm kiếm thông tin (Information Retrieval) và RAG (Retrieval-Augmented Generation) cho AI, việc chuyển đổi tài liệu dạng văn bản tự nhiên thành không gian vector…
Trong dự báo chuỗi thời gian (như nhu cầu tiêu thụ điện, doanh số bán hàng, lưu lượng truy cập), các mô hình học máy bảng (như Gradient Boosting hoặc Hồi quy) không thể tự động hiể…
Phân cụm K-Means là thuật toán học máy không giám sát (Unsupervised Learning) cốt lõi dùng để phân nhóm khách hàng, phân đoạn ảnh, hoặc nén vector dữ liệu (Vector Quantization). Kh…
Cấu trúc dữ liệu nâng cao và nhiều bước chứng minh.
1. Lớp OutlierCapper(factor=1.5):
Cài đặt lớp DecisionTreeClassifierScratch(max_depth=3, min_samples_split=2):
Trong hệ thống ngân hàng số, một giao dịch chuyển 50,000,000 VNĐ có thể là bình thường vào ban ngày tại chi nhánh quen thuộc, nhưng sẽ trở thành bất thường nghiêm trọng nếu diễn ra…
Khi đánh giá mô hình học máy phân loại gian lận hoặc chẩn đoán y tế, chỉ số Accuracy thường vô nghĩa do mất cân bằng dữ liệu nghiêm trọng (Imbalanced Classes). Kỹ sư AI cần có một…
Trong các sàn thương mại điện tử, ma trận đánh giá giữa Người dùng (Users) và Sản phẩm (Items) có độ thưa rất cao (hơn 99% các ô chưa được đánh giá). Thuật toán Phân rã ma trận xấp…
Trong đồ thị web, một liên kết từ trang A tới trang B được coi là một "phiếu bầu" tín nhiệm cho trang B. Tuy nhiên, phiếu bầu từ các trang có uy tín cao sẽ có trọng số lớn hơn phiế…
Hệ thống kiểm tra đạo văn và chống gian lận học thuật của AI Empire Academy cần đối soát mã nguồn và bài nộp của học viên. Nếu lưu trữ toàn bộ các đoạn văn bản hoặc mã băm của mọi…