Phép Tích Chập 2D Cơ Bản Với Bộ Lọc Đơn Kênh (Conv2D)
Mạng Nơ-ron Tích chập (Convolutional Neural Networks - CNN) là nền móng của Thị giác Máy tính (Computer Vision), từ nhận diện hình ảnh, phát hiện vật thể đến xử lý video. Phép toán…

Từ phép nhân tích chập ma trận đến mô hình phân loại ảnh hiện đại. Làm chủ các kiến trúc CNN kinh điển và cách xử lý dữ liệu hình ảnh nhiều kênh màu.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Cài đặt tích chập giữa ảnh và bộ lọc kernel với tham số stride và padding.
Chuyển phép tích chập trượt thành phép nhân ma trận chuẩn nhanh bằng thuật toán im2col.
Giảm chiều không gian đặc trưng bằng Max Pooling và Average Pooling.
Ghép nối các tầng Conv, BatchNorm, ReLU và Linear để phân loại ảnh.
Tính toán sai kích thước output của tầng tích chập: (W - F + 2P)/S + 1.
Không đổi kênh màu hình ảnh từ (H, W, C) sang định dạng chuẩn PyTorch (C, H, W).
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Mạng Nơ-ron Tích chập (Convolutional Neural Networks - CNN) là nền móng của Thị giác Máy tính (Computer Vision), từ nhận diện hình ảnh, phát hiện vật thể đến xử lý video. Phép toán…
Xây dựng lớp Pooling2D:
Phép tích chập tiêu chuẩn tốn K2 · Cin · Cout tham số.
1. Horizontal Flip: Lật ngược ảnh theo trục ngang (trục chiều rộng W).
IoU = Area of OverlapArea of Union = IntersectionArea1 + Area2 - Intersection
Thuật toán chuyên sâu: quy hoạch động, đồ thị, cây.
1. Sắp xếp danh sách các box theo thứ tự điểm số giảm dần (scores).
FL(pt) = -αt (1 - pt)γ log(pt)
Hout = ⌊ H + 2P - KhS ⌋ + 1, Wout = ⌊ W + 2P - KwS ⌋ + 1
Xây dựng lớp CompactCNN(torch.nn.Module) và hai hàm train_one_epoch, evaluate_model.
Cấu trúc dữ liệu nâng cao và nhiều bước chứng minh.
Cho đầu vào X ∈ RB × Cin × H × W và bộ lọc W ∈ RCout × Cin × KH × KW.
running_mean = (1 - m) · running_mean + m · μ
Thay vì học ánh xạ trực tiếp H(x), mạng học ánh xạ thặng dư (residual mapping) F(x) = H(x) - x. Đầu ra khối là:
1. Ảnh đầu vào X ∈ RB × C × H × W.