AI Empire Academy
CHUYÊN ĐỀ AI THỰC CHIẾN

Bài tập Học tăng cường (Reinforcement Learning) & Tối ưu chính sách

Khác với học có giám sát, tác nhân RL học cách đưa ra quyết định thông qua phần thưởng và hình phạt từ môi trường. Nền tảng cốt lõi của RLHF căn chỉnh AI.

10

bài tập có chấm code

Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.

0

cơ bản

Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.

4

trung bình

Kết hợp nhiều bước suy luận để vận dụng kiến thức.

6

nâng cao

Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.

Lộ trình thực hành đề xuất

Bước 1

MDP & Phần thưởng

Mô hình hóa trạng thái (State), hành động (Action), phần thưởng (Reward) và hệ số chiết khấu gamma.

Bước 2

Bảng Q-Table

Cập nhật giá trị Q-value bằng phương trình Bellman lặp và chiến lược e-greedy.

Bước 3

Policy Gradient cơ bản

Tối ưu hóa trực tiếp hàm chính sách policy bằng thuật toán REINFORCE.

Lỗi thường gặp & Cách phòng tránh

•

Hệ số khám phá epsilon giảm quá nhanh khiến tác nhân bị kẹt ở chiến lược cục bộ dưới tối ưu.

•

Không chuẩn hóa phần thưởng tích lũy (discounted rewards) khiến gradient dao động mạnh.

Danh sách bài tập thực hành (10 bài)

Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.

Trung bình 4 bài

Nâng cao 6 bài