Quy Hoạch Động Lặp Giá Trị (Value Iteration) Cho Quá Trình Quyết Định Markov
Vk+1(s) = maxa ∈ A [ R(s, a) + γ ∑s' ∈ S P(s' | s, a) Vk(s') ]

Khác với học có giám sát, tác nhân RL học cách đưa ra quyết định thông qua phần thưởng và hình phạt từ môi trường. Nền tảng cốt lõi của RLHF căn chỉnh AI.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Mô hình hóa trạng thái (State), hành động (Action), phần thưởng (Reward) và hệ số chiết khấu gamma.
Cập nhật giá trị Q-value bằng phương trình Bellman lặp và chiến lược e-greedy.
Tối ưu hóa trực tiếp hàm chính sách policy bằng thuật toán REINFORCE.
Hệ số khám phá epsilon giảm quá nhanh khiến tác nhân bị kẹt ở chiến lược cục bộ dưới tối ưu.
Không chuẩn hóa phần thưởng tích lũy (discounted rewards) khiến gradient dao động mạnh.
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Vk+1(s) = maxa ∈ A [ R(s, a) + γ ∑s' ∈ S P(s' | s, a) Vk(s') ]
Rpenalized(x, y) = R(x, y) - β · DKL(πθ ∥ πref)
∇θ J(θ) = Eτ [ ∑t=0T ∇θ log πθ(at | st) (Gt - b(st)) ]
1. Mạng chính θ: Dùng để chọn hành động và tính giá trị Q(st, at; θ).
P(yw ≻ yl | x) = σ(rθ(x, yw) - rθ(x, yl)) = 11 + e-(rθ(x, yw) - rθ(x, yl))
a* = argmaxa ∈ A [ Q(s, a) + U(s, a) ]
rt(θ) = πθ(at | st)πθold(at | st) = exp(log πθ(at | st) - log πθold(at | st))
δtV = rt + γ V(st+1)(1 - dt) - V(st)
r(x, y) = β log πθ(y | x)πref(y | x)
oddsθ(y | x) = Pθ(y | x)1 - Pθ(y | x)