Cơ chế phạt lặp từ trong sinh văn bản (Repetition Penalty Logit Adjustment)
Hiện tượng mô hình ngôn ngữ lặp lại một từ hoặc cụm từ vô tận là một lỗi kinh điển trong sinh văn bản.

Làm chủ cách thức mô hình AI lựa chọn từ tiếp theo từ phân phối xác suất logits. Tinh chỉnh sự sáng tạo và tính chính xác của phản hồi văn bản.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Chọn từ có xác suất cao nhất tại mỗi bước bằng phép lấy argmax.
Làm sắc nét hoặc san bằng phân phối xác suất logits bằng phép chia nhiệt độ T.
Cắt bỏ đuôi xác suất thấp, chỉ lấy mẫu trong tập K từ tốt nhất hoặc ngưỡng tích lũy P.
Đặt nhiệt độ Temperature = 0 gây ra lỗi chia cho 0 trong công thức toán học.
Quên chuẩn hóa lại tổng xác suất bằng 1 sau khi lọc Top-K / Top-P.
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Hiện tượng mô hình ngôn ngữ lặp lại một từ hoặc cụm từ vô tận là một lỗi kinh điển trong sinh văn bản.
Trong mô hình ngôn ngữ tự hồi quy (Autoregressive Language Model), đầu ra của tầng cuối cùng (LM Head) là một vector logits thô z ∈ RV với V là kích thước từ điển (vo…
Dùng một kỹ thuật quen thuộc: sắp xếp, tìm kiếm, đếm, ngăn xếp.
Trong quá trình sinh văn bản của LLM (như GPT, LLaMA), để ngăn mô hình chọn phải các từ vựng vô nghĩa ở đuôi phân phối (tail of distribution), kỹ thuật Top-K Sampling chỉ giữ lại K…
Gần đây trong cộng đồng Open LLM, kỹ thuật Min-P Sampling được đánh giá vượt trội so với Top-P và Top-K:
Trong huấn luyện và đánh giá LLM (như GPT, LLaMA), Perplexity (PPL) là độ đo tiêu chuẩn để đánh giá khả năng dự đoán từ tiếp theo của mô hình:
Tham số nhiệt độ (T > 0) điều khiển độ ngẫu nhiên của văn bản sinh ra bằng cách làm phẳng hoặc làm nhọn phân phối xác suất:
Thuật toán lọc Top-K (Fan et al., 2018) giới hạn không gian lấy mẫu chỉ trong K token có xác suất cao nhất:
Phối hợp hai kỹ thuật trong cùng một lời giải.
Các mô hình ngôn ngữ tự hồi quy thường có xu hướng tự khuếch đại xác suất của các từ đã xuất hiện, dẫn đến vòng lặp vô nghĩa (như *"và anh ấy nói và anh ấy nói..."*).
pi = softmax(z)i, ptop = maxj pj
Xây dựng lớp KVCache:
1. HuggingFace Repetition Penalty (Keskar et al., 2019):
Thuật toán chuyên sâu: quy hoạch động, đồ thị, cây.
Nhược điểm của Top-K là số lượng ứng viên K luôn cố định:
Greedy decoding chỉ nhìn thấy một bước tiếp theo nên dễ rơi vào cực tiểu cục bộ (chọn một từ có xác suất cao ở bước 1 nhưng dẫn tới toàn bộ các bước sau có xác suất cực thấp).
1. Temperature Scaling (T > 0):
Vì mỗi bước cộng thêm một số âm log P(wt) ≤ 0, câu càng dài thì tổng log xác suất càng âm. Nếu chỉ so sánh điểm thô, mô hình luôn có xu hướng sinh câu cụt ngủn.
Cấu trúc dữ liệu nâng cao và nhiều bước chứng minh.
Speculative decoding tăng tốc inference LLM bằng cách:
Được đề xuất bởi Ari Holtzman et al. (2019), Nucleus (Top-P) Sampling khắc phục nhược điểm của Top-K khi phân phối xác suất thay đổi độ tập trung:
Quy trình:
PPL = exp(-1N∑i=1N log P(wi | w<i)) = exp(H)