ai-049Đọc toàn bộ đề miễn phí

Quản Lý KV-Cache Cho Sinh Văn Bản Tự Hồi Quy (Autoregressive)

Xây dựng lớp KVCache:

AITrung bình35 phút

Tiến độ của tôi ở bài này

Điểm được lưu vào tài khoản sau khi chấm bài.

Đang tải điểm của bạn…

Kiến thức và chủ đề

llmkv-cacheattentiontransformerautoregressivegeneration

Kiến thức tiên quyết: multi-head-attention-from-scratch.

Nội dung đề bài

Mục tiêu kiến thức

  • Trong mô hình Transformer sinh văn bản (Decoder-only như GPT, LLaMA), tại mỗi bước sinh token mới t, việc tính lại toàn bộ Key (K) và Value (V) của các token cũ 1, …, t-1 sẽ có độ phức tạp O(T2) tính toán.
  • KV Cache lưu trữ các tensor K, V của các bước trước đó trong bộ nhớ:
  • Khi token mới đến, ta chỉ tính Kstep, Vstep của duy nhất token đó.
  • Nối (concatenate) Kstep, Vstep vào cache theo chiều sequence length (dimension 2).
  • Trả về tensor K, V đầy đủ để lớp Multi-Head Attention tính attention scores.
  • Kỹ thuật Sliding Window / Max Context: Khi độ dài chuỗi vượt quá max_seq_len, chỉ giữ lại max_seq_len token mới nhất gần đây.

Yêu cầu

Xây dựng lớp KVCache:

class KVCache:
    def __init__(self, num_layers: int, max_seq_len: int | None = None):
        pass

    def update(self, key_step: torch.Tensor, value_step: torch.Tensor, layer_idx: int) -> tuple[torch.Tensor, torch.Tensor]:
        pass

    def reset(self) -> None:
        pass

    def get_seq_len(self, layer_idx: int) -> int:
        pass
  • Định dạng tensor:
  • key_step, value_step: Shape (batch_size, num_heads, seq_len_step, head_dim). Thường seq_len_step == 1 trong quá trình sinh token, hoặc > 1 ở bước Prefill.
  • update(key_step, value_step, layer_idx):
  • Nối tensor mới vào cache của tầng layer_idx dọc theo dim=2.
  • Nếu max_seq_len được khai báo và seq_len > max_seq_len, cắt bỏ các token cũ ở đầu, chỉ giữ lại max_seq_len token cuối cùng [:, :, -self.max_seq_len:, :].
  • Trả về tuple (full_key, full_value).

Input

  • Lớp KVCache(num_layers, max_seq_len): Khởi tạo đối tượng với các tham số, trọng số hoặc cấu hình tương ứng.

Output

  • Các phương thức của KVCache: Trả về kết quả tính toán hoặc cập nhật trạng thái nội bộ của đối tượng.

Ràng buộc

  • Thời gian chạy tối đa: 2000ms.
  • Giới hạn bộ nhớ: 512MB.
  • Dữ liệu đầu vào hợp lệ theo đúng kiểu dữ liệu và miền giá trị được mô tả.

Ví dụ 1

Input

cache = KVCache(num_layers=2)
B, H, D = (1, 4, 16)
k_init = torch.ones(B, H, 3, D)
v_init = torch.ones(B, H, 3, D)
k_out, v_out = cache.update(k_init, v_init, layer_idx=0)
k_step1 = torch.full((B, H, 1, D), 2.0)
v_step1 = torch.full((B, H, 1, D), 2.0)
k_out, v_out = cache.update(k_step1, v_step1, layer_idx=0)

Output

(Tensor shape: (1, 4, 4, 16), dtype=torch.float32, Tensor shape: (1, 4, 4, 16), dtype=torch.float32)

Giải thích

Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.

3 cấp độ gợi ýMở dần khi bạn thật sự cần hỗ trợ.
Phân tích lời giảiGiải thích hướng tư duy và thuật toán.
Code tham khảoDùng để đối chiếu sau khi tự làm.

Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.