Trích Xuất và Xác Thực Cấu Trúc JSON từ Đầu Ra LLM
Khi xây dựng các Ứng dụng AI và AI Agent sử dụng Mô hình Ngôn ngữ Lớn (LLM), việc LLM trả về văn bản kèm mã JSON bọc trong markdown codeblock (ví dụ json { ... } ) hoặc kèm lời g…

Khoảng cách giữa một file notebook thử nghiệm và hệ thống AI phục vụ hàng triệu người dùng là kỹ thuật hệ thống. Luyện tập tối ưu hóa tài nguyên, bảo mật và độ trễ.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Tạo API nhận dữ liệu ảnh/văn bản, tiền xử lý và trả về kết quả dự đoán có schema an toàn.
Gộp các request lẻ thành batch để tận dụng tối đa băng thông tính toán phần cứng.
Chuyển đổi trọng số từ Float32 sang Int8 để giảm dung lượng RAM và tăng tốc suy luận.
Nạp lại mô hình từ đĩa ở mỗi request thay vì nạp một lần duy nhất lúc khởi động server (lifecycle event).
Không thiết lập cơ chế timeout và giới hạn dung lượng payload dẫn đến cạn kiệt tài nguyên hệ thống.
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Khi xây dựng các Ứng dụng AI và AI Agent sử dụng Mô hình Ngôn ngữ Lớn (LLM), việc LLM trả về văn bản kèm mã JSON bọc trong markdown codeblock (ví dụ json { ... } ) hoặc kèm lời g…
Dùng một kỹ thuật quen thuộc: sắp xếp, tìm kiếm, đếm, ngăn xếp.
Mỗi ma trận trọng số W ∈ Rm × n có thể xấp xỉ bởi:
Một model serving API phải validate input trước khi inference.
Trong các ứng dụng Chatbot AI nhiều lượt (Multi-turn Conversational LLM), tổng số lượng token của cuộc hội thoại có thể dễ dàng vượt quá giới hạn cửa sổ ngữ cảnh max_tokens của mô…
1. Required fields: Mọi trường trong danh sách required phải có mặt trong arguments.
{"role": "system", "content": f"Summary of previous conversation: {summary_text}"} đặt ngay sau tin nhắn system ban đầu.
Phối hợp hai kỹ thuật trong cùng một lời giải.
data: {"id": "chatcmpl-123", "object": "chat.completion.chunk", "created": 1700000000, "model": "ai-empire-llm", "choices": [{"index": 0, "delta": {"content": "text_chunk"}, "finis…
xq = round(xs + z), xq ∈ [0, 255]
Pruning loại bỏ các trọng số nhỏ nhất để tạo mô hình thưa. Unstructured pruning zeroing out từng weight riêng lẻ dựa trên biên độ (|weight|).
ML Pipeline cần xử lý nhiều loại feature khác nhau một cách nhất quán.
PSI = ∑i (Pi - Qi) · lnPiQi
Bài dài hơn, cần chọn đúng cấu trúc dữ liệu.
z = pA - pB√(p(1-p)(1nA + 1nB))
Production ML cần monitor 4 tín hiệu vàng: latency, throughput, error rate, saturation.
Checkpoint phải lưu đủ thông tin để tiếp tục huấn luyện chính xác.
Model Registry theo dõi tất cả thí nghiệm, metrics và artifacts.
Knowledge Distillation (Hinton 2015) huấn luyện student model học từ teacher model bằng cách dùng *soft labels* (xác suất mềm) thay vì hard labels (one-hot).
Thuật toán chuyên sâu: quy hoạch động, đồ thị, cây.
Thought: <nội dung suy luận>
1. Prompt Injection Detector: Phát hiện các cụm từ tấn công phổ biến (không phân biệt hoa thường):
FP16 có range nhỏ hơn FP32, dễ bị underflow gradient. Loss scaling nhân loss với factor lớn S trước khi backward, sau đó chia gradient cho S.
Online learning cập nhật mô hình tức thời sau mỗi sample, không cần lưu toàn bộ dữ liệu.
Dynamic batching gom nhiều request riêng lẻ thành một batch để tận dụng GPU parallelism.
Cấu trúc dữ liệu nâng cao và nhiều bước chứng minh.
1. Chia effective_batch_size thành accumulation_steps mini-batches
Không phải mọi attention head đều quan trọng. Điểm quan trọng Taylor bậc nhất:
QLoRA đề xuất hai kỹ thuật tiết kiệm bộ nhớ:
Token Merging (ToMe) giảm số lượng token bằng cách gộp các token giống nhau.