Tự xây dựng tầng nhúng Embedding Lookup Table từ ma trận trọng số và Index Slicing
Trong các mô hình ngôn ngữ lớn (LLM), tầng Embedding (nn.Embedding) thực chất là một bảng tra cứu (lookup table) ma trận trọng số W ∈ RV × D, trong đó V là kích…

Cung cấp kiến thức chuyên sâu và dữ liệu doanh nghiệp cho LLM mà không cần huấn luyện lại. Tự xây dựng trọn vẹn quy trình trích xuất và truy hồi thông tin theo vector.
bài tập có chấm code
Bài tập theo chuyên đề, có đề bài, ví dụ và starter code riêng.
cơ bản
Củng cố nền tảng và làm quen với kỹ thuật cốt lõi.
trung bình
Kết hợp nhiều bước suy luận để vận dụng kiến thức.
nâng cao
Thử thách tối ưu, cấu trúc dữ liệu và thuật toán chuyên sâu.
Chiến lược cắt đoạn theo kích thước cố định có độ gối đầu (overlap) và cắt đoạn theo ngữ nghĩa.
Chuyển văn bản thành vector đặc trưng nhiều chiều và tối ưu hóa bộ nhớ.
Tính toán độ tương đồng Cosine giữa vector truy vấn và toàn bộ cơ sở dữ liệu để chọn K đoạn văn bản sát nhất.
Tái xếp hạng kết quả và đo lường độ phủ thông tin (Recall@K, MRR).
Cắt đoạn văn bản quá ngắn làm mất ngữ cảnh hoặc quá dài vượt quá cửa sổ ngữ cảnh của mô hình.
Không chuẩn hóa vector embedding (L2 normalize) trước khi tính tích vô hướng dot product.
Trong mỗi mức độ, bài tập được xếp từ dễ nhất đến khó nhất — hãy đi theo số bước.
Trong các mô hình ngôn ngữ lớn (LLM), tầng Embedding (nn.Embedding) thực chất là một bảng tra cứu (lookup table) ma trận trọng số W ∈ RV × D, trong đó V là kích…
Trong các hệ thống RAG và Vector Database quy mô lớn, phép tính Cosine Similarity:
Dùng một kỹ thuật quen thuộc: sắp xếp, tìm kiếm, đếm, ngăn xếp.
Khi xây dựng các mô hình Sentence Embedding (như BERT, SimCSE, OpenAI text-embedding), biểu diễn của cả câu được tạo ra bằng cách gom cụm (pooling) các vector token dọc theo trục đ…
Khi huấn luyện các mô hình ngôn ngữ lớn với từ điển lên đến 32,000 – 128,000 token, việc lưu trữ một ma trận gradient dày ∇W ∈ RV × D cho mỗi bước tốn hàng…
Một trong những phát hiện chấn động của mô hình Word2Vec (Mikolov et al., 2013) là không gian vector nhúng có khả năng bảo toàn các mối quan hệ ngữ nghĩa tuyến tính thông qua phép…
Ưu tiên ngắt tại các ranh giới tự nhiên lớn nhất trước: ["\n\n", "\n", " ", ""]. Nếu đoạn văn bản sau khi tách vẫn lớn hơn chunk_size, chuyển sang dấu phân cách nhỏ hơn tiếp theo.
Thay vì tính u · v|u| |v| cho mỗi truy vấn, ta chuẩn hóa chuẩn L2 tất cả các vector ngay khi nạp vào chỉ mục (v ← v|v|2).
1. Giai đoạn 1 (Bi-Encoder / Retrieval): Tìm kiếm nhanh top 50 tài liệu ứng viên bằng Vector Index hoặc BM25 trong vài mili-giây.
Một Prompt hoàn chỉnh gồm:
Phối hợp hai kỹ thuật trong cùng một lời giải.
1. Faithfulness (Độ trung thực / Chống ảo giác): Tỷ lệ các luận điểm (claims/statements) trong câu trả lời được chứng minh trực tiếp bởi Context được cung cấp:
cosine(q, d) = q · d|q| |d|
RRF(d, L) = ∑r ∈ L 1k + r(d)
BM25 (Best Match 25) là hàm xếp hạng tiêu chuẩn trong Information Retrieval, cải tiến TF-IDF bằng cách chuẩn hóa độ dài tài liệu.
TF(t, d) = count(t, d)|d|, IDF(t) = logN + 1df(t) + 1
Trong học không gian biểu diễn (Metric Learning / FaceNet / Dense Passage Retrieval), mục tiêu là kéo các vector cùng lớp (Anchor và Positive) lại gần nhau, đồng thời đẩy các vecto…
RRF_Score(d) = ∑m ∈ M 1k + rm(d)
Thuật toán chuyên sâu: quy hoạch động, đồ thị, cây.
L = -ln σ(uwOT vwI) - ∑k=1K ln σ(-uwnkT vwI)
BM25(D, Q) = ∑q ∈ Q IDF(q) · f(q, D) · (k1 + 1)f(q, D) + k1 · (1 - b + b · |D|avgdl)
RAG 2 giai đoạn:
MRL học embeddings có thể truncate về kích thước nhỏ hơn mà vẫn giữ chất lượng:
3 metrics quan trọng nhất để đánh giá RAG pipeline:
Cấu trúc dữ liệu nâng cao và nhiều bước chứng minh.
Li = -log exp(sim(zi, zi+)/τ)∑j ≠ i exp(sim(zi, zj)/τ)
1. Giai đoạn Huấn luyện (Train): Chạy K-Means để chia không gian vector thành C tế bào Voronoi (Voronoi cells), mỗi tế bào có một tâm cụm (centroid).
Hybrid search kết hợp hai tín hiệu bổ sung nhau:
1. Chunking: chia tài liệu dài thành đoạn nhỏ có overlap