Tìm kiếm K-Láng giềng gần nhất và Giải toán tương quan ngữ nghĩa (Word Analogies & K-NN Search)
Một trong những phát hiện chấn động của mô hình Word2Vec (Mikolov et al., 2013) là không gian vector nhúng có khả năng bảo toàn các mối quan hệ ngữ nghĩa tuyến tính thông qua phép…
Tiến độ của tôi ở bài này
Điểm được lưu vào tài khoản sau khi chấm bài.
Đang tải điểm của bạn…
Kiến thức và chủ đề
Kiến thức tiên quyết: l2-normalized-embeddings-cosine-retrieval.
Nội dung đề bài
Mô tả bài toán
Một trong những phát hiện chấn động của mô hình Word2Vec (Mikolov et al., 2013) là không gian vector nhúng có khả năng bảo toàn các mối quan hệ ngữ nghĩa tuyến tính thông qua phép cộng trừ vector:
vKing - vMan + vWoman ≈ vQueen
Tương tự: vParis - vFrance + vGermany ≈ vBerlin
Yêu cầu kỹ thuật:
- Viết hàm
find_k_nearest_tokens(target_idx: int, embeddings: np.ndarray, k: int = 3) -> list[tuple[int, float]]: target_idx: Chỉ số nguyên của token cần tìm láng giềng.embeddings: Ma trận nhúng shape (V, D).- Lưu ý: Phải loại trừ chính
target_idxkhỏi danh sách kết quả! - Trả về danh sách gồm k phần tử
(token_idx, cosine_similarity)có độ tương đồng cao nhất, sắp xếp giảm dần theo điểm. - Viết hàm
solve_word_analogy(a_idx: int, b_idx: int, c_idx: int, embeddings: np.ndarray, top_k: int = 1) -> list[tuple[int, float]]: - Tính vector mục tiêu: d = vb - va + vc.
- Tìm kiếm các token có Cosine Similarity cao nhất đối với d.
- Ràng buộc quan trọng: Phải loại trừ cả 3 token đầu vào
{a_idx, b_idx, c_idx}khỏi tập kết quả ứng viên! - Trả về danh sách gồm
top_kphần tử(token_idx, cosine_similarity)sắp xếp giảm dần.
Input
- Hàm
find_k_nearest_tokens(target_idx,embeddings,k): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng. - Hàm
solve_word_analogy(a_idx,b_idx,c_idx,embeddings,top_k): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng.
Output
- Hàm
find_k_nearest_tokens: Trả về kết quả kiểulist[tuple[int, float]]theo đúng đặc tả kỹ thuật và kích thước quy định. - Hàm
solve_word_analogy: Trả về kết quả kiểulist[tuple[int, float]]theo đúng đặc tả kỹ thuật và kích thước quy định.
Ràng buộc
- Thời gian chạy tối đa: 6000ms.
- Giới hạn bộ nhớ: 512MB.
- Dữ liệu đầu vào hợp lệ theo đúng kiểu dữ liệu và miền giá trị được mô tả.
Ví dụ 1
Input
embeddings = np.array([[1.0, 0.0], [0.9, 0.1], [0.0, 1.0]])
nearest = find_k_nearest_tokens(target_idx=0, embeddings=embeddings, k=2)Output
[(1, 0.9938837346715274), (2, 0.0)]Giải thích
Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.
Ví dụ 2
Input
embeddings = np.array([[1.0, 0.0], [1.0, 2.0], [0.01, 0.01], [0.0, 2.0], [0.5, 0.5], [-1.0, 0.0]])
analogy = solve_word_analogy(a_idx=0, b_idx=1, c_idx=2, embeddings=embeddings, top_k=3)
candidate_ids = [idx for idx, _ in analogy]Output
[3, 4, 5]Giải thích
Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.
Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.
Góp ý & báo lỗi bài tập
Đề bài chưa rõ, test có vấn đề hay bạn có ý tưởng giúp bài tốt hơn? Gửi cho đội ngũ AI Empire nhé — mỗi góp ý đều được đọc.
