ai-238Đọc toàn bộ đề miễn phí

Tìm kiếm K-Láng giềng gần nhất và Giải toán tương quan ngữ nghĩa (Word Analogies & K-NN Search)

Một trong những phát hiện chấn động của mô hình Word2Vec (Mikolov et al., 2013) là không gian vector nhúng có khả năng bảo toàn các mối quan hệ ngữ nghĩa tuyến tính thông qua phép…

AITrung bình30 phút

Tiến độ của tôi ở bài này

Điểm được lưu vào tài khoản sau khi chấm bài.

Đang tải điểm của bạn…

Kiến thức và chủ đề

embeddingword-analogyknnvector-arithmetic

Kiến thức tiên quyết: l2-normalized-embeddings-cosine-retrieval.

Nội dung đề bài

Mô tả bài toán

Một trong những phát hiện chấn động của mô hình Word2Vec (Mikolov et al., 2013) là không gian vector nhúng có khả năng bảo toàn các mối quan hệ ngữ nghĩa tuyến tính thông qua phép cộng trừ vector:

vKing - vMan + vWoman ≈ vQueen

Tương tự: vParis - vFrance + vGermany ≈ vBerlin

Yêu cầu kỹ thuật:

  • Viết hàm find_k_nearest_tokens(target_idx: int, embeddings: np.ndarray, k: int = 3) -> list[tuple[int, float]]:
  • target_idx: Chỉ số nguyên của token cần tìm láng giềng.
  • embeddings: Ma trận nhúng shape (V, D).
  • Lưu ý: Phải loại trừ chính target_idx khỏi danh sách kết quả!
  • Trả về danh sách gồm k phần tử (token_idx, cosine_similarity) có độ tương đồng cao nhất, sắp xếp giảm dần theo điểm.
  • Viết hàm solve_word_analogy(a_idx: int, b_idx: int, c_idx: int, embeddings: np.ndarray, top_k: int = 1) -> list[tuple[int, float]]:
  • Tính vector mục tiêu: d = vb - va + vc.
  • Tìm kiếm các token có Cosine Similarity cao nhất đối với d.
  • Ràng buộc quan trọng: Phải loại trừ cả 3 token đầu vào {a_idx, b_idx, c_idx} khỏi tập kết quả ứng viên!
  • Trả về danh sách gồm top_k phần tử (token_idx, cosine_similarity) sắp xếp giảm dần.

Input

  • Hàm find_k_nearest_tokens(target_idx, embeddings, k): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng.
  • Hàm solve_word_analogy(a_idx, b_idx, c_idx, embeddings, top_k): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng.

Output

  • Hàm find_k_nearest_tokens: Trả về kết quả kiểu list[tuple[int, float]] theo đúng đặc tả kỹ thuật và kích thước quy định.
  • Hàm solve_word_analogy: Trả về kết quả kiểu list[tuple[int, float]] theo đúng đặc tả kỹ thuật và kích thước quy định.

Ràng buộc

  • Thời gian chạy tối đa: 6000ms.
  • Giới hạn bộ nhớ: 512MB.
  • Dữ liệu đầu vào hợp lệ theo đúng kiểu dữ liệu và miền giá trị được mô tả.

Ví dụ 1

Input

embeddings = np.array([[1.0, 0.0], [0.9, 0.1], [0.0, 1.0]])
nearest = find_k_nearest_tokens(target_idx=0, embeddings=embeddings, k=2)

Output

[(1, 0.9938837346715274), (2, 0.0)]

Giải thích

Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.

Ví dụ 2

Input

embeddings = np.array([[1.0, 0.0], [1.0, 2.0], [0.01, 0.01], [0.0, 2.0], [0.5, 0.5], [-1.0, 0.0]])
analogy = solve_word_analogy(a_idx=0, b_idx=1, c_idx=2, embeddings=embeddings, top_k=3)
candidate_ids = [idx for idx, _ in analogy]

Output

[3, 4, 5]

Giải thích

Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.

3 cấp độ gợi ýMở dần khi bạn thật sự cần hỗ trợ.
Phân tích lời giảiGiải thích hướng tư duy và thuật toán.
Code tham khảoDùng để đối chiếu sau khi tự làm.

Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.