Mã hoá và giải mã một câu ngắn
Một tokenizer biến câu thành dãy chỉ số theo từ vựng (encode) và có thể dựng lại câu gốc từ
Tiến độ của tôi ở bài này
Điểm và code bạn nộp được lưu vào tài khoản sau khi chấm bài.
Đang tải điểm của bạn…
Kiến thức và chủ đề
Kiến thức tiên quyết: python-basics, python-dicts.
Nội dung đề bài
Mô tả bài toán
Một tokenizer biến câu thành dãy chỉ số theo từ vựng (encode) và có thể dựng lại câu gốc từ dãy chỉ số đó (decode). Kiểm tra vòng lặp mã hoá rồi giải mã ra đúng câu ban đầu là cách nhanh nhất để phát hiện từ vựng bị lệch.
Yêu cầu
Viết hàm tokenize_round_trip(sentence, vocab) trả về một từ điển gồm ids (dãy chỉ số) và decoded (câu dựng lại).
Quy ước nộp bài
Nộp hàm tokenize_round_trip trong solution.py. Hệ thống gọi hàm trực tiếp và so giá trị; không đọc stdin và không in ra stdout.
Input
- sentence: câu cần mã hoá, các từ cách nhau bởi dấu cách.
- vocab: từ điển ánh xạ từ sang chỉ số nguyên.
Output
Từ điển {"ids": [...], "decoded": "..."}; decoded phải bằng câu ban đầu.
Ràng buộc
- Nếu một từ không có trong vocab thì ném ValueError.
- Các chỉ số trong vocab phải đôi một khác nhau; nếu trùng thì ném ValueError.
- Câu rỗng cho ids = [] và decoded = "".
Ví dụ 1
Input
tokenize_round_trip(sentence="i love cats", vocab={"i": 0, "love": 1, "cats": 2, "and": 3, "dogs": 4})
Output
{"ids": [0, 1, 2], "decoded": "i love cats"}
Ví dụ 2
Input
tokenize_round_trip(sentence="dogs and cats", vocab={"i": 0, "love": 1, "cats": 2, "and": 3, "dogs": 4})
Output
{"ids": [4, 3, 2], "decoded": "dogs and cats"}
Giải thích
Với vocab = {"i": 0, "love": 1, "cats": 2, "and": 3, "dogs": 4} và sentence = "i love cats" thì ids = [0, 1, 2] và decoded = "i love cats".
Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.
Góp ý & báo lỗi bài tập
Đề bài chưa rõ, test có vấn đề hay bạn có ý tưởng giúp bài tốt hơn? Gửi cho đội ngũ AI Empire nhé — mỗi góp ý đều được đọc.
