Đánh Giá RAG – Faithfulness, Relevance Và Context Recall
3 metrics quan trọng nhất để đánh giá RAG pipeline:
Tiến độ của tôi ở bài này
Điểm được lưu vào tài khoản sau khi chấm bài.
Đang tải điểm của bạn…
Kiến thức và chủ đề
Kiến thức tiên quyết: rag-document-chunking-and-retrieval-pipeline.
Nội dung đề bài
Mục tiêu kiến thức
3 metrics quan trọng nhất để đánh giá RAG pipeline:
- Faithfulness: câu trả lời có faithful với context không? (token overlap precision)
Faithfulness = |answer tokens ∩ context tokens||answer tokens|
- Answer Relevance: context có liên quan đến question không?
Relevance = |question tokens ∩ context tokens||question tokens|
- Context Recall: gold answer có được bao phủ bởi context không?
Recall = |gold tokens ∩ context tokens||gold tokens|
Yêu cầu
def compute_faithfulness(answer: str, context: str) -> float: pass
def compute_answer_relevance(question: str, context: str) -> float: pass
def compute_context_recall(gold_answer: str, context: str) -> float: pass
def compute_rag_score(question, context, answer, gold_answer) -> dict: passInput
- Hàm
compute_faithfulness(answer,context): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng. - Hàm
compute_answer_relevance(question,context): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng. - Hàm
compute_context_recall(gold_answer,context): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng. - Hàm
compute_rag_score(question,context,answer,gold_answer): Các tham số đầu vào chứa dữ liệu Tensor/mảng NumPy hoặc giá trị siêu tham số tương ứng.
Output
- Hàm
compute_faithfulness: Trả về kết quả kiểufloattheo đúng đặc tả kỹ thuật và kích thước quy định. - Hàm
compute_answer_relevance: Trả về kết quả kiểufloattheo đúng đặc tả kỹ thuật và kích thước quy định. - Hàm
compute_context_recall: Trả về kết quả kiểufloattheo đúng đặc tả kỹ thuật và kích thước quy định. - Hàm
compute_rag_score: Trả về kết quả kiểudicttheo đúng đặc tả kỹ thuật và kích thước quy định.
Ràng buộc
- Thời gian chạy tối đa: 3000ms.
- Giới hạn bộ nhớ: 256MB.
- Dữ liệu đầu vào hợp lệ theo đúng kiểu dữ liệu và miền giá trị được mô tả.
Ví dụ 1
Input
answer = 'the cat sat on the mat'
context = 'the cat sat on the mat'Output
'the cat sat on the mat'Giải thích
Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.
Ví dụ 2
Input
answer = 'the cat sat on the mat'
context = 'the cat ran fast'
score = compute_faithfulness(answer, context)Output
0.4Giải thích
Hàm/lớp được gọi với các tham số mẫu trên và trả về kết quả số học / kích thước tensor tương ứng theo đúng thiết kế.
Gợi ý và lời giải chỉ mở sau khi bạn bấm Nộp bài. Giáo viên và quản trị viên mở được ngay.
Góp ý & báo lỗi bài tập
Đề bài chưa rõ, test có vấn đề hay bạn có ý tưởng giúp bài tốt hơn? Gửi cho đội ngũ AI Empire nhé — mỗi góp ý đều được đọc.
