CHỦ ĐỀ 04 · Đánh giá & tối ưu
Xây bộ đánh giá trước khi tối ưu
Đo đúng vấn đề, phân tầng kết quả và tránh tối ưu trên một bộ ví dụ quá dễ.
01Từ tiêu chí tới test case
Mỗi tiêu chí thành công cần tình huống kiểm tra. Bao gồm luồng bình thường, dữ liệu thiếu, đầu vào nhiễu và hành vi vượt quyền. Chia kết quả theo nhóm người dùng hoặc loại tác vụ để một tỷ lệ trung bình đẹp không che đi nhóm bị lỗi nghiêm trọng.
02Chọn cách chấm phù hợp
Dùng code cho exact match, schema và quy tắc xác định. Dùng rubric khi đánh giá nội dung có nhiều cách đúng. Nếu dùng LLM làm giám khảo, hiệu chuẩn với con người, kiểm tra thiên lệch và theo dõi mức đồng thuận. Một giám khảo tự tin không phải là bằng chứng độc lập.
03Giữ tập kiểm tra độc lập
Tách dữ liệu chỉnh prompt khỏi holdout. Phiên bản hoá model, prompt, retrieval và tiêu chí chấm. Khi cải tiến, so với baseline trên cùng điều kiện; dùng các lỗi production đã được xử lý dữ liệu phù hợp làm regression tests.
GÓC QUYẾT ĐỊNH
Prompt mới đạt 98% trên những ví dụ dùng để chỉnh prompt, nhưng chưa có holdout.
Chưa kết luận khả năng tổng quát hoá. Đánh giá trên dữ liệu độc lập, phân nhóm kết quả và kiểm tra những tình huống rủi ro trước khi rollout.
Những điều cần giữ lại
- Tiêu chí đo phải bám mục tiêu của sản phẩm.
- LLM-as-judge cần hiệu chuẩn và kiểm tra.
- Dữ liệu tinh chỉnh và dữ liệu kiểm chứng cần được tách.
Thuật ngữ quan trọng
7 thuật ngữ của bài — lưu thành thẻ ghi nhớ để ôn theo lịch.
- Eval
- Bộ tình huống kiểm tra kèm cách chấm, dùng để đo hệ thống có đạt tiêu chí thành công hay không. Xây trước khi tối ưu prompt hay đổi model.
- Edge case
- Tình huống ngoài luồng bình thường — dữ liệu thiếu, đầu vào nhiễu, yêu cầu vượt quyền, nguồn mâu thuẫn. Bộ kiểm tra chỉ có trường hợp dễ thì điểm cao không chứng minh được gì.
- Result slicing
- Chia kết quả đánh giá theo nhóm người dùng hoặc loại tác vụ, để một tỷ lệ trung bình đẹp không che mất nhóm đang bị lỗi nghiêm trọng.
- Rubric
- Bảng tiêu chí chấm dùng khi nội dung có nhiều cách đúng. Phần xác định được như exact match, schema hay quy tắc cố định thì vẫn chấm bằng code.
- LLM-as-judge
- Dùng một LLM làm giám khảo chấm đầu ra. Phải hiệu chuẩn với người chấm, kiểm tra thiên lệch và theo dõi mức đồng thuận — giám khảo tự tin không phải bằng chứng độc lập.
- Holdout set
- Tập dữ liệu giữ riêng, không dùng khi chỉnh prompt, để đo khả năng tổng quát hoá. Đạt 98% trên chính các ví dụ đã dùng để chỉnh chưa đủ để kết luận.
- Regression test
- Test giữ lại các lỗi đã từng gặp, kể cả lỗi production đã xử lý dữ liệu phù hợp, để mỗi lần đổi model, prompt hay retrieval đều kiểm rằng lỗi cũ không quay lại.
THỬ ÁP DỤNG
Viết 5 test case cho trợ lý tra cứu chính sách, gồm một trường hợp nguồn mâu thuẫn và một yêu cầu vượt quyền.