Metric sai hướng khiến bạn tối ưu nhầm mục tiêu — model có accuracy cao vẫn có thể vô dụng thực tế nếu bài toán có dữ liệu mất cân bằng hoặc chi phí sai loại lỗi khác nhau. Nhà tuyển dụng dùng câu hỏi này để kiểm tra tư duy đánh giá thực chất, không chỉ biết công thức.
"Khi nào ưu tiên Precision, khi nào ưu tiên Recall?" — Ưu tiên Precision khi chi phí false positive cao (vd. hệ thống duyệt vay tự động — duyệt nhầm người không đủ điều kiện gây thiệt hại tài chính trực tiếp). Ưu tiên Recall khi chi phí false negative cao (vd. sàng lọc bệnh — bỏ sót ca bệnh thật nguy hiểm hơn nhiều báo động giả).
"AUC-ROC là gì, khi nào không phù hợp?" — Đo khả năng phân biệt giữa 2 lớp ở mọi ngưỡng quyết định (threshold) — hữu ích khi chưa xác định rõ ngưỡng cụ thể. Không phù hợp khi dữ liệu mất cân bằng nghiêm trọng (nên dùng Precision-Recall AUC thay thế vì ROC-AUC có thể "lạc quan giả" với lớp thiểu số).
"MAE và RMSE khác nhau thế nào, khi nào dùng cái nào?" — RMSE phạt nặng hơn với sai số lớn (bình phương trước khi tính trung bình) — phù hợp khi outlier lớn thực sự nguy hiểm, cần model tránh sai số lớn bằng mọi giá. MAE cho trọng số đều với mọi sai số — phù hợp khi outlier không quan trọng hơn sai số nhỏ thường xuyên.
"Làm sao phát hiện data drift khi không có label mới ngay lập tức (label thường có độ trễ)?" — Theo dõi phân phối thống kê của input feature theo thời gian (dùng các phương pháp như Population Stability Index, Kolmogorov-Smirnov test) để phát hiện thay đổi bất thường mà không cần đợi có label thật để tính lại metric hiệu suất.
"Phát hiện drift rồi thì làm gì tiếp theo?" — Không phải lúc nào cũng cần retrain ngay — cần điều tra nguyên nhân drift (thay đổi hành vi user thật, hay lỗi thu thập dữ liệu upstream), đánh giá mức độ ảnh hưởng tới business metric thực tế trước khi quyết định retrain (tốn chi phí) hay chỉ giám sát thêm.
Chỉ nhắc tới accuracy như metric duy nhất — đây là dấu hiệu thiếu kinh nghiệm thực chiến với dữ liệu thật (hầu như luôn có vấn đề mất cân bằng hoặc chi phí lỗi không đối xứng ở mức độ nào đó).
Kể 1 case cụ thể: metric chính đã chọn và lý do liên kết với mục tiêu kinh doanh, và nếu từng gặp model drift thật — cách phát hiện và quyết định xử lý (retrain, điều chỉnh threshold, hay giữ nguyên và chỉ giám sát thêm).