Hệ thống production sẽ luôn có sự cố — điều nhà tuyển dụng muốn biết không phải bạn có tránh được sự cố hay không, mà là bạn phản ứng có hệ thống thế nào khi nó xảy ra, đặc biệt dưới áp lực thời gian.
"Bạn đang on-call, nhận alert lúc 2 giờ sáng báo API lỗi 500 tăng đột biến, bạn làm gì đầu tiên?" — Câu trả lời tốt theo đúng thứ tự: kiểm tra dashboard/log để xác nhận mức độ nghiêm trọng thật (tránh false alarm), xem có deploy gần đây không (nguyên nhân phổ biến nhất), và quyết định rollback ngay nếu deploy gần đây là nghi phạm chính — không cần đợi điều tra kỹ mới hành động khi hậu quả đang lan rộng.
"Sự cố đã fix nhưng bạn không chắc nguyên nhân gốc rễ, có nên đóng ticket không?" — Không nên đóng vội — nên ghi rõ giả thuyết nguyên nhân, hành động đã làm để giảm thiểu, và kế hoạch điều tra tiếp theo. Đóng ticket khi chưa hiểu rõ nguyên nhân dễ khiến sự cố lặp lại.
Khả năng giữ bình tĩnh và làm việc có hệ thống dưới áp lực (không hoảng loạn thử nhiều thứ cùng lúc mà không ghi lại đã thử gì), và tư duy "ưu tiên khôi phục dịch vụ trước, phân tích sâu sau" — đây là khác biệt lớn giữa người có kinh nghiệm on-call thật và người chỉ biết lý thuyết.
Hãy trung thực và thể hiện tư duy đúng hướng: "Em chưa từng on-call chính thức, nhưng khi gặp lỗi production ở dự án X, em đã ưu tiên rollback trước rồi mới điều tra nguyên nhân, và viết lại báo cáo để team rút kinh nghiệm." Cách tiếp cận đúng quan trọng hơn số năm kinh nghiệm on-call.