A/B testing là công cụ ra quyết định dựa trên dữ liệu phổ biến nhất trong sản phẩm số — nhưng cũng dễ bị làm sai (p-hacking, sample size không đủ, dừng test quá sớm). Nhà tuyển dụng dùng chủ đề này để kiểm tra tư duy thống kê thực chất.
P-value là gì, không phải là gì? — P-value là xác suất quan sát được kết quả (hoặc cực đoan hơn) NẾU giả thuyết không (null hypothesis — không có khác biệt) là đúng. Nó KHÔNG phải là xác suất giả thuyết đúng, và cũng không đo độ lớn của hiệu ứng (effect size).
Statistical power là gì? — Xác suất phát hiện được hiệu ứng thật nếu nó thực sự tồn tại. Power thấp (do sample size nhỏ) dễ dẫn tới false negative — kết luận "không có khác biệt" trong khi thực ra có nhưng chưa đủ dữ liệu để phát hiện.
"Test chạy 3 ngày đã thấy version B thắng rõ rệt, có nên dừng sớm không?" — Không nên. Dừng test khi thấy kết quả có vẻ tốt (thay vì theo kế hoạch mẫu/thời gian đã tính trước) là lỗi "peeking" — làm tăng false positive rate đáng kể. Cần xác định trước sample size cần thiết (power analysis) và tuân thủ.
"Test A/B có kết quả không có ý nghĩa thống kê (p > 0.05), điều đó có nghĩa 2 version giống nhau không?" — Không. "Không đủ bằng chứng để bác bỏ giả thuyết không" khác với "chứng minh được không có khác biệt". Có thể do sample size chưa đủ để phát hiện effect size thực tế.
"Làm sao chọn metric chính (primary metric) cho A/B test?" — Metric chính phải liên kết trực tiếp với mục tiêu kinh doanh của thay đổi đang test (vd. test nút CTA mới thì conversion rate là primary, không phải page view), và nên có metric phụ (guardrail metric) để đảm bảo thay đổi không gây hại ở khía cạnh khác (vd. tăng conversion nhưng giảm retention).
Novelty effect (hiệu ứng mới lạ khiến user tương tác nhiều hơn ban đầu rồi giảm dần — cần test đủ lâu để loại trừ), và multiple comparison problem (test nhiều metric cùng lúc làm tăng khả năng tìm thấy kết quả "có ý nghĩa" chỉ do ngẫu nhiên — cần điều chỉnh ngưỡng ý nghĩa, vd. Bonferroni correction).
Nếu từng chạy A/B test thật, hãy kể rõ: giả thuyết ban đầu, metric đo lường, kích thước mẫu, và quan trọng nhất — bạn xử lý thế nào khi kết quả không như kỳ vọng (đây là lúc thể hiện tư duy khoa học thật sự thay vì chỉ tìm cách chứng minh ý tưởng ban đầu đúng).