Một mô hình được báo cáo với hiệu năng tổng thể tốt. Nhưng con số tổng là trung bình có trọng số — và trung bình che giấu sự khác biệt.
Vì sao chênh lệch xuất hiện
Dữ liệu huấn luyện không đại diện
Nguyên nhân phổ biến nhất. Nếu một nhóm chiếm tỷ lệ nhỏ trong dữ liệu huấn luyện, mô hình học được ít mẫu hình của nhóm đó.
Và vì hàm mất mát tối ưu trên toàn bộ dữ liệu, việc hoạt động kém ở nhóm nhỏ ít ảnh hưởng tới kết quả tổng — nên quá trình huấn luyện không có động lực cải thiện.
Biểu hiện bệnh khác nhau
Một số bệnh có biểu hiện khác nhau giữa các nhóm tuổi hoặc giới. Nếu dữ liệu huấn luyện chủ yếu từ một nhóm, mô hình học biểu hiện điển hình của nhóm đó.
Chất lượng dữ liệu đầu vào khác nhau
Nếu một nhóm thường được chụp bằng loại thiết bị khác, hoặc trong điều kiện khác, đặc tính dữ liệu sẽ khác.
Tỷ lệ hiện mắc khác nhau
Cùng một mô hình với cùng độ nhạy và độ đặc hiệu sẽ cho giá trị tiên đoán dương khác nhau ở các nhóm có tỷ lệ hiện mắc khác nhau.
Nhãn có thiên lệch
Nếu nhãn được tạo từ chẩn đoán trong thực hành, và thực hành vốn có sự khác biệt trong việc chẩn đoán giữa các nhóm, thì mô hình sẽ học lại sự khác biệt đó.
Đây là cơ chế tinh vi nhất: mô hình không tạo ra thiên lệch mà sao chép thiên lệch có sẵn trong dữ liệu.
Vì sao con số tổng che giấu
Nếu một nhóm chiếm tỷ lệ nhỏ trong tập kiểm định, hiệu năng kém ở nhóm đó chỉ làm giảm con số tổng một chút.
Kết quả: báo cáo tổng thể vẫn tốt, trong khi nhóm đó chịu rủi ro cao hơn hẳn — và không ai biết.
Phân tích phân nhóm
Xác định nhóm trước
Dựa trên hiểu biết lâm sàng, không dò tìm ngẫu nhiên trong dữ liệu.
Các chiều thường cần phân tích:
- Nhóm tuổi.
- Giới.
- Các đặc điểm sinh học có liên quan tới bệnh đang xét.
- Loại thiết bị tạo dữ liệu.
- Tuyến điều trị.
- Mức độ nặng của bệnh.
- Sự hiện diện của bệnh kèm.
Báo cáo đầy đủ
Với mỗi nhóm: cỡ mẫu, các chỉ số hiệu năng, khoảng tin cậy.
Khoảng tin cậy quan trọng: với nhóm nhỏ, ước lượng không chắc chắn, và cần nói rõ điều đó thay vì báo một con số như thể nó chính xác.
Vấn đề cỡ mẫu
Đây là khó khăn thực tế: chính các nhóm cần phân tích nhất lại thường có ít dữ liệu nhất.
Không có cách giải quyết hoàn hảo. Cách trung thực là báo cáo rõ cỡ mẫu và mức không chắc chắn, thay vì bỏ qua nhóm đó.
Các biện pháp xử lý
Bổ sung dữ liệu
Cách căn bản nhất nhưng tốn kém và mất thời gian. Cần chủ động thu thập thêm dữ liệu từ nhóm thiếu đại diện.
Điều chỉnh trọng số khi huấn luyện
Tăng trọng số cho nhóm ít dữ liệu. Có thể cải thiện hiệu năng nhóm đó, thường đổi lại một chút ở nhóm khác.
Ngưỡng riêng theo nhóm
Dùng ngưỡng vận hành khác nhau cho các nhóm khác nhau.
Về mặt kỹ thuật khả thi, nhưng đặt ra câu hỏi cần cân nhắc kỹ về mặt lâm sàng và đạo đức — và cần được quyết định bởi hội đồng chuyên môn, không phải bởi nhóm kỹ thuật.
Giới hạn phạm vi sử dụng
Nếu mô hình hoạt động kém ở một nhóm, loại nhóm đó khỏi phạm vi sử dụng và xử lý theo cách khác.
Đây là cách an toàn nhất, và nó cần được nêu rõ trong tài liệu sản phẩm.
Thông báo cho người dùng
Biện pháp tối thiểu: người dùng phải biết hệ thống hoạt động kém hơn ở nhóm nào, để tăng cảnh giác tương ứng.
Giám sát sau triển khai
Chênh lệch có thể xuất hiện sau khi triển khai, ngay cả khi kiểm định trước đó không thấy:
- Quần thể thực tế khác với quần thể kiểm định.
- Thành phần người bệnh thay đổi theo thời gian.
- Thiết bị mới được đưa vào.
Vì vậy giám sát định kỳ nên tách theo nhóm, không chỉ theo tổng.
Trách nhiệm của các bên
Nhà sản xuất
- Cung cấp dữ liệu hiệu năng tách theo nhóm.
- Nêu rõ thành phần dữ liệu huấn luyện.
- Nêu rõ các nhóm mà sản phẩm chưa được kiểm định đủ.
Cơ sở sử dụng
- Yêu cầu dữ liệu phân nhóm trước khi mua.
- Đánh giá xem quần thể của mình có khớp với quần thể kiểm định không.
- Giám sát hiệu năng theo nhóm sau triển khai.
- Thông báo cho người dùng về các hạn chế đã biết.
Một câu hỏi khi mua sản phẩm
"Xin cho biết hiệu năng tách theo nhóm tuổi, giới và loại thiết bị, kèm cỡ mẫu của từng nhóm."
Đây là yêu cầu hợp lý, và phản ứng với nó nói lên nhiều điều.
Một nhà sản xuất đã làm phân tích này sẽ có sẵn dữ liệu. Một nhà sản xuất chưa làm sẽ trả lời chung chung — và đó là thông tin cần biết trước khi quyết định.
Câu hỏi thường gặp
Vì sao hiệu năng tổng thể không đủ để đánh giá?
Vì nó là trung bình có trọng số theo số lượng. Một nhóm chiếm tỷ lệ nhỏ trong dữ liệu có thể có hiệu năng rất kém mà con số tổng vẫn đẹp, và chính nhóm đó lại là nhóm chịu rủi ro cao nhất.
Nguyên nhân thường gặp là gì?
Chủ yếu là dữ liệu huấn luyện không đủ đại diện cho nhóm đó, khiến mô hình học được ít mẫu hình của họ. Ngoài ra còn có trường hợp biểu hiện bệnh khác nhau giữa các nhóm, hoặc chất lượng dữ liệu đầu vào khác nhau.
Nên phân tích theo những nhóm nào?
Tuổi, giới, các nhóm có đặc điểm sinh học khác biệt liên quan tới bệnh, loại thiết bị tạo dữ liệu, tuyến điều trị, và các nhóm có tỷ lệ hiện mắc khác nhau. Cần xác định trước dựa trên hiểu biết lâm sàng chứ không dò tìm ngẫu nhiên.
Phát hiện ra chênh lệch thì xử lý thế nào?
Tuỳ mức độ: có thể giới hạn phạm vi sử dụng loại trừ nhóm đó, điều chỉnh ngưỡng riêng cho nhóm, bổ sung dữ liệu huấn luyện, hoặc tối thiểu là thông báo rõ cho người dùng về hạn chế này.