Khi đánh giá một hệ thống hỗ trợ đọc phim, câu hỏi thường được đặt là mô hình chính xác tới đâu. Câu hỏi ít được đặt hơn — và quan trọng hơn — là hiệu năng của người đọc thay đổi thế nào khi có hệ thống.
Hai chiều tác động
Chiều thứ nhất: chấp nhận gợi ý sai
Hệ thống đánh dấu một vùng bình thường là bất thường. Người đọc, thấy dấu hiệu được đánh dấu, xem kỹ hơn và bắt đầu nhìn thấy thứ không có.
Hiện tượng này được ghi nhận trong các nghiên cứu về hệ thống phát hiện có máy tính hỗ trợ.
Chiều thứ hai: bỏ qua phát hiện đúng của chính mình
Đây là chiều nguy hiểm hơn và ít được nói tới.
Người đọc nhận ra một dấu hiệu bất thường. Hệ thống không đánh dấu nó. Người đọc bắt đầu nghi ngờ chính mình và bỏ qua.
Đây là dạng gây hại nhất, vì nó phá huỷ chính phần giá trị mà người đọc mang lại: khả năng nhận ra những thứ nằm ngoài danh mục mà mô hình được huấn luyện để tìm.
Nghịch lý của một hệ thống tốt
Một hệ thống có độ chính xác cao làm tăng — chứ không giảm — nguy cơ thiên lệch tự động hoá.
Cơ chế: hệ thống đúng nhiều lần liên tiếp, người dùng dần tin tưởng, mức cảnh giác giảm.
Rồi tới lần nó sai — và đó thường là ca khó, ca không điển hình, tức chính ca cần sự cảnh giác nhất.
Đây là lý do vì sao không thể đánh giá một hệ thống chỉ bằng độ chính xác của mô hình đứng một mình.
Các yếu tố làm tăng thiên lệch
- Áp lực thời gian. Hàng đợi dài, ít thời gian mỗi ca.
- Ca khó. Khi không chắc, người ta bám vào gợi ý bên ngoài.
- Thiếu kinh nghiệm. Người mới chịu ảnh hưởng nhiều hơn.
- Hệ thống trình bày quá tự tin. Một con số xác suất kèm màu đỏ gây ảnh hưởng mạnh hơn một dấu hiệu nhẹ.
- Gợi ý hiện ra trước khi người đọc kịp có nhận định riêng.
Yếu tố cuối là yếu tố thiết kế, và cũng là yếu tố can thiệp được dễ nhất.
Biện pháp thiết kế
Đọc độc lập trước, hiện gợi ý sau
Đây là biện pháp có cơ sở mạnh nhất.
Người đọc xem phim và ghi nhận định ban đầu. Sau đó hệ thống hiện kết quả. Nếu có khác biệt, người đọc xem lại và quyết định.
Cách này giữ được đánh giá độc lập của con người — tức là giữ được nguồn thông tin thứ hai thật sự, thay vì biến nó thành sự xác nhận cho máy.
Cái giá: tốn thêm thời gian. Đây là đánh đổi cần cân nhắc theo bối cảnh.
Trình bày mức độ chắc chắn một cách hiệu chuẩn
Nếu hệ thống đưa ra điểm số, điểm đó cần được hiệu chuẩn để phản ánh đúng xác suất thật, không phải một con số tuỳ ý.
Một hệ thống nói "khả năng cao" cho các trường hợp mà thực tế chỉ đúng một nửa số lần đang gây hiểu nhầm có hệ thống.
Cho thấy căn cứ, không chỉ kết luận
Hiển thị vùng mà mô hình dựa vào giúp người đọc đánh giá xem gợi ý có hợp lý không, thay vì chỉ chấp nhận hoặc từ chối một con số.
Không bắt buộc phản hồi từng cảnh báo
Bắt người đọc bấm xác nhận cho mọi cảnh báo tạo ra thói quen bấm tự động — phản tác dụng hoàn toàn.
Đào tạo: phần hay bị bỏ qua
Người dùng cần biết những gì trước khi bắt đầu dùng một hệ thống:
- Mô hình được huấn luyện để tìm những gì — và quan trọng hơn, những gì không nằm trong danh mục đó.
- Nó hay sai ở loại ca nào.
- Hiệu năng trên quần thể của chính cơ sở này, không phải con số trong bài báo.
- Rằng việc không được đánh dấu không có nghĩa là bình thường.
Điểm cuối đáng nhấn mạnh trong mọi buổi đào tạo, vì nó chống lại trực tiếp chiều tác động nguy hiểm nhất.
Theo dõi sau triển khai
Các chỉ số nên đo, tách theo nhóm được và không được hệ thống đánh dấu:
- Tỷ lệ bỏ sót ở nhóm không được hệ thống đánh dấu — nếu tăng so với trước khi triển khai, đó là dấu hiệu thiên lệch.
- Tỷ lệ dương tính giả ở nhóm được đánh dấu.
- Tỷ lệ người đọc bác bỏ gợi ý của hệ thống — quá thấp cũng là dấu hiệu đáng chú ý.
- Thời gian đọc trung bình.
Chỉ số thứ ba thú vị: nếu gần như không ai bao giờ không đồng ý với hệ thống, khả năng cao là người đọc đã ngừng đánh giá độc lập.
Một nguyên tắc
Khi đánh giá một hệ thống hỗ trợ đọc phim, đơn vị đánh giá phải là tổ hợp người và máy, không phải máy đứng một mình.
Một mô hình chính xác hơn người có thể vẫn làm tổ hợp kém đi, nếu cách nó tương tác với người đọc phá vỡ sự đánh giá độc lập.
Đây là lý do vì sao các nghiên cứu so sánh "AI với bác sĩ" ít hữu ích hơn các nghiên cứu so sánh "bác sĩ có AI với bác sĩ không có AI".
Câu hỏi thường gặp
Thiên lệch tự động hoá là gì trong bối cảnh đọc phim?
Là xu hướng người đọc chấp nhận gợi ý của hệ thống hơn mức hợp lý, hoặc ngược lại bỏ qua nhận định của chính mình khi nó mâu thuẫn với máy. Cả hai chiều đều làm thay đổi hiệu năng đọc theo hướng không mong muốn.
Chiều tác động xấu nào ít được nói tới?
Việc người đọc bỏ qua một tổn thương mình đã nhận ra vì hệ thống không đánh dấu nó. Đây là dạng nguy hiểm hơn vì nó làm mất chính phần giá trị mà người đọc mang lại so với máy.
Thiết kế giao diện ảnh hưởng thế nào?
Rất nhiều. Việc hiển thị gợi ý trước hay sau khi người đọc đưa ra nhận định ban đầu, cách trình bày mức độ chắc chắn, và việc có bắt buộc phản hồi hay không đều làm thay đổi mức độ ảnh hưởng.
Biện pháp giảm thiểu hiệu quả nhất là gì?
Cho người đọc đưa ra nhận định độc lập trước rồi mới hiện gợi ý của hệ thống. Cách này giữ được đánh giá độc lập của con người trong khi vẫn tận dụng được khả năng phát hiện của mô hình.