Viết bài bằng AI. Dịch bằng AI. Sửa link bằng AI. Thống kê lượt truy cập bằng AI. Hỏi AI “chỗ này có khó hiểu không?”, rồi lại nhờ AI sửa.
Đi đến mức này thì thường sẽ nảy ra một vấn đề.
Ai cũng quá quen với website này.
Người làm ra nó biết nút này có nghĩa là gì. AI đọc tài liệu đặc tả là hiểu ngay “nút này dành cho bài viết liên quan”. Người vận hành đã xem đi xem lại quá nhiều lần, nên dù có chỗ hơi lạ, não cũng tự động “vá” lại giúp.
Nhưng người lần đầu ghé qua thì không như vậy.
“Cái này là gì vậy?” “Bấm vào đâu đây?” “Sao chỉ mỗi chỗ này là tiếng Anh?” “Không quay lại được.” “Chữ thì đọc được, nhưng sao cứ thấy khó chịu khó chịu.”
Tôi cần chính cái “sao cứ thấy” đó.
Và ý tưởng cuối cùng nảy ra khá thú vị.
Cuối cùng, tôi sẽ thuê người thật làm khâu gỡ lỗi (debug).
Mà còn trả 1 yên cho mỗi góp ý, tối đa 1.000 yên một người.
Thời đại con người cướp việc của AI đã đến. Mảng phụ trách của họ là “cảm giác sai sai”.
1. Thứ muốn thuê không phải là review code, mà là “chỗ vấp ngay lần nhìn đầu tiên”
Lần này tôi không cần một cuộc kiểm toán quy mô lớn của chuyên gia.
- Không hiểu nút này có nghĩa là gì
- Không biết nên đi đâu tiếp
- Tiêu đề nghe lạ
- Bấm khó trên điện thoại
- Link dẫn đến trang bằng ngôn ngữ khác
- Bấm vào đâu đó thì màn hình trắng xóa
- Câu đúng ngữ pháp, nhưng người đọc thấy kỳ
- Ở đây mà có thêm một tính năng thì tiện
Đại loại như vậy.
Digital.gov, trang hướng dẫn web của chính phủ Mỹ, mô tả kiểm thử khả năng sử dụng (usability testing) là cách quan sát người dùng thật khi họ thử dùng một sản phẩm hay dịch vụ. [1] GOV.UK, cổng thông tin của chính phủ Anh, cũng nói rằng việc quan sát người dùng thật thao tác giúp phát hiện những vấn đề cụ thể như ngôn ngữ và bố cục. [2]
Nói cách khác, “cho người thật bấm thử một lần” không phải là nghi thức bí ẩn bỗng xuất hiện trong thời đại AI.
Đó là bài kiểm thử khả năng sử dụng có từ lâu, nay quay lại với một website mà AI có thể sản xuất và sửa hàng loạt.
2. Có khi chính người vận hành lại là người kiểm tra tệ nhất
Hằng ngày xem kỹ website của chính mình.
Nói thì dễ. Nhưng khi bài viết, ngôn ngữ và tính năng cứ nhiều lên thì đơn giản là không làm nổi.
Hơn nữa, “người làm ra tự kiểm tra” còn có một vấn đề khác.
Họ biết ô tìm kiếm nằm đâu. Họ biết bài liên quan hiện ở chỗ nào. Họ biết cách chuyển ngôn ngữ hoạt động ra sao. Dù có chỗ hơi lạ, họ cũng bỏ qua vì nghĩ “vốn dĩ nó vậy mà”.
Và quan trọng nhất, xem lại thật là phiền.
Điều này quan trọng hơn bạn nghĩ.
Nếu chỉ dùng ý chí để chống lại sự phiền, kiểu “mỗi ngày kiểm tra 100 trang”, thì cách làm đó sẽ không bền. Vậy thì tách riêng khâu phiền phức đó ra.
Người vận hành không cần là người xem tất cả.
Chỉ cần là người quyết định cần xem gì, và dựng cơ chế sửa những bất thường được gom về.
3. 1 yên mỗi góp ý không mua “ý tưởng”, mà mua đôi mắt còn mới
Chỉ nhìn con số thì 1 yên một góp ý rẻ đến mức khó tin.
Nhưng thứ tôi muốn mua ở đây không phải là một bản tư vấn bóng bẩy.
Mà là sự thật rằng một đôi mắt lần đầu nhìn đã vấp ở đây một lần.
Một người gửi 1.000 điều thì được 1.000 yên. Nhưng nếu chỉ là cùng một nội dung viết lại bằng lời khác thì chỉ tính 1 góp ý. Mức thù lao tối đa cho mỗi người cũng là 1.000 yên.
Mức trần này khá quan trọng.
Ngay khi nói “tôi muốn có thật nhiều”, cả thế giới sẽ lập tức chạy theo hướng “vậy cho AI nghĩ ra 10.000 điểm cải thiện thì được 10.000 yên à?”.
Vì thế, cùng với việc trả theo số lượng, tôi đặt đồng thời các điều kiện sau:
- Phải thực sự xem website
- Chỉ viết về những chỗ và hành vi có thật
- Không độn danh sách bằng cách diễn đạt lại cùng một góp ý
- Có mức trần
Nói thêm, 1 yên một góp ý chỉ là thiết kế cho thử nghiệm lần này, không phải mức thù lao hợp lý chung cho mọi trường hợp. Nếu nhờ làm việc nhiều giờ hoặc đánh giá chuyên môn, điều kiện cần được điều chỉnh cho phù hợp với thời gian và độ khó.
4. Kẻ thù lớn nhất là “tôi cho AI nghĩ ra 10.000 điểm cải thiện rồi”
Không cần cấm dùng AI.
Vấn đề nằm ở những đề xuất cải thiện được viết mà chưa từng xem website một lần nào.
“Nói chung, website nên làm cho điều hướng dễ hiểu hơn.” “Hãy cải thiện khả năng tiếp cận.” “Hãy tối ưu cho nhiều kích thước màn hình.”
Đều đúng cả.
Và đều không phải thứ tôi cần lần này.
Thứ tôi cần là những quan sát như:
“Trang này, nút này: tôi không biết bấm vào thì sẽ xảy ra gì.” “Ngay sau tiêu đề này, chủ đề đột ngột nhảy sang chuyện khác.” “Chỉ riêng phiên bản ngôn ngữ này, bài viết liên quan lại dẫn sang một ngôn ngữ khác.”
AI có thể dùng để rút gọn những quan sát đó và gộp các mục trùng.
Con người phát hiện, AI sắp xếp.
Điều quan trọng là đừng đảo ngược thứ tự này.
5. Nếu gửi từng góp ý một qua chat, người nhờ việc sẽ kiệt sức trước
Nếu muốn số lượng báo cáo tăng, cách nộp cũng phải được thiết kế.
Kiểu khổ nhất là:
“Góp ý thứ nhất đây.” “Thứ hai.” “À quên, thứ ba.” “Bổ sung thêm cái thứ tư.”
Khung chat cứ dài mãi không dứt.
Như vậy, đã thuê người gỡ lỗi rồi mà lại phát sinh một việc thủ công mới là gom báo cáo.
Vì thế, nộp một lần. Cách nào cũng được:
- Excel
- Bảng tính
- File txt
- Danh sách đánh số
- Văn bản có thể sao chép và dán
Về nguyên tắc, ảnh chụp màn hình cũng không cần. Ảnh thì xem cho tiện, nhưng sau này khi tìm kiếm, loại trùng hay cho AI xử lý sẽ gây nhiều vướng mắc.
Hướng dẫn nghiên cứu người dùng của GOV.UK cũng nói rằng ghi chú đánh máy dễ lưu và phân tích sau này, và tách mỗi quan sát thành một mục sẽ dễ sắp xếp và phân tích hơn. [3]
Định dạng đơn giản là đủ.
Ở đâu / hiện đang thế nào / nên làm sao thì tốt hơn
Nếu là lỗi (bug):
Ở đâu / đã làm gì / điều gì xảy ra
Chỉ cần vậy là AI ở khâu sau đã làm được khá nhiều việc.
6. Với website nhiều ngôn ngữ, “đã dịch xong” và “người đọc được” là hai chuyện khác nhau
Website đa ngôn ngữ còn thú vị hơn nữa.
Xét theo máy móc, cả 12 ngôn ngữ đều tạo thành công. Build thành công. HTTP 200. Link cũng tồn tại.
Vậy mà khi người ta xem, vẫn có thể thấy khá nhiều chỗ lạ.
- Một phần còn sót lại ngôn ngữ gốc
- Chỉ riêng các nút là dịch kỳ
- Câu có nghĩa, nhưng với người bản ngữ thì không tự nhiên
- Chữ dài ra làm vỡ bố cục
- Sau khi đổi ngôn ngữ, chỉ riêng bài liên quan quay về ngôn ngữ gốc
- Rõ ràng là cùng một bài nhưng thiếu mất một phần
Phần này chỉ cần người đọc được ngôn ngữ đó xem.
Người đọc được tiếng Anh thì xem tiếng Anh. Người đọc được tiếng Hàn thì xem tiếng Hàn. Tiếng Trung, Tây Ban Nha, Bồ Đào Nha, Indonesia, Thái, Việt, Pháp, Đức cũng vậy.
Không cần cho mọi người xem mọi ngôn ngữ.
Máy xác nhận “đã tạo xong”, người xác nhận “đọc có tự nhiên không”.
Vai trò khác nhau.
7. Trùng lặp chỉ tính 1 góp ý khi trả thưởng, nhưng với phân tích thì cực kỳ quan trọng
Nếu cùng một người viết:
“Nút này khó hiểu.” “Không rõ ý nghĩa của nút.” “Nút này là gì vậy?”
thì chỉ tính 1 góp ý là đủ.
Nhưng nếu ba người khác nhau, mỗi người độc lập, cùng vấp ở một nút, thì câu chuyện đã khác.
Đó không còn là trùng lặp đơn thuần, mà là một điểm cản trở có thể tái hiện.
Vì vậy khi tổng hợp, tôi tách ra như sau:
- Diễn đạt lại trong cùng một người → gộp lại
- Cùng một góp ý do những người khác nhau đưa ra độc lập → giữ lại làm tần suất
“Ba người cùng lạc ở một chỗ” có sức nặng hơn sở thích của người vận hành.
GOV.UK cũng đưa vào tiêu chuẩn dịch vụ việc thường xuyên kiểm tra khả năng sử dụng với người dùng thật hoặc dự kiến, và thử nghiệm trên các thiết bị phản ánh hành vi của người dùng. [4]
Tăng số người không phải để “bỏ phiếu ý kiến”, mà là để xem cùng một điểm cản trở có xảy ra với người khác hay không.
8. Hình thái hoàn chỉnh là AI → người → AI, và con người trở thành cảm biến
Quy trình cuối cùng khá gọn gàng.
- AI tạo bài viết
- AI dịch
- AI kiểm tra link, cấu trúc và hiển thị
- AI sửa những lỗi đã biết
- Con người thực sự đọc, bấm và bị lạc
- Con người viết ra “thấy sai sai” bằng văn bản
- AI gộp các mục trùng
- AI phân loại theo mức độ nghiêm trọng, khả năng tái hiện và chi phí sửa
- AI soạn phương án sửa
- Sau khi sửa, quay lại kiểm tra bằng máy và người xác nhận
Cuối cùng, đến con người cũng trở thành một khâu trong dây chuyền.
Nhưng việc còn lại cho con người không phải là việc tay chân đơn giản.
Đó là phát hiện những điểm cản trở mà chỉ con người mới cảm nhận được.
Thậm chí giống thăng chức hơn.
Để máy xem “link có bị 404 không”, còn để người xem “không phải 404, nhưng không hiểu sao mình bị đưa đến đây”.
Để máy xem “chuỗi đã dịch có tồn tại không”, còn để người xem “có thì có, nhưng người bình thường không nói như vậy”.
Phân chia như vậy tự nhiên hơn.
9. Người thử nghiệm xem thì lượt xem trang cũng tăng. Nhưng đó không phải mục đích
Đương nhiên, cho người ta xem hàng chục trang thì lượt xem sẽ tăng.
Với website có quảng cáo, quảng cáo cũng có thể hiển thị theo lượt xem thông thường.
Nhưng đây hoàn toàn chỉ là sản phẩm phụ.
Thiết kế kiểu yêu cầu bấm quảng cáo, hay đặt việc tăng số lần hiển thị quảng cáo làm điều kiện công việc thì lại là chuyện khác hẳn.
Thứ tôi mua không phải lượt xem trang.
Mà là những quan sát còn lại sau khi một người đã xem trang.
Nếu tiện thể lượt truy cập tăng chút ít, cứ nghĩ là “đang làm kiểm thử người dùng thì máy tính tiền cũng kêu leng keng một chút” là vừa.
10. Điểm cuối của tự động hóa không phải là “không còn người”
Khi bắt đầu dùng AI, ta dễ muốn biết có thể loại bỏ con người đến mức nào.
Nhưng khi thực sự đẩy tự động hóa đi, đôi khi lại ra kết luận ngược lại.
Không cần loại bỏ hết con người.
Chỉ cần chuyển con người đến nơi mà chỉ con người mới tạo ra giá trị.
Soạn thảo bài viết. Dịch thuật. Dọn các mục trùng. Kiểm tra link. Phân loại. Tổng hợp. Đề xuất sửa.
Những việc này dồn về phía máy.
Và cuối cùng, chỉ mua từ con người những điều như:
“Lần đầu xem, không hiểu gì cả.” “Tôi không thích chỗ này.” “Thấy sai sai.” “Cái này tiện đấy.”
Thứ mua bằng 1 yên mỗi góp ý không phải một dòng chữ.
Mà là cảm giác lạ thoáng qua của một người khác, thứ mà cả tôi lẫn AI đều không có.
Đẩy tự động hóa đến cùng, con người lại quay về.
Mà bộ phận phụ trách lại là “thấy sai sai”.
Rất con người.
- Digital.gov, “Usability testing digital.gov
- GOV.UK Service Manual, “Using moderated usability testing gov.uk
- GOV.UK Service Manual, “Taking notes and recording user research sessions gov.uk
- GOV.UK Service Manual, “4. Make the service simple to use gov.uk

