Nền tảng AI
AI bịa thông tin - vì sao xảy ra và cách kiểm chứng trước khi dùng
Hiện tượng AI tạo ra thông tin sai nghe rất thuyết phục - nguyên nhân, những loại nội dung dễ bị sai nhất và cách kiểm chứng trước khi đưa vào báo cáo, email hay tài liệu gửi khách.
Hiện tượng AI bịa thông tin là gì
Trong tiếng Anh, hiện tượng này thường được gọi là hallucination: công cụ AI tạo ra thông tin không đúng sự thật nhưng trình bày với giọng rất chắc chắn. Đó có thể là một con số thống kê không tồn tại, một điều luật bị trích sai, một cuốn sách chưa từng được xuất bản, hay một đường link dẫn tới trang không có thật.
Điều khiến hiện tượng này nguy hiểm không phải là AI sai, vì con người cũng sai. Điều nguy hiểm là AI sai theo cách rất khó nhận ra: câu văn trôi chảy, định dạng chuyên nghiệp, không có dấu hiệu do dự. Người đọc vội vàng dễ tin ngay.
Các nhà phát triển công cụ AI đều thừa nhận hạn chế này. Trong bài nghiên cứu về nguyên nhân mô hình ngôn ngữ bịa thông tin, OpenAI xác nhận ChatGPT vẫn gặp hiện tượng này dù các phiên bản mới đã giảm đáng kể, và gọi đây là thách thức cơ bản của mọi mô hình ngôn ngữ lớn.
Vì sao AI lại bịa
Mô hình ngôn ngữ được huấn luyện để tạo ra văn bản có khả năng phù hợp nhất với ngữ cảnh. Khi câu hỏi nằm trong vùng mô hình đã học kỹ, câu trả lời hợp lý thường cũng là câu trả lời đúng. Khi câu hỏi nằm ngoài vùng đó, mô hình vẫn tạo ra một câu trả lời có hình thức hợp lý, vì đó là việc nó được thiết kế để làm.
Nghiên cứu của OpenAI chỉ ra một nguyên nhân quan trọng: cách huấn luyện và chấm điểm mô hình thường thưởng cho việc đoán hơn là thừa nhận không chắc chắn. Giống một thí sinh làm trắc nghiệm, đoán bừa vẫn có cơ hội được điểm, còn bỏ trống thì chắc chắn không. Cũng theo nghiên cứu này, mô hình hoàn toàn có thể từ chối trả lời khi không chắc chắn, nếu được khuyến khích làm vậy.
Một số tình huống làm tăng khả năng bịa:
- Câu hỏi về chi tiết rất cụ thể: số liệu của một công ty nhỏ, số hiệu văn bản pháp luật, ngày tháng của một sự kiện ít người biết.
- Thông tin mới hơn dữ liệu huấn luyện: quy định vừa sửa đổi, sản phẩm vừa ra mắt, giá mới cập nhật.
- Câu hỏi có tiền đề sai: hỏi "vì sao quy định X yêu cầu Y" trong khi quy định X không hề yêu cầu Y. Mô hình có xu hướng giải thích thay vì phản bác.
- Yêu cầu trích dẫn nguồn khi không có công cụ tìm kiếm: mô hình có thể tạo ra tên bài báo, tác giả, đường link trông rất thật.
- Tài liệu quá dài hoặc lộn xộn: khi tóm tắt, mô hình có thể trộn thông tin giữa các phần.
Những loại thông tin hay bị sai nhất
| Loại thông tin | Ví dụ | Mức rủi ro |
|---|---|---|
| Con số, thống kê | Tỷ lệ tăng trưởng, số liệu thị trường | Cao |
| Văn bản pháp luật | Số hiệu nghị định, nội dung điều khoản, hiệu lực | Rất cao |
| Nguồn trích dẫn | Tên nghiên cứu, đường link, tác giả | Cao |
| Thông tin người, công ty cụ thể | Chức danh, năm thành lập, sự kiện | Cao |
| Tính toán nhiều bước | Cộng dồn, tỷ lệ phần trăm trong bảng lớn | Trung bình đến cao |
| Viết lại, tóm tắt văn bản bạn cung cấp | Email, biên bản | Thấp hơn, nhưng vẫn cần đọc lại |
| Ý tưởng, dàn ý, gợi ý cách diễn đạt | Tiêu đề, bố cục | Thấp, vì không có đúng sai tuyệt đối |
Quy luật chung: càng dựa vào kiến thức sẵn có của mô hình, càng rủi ro; càng dựa vào dữ liệu bạn đưa vào, càng an toàn hơn.
Quy trình kiểm chứng bốn bước
Bước 1: Tách phần cần kiểm tra
Khi đọc kết quả, đánh dấu mọi chỗ là sự thật có thể đúng hoặc sai: con số, tên riêng, ngày tháng, trích dẫn, quy định. Những phần còn lại như câu chữ, bố cục, giọng văn thì chỉ cần đọc lại cho mượt.
Bước 2: Hỏi AI về độ chắc chắn và nguồn
Yêu cầu AI chỉ ra thông tin nào nó không chắc chắn, và nguồn của những thông tin quan trọng. Nếu công cụ có tính năng tìm kiếm web, hãy bật lên để nó trả về đường link có thể mở ra kiểm tra. Đừng tin một đường link chỉ vì nó trông hợp lý; hãy mở ra xem.
Bước 3: Đối chiếu với nguồn gốc
Với thông tin quan trọng, tìm nguồn chính thức: văn bản pháp luật trên cổng thông tin chính thức, báo cáo tài chính do công ty công bố, tài liệu hướng dẫn của nhà sản xuất phần mềm. Với số liệu tính toán, yêu cầu AI xuất công thức hoặc chạy bằng công cụ phân tích dữ liệu, rồi kiểm tra vài kết quả bằng tay.
Bước 4: Chịu trách nhiệm phần cuối
Trước khi gửi đi, tự hỏi: nếu thông tin này sai, ai bị ảnh hưởng? Với email nội bộ thông thường, đọc lại là đủ. Với báo cáo tài chính, hồ sơ thuế, tài liệu gửi khách hàng, mọi con số phải được kiểm chứng.
Cách viết câu lệnh để giảm rủi ro ngay từ đầu
Không thể loại bỏ hoàn toàn việc AI bịa thông tin, nhưng có thể giảm đáng kể bằng cách giao việc đúng cách. Tài liệu hướng dẫn của Anthropic cho Claude gợi ý một số kỹ thuật mà người dùng văn phòng áp dụng được ngay:
Cho phép AI nói "tôi không biết". Thêm vào câu lệnh: "Nếu không chắc chắn hoặc không có thông tin, hãy nói rõ thay vì đoán."
Yêu cầu dựa trên tài liệu bạn cung cấp. "Chỉ trả lời dựa trên tài liệu dưới đây. Nếu tài liệu không đề cập, ghi là không có thông tin."
Yêu cầu trích đoạn làm bằng chứng. "Với mỗi kết luận, trích nguyên văn câu trong tài liệu làm căn cứ." Cách này giúp bạn kiểm tra nhanh kết luận có thật sự đến từ tài liệu hay không.
Đưa dữ liệu thay vì hỏi kiến thức. Thay vì hỏi "doanh thu ngành bán lẻ năm ngoái là bao nhiêu", hãy dán báo cáo có số liệu và yêu cầu AI phân tích.
Tình huống thực tế trong công việc
Kế toán tra cứu quy định. Một kế toán hỏi AI về thời hạn nộp một loại tờ khai. AI trả lời kèm số hiệu văn bản rất cụ thể. Kiểm tra lại thì văn bản đó đã được sửa đổi. Cách làm đúng: dùng AI để biết vấn đề nằm ở loại văn bản nào, sau đó đọc văn bản gốc và kiểm tra hiệu lực.
Nhân viên marketing viết bài có số liệu. AI viết đoạn mở đầu với "theo khảo sát, 78% người tiêu dùng...". Không có nguồn cho con số này. Cách làm đúng: xóa con số không có nguồn, hoặc tìm một khảo sát thật và dẫn nguồn.
Chuyên viên tổng hợp báo cáo từ bảng tính. AI đọc bảng và nói doanh số quý tăng 12%. Tính lại bằng Excel thì là 9%, do AI bỏ sót một dòng. Cách làm đúng: yêu cầu AI xuất công thức tính, chạy trong bảng tính, đối chiếu với tổng đã biết.
Câu hỏi thường gặp
Bản trả phí có ít bịa thông tin hơn bản miễn phí không?
Các mô hình mới và mạnh hơn thường giảm tỷ lệ bịa, và gói trả phí thường cho dùng mô hình mạnh hơn nhiều hơn. Nhưng không có gói nào loại bỏ hoàn toàn hiện tượng này. Quy trình kiểm chứng vẫn cần thiết với mọi gói.
Bật tìm kiếm web có hết bịa không?
Tìm kiếm web giúp câu trả lời bám nguồn thật hơn và cho bạn đường link để kiểm tra. Tuy vậy, AI vẫn có thể hiểu sai nội dung trang, chọn nguồn kém tin cậy hoặc tóm tắt lệch ý. Hãy mở nguồn quan trọng ra đọc trực tiếp.
Làm sao biết một đường link do AI đưa ra là thật?
Cách duy nhất chắc chắn là mở link. Nếu trang không tồn tại, hoặc tồn tại nhưng không chứa thông tin AI nêu, xem như thông tin đó chưa được kiểm chứng.
Không vì thế mà ngừng dùng AI
Hiện tượng bịa thông tin không làm AI trở nên vô dụng. Nó chỉ xác định rõ vai trò: AI là trợ lý làm nhanh phần nháp và phần xử lý, con người là người kiểm tra và chịu trách nhiệm. Người đi làm biết kiểm chứng sẽ tiết kiệm được nhiều thời gian mà không đánh đổi độ tin cậy.
Kỹ năng kiểm chứng là nội dung xuyên suốt trong các khóa học tại trung tâm. Khóa AI cho người mới bắt đầu dạy nguyên tắc nền tảng. Người làm việc với số liệu nên xem khóa AI trong phân tích dữ liệu, còn kế toán có khóa AI trong kế toán với quy trình tra cứu quy định có đối chiếu văn bản gốc.