AI đang khiến thông tin sai lệch trở nên khó phát hiện hơn – nhưng chúng ta đã tìm ra cách mới để bắt bài
AI is making disinformation harder to spot – but we’ve found a new way to catch it

Bạn đã bao giờ thấy những bình luận trên mạng xã hội có vẻ hoàn toàn lạc đề, nhưng lại vẫn cố bẻ lái cuộc thảo luận sang một cuộc tranh cãi chính trị đầy chia rẽ chưa?
Một cuộc thảo luận về chi phí sinh hoạt bỗng chốc biến thành một cuộc tranh cãi về vấn đề nhập cư. Một cuộc trò chuyện về cuộc chiến ở Ukraine lại chuyển thành những cáo buộc về tham nhũng của chính phủ. Điều đó có thể gây ra cảm giác lạc lõng – và đôi khi đây là một hành động có chủ ý.
Khi AI tạo sinh ngày càng trở nên mạnh mẽ hơn, các nhóm độc hại đang ngày càng sử dụng nó để tạo ra và phát tán thông tin sai lệch trên mạng. Các tài khoản tự động có thể làm ngập tràn mạng xã hội bằng những bình luận có vẻ thuyết phục nhằm gieo rắc sự chia rẽ, thổi bùng tranh cãi chính trị và làm suy yếu niềm tin vào thông tin đáng tin cậy.
Nhưng nghiên cứu mới nhất của chúng tôi cung cấp một cách để phát hiện những nỗ lực này. Thay vì cố gắng xác định xem một bài đăng có phải do AI viết hay không, chúng tôi tập trung vào một điều khác: liệu nó có đang cố gắng làm lệch hướng cuộc trò chuyện hay không.
Cho đến gần đây, việc xác định các tài khoản độc hại thường khá đơn giản. Nhiều chiến dịch dựa vào những người viết bằng ngôn ngữ thứ hai. Do đó, các bài đăng đôi khi chứa lỗi ngữ pháp hoặc lựa chọn từ ngữ bất thường. Các hệ thống phát hiện có thể tìm kiếm những mẫu này trong ngôn ngữ được sử dụng.
Nhưng AI tạo sinh đã thay đổi điều đó. Các hệ thống AI giờ đây có thể tạo ra văn bản trôi chảy, nghe tự nhiên và rất khó phân biệt với văn bản do con người viết. Ví dụ, các mẫu câu như việc sử dụng dấu gạch ngang dài (em-dash) và từ “delve” (đào sâu) từng là dấu hiệu tố cáo một văn bản do AI tạo ra. Nhưng AI đang thích nghi, và các hệ thống cũ này ngày càng trở nên kém hiệu quả.
Việc cố gắng phát hiện AI hoàn toàn dựa vào từ ngữ mà con người sử dụng đang trở thành một cuộc chiến thua cuộc. Chúng tôi tin rằng cách tiếp cận tốt hơn là xem xét mục tiêu mà một thông điệp đang cố gắng đạt được.
Looking for signs
Tìm kiếm các dấu hiệu
Các nỗ lực phát tán thông tin sai lệch thường hoạt động bằng cách lái các cuộc trò chuyện ra khỏi chủ đề ban đầu của chúng, hướng tới các vấn đề gây chia rẽ hơn. Vì vậy, thay vì phân tích từng từ đơn lẻ, chúng tôi bắt tay vào xây dựng một hệ thống có thể nhận ra hiện tượng này trong các cuộc thảo luận trực tuyến.
Chúng tôi đã phân tích các bình luận được đăng bên dưới các video của BBC News trên YouTube, một nền tảng trước đây từng là mục tiêu của các chiến dịch thông tin sai lệch có tổ chức.
Ví dụ, hãy tưởng tượng một bình luận về tổng thống Ukraine, Volodymyr Zelensky, khi ông tương tác với các nhân vật chính trị cấp cao của Anh: “Zelensky hẳn đang tự hỏi không biết Vương quốc Anh đã thay bao nhiêu Bộ trưởng Ngoại giao rồi.” Bây giờ, hãy tưởng tượng một người khác trả lời: “Nhớ nhé, Zelensky vừa mới làm tổng thống chưa đầy bốn năm. Có lẽ đó là lý do tại sao tên bạo chúa nhỏ bé lại cấm phe đối lập của mình.”
Điểm thứ hai đó đúng hay sai không phải là vấn đề. Thay vì trả lời bình luận ban đầu, nó lại chuyển hướng cuộc trò chuyện sang một chủ đề khác, gây chia rẽ hơn nhiều.
Đây được gọi là đánh trống lảng (red herring): đưa ra một vấn đề không liên quan làm phân tán sự chú ý khỏi cuộc thảo luận ban đầu. Những loại thay đổi này rất khó để các hệ thống phát hiện thông tin sai lệch thông conventional nhận diện, bởi vì chúng không gắn liền với các từ hoặc cụm từ cụ thể nào.
Chúng tôi đã phân tích thủ công hơn 1.600 bình luận dưới các video của BBC News, gắn nhãn chúng theo 25 đặc điểm khác nhau của cuộc thảo luận trực tuyến – và phát hiện ra một số mẫu rõ ràng.
Chúng tôi thấy rằng 36% thông điệp làm lệch hướng có chứa thông tin đánh trống lảng, 65% có sự bước nhảy vọt trong tư duy được gọi là “lập luận vô lý” (non sequiturs) , và 20% chứa các cuộc tấn công cá nhân. Chúng cũng ít có khả năng thừa nhận các bình luận trước đó hoặc thể hiện sự đồng cảm hơn.
Spotting manipulation
Phát hiện sự thao túng
Bước tiếp theo là xem liệu một hệ thống AI có thể tự động nhận ra những mẫu này hay không. Chúng tôi đã dùng AI để bắt AI.
Đối với mỗi bình luận trực tuyến chính thống, chúng tôi yêu cầu một mô hình ngôn ngữ lớn AI tạo ra một số phản hồi hợp lý, liên quan. Quay lại ví dụ về các Bộ trưởng Ngoại giao Anh, AI đã gợi ý các câu trả lời như: “Tình hình hiện tại ở đất nước này hẳn là một cú sốc lớn” hoặc “Hơi quá tay một chút chăng?”. Cả hai đều trả lời trực tiếp vào điểm chính ban đầu.
Hệ thống sau đó so sánh phản hồi thực tế với các câu trả lời do AI tạo ra của chúng tôi. Nếu bình luận thực tế khác biệt đáng kể, điều đó có thể cho thấy ai đó đang cố gắng lái cuộc trò chuyện theo một hướng khác. Vì vậy, thay vì tìm kiếm các từ đáng ngờ, hệ thống của chúng tôi tìm kiếm những thay đổi bất ngờ trong dòng chảy của cuộc thảo luận.
Hệ thống hoạt động như thế nào:
Chúng tôi đã thử nghiệm cách tiếp cận này bằng cách sử dụng bộ dữ liệu được dán nhãn thủ công của mình. Trong nghiên cứu thứ hai của chúng tôi, hệ thống đã xác định chính xác các bình luận làm lệch hướng khoảng 77% thời gian.
Con số đó còn lâu mới là hoàn hảo, nhưng không có hệ thống phát hiện nào hoàn hảo cả – đặc biệt là khi phân tích một thứ phức tạp như cuộc trò chuyện của con người. Tuy nhiên, cách tiếp cận của chúng tôi đạt hiệu quả cao gấp khoảng hai lần so với các hệ thống hiện có dựa trên việc phân tích cảm sentiment ở cấp độ từ ngữ. Nó cũng đạt được kết quả tương đương với mức độ đồng thuận giữa các nhà nghiên cứu là con người.
Cách tiếp cận của chúng tôi rất hiệu quả bởi vì AI học được một phản hồi điển hình cho một cuộc trò chuyện trông như thế nào. Khi một câu trả lời làm thay đổi cuộc thảo luận một cách bất ngờ, hệ thống có thể xác định sự thay đổi đó và phân tích các mẫu mà các phương pháp trước đây không thể phát hiện.
Tất nhiên, việc đi lạc đề không nhất thiết là dấu hiệu của ý đồ xấu hoặc thông tin sai lệch. Con người tự nhiên đưa các cuộc trò chuyện theo những hướng bất ngờ, và có rất nhiều lý do chính đáng khiến các cuộc thảo luận phát triển.
Vì lý do đó, công nghệ này có thể đóng vai trò như một hệ thống cảnh báo sớm thay vì thay thế cho phán quyết của con người. Nó có thể giúp người kiểm duyệt xác định các cuộc trò chuyện cần được chú ý kỹ hơn – nhưng mọi quyết định cuối cùng vẫn nên thuộc về các chuyên gia đã được đào tạo.
Ngoài ra còn có những câu hỏi đạo đức quan trọng cần giải quyết. Các hệ thống AI có thể phản ánh các định kiến trong dữ liệu mà chúng được đào tạo, và chúng vẫn chưa hiểu các cuộc trò chuyện theo cách giống như con người. Việc cải thiện cách AI đại diện và diễn giải các cuộc thảo luận của con người vẫn là một thách thức.
Khi nội dung do AI tạo ra ngày càng trở nên khó phân biệt với văn bản do con người viết, việc phát hiện thông tin sai lệch đòi hỏi nhiều hơn là chỉ đơn thuần tìm kiếm những từ ngữ tố cáo. Nó đòi hỏi phải hiểu cách các cuộc trò chuyện hoạt động, cách chúng bị thao túng, và khi nào ai đó đang cố gắng lén lút lái chúng đi chệch hướng.
Seán Roberts
Seán Roberts được tài trợ bởi dự án AI và tính tự chủ cho hoạt động tình báo, giám sát và trinh sát (A2ISR) tại Phòng thí nghiệm Khoa học và Công nghệ Quốc phòng (Dstl) thông qua Quỹ Tăng tốc Quốc phòng và An ninh (DASA) , thuộc Bộ Quốc phòng Vương quốc Anh, Vương quốc Anh.
Kateryna Krykoniuk
Kateryna Krykoniuk được tài trợ bởi dự án AI và tính tự chủ cho hoạt động tình báo, giám sát và trinh sát (A2ISR) tại Phòng thí nghiệm Khoa học và Công nghệ Quốc phòng (Dstl) thông qua Quỹ Tăng tốc Quốc phòng và An ninh (DASA) , thuộc Bộ Quốc phòng Vương quốc Anh, Vương quốc Anh.
có thể bạn cũng quan tâm
-

Đồng hồ tuổi trung niên đang điểm: Hiểu về ‘thời gian còn lại’ có thể giúp chúng ta tận dụng nó hiệu quả
The midlife clock is ticking: How we understand ‘time left’ can help us use it well
-

Đã đến lúc đào tạo lại? Làm thế nào để tương lai hóa sự nghiệp của bạn trong kỷ nguyên AI
Time to retrain? How to future-proof your career in the AI age