AI đang khiến thông tin sai lệch trở nên khó phát hiện hơn – nhưng chúng ta đã tìm ra cách mới để bắt bài

AI is making disinformation harder to spot – but we’ve found a new way to catch it

AI đang khiến thông tin sai lệch trở nên khó phát hiện hơn – nhưng chúng ta đã tìm ra cách mới để bắt bài
Seán Roberts, Lecturer in Linguistics, Cardiff University Kateryna Krykoniuk, Research Associate in the School of Languages, Arts and Societies, University of Sheffield
Show
Hide
EN – VI
VI – EN
3000-5000 ▼
0-3000
3000-5000
5000-7000
7000-10000

Do you ever see comments on social media that seem way off topic, but still manage to wrench the discussion around to divisive political debate?

Bạn đã bao giờ thấy những bình luận trên mạng xã hội có vẻ hoàn toàn lạc đề, nhưng lại vẫn cố bẻ lái cuộc thảo luận sang một cuộc tranh cãi chính trị đầy chia rẽ chưa?

A discussion about the cost of living suddenly becomes an argument about immigration. A conversation about the war in Ukraine turns into claims about government corruption. It can feel jarring – and sometimes this is deliberate.

Một cuộc thảo luận về chi phí sinh hoạt bỗng chốc biến thành một cuộc tranh cãi về vấn đề nhập cư. Một cuộc trò chuyện về cuộc chiến ở Ukraine lại chuyển thành những cáo buộc về tham nhũng của chính phủ. Điều đó có thể gây ra cảm giác lạc lõng – và đôi khi đây là một hành động có chủ ý.

As generative AI becomes more powerful, malicious groups are increasingly using it to produce and spread disinformation online. Automated accounts can flood social media with convincing comments designed to sow division, inflame political debate and undermine trust in reliable information.

Khi AI tạo sinh ngày càng trở nên mạnh mẽ hơn, các nhóm độc hại đang ngày càng sử dụng nó để tạo ra và phát tán thông tin sai lệch trên mạng. Các tài khoản tự động có thể làm ngập tràn mạng xã hội bằng những bình luận có vẻ thuyết phục nhằm gieo rắc sự chia rẽ, thổi bùng tranh cãi chính trị và làm suy yếu niềm tin vào thông tin đáng tin cậy.

But our latest research offers a way to spot these attempts. Rather than trying to identify whether a post was written by AI, we focus on something different: whether it’s trying to derail the conversation.

Nhưng nghiên cứu mới nhất của chúng tôi cung cấp một cách để phát hiện những nỗ lực này. Thay vì cố gắng xác định xem một bài đăng có phải do AI viết hay không, chúng tôi tập trung vào một điều khác: liệu nó có đang cố gắng làm lệch hướng cuộc trò chuyện hay không.

Until recently, identifying malicious accounts was often quite straightforward. Many campaigns relied on people writing in a second language. So, posts sometimes contained grammatical mistakes or unusual word choices. Detection systems could look for these patterns in the language used.

Cho đến gần đây, việc xác định các tài khoản độc hại thường khá đơn giản. Nhiều chiến dịch dựa vào những người viết bằng ngôn ngữ thứ hai. Do đó, các bài đăng đôi khi chứa lỗi ngữ pháp hoặc lựa chọn từ ngữ bất thường. Các hệ thống phát hiện có thể tìm kiếm những mẫu này trong ngôn ngữ được sử dụng.

But generative AI has changed that. AI systems can now produce fluent, natural–sounding text that is much harder to distinguish from human writing. For example, patterns like use of em-dashes and the word “delve” used to be telltale signs of a text being generated by AI. But AIs are adapting, and these older systems are increasingly ineffective.

Nhưng AI tạo sinh đã thay đổi điều đó. Các hệ thống AI giờ đây có thể tạo ra văn bản trôi chảy, nghe tự nhiên và rất khó phân biệt với văn bản do con người viết. Ví dụ, các mẫu câu như việc sử dụng dấu gạch ngang dài (em-dash) và từ “delve” (đào sâu) từng là dấu hiệu tố cáo một văn bản do AI tạo ra. Nhưng AI đang thích nghi, và các hệ thống cũ này ngày càng trở nên kém hiệu quả.

Trying to detect AI purely from the words people use is becoming a losing battle. We believe the better approach is to look at what a message is trying to achieve.

Việc cố gắng phát hiện AI hoàn toàn dựa vào từ ngữ mà con người sử dụng đang trở thành một cuộc chiến thua cuộc. Chúng tôi tin rằng cách tiếp cận tốt hơn là xem xét mục tiêu mà một thông điệp đang cố gắng đạt được.

Looking for signs

Tìm kiếm các dấu hiệu

Attempts to spread disinformation often work by steering conversations away from their original topic, towards more polarising issues. So, instead of analysing individual words, we set out to build a system that could recognise this phenomenon in online discussions.

Các nỗ lực phát tán thông tin sai lệch thường hoạt động bằng cách lái các cuộc trò chuyện ra khỏi chủ đề ban đầu của chúng, hướng tới các vấn đề gây chia rẽ hơn. Vì vậy, thay vì phân tích từng từ đơn lẻ, chúng tôi bắt tay vào xây dựng một hệ thống có thể nhận ra hiện tượng này trong các cuộc thảo luận trực tuyến.

We analysed comments posted beneath BBC News videos on YouTube, a platform that has previously been targeted by organised disinformation campaigns.

Chúng tôi đã phân tích các bình luận được đăng bên dưới các video của BBC News trên YouTube, một nền tảng trước đây từng là mục tiêu của các chiến dịch thông tin sai lệch có tổ chức.

For example, imagine a comment about Ukraine’s president, Volodymyr Zelensky, interacting with senior UK political figures: “Zelensky must be wondering how many foreign secretaries the UK goes through.” Now, imagine another person responding: “Mind you, Zelensky has barely been president for four years. Maybe that’s why the little tyrant bans his opposition.”

Ví dụ, hãy tưởng tượng một bình luận về tổng thống Ukraine, Volodymyr Zelensky, khi ông tương tác với các nhân vật chính trị cấp cao của Anh: “Zelensky hẳn đang tự hỏi không biết Vương quốc Anh đã thay bao nhiêu Bộ trưởng Ngoại giao rồi.” Bây giờ, hãy tưởng tượng một người khác trả lời: “Nhớ nhé, Zelensky vừa mới làm tổng thống chưa đầy bốn năm. Có lẽ đó là lý do tại sao tên bạo chúa nhỏ bé lại cấm phe đối lập của mình.”

Whether that second point is true or false is not the issue. Instead of responding to the original comment, it redirects the conversation towards a different, more divisive topic.

Điểm thứ hai đó đúng hay sai không phải là vấn đề. Thay vì trả lời bình luận ban đầu, nó lại chuyển hướng cuộc trò chuyện sang một chủ đề khác, gây chia rẽ hơn nhiều.

This is known as a red herring: introducing an unrelated issue that distracts from the original discussion. These kinds of shift are difficult for conventional disinformation detection systems to identify, because they are not tied to particular words or phrases.

Đây được gọi là đánh trống lảng (red herring): đưa ra một vấn đề không liên quan làm phân tán sự chú ý khỏi cuộc thảo luận ban đầu. Những loại thay đổi này rất khó để các hệ thống phát hiện thông tin sai lệch thông conventional nhận diện, bởi vì chúng không gắn liền với các từ hoặc cụm từ cụ thể nào.

Figure
36% of derailing messages online included ‘red herrings’. Roman Samborskyi/Shutterstock
36% thông điệp làm lệch hướng trên mạng có chứa ‘thông tin đánh trống lảng’. Roman Samborskyi/Shutterstock

We manually analysed more than 1,600 comments under BBC News videos, labelling them according to 25 different features of online discussion – and discovered some clear patterns.

Chúng tôi đã phân tích thủ công hơn 1.600 bình luận dưới các video của BBC News, gắn nhãn chúng theo 25 đặc điểm khác nhau của cuộc thảo luận trực tuyến – và phát hiện ra một số mẫu rõ ràng.

We found that 36% of derailing messages had red herrings, 65% had leaps in logic known as “non sequiturs”, and 20% contained personal attacks. They were also much less likely to acknowledge previous comments or express empathy.

Chúng tôi thấy rằng 36% thông điệp làm lệch hướng có chứa thông tin đánh trống lảng, 65% có sự bước nhảy vọt trong tư duy được gọi là “lập luận vô lý” (non sequiturs) , và 20% chứa các cuộc tấn công cá nhân. Chúng cũng ít có khả năng thừa nhận các bình luận trước đó hoặc thể hiện sự đồng cảm hơn.

Spotting manipulation

Phát hiện sự thao túng

The next step was to see whether an AI system could recognise these patterns automatically. We used an AI to catch an AI.

Bước tiếp theo là xem liệu một hệ thống AI có thể tự động nhận ra những mẫu này hay không. Chúng tôi đã dùng AI để bắt AI.

For every genuine online comment, we asked an AI large language model to generate several reasonable, relevant responses. Returning to the example of UK foreign secretaries, the AI suggested replies such as: “The current situation in this country must come as quite a shock” or “One too many?”. Both responded directly to the original point.

Đối với mỗi bình luận trực tuyến chính thống, chúng tôi yêu cầu một mô hình ngôn ngữ lớn AI tạo ra một số phản hồi hợp lý, liên quan. Quay lại ví dụ về các Bộ trưởng Ngoại giao Anh, AI đã gợi ý các câu trả lời như: “Tình hình hiện tại ở đất nước này hẳn là một cú sốc lớn” hoặc “Hơi quá tay một chút chăng?”. Cả hai đều trả lời trực tiếp vào điểm chính ban đầu.

The system then compares the real response with our AI-generated replies. If the actual comment differs substantially, it may indicate that someone is attempting to steer the conversation in a different direction. So, rather than searching for suspicious words, our system looks for unexpected changes in the flow of the discussion.

Hệ thống sau đó so sánh phản hồi thực tế với các câu trả lời do AI tạo ra của chúng tôi. Nếu bình luận thực tế khác biệt đáng kể, điều đó có thể cho thấy ai đó đang cố gắng lái cuộc trò chuyện theo một hướng khác. Vì vậy, thay vì tìm kiếm các từ đáng ngờ, hệ thống của chúng tôi tìm kiếm những thay đổi bất ngờ trong dòng chảy của cuộc thảo luận.

How the system works:

Hệ thống hoạt động như thế nào:

Figure
Discourse derailment is measured by the distance between the real reply and a set of expected replies generated by an AI. Krykoniuk, Hopkin-King & Roberts: Using LLMs to identify discourse derailment as a potential cue for disinformation in social media posts (2026) ., CC BY
Sự lệch hướng của diễn ngôn được đo lường bằng khoảng cách giữa câu trả lời thực tế và một tập hợp các câu trả lời dự kiến do AI tạo ra. Krykoniuk, Hopkin-King & Roberts: Sử dụng LLMs để xác định sự lệch hướng của diễn ngôn như một dấu hiệu tiềm năng cho thông tin sai lệch trong các bài đăng trên mạng xã hội (2026) , CC BY

We tested this approach using our manually labelled dataset. In our second study, the system correctly identified derailing comments around 77% of the time.

Chúng tôi đã thử nghiệm cách tiếp cận này bằng cách sử dụng bộ dữ liệu được dán nhãn thủ công của mình. Trong nghiên cứu thứ hai của chúng tôi, hệ thống đã xác định chính xác các bình luận làm lệch hướng khoảng 77% thời gian.

That’s far from perfect, but no detection system is – particularly when analysing something as complex as human conversation. However, our approach performed around twice as well as existing systems based on word–level sentiment analysis. It also achieved results comparable with the level of agreement between human researchers.

Con số đó còn lâu mới là hoàn hảo, nhưng không có hệ thống phát hiện nào hoàn hảo cả – đặc biệt là khi phân tích một thứ phức tạp như cuộc trò chuyện của con người. Tuy nhiên, cách tiếp cận của chúng tôi đạt hiệu quả cao gấp khoảng hai lần so với các hệ thống hiện có dựa trên việc phân tích cảm sentiment ở cấp độ từ ngữ. Nó cũng đạt được kết quả tương đương với mức độ đồng thuận giữa các nhà nghiên cứu là con người.

Our approach is effective because the AI learns what a typical response to a conversation looks like. When a reply unexpectedly changes the discussion, the system can identify that change and analyse patterns that earlier methods couldn’t detect.

Cách tiếp cận của chúng tôi rất hiệu quả bởi vì AI học được một phản hồi điển hình cho một cuộc trò chuyện trông như thế nào. Khi một câu trả lời làm thay đổi cuộc thảo luận một cách bất ngờ, hệ thống có thể xác định sự thay đổi đó và phân tích các mẫu mà các phương pháp trước đây không thể phát hiện.

Of course, going off topic isn’t necessarily a sign of malicious intent or disinformation. People naturally take conversations in unexpected directions, and there are many legitimate reasons why discussions evolve.

Tất nhiên, việc đi lạc đề không nhất thiết là dấu hiệu của ý đồ xấu hoặc thông tin sai lệch. Con người tự nhiên đưa các cuộc trò chuyện theo những hướng bất ngờ, và có rất nhiều lý do chính đáng khiến các cuộc thảo luận phát triển.

For that reason, this technology may act as an early–warning system rather than a replacement for human judgment. It could help moderators identify conversations that deserve closer attention – but any final decisions should remain with trained experts.

Vì lý do đó, công nghệ này có thể đóng vai trò như một hệ thống cảnh báo sớm thay vì thay thế cho phán quyết của con người. Nó có thể giúp người kiểm duyệt xác định các cuộc trò chuyện cần được chú ý kỹ hơn – nhưng mọi quyết định cuối cùng vẫn nên thuộc về các chuyên gia đã được đào tạo.

There are also important ethical questions to address. AI systems can reflect biases in the data they are trained on, and they still do not understand conversations in quite the same way that people do. Improving how AI represents and interprets human discussion remains a challenge.

Ngoài ra còn có những câu hỏi đạo đức quan trọng cần giải quyết. Các hệ thống AI có thể phản ánh các định kiến trong dữ liệu mà chúng được đào tạo, và chúng vẫn chưa hiểu các cuộc trò chuyện theo cách giống như con người. Việc cải thiện cách AI đại diện và diễn giải các cuộc thảo luận của con người vẫn là một thách thức.

As AI-generated content becomes increasingly difficult to distinguish from human writing, detecting disinformation requires more than simply searching for telltale words. It requires understanding how conversations work, how they are manipulated, and when someone is trying to quietly steer them off course.

Khi nội dung do AI tạo ra ngày càng trở nên khó phân biệt với văn bản do con người viết, việc phát hiện thông tin sai lệch đòi hỏi nhiều hơn là chỉ đơn thuần tìm kiếm những từ ngữ tố cáo. Nó đòi hỏi phải hiểu cách các cuộc trò chuyện hoạt động, cách chúng bị thao túng, và khi nào ai đó đang cố gắng lén lút lái chúng đi chệch hướng.

Seán Roberts was funded by the AI and autonomy for intelligence, surveillance and reconnaissance (A2ISR) project at the Defence Science and Technology Laboratory (Dstl) through the Defence and Security Accelerator (DASA) , which is part of the UK Ministry of Defence, United Kingdom.

Seán Roberts được tài trợ bởi dự án AI và tính tự chủ cho hoạt động tình báo, giám sát và trinh sát (A2ISR) tại Phòng thí nghiệm Khoa học và Công nghệ Quốc phòng (Dstl) thông qua Quỹ Tăng tốc Quốc phòng và An ninh (DASA) , thuộc Bộ Quốc phòng Vương quốc Anh, Vương quốc Anh.

Kateryna Krykoniuk was funded by the AI and autonomy for intelligence, surveillance and reconnaissance (A2ISR) project at the Defence Science and Technology Laboratory (Dstl) through the Defence and Security Accelerator (DASA) , which is part of the UK Ministry of Defence, United Kingdom.

Kateryna Krykoniuk được tài trợ bởi dự án AI và tính tự chủ cho hoạt động tình báo, giám sát và trinh sát (A2ISR) tại Phòng thí nghiệm Khoa học và Công nghệ Quốc phòng (Dstl) thông qua Quỹ Tăng tốc Quốc phòng và An ninh (DASA) , thuộc Bộ Quốc phòng Vương quốc Anh, Vương quốc Anh.