Các trường đại học và phổ thông đang từ bỏ phần mềm phát hiện AI. Họ nên dừng hẳn việc sử dụng nó

Unis and schools are moving away from AI-detection software. They should stop using it altogether

Các trường đại học và phổ thông đang từ bỏ phần mềm phát hiện AI. Họ nên dừng hẳn việc sử dụng nó
Mark A. Bassett, Associate Professor and Director, Academic Quality, Standards, and Integrity, Charles Sturt University
Show
Hide
EN – VI
VI – EN
3000-5000 ▼
0-3000
3000-5000
5000-7000
7000-10000

Since artificial intelligence (AI) software ChatGPT was released in 2022, teachers have been looking for ways to tell when AI has been used to generate text in assessments. AI-detection software is still sold by some tech companies, such as Pangram, as a potential solution.

Kể từ khi phần mềm trí tuệ nhân tạo (AI) ChatGPT ra mắt vào năm 2022, giáo viên đã tìm kiếm các cách để nhận biết khi nào AI được dùng để tạo văn bản trong các bài đánh giá. Phần mềm phát hiện AI vẫn được bán bởi một số công ty công nghệ, chẳng hạn như Pangram, như một giải pháp tiềm năng.

This month, the New South Wales Education Standards Authority updated its rules to stop schools from relying on AI-detection software when deciding if a student has cheated. The reasoning is that these tools are not always reliable.

Tháng này, Cơ quan Tiêu chuẩn Giáo dục New South Wales đã cập nhật các quy định nhằm ngăn các trường học phụ thuộc vào phần mềm phát hiện AI khi quyết định xem một học sinh có gian lận hay không. Lý do là các công cụ này không phải lúc nào cũng đáng tin cậy.

While most Australian unis have have already shifted away from AI-detection software in some form, my research suggests the education sector should go one step further, and not use AI-detection tools at all.

Mặc dù phần lớn các trường đại học Úc đã chuyển hướng khỏi phần mềm phát hiện AI dưới hình thức này hay hình thức khác, nghiên cứu của tôi cho thấy ngành giáo dục nên tiến thêm एक bước nữa và hoàn toàn không sử dụng các công cụ phát hiện AI.

Where are unis at?

Tình hình ở các trường đại học hiện nay ra sao?

Unis each have their own rules around how they use AI-detection software, or whether they use it at all.

Mỗi trường đại học có quy định riêng về cách họ sử dụng phần mềm phát hiện AI, hoặc có sử dụng chúng hay không.

Some unis, such as the University of Melbourne, the University of Sydney and the University of NSW, use AI-detection tools in some form to assist in flagging potential cases of misconduct.

Một số trường đại học, chẳng hạn như Đại học Melbourne, Đại học Sydney và Đại học NSW, sử dụng các công cụ phát hiện AI dưới một hình thức nào đó để hỗ trợ gắn cờ các trường hợp vi phạm tiềm ẩn.

Other unis, such as Curtin University and the University of Queensland, have opted to not use AI-detection tools at all.

Các trường đại học khác, như Đại học Curtin và Đại học Queensland, đã chọn không sử dụng các công cụ phát hiện AI chút nào.

Not always reliable

Không phải lúc nào cũng đáng tin cậy

The reason is because this software is not always accurate.

Lý do là vì phần mềm này không phải lúc nào cũng chính xác.

When AI-detection tools incorrectly flag a student’s work as including AI-generated text, this is called a false positive. AI companies want to develop detectors that have low false-positive rates.

Khi các công cụ phát hiện AI gắn cờ nhầm bài làm của học sinh là có chứa văn bản do AI tạo ra, điều này được gọi là kết quả dương tính giả (false positive) . Các công ty AI muốn phát triển các bộ phát hiện có tỷ lệ dương tính giả thấp.

For instance, Turnitin, a United States–based company that sells AI-detection software, promotes a false-positive rate of less than 1%. However, Turnitin says this software is only reliable in detecting AI use when documents contain more than 20% AI-generated content.

Chẳng hạn, Turnitin, một công ty có trụ sở tại Hoa Kỳ chuyên bán phần mềm phát hiện AI, quảng bá tỷ lệ dương tính giả dưới 1%. Tuy nhiên, Turnitin cho biết phần mềm này chỉ đáng tin cậy trong việc phát hiện sử dụng AI khi tài liệu chứa hơn 20% nội dung do AI tạo ra.

Impacts on students

Tác động đối với học sinh, sinh viên

A small false-positive rate can still lead to big problems.

Tỷ lệ dương tính giả thấp vẫn có thể dẫn đến những vấn đề lớn.

In 2023, academic integrity expert Phillip Dawson estimated that even a 0.7% false-positive rate would result in over 100,000 assessments being wrongly flagged as AI generated each year in the Australian higher education sector alone.

Vào năm 2023, chuyên gia về tính liêm chính trong học thuật Phillip Dawson ước tính rằng ngay cả tỷ lệ dương tính giả 0,7% cũng sẽ dẫn đến hơn 100.000 bài đánh giá bị gắn cờ nhầm là do AI tạo ra mỗi năm chỉ tính riêng trong lĩnh vực giáo dục đại học của Úc.

This happened on a smaller scale at the Australian Catholic University, which referred nearly 6,000 students for alleged academic misconduct in 2024, about 90% of them over AI use. The ABC reported last year the uni later dismissed any cases where the evidence for misconduct was solely based on Turnitin’s AI-detection technology.

Điều này đã xảy ra ở quy mô nhỏ hơn tại Đại học Công giáo Úc, nơi đã chuyển gần 6.000 sinh viên vì cáo buộc vi phạm liêm chính học thuật vào năm 2024, trong đó khoảng 90% liên quan đến việc sử dụng AI. ABC đưa tin vào năm ngoái rằng trường đại học này sau đó đã bác bỏ mọi trường hợp mà bằng chứng vi phạm chỉ dựa hoàn toàn vào công nghệ phát hiện AI của Turnitin.

Turnitin states its software should not be used in isolation to decide whether a student has used AI improperly:

Turnitin nêu rõ rằng phần mềm của họ không nên được sử dụng độc lập để quyết định xem một sinh viên có sử dụng AI không đúng cách hay không:

Rather, we provide data for educators to make an informed decision based on their academic and institutional policies.
Thay vào đó, chúng tôi cung cấp dữ liệu để các nhà giáo dục đưa ra quyết định sáng suốt dựa trên các chính sách học thuật và thể chế của họ.

But this still has an impact on students’ wellbeing. Research shows false accusations of academic misconduct harm students and cause significant stress and anxiety.

Nhưng điều này vẫn gây tác động đến sức khỏe tinh thần của sinh viên. Nghiên cứu cho thấy những cáo buộc sai lệch về vi phạm học thuật gây tổn hại cho sinh viên và gây ra căng thẳng cũng như lo lắng đáng kể.

Why aren’t detection tools more accurate?

Tại sao các công cụ phát hiện không có độ chính xác cao hơn?

Companies measure the accuracy of AI-detection software under controlled conditions. To calculate the false positive rate, companies test text they know was AI generated and text they know was entirely human written. Using these texts, they then measure how often the detector gets it right or wrong.

Các công ty đo lường độ chính xác của phần mềm phát hiện AI trong các điều kiện được kiểm soát. Để tính toán tỷ lệ dương tính giả, các công ty thử nghiệm các văn bản mà họ biết chắc do AI tạo ra và các văn bản mà họ biết hoàn toàn do con người viết. Sử dụng các văn bản này, họ sau đó đo lường tần suất bộ phát hiện đưa ra kết quả đúng hoặc sai.

However, we don’t really know all the details of how companies test their AI-detection software.

Tuy nhiên, chúng ta không thực sự biết tất cả chi tiết về cách các công ty thử nghiệm phần mềm phát hiện AI của họ.

Testing doesn’t translate well

Thử nghiệm không phản ánh chính xác thực tế

My research with colleagues, published in the Journal of Higher Education Policy and Management, suggests these controlled tests do not translate well when AI detectors are used in real world contexts, such as in unis.

Nghiên cứu của tôi cùng các đồng nghiệp, được công bố trên Tạp chí Chính sách và Quản lý Giáo dục Đại học, cho thấy các bài kiểm tra được kiểm soát này không phản ánh tốt khi các bộ phát hiện AI được sử dụng trong các bối cảnh thế giới thực, chẳng hạn như ở các trường đại học.

First, detection tools attempt to distinguish between AI-generated text and human–written text. However, this is not always so straightforward, as anything produced by AI could plausibly have been written by a human depending on their writing style. Students may also submit work that has been written with the assistance of AI, rather than sections of text simply generated by it.

Thứ nhất, các công cụ phát hiện cố gắng phân biệt giữa văn bản do AI tạo ra và văn bản do con người viết. Tuy nhiên, điều này không phải lúc nào cũng đơn giản, vì bất kỳ nội dung nào do AI sản xuất cũng có thể được viết bởi con người tùy thuộc vào phong cách viết của họ. Sinh viên cũng có thể nộp bài làm được viết với sự hỗ trợ của AI, thay vì các đoạn văn bản đơn thuần do AI tạo ra.

Second, even if a teacher uses an AI detector with a very low false-positive rate, it still doesn’t tell them the chance an individual student’s assessment is AI generated.

Thứ hai, ngay cả khi một giáo viên sử dụng bộ phát hiện AI có tỷ lệ dương tính giả rất thấp, nó vẫn không cho họ biết xác suất bài đánh giá của một sinh viên cụ thể là do AI tạo ra.

This is because a 1% false positive rate means one wrong flag for every hundred papers that humans wrote. So if you know how many human–written papers there are, you know how many to expect to be falsely flagged. But in the real world, where students complete assessments outside the classroom, we can never know in advance how many papers are human written — that’s why we’re using an AI detector in the first place — so we can’t know what the chances are that the flag is correct.

Điều này là do tỷ lệ dương tính giả 1% có nghĩa là có một lần gắn cờ sai cho mỗi một trăm bài làm do con người viết. Vì vậy, nếu bạn biết có bao nhiêu bài làm do con người viết, bạn sẽ biết có bao nhiêu bài dự kiến sẽ bị gắn cờ nhầm. Nhưng trong thế giới thực, nơi sinh viên hoàn thành các bài đánh giá bên ngoài lớp học, chúng ta không bao giờ có thể biết trước có bao nhiêu bài do con người viết — đó là lý do tại sao chúng ta sử dụng bộ phát hiện AI từ đầu — nên chúng ta không thể biết xác suất chiếc cờ được cắm là chính xác là bao nhiêu.

Multiple AI tools are not a solution

Nhiều công cụ AI không phải là giải pháp

It seems like using more than one AI detector would increase the chances of an accurate result. But AI detectors are all built on the same assumption that humans and AI write differently. Agreement between multiple AI detectors doesn’t mean they are right. It only means they made the same mistake.

Có vẻ như việc sử dụng nhiều hơn một bộ phát hiện AI sẽ làm tăng cơ hội có được kết quả chính xác. Nhưng các bộ phát hiện AI đều được xây dựng trên cùng một giả định rằng con người và AI viết khác nhau. Sự đồng thuận giữa nhiều bộ phát hiện AI không có nghĩa là chúng đúng. Nó chỉ có nghĩa là chúng đã mắc cùng một sai lầm.

False negatives are also a problem. This is when a detector fails to identify text where AI has been used. These mistakes get far less attention than false positives, and are a big problem for educators when determining whether a student has cheated.

Kết quả âm tính giả (false negative) cũng là một vấn đề. Đây là khi một bộ phát hiện không thể nhận diện được văn bản có sử dụng AI. Những sai lầm này ít nhận được sự chú ý hơn nhiều so với kết quả dương tính giả, và là một vấn đề lớn đối với các nhà giáo dục khi xác định xem một học sinh có gian lận hay không.

What’s the alternative?

Đâu là giải pháp thay thế?

The question assumes there must be a technical solution that allows us to continue using unsupervised written assessments as the sole basis for judging student learning. But not every unreliable technology needs a replacement. The same applies to AI watermarking, which has its own limitations.

Câu hỏi này ngầm giả định rằng phải có một giải pháp kỹ thuật cho phép chúng ta tiếp tục sử dụng các bài đánh giá viết không có sự giám sát làm cơ sở duy nhất để đánh giá việc học của học sinh. Nhưng không phải mọi công nghệ kém tin cậy đều cần phải có sự thay thế. Điều tương tự cũng áp dụng cho hình mờ AI (AI watermarking) , vốn có những hạn chế riêng của nó.

Instead of searching for signs of cheating, teachers should look at whether their students have learned what an assessment was designed to measure, and if the work they submit provides valid evidence of that learning.

Thay vì tìm kiếm các dấu hiệu gian lận, giáo viên nên xem xét liệu học sinh của họ đã học được những gì mà một bài đánh giá được thiết kế để đo lường hay chưa, và liệu bài làm các em nộp có cung cấp bằng chứng hợp lệ về quá trình học tập đó hay không.

Rather than attempting to make all assessments AI-proof, they can identify a number of points across a course where it matters most that students demonstrate key outcomes under supervision, through exams, practicals, presentations or interviews.

Thay vì cố gắng làm cho mọi bài đánh giá đều miễn nhiễm với AI, họ có thể xác định một số điểm trong suốt khóa học mà việc học sinh thể hiện các kết quả cốt lõi dưới sự giám sát là quan trọng nhất, thông qua các kỳ thi, bài thực hành, bài thuyết trình hoặc phỏng vấn.

It’s an approach supported by Australia’s higher education regulator that leaves room for students to use AI where it suits the task, and to learn how to use it well. None of this depends on software guessing how a piece of text was written.

Đó là một cách tiếp cận được cơ quan quản lý giáo dục đại học của Úc ủng hộ, mở ra không gian cho sinh viên sử dụng AI khi phù hợp với nhiệm vụ và học cách sử dụng nó một cách hiệu quả. Không có điều nào trong số này phụ thuộc vào việc phần mềm đoán xem một đoạn văn bản được viết như thế nào.

Mark A. Bassett does not work for, consult, own shares in or receive funding from any company or organisation that would benefit from this article, and has disclosed no relevant affiliations beyond their academic appointment.

Mark A. Bassett không làm việc cho, tư vấn, nắm giữ cổ phần hoặc nhận tài trợ từ bất kỳ công ty hay tổ chức nào có thể hưởng lợi từ bài viết này, và không công bố mối liên hệ nào có liên quan ngoài học hàm học vị của ông.