Các trường đại học và phổ thông đang từ bỏ phần mềm phát hiện AI. Họ nên dừng hẳn việc sử dụng nó
Unis and schools are moving away from AI-detection software. They should stop using it altogether

Kể từ khi phần mềm trí tuệ nhân tạo (AI) ChatGPT ra mắt vào năm 2022, giáo viên đã tìm kiếm các cách để nhận biết khi nào AI được dùng để tạo văn bản trong các bài đánh giá. Phần mềm phát hiện AI vẫn được bán bởi một số công ty công nghệ, chẳng hạn như Pangram, như một giải pháp tiềm năng.
Tháng này, Cơ quan Tiêu chuẩn Giáo dục New South Wales đã cập nhật các quy định nhằm ngăn các trường học phụ thuộc vào phần mềm phát hiện AI khi quyết định xem một học sinh có gian lận hay không. Lý do là các công cụ này không phải lúc nào cũng đáng tin cậy.
Mặc dù phần lớn các trường đại học Úc đã chuyển hướng khỏi phần mềm phát hiện AI dưới hình thức này hay hình thức khác, nghiên cứu của tôi cho thấy ngành giáo dục nên tiến thêm एक bước nữa và hoàn toàn không sử dụng các công cụ phát hiện AI.
Where are unis at ?
Tình hình ở các trường đại học hiện nay ra sao?
Unis
Mỗi trường đại học có quy định riêng về cách họ sử dụng phần mềm phát hiện AI, hoặc có sử dụng chúng hay không.
Một số trường đại học, chẳng hạn như Đại học Melbourne, Đại học Sydney và Đại học NSW, sử dụng các công cụ phát hiện AI dưới một hình thức nào đó để hỗ trợ gắn cờ các trường hợp vi phạm tiềm ẩn.
Các trường đại học khác, như Đại học Curtin và Đại học Queensland, đã chọn không sử dụng các công cụ phát hiện AI chút nào.
Not always reliable
Không phải lúc nào cũng đáng tin cậy
Lý do là vì phần mềm này không phải lúc nào cũng chính xác.
Khi các công cụ phát hiện AI gắn cờ nhầm bài làm của học sinh là có chứa văn bản do AI tạo ra, điều này được gọi là kết quả dương tính giả (false positive) . Các công ty AI muốn phát triển các bộ phát hiện có tỷ lệ dương tính giả thấp.
Chẳng hạn, Turnitin, một công ty có trụ sở tại Hoa Kỳ chuyên bán phần mềm phát hiện AI, quảng bá tỷ lệ dương tính giả dưới 1%. Tuy nhiên, Turnitin cho biết phần mềm này chỉ đáng tin cậy trong việc phát hiện sử dụng AI khi tài liệu chứa hơn 20% nội dung do AI tạo ra.
Impacts on students
Tác động đối với học sinh, sinh viên
Tỷ lệ dương tính giả thấp vẫn có thể dẫn đến những vấn đề lớn.
Vào năm 2023, chuyên gia về tính liêm chính trong học thuật Phillip Dawson ước tính rằng ngay cả tỷ lệ dương tính giả 0,7% cũng sẽ dẫn đến hơn 100.000 bài đánh giá bị gắn cờ nhầm là do AI tạo ra mỗi năm chỉ tính riêng trong lĩnh vực giáo dục đại học của Úc.
Điều này đã xảy ra ở quy mô nhỏ hơn tại Đại học Công giáo Úc, nơi đã chuyển gần 6.000 sinh viên vì cáo buộc vi phạm liêm chính học thuật vào năm 2024, trong đó khoảng 90% liên quan đến việc sử dụng AI. ABC đưa tin vào năm ngoái rằng trường đại học này sau đó đã bác bỏ mọi trường hợp mà bằng chứng vi phạm chỉ dựa hoàn toàn vào công nghệ phát hiện AI của Turnitin.
Turnitin
Turnitin nêu rõ rằng phần mềm của họ không nên được sử dụng độc lập để quyết định xem một sinh viên có sử dụng AI không đúng cách hay không:
Rather ,we provide data for educatorsto make an informed decision based on their academic and institutionalpolicies .
Thay vào đó, chúng tôi cung cấp dữ liệu để các nhà giáo dục đưa ra quyết định sáng suốt dựa trên các chính sách học thuật và thể chế của họ.
Nhưng điều này vẫn gây tác động đến sức khỏe tinh thần của sinh viên. Nghiên cứu cho thấy những cáo buộc sai lệch về vi phạm học thuật gây tổn hại cho sinh viên và gây ra căng thẳng cũng như lo lắng đáng kể.
Why aren’t detection tools more accurate ?
Tại sao các công cụ phát hiện không có độ chính xác cao hơn?
Các công ty đo lường độ chính xác của phần mềm phát hiện AI trong các điều kiện được kiểm soát. Để tính toán tỷ lệ dương tính giả, các công ty thử nghiệm các văn bản mà họ biết chắc do AI tạo ra và các văn bản mà họ biết hoàn toàn do con người viết. Sử dụng các văn bản này, họ sau đó đo lường tần suất bộ phát hiện đưa ra kết quả đúng hoặc sai.
Tuy nhiên, chúng ta không thực sự biết tất cả chi tiết về cách các công ty thử nghiệm phần mềm phát hiện AI của họ.
Testing doesn’t translate well
Thử nghiệm không phản ánh chính xác thực tế
Nghiên cứu của tôi cùng các đồng nghiệp, được công bố trên Tạp chí Chính sách và Quản lý Giáo dục Đại học, cho thấy các bài kiểm tra được kiểm soát này không phản ánh tốt khi các bộ phát hiện AI được sử dụng trong các bối cảnh thế giới thực, chẳng hạn như ở các trường đại học.
Thứ nhất, các công cụ phát hiện cố gắng phân biệt giữa văn bản do AI tạo ra và văn bản do con người viết. Tuy nhiên, điều này không phải lúc nào cũng đơn giản, vì bất kỳ nội dung nào do AI sản xuất cũng có thể được viết bởi con người tùy thuộc vào phong cách viết của họ. Sinh viên cũng có thể nộp bài làm được viết với sự hỗ trợ của AI, thay vì các đoạn văn bản đơn thuần do AI tạo ra.
Thứ hai, ngay cả khi một giáo viên sử dụng bộ phát hiện AI có tỷ lệ dương tính giả rất thấp, nó vẫn không cho họ biết xác suất bài đánh giá của một sinh viên cụ thể là do AI tạo ra.
Điều này là do tỷ lệ dương tính giả 1% có nghĩa là có một lần gắn cờ sai cho mỗi một trăm bài làm do con người viết. Vì vậy, nếu bạn biết có bao nhiêu bài làm do con người viết, bạn sẽ biết có bao nhiêu bài dự kiến sẽ bị gắn cờ nhầm. Nhưng trong thế giới thực, nơi sinh viên hoàn thành các bài đánh giá bên ngoài lớp học, chúng ta không bao giờ có thể biết trước có bao nhiêu bài do con người viết — đó là lý do tại sao chúng ta sử dụng bộ phát hiện AI từ đầu — nên chúng ta không thể biết xác suất chiếc cờ được cắm là chính xác là bao nhiêu.
Multiple AI tools are not a solution
Nhiều công cụ AI không phải là giải pháp
Có vẻ như việc sử dụng nhiều hơn một bộ phát hiện AI sẽ làm tăng cơ hội có được kết quả chính xác. Nhưng các bộ phát hiện AI đều được xây dựng trên cùng một giả định rằng con người và AI viết khác nhau. Sự đồng thuận giữa nhiều bộ phát hiện AI không có nghĩa là chúng đúng. Nó chỉ có nghĩa là chúng đã mắc cùng một sai lầm.
False
Kết quả âm tính giả (false negative) cũng là một vấn đề. Đây là khi một bộ phát hiện không thể nhận diện được văn bản có sử dụng AI. Những sai lầm này ít nhận được sự chú ý hơn nhiều so với kết quả dương tính giả, và là một vấn đề lớn đối với các nhà giáo dục khi xác định xem một học sinh có gian lận hay không.
What ’s the alternative ?
Đâu là giải pháp thay thế?
Câu hỏi này ngầm giả định rằng phải có một giải pháp kỹ thuật cho phép chúng ta tiếp tục sử dụng các bài đánh giá viết không có sự giám sát làm cơ sở duy nhất để đánh giá việc học của học sinh. Nhưng không phải mọi công nghệ kém tin cậy đều cần phải có sự thay thế. Điều tương tự cũng áp dụng cho hình mờ AI (AI watermarking) , vốn có những hạn chế riêng của nó.
Thay vì tìm kiếm các dấu hiệu gian lận, giáo viên nên xem xét liệu học sinh của họ đã học được những gì mà một bài đánh giá được thiết kế để đo lường hay chưa, và liệu bài làm các em nộp có cung cấp bằng chứng hợp lệ về quá trình học tập đó hay không.
Thay vì cố gắng làm cho mọi bài đánh giá đều miễn nhiễm với AI, họ có thể xác định một số điểm trong suốt khóa học mà việc học sinh thể hiện các kết quả cốt lõi dưới sự giám sát là quan trọng nhất, thông qua các kỳ thi, bài thực hành, bài thuyết trình hoặc phỏng vấn.
Đó là một cách tiếp cận được cơ quan quản lý giáo dục đại học của Úc ủng hộ, mở ra không gian cho sinh viên sử dụng AI khi phù hợp với nhiệm vụ và học cách sử dụng nó một cách hiệu quả. Không có điều nào trong số này phụ thuộc vào việc phần mềm đoán xem một đoạn văn bản được viết như thế nào.
Mark A. Bassett không làm việc cho, tư vấn, nắm giữ cổ phần hoặc nhận tài trợ từ bất kỳ công ty hay tổ chức nào có thể hưởng lợi từ bài viết này, và không công bố mối liên hệ nào có liên quan ngoài học hàm học vị của ông.
có thể bạn cũng quan tâm
-

Muỗi cũng kén ăn – Chúng tôi đã nghiên cứu 3 loài muỗi phổ biến ở miền Nam Florida để tìm hiểu lý do tại sao chúng thích một số người hơn những người khác
Mosquitoes are picky eaters – we studied 3 common South Florida species to learn why they like some people more than others
-

Khi con bạn hỏi liệu chúng có bị tổn thương như những người trên tin tức hay không, bạn sẽ nói gì? Các nhà tâm lý học đưa ra lời khuyên về cách trò chuyện về bản sắc
When your child asks if they’ll be harmed like the people on the news, what do you say? Psychologists provide tips on how to talk about identity