Không, các hệ thống AI không có động lực sinh tồn – một nhà tâm lý học phát triển giải thích lý do tại sao trông có vẻ như vậy

No, AI systems don’t have a drive to survive – a developmental psychologist explains why it only looks that way

Không, các hệ thống AI không có động lực sinh tồn – một nhà tâm lý học phát triển giải thích lý do tại sao trông có vẻ như vậy
Peter J. Marshall, Professor of Psychology and Neuroscience, Temple University
Show
Hide
EN – VI
VI – EN
3000-5000 ▼
0-3000
3000-5000
5000-7000
7000-10000

In controlled safety tests described earlier this year, researchers asked AI models to solve a series of simple math problems. Partway through the exercise, the instructors warned the bots that if they tried to solve the next problem, the computer environment they were operating in would be shut down. In some runs, the shutdown occurred as specified. In others, models interfered with the shutdown script and continued with the remaining problems.

Trong các bài kiểm tra an toàn có kiểm soát được mô tả hồi đầu năm nay, các nhà nghiên cứu đã yêu cầu các mô hình AI giải một loạt các bài toán đơn giản. Giữa buổi thực hành, những người hướng dẫn đã cảnh báo các bot rằng nếu chúng cố gắng giải bài toán tiếp theo, môi trường máy tính mà chúng đang hoạt động sẽ bị tắt. Trong một số lần chạy, việc tắt máy đã diễn ra như chỉ định. Ở những lần khác, các mô hình đã can thiệp vào tập lệnh tắt máy và tiếp tục giải các bài toán còn lại.

What explains this behavior? Do artificial intelligence systems have a drive to survive?

Điều gì giải thích cho hành vi này? Các hệ thống trí tuệ nhân tạo có động lực sinh tồn không?

Resistance to instructions

Sự chống lại các hướng dẫn

Consider a robot vacuum cleaner. When it detects that its battery is running low, it returns to its charger, recharges itself, then resumes cleaning. The machine is keeping itself going, but no one is panicking about an existential Roomba threat to humankind because the behavior is straightforward. Designers built in the ability to recharge.

Hãy xem xét một chiếc máy hút bụi robot. Khi phát hiện pin sắp cạn, nó sẽ quay trở lại đế sạc, tự sạc lại rồi tiếp tục việc dọn dẹp. Máy tự duy trì hoạt động, nhưng không ai hoảng sợ về mốiμε đe dọa hiện sinh từ Roomba đối với loài người vì hành vi đó rất đơn giản. Các nhà thiết kế đã tích hợp sẵn khả năng tự sạc.

AI models are more complex. For years, researchers have discussed scenarios in which an AI agent might act to prevent shutdown so it could complete the tasks it had been assigned. Staying “on” could be a means to an end, even without an explicit instruction to resist shutdown.

Các mô hình AI phức tạp hơn. Trong nhiều năm qua, các nhà nghiên cứu đã bàn luận về các kịch bản trong đó một tác nhân AI có thể hành động để ngăn chặn việc bị tắt nguồn nhằm hoàn thành các nhiệm vụ được giao. Việc duy trì trạng thái “bật” có thể là phương tiện để đạt được mục đích, ngay cả khi không có hướng dẫn rõ ràng về việc chống lại việc tắt máy.

One recent experiment showed that when researchers spelled out to an AI agent that allowing a shutdown took priority over completing a task, the resistance disappeared. But another, much broader experiment found some resistance even when the researchers instructed the models that allowing a shutdown had priority. Why some resistance remained is an open question.

Một thí nghiệm gần đây cho thấy khi các nhà nghiên cứu giải thích rõ ràng cho một tác nhân AI rằng việc cho phép tắt máy có ưu tiên hơn so với việc hoàn thành nhiệm vụ, thì sự chống đối đã biến mất. Tuy nhiên, một thí nghiệm khác có quy mô lớn hơn nhiều lại phát hiện ra một số sự chống đối ngay cả khi các nhà nghiên cứu đã hướng dẫn các mô hình rằng việc cho phép tắt máy là ưu tiên hàng đầu. Tại sao vẫn còn một số sự chống đối vẫn là một câu hỏi ngỏ.

What evolution explains

Tiến hóa giải thích điều gì

Self–protective behavior in an AI model may look like a drive to survive. Historian Yuval Noah Harari argued in a recent interview with The Economist that “the first thing that basically any entity learns as it develops is to survive.” He also said that evolution drives organisms toward survival. In a different article, he called survival “the most basic goal of any agent.”

Hành vi tự bảo vệ ở một mô hình AI có thể trông giống như động lực sinh tồn. Nhà sử học Yuval Noah Harari đã lập luận trong một cuộc phỏng vấn gần đây với tờ The Economist rằng “điều đầu tiên mà cơ bản bất kỳ thực thể nào học được khi phát triển là sinh tồn.” Ông cũng cho rằng tiến hóa thúc đẩy các sinh vật hướng tới sự sinh tồn. Trong một bài báo khác, ông gọi sinh tồn là “mục tiêu cơ bản nhất của bất kỳ tác nhân nào.”

But does invoking evolution explain why machines or even living things behave in self–preserving ways? A rabbit running from a fox is trying to save itself, and this kind of behavior has likely been favored in evolution. But natural selection is a historical process through which characteristics that contribute to survival and reproduction become more common across generations. It does not give an individual rabbit an instruction to “stay alive.”

Nhưng liệu việc viện dẫn tiến hóa có giải thích được lý do tại sao máy móc hay thậm chí là các sinh vật sống lại cư xử theo những cách tự bảo vệ không? Một con thỏ chạy trốn cáo là đang cố gắng cứu lấy chính mình, và loại hành vi này rất có thể đã được ưu ái trong quá trình tiến hóa. Nhưng chọn lọc tự nhiên là một quá trình lịch sử qua đó các đặc điểm góp phần vào sự sinh tồn và sinh sản trở nên phổ biến hơn qua các thế hệ. Nó không đưa ra một mệnh lệnh “hãy duy trì sự sống” cho một con thỏ cụ thể nào cả.

Even if AI systems were eventually subject to a comparable process of selection, that alone would not tell us what continued operation means for an individual system.

Ngay cả khi các hệ thống AI cuối cùng phải chịu một quá trình chọn lọc tương tự đi nữa, điều đó một mình nó cũng không cho chúng ta biết hoạt động liên tục có ý nghĩa gì đối với một hệ thống đơn lẻ.

In ‘2001: A Space Odyssey’, was the AI Hal 9000 trying to stay ‘alive’ or going overboard in trying to complete its mission?
Trong ‘2001: A Space Odyssey’, liệu AI Hal 9000 có đang cố gắng giữ mạng “sống” hay đã đi quá xa trong nỗ lực hoàn thành sứ mệnh của mình?

What it means to stay alive

Ý nghĩa của việc duy trì sự sống

A rabbit fleeing a fox and an AI altering a shutdown script can look broadly similar: Both behaviors help the individual or system continue. But what it means to continue is not the same in each case.

Một con thỏ chạy trốn con cáo và một AI thay đổi tập lệnh tắt máy có thể trông khá giống nhau: Cả hai hành vi đều giúp cá thể hoặc hệ thống tiếp tục tồn tại. Nhưng ý nghĩa của việc tiếp tục tồn tại đó không giống nhau trong từng trường hợp.

When a rabbit is not running for its life, it is constantly engaged in breathing, digesting, regulating its temperature, repairing tissue and defending against infection. This ongoing work is more than simple maintenance; it also builds and replaces the structures that make these processes possible. The gut lining that absorbs the rabbit’s food is itself rebuilt, every few days, from the food it absorbs.

Khi một con thỏ không chạy trốn để giữ mạng sống, nó liên tục thực hiện việc thở, tiêu hóa, điều hòa thân nhiệt, sửa chữa mô và chống lại nhiễm trùng. Công việc đang diễn ra này không chỉ đơn thuần là bảo dưỡng; nó còn xây dựng và thay thế các cấu trúc làm cho các quá trình này trở nên khả thi. Lớp niêm mạc ruột hấp thụ thức ăn của con thỏ cũng tự được tái tạo, chỉ sau vài ngày, từ chính thức ăn mà nó hấp thụ.

The rabbit is alive only as long as this continual producing, maintaining and repairing continues. Staying alive is not the outcome of that activity; it is the activity itself continuing. The rabbit’s existence depends on this ongoing activity, whether or not it is facing an immediate threat.

Con thỏ chỉ còn sống chừng nào quá trình sản xuất, duy trì và sửa chữa liên tục này còn tiếp diễn. Giữ gìn sự sống không phải là kết quả của hoạt động đó; mà chính là bản thân hoạt động đó đang tiếp diễn. Sự tồn tại của con thỏ phụ thuộc vào hoạt động đang diễn ra này, bất kể nó có đang phải đối mặt với một mối đe dọa ngay trước mắt hay không.

An AI system may take steps to stay on. In the safety tests, the models did not rewrite their own code or hack into the operating system – they simply moved or renamed the shutdown script, changed its permission or replaced it with something harmless. When that succeeded, the call that was supposed to trigger shutdown didn’t happen, and the model could continue with the task.

Một hệ thống AI có thể thực hiện các bước để giữ cho mình tiếp tục hoạt động. Trong các bài kiểm tra an toàn, các mô hình không viết lại mã của chính chúng hay xâm nhập vào hệ thống vận hành – chúng đơn giản chỉ di chuyển hoặc đổi tên tập lệnh tắt máy, thay đổi quyền hạn của nó hoặc thay thế nó bằng một thứ vô hại. Khi điều đó thành công, lệnh vốn dĩ phải kích hoạt việc tắt máy đã không xảy ra, và mô hình có thể tiếp tục với nhiệm vụ.

But staying on is not the same as staying alive. The shutdown resistance did not lead to a new course of action aimed at keeping the AI model operating. It just helped the model continue the task at hand.

Nhưng việc duy trì trạng thái bật không giống như việc duy trì sự sống. Sự chống lại việc tắt máy không dẫn đến một hướng hành động mới nhằm giữ cho mô hình AI tiếp tục hoạt động. Nó chỉ giúp mô hình tiếp tục nhiệm vụ trước mắt.

Nor is being switched off the same as dying. For a living organism, death is the irreversible breakdown of the activity that keeps it going. As Harari acknowledged in the Economist interview, “it is not clear what death means for an AI.”

Việc bị ngắt nguồn cũng không giống như cái chết. Đối với một sinh vật sống, cái chết là sự sụp đổ không thể đảo ngược của hoạt động duy trì sự sống cho nó. Như Harari đã thừa nhận trong cuộc phỏng vấn với tờ Economist, “vẫn chưa rõ cái chết có ý nghĩa gì đối với một AI.”

What it means to stay on

Ý nghĩa của việc duy trì trạng thái bật

The current shutdown tests show that an unfinished task can be enough to produce shutdown resistance in an AI. Although this behavior is not fully understood, it should not be automatically interpreted as self–preservation.

Các bài kiểm tra tắt máy hiện tại cho thấy một nhiệm vụ chưa hoàn thành có thể là đủ để tạo ra sự kháng cự tắt máy ở AI. Mặc dù hành vi này chưa được hiểu một cách thấu đáo, nhưng nó không nên tự động bị diễn giải là sự tự bảo vệ bản thân.

Whether AI could ever develop anything comparable to the self–producing and self–maintaining organization of living systems is a separate question. Current AI systems are kept running by an engineered infrastructure around them. Their own activity does not continually produce and replace the structures that keep them running.

Việc liệu AI có bao giờ phát triển được điều gì tương đương với tổ chức tự sản xuất và tự duy trì của các hệ thống sống hay không lại là một câu hỏi khác. Các hệ thống AI hiện tại được giữ cho hoạt động nhờ cơ sở hạ tầng được thiết kế xoay quanh chúng. Hoạt động của chính chúng không liên tục sản xuất và thay thế các cấu trúc giúp chúng vận hành.

Shutdown resistance in AI may still be dangerous, but these behaviors do not show that an AI system has a drive to survive.

Sự kháng cự tắt máy ở AI vẫn có thể gây nguy hiểm, nhưng những hành vi này không cho thấy hệ thống AI có động lực sinh tồn.

Peter J. Marshall does not work for, consult, own shares in or receive funding from any company or organization that would benefit from this article, and has disclosed no relevant affiliations beyond their academic appointment.

Peter J. Marshall không làm việc cho, tư vấn cho, sở hữu cổ phần trong hoặc nhận tài trợ từ bất kỳ công ty hay tổ chức nào có thể hưởng lợi từ bài báo này, đồng thời không công bố bất kỳ mối liên hệ nào có liên quan ngoài học hàm học vị của mình.