Thuật toán đề xuất nội dung của Google là một chiếc hộp đen. Dưới đây là cách thức nó quyết định những gì hiển thị cho bạn
Google’s content recommendation algorithm is a black box. Here’s how it decides what to show you

Nếu bạn là một trong hàng triệu người dùng Google Discover hằng ngày, chắc hẳn bạn đã từng bắt gặp đủ loại nội dung mà không cần phải chủ động tìm kiếm. Chẳng hạn, một người dùng ở Tây Ban Nha có thể nhìn thấy các tiêu đề hứa hẹn tiết lộ công thức bí mật của bếp trưởng tiên phong Ferràn Adrià, giờ đi ngủ của nữ MC 46 tuổi Pilar Rubio, các ưu đãi không thể bỏ lỡ mới nhất từ Lidl, hoặc mẫu ô tô mới sẽ giúp họ nói lời “vĩnh biệt” với các đợt kiểm tra định kỳ hàng năm.
Chúng ta vẫn có xu hướng coi Google trước hết và trên hết là một công cụ tìm kiếm. Thanh tìm kiếm mang tính biểu tượng trên nền trắng – sản phẩm chủ lực của Alphabet đóng vai trò là nền tảng cho nguồn doanh thu quảng cáo khổng lồ – từ lâu đã trở thành một phần trong từ vựng của chúng ta, đóng vai trò cả danh từ lẫn động từ mang tính quyết định trong các cuộc tranh luận đầy tranh cãi.
Nhưng qua nhiều năm, Google đã thiết lập một dịch vụ khác, một dịch vụ vượt ra ngoài ranh giới “tìm kiếm” truyền thống để chuyển sang “khám phá” theo thuật toán. Google Discover, hệ thống đề xuất nội dung của hãng, có giao diện tương tự như bảng tin mạng xã hội, dù không có phần bình luận, lượt đăng lại (retweet) hay các tương tác hiển thị từ những người dùng khác.
Không giống như các dịch vụ khác của Google như Maps, Drive hay Photos, Discover không có ứng dụng riêng. Thay vào đó, nó được cài đặt sẵn trên điện thoại Android như một phần không thể thiếu của giao diện, thường được truy cập bằng cách vuốt sang phải trên màn hình chính.
Câu hỏi lớn đối với hệ thống này cũng như bất kỳ hệ thống đề xuất nào khác – từ các thuật toán gây tranh cãi trên Instagram và Facebook, cho đến Netflix, YouTube và thậm chí cả các dịch vụ có vẻ vô hại như Vinted – là làm thế nào nó quyết định nội dung gì để đề xuất cho bạn. Bạn, với tư cách là một người dùng, đã làm gì để xứng đáng nhận được những nội dung này trên điện thoại của mình?
No magic formula
Không có công thức ma thuật
Khi mọi người cố gắng giải thích cách các nền tảng đề xuất nội dung cho chúng ta, họ thường dựa vào trí tưởng tượng thuật toán, những lời đồn đại hoặc niềm tin không có cơ sở. Thậm chí, một số người còn cố gắng huấn luyện hoặc thao túng thuật toán dựa trên những cách hiểu này.
Tuy nhiên, sự thật là không có một thuật toán đơn lẻ hay một phương trình vĩ đại nào mà bạn có thể kiểm soát. Các hệ thống đề xuất như Google Discover được vận hành bởi một mạng lưới cơ sở hạ tầng thuật toán vô cùng lớn và mơ hồ, một chuỗi các câu lệnh máy tính được ẩn giấu bên trong chiếc hộp đen ẩn dụ mà Google rất ít khi tiết lộ chi tiết.
Mọi thứ khác mà chúng ta biết đều xuất phát từ các nỗ lực chuyên môn nhằm tìm hiểu cách thức hoạt động của nó, hoặc từ các tài liệu khoa học đã ghi nhận tác động của nó đối với các lĩnh vực như báo chí.
Tuy nhiên, các thành phần của những hệ thống này không thể đơn giản được đọc giống như nhãn trên một chai tương cà hoặc dầu gội.
Leer más: TikTok’s
Đọc thêm: Chủ sở hữu mới của TikTok đưa thuật toán của ứng dụng lên bàn cân – một chuyên gia mạng xã hội giải thích cách trang ‘Dành cho bạn’ hoạt động
Funnelling content
Đưa nội dung vào phễu
Google’s webpage
Trang web của Google định nghĩa Discover là một nguồn cấp nội dung cá nhân hóa dựa trên sở thích của người dùng, được xác định thông qua hoạt động của họ trên web và trong các ứng dụng. Các nghiên cứu khoa học do chính các kỹ sư của Google công bố đã tiết lộ đây là một hệ thống đề xuất nội dung quy mô công nghiệp, trong khi các nghiên cứu học術 độc lập xếp nó vào điểm giao thoa giữa truy xuất thông tin và quản cur thuật toán.
Dù chúng ta không biết chính xác cách thức hoạt động của nó, chúng ta vẫn có thể giải thích lý do tại sao Google Discover hiển thị cho bạn một số nội dung nhất định bằng cách xem xét kiến trúc điển hình của một hệ thống đề xuất, cùng với các bằng chứng và giả thuyết mà chúng ta có về sản phẩm của Google.
Một phép ẩn dụ hữu ích là chiếc phễu được chia thành nhiều giai đoạn. Mỗi ngày, hàng triệu mảnh nội dung đủ mọi thể loại được đăng tải trực tuyến, từ các bài báo và video dài cho đến các bài đăng trên mạng xã hội và bản tóm tắt bằng AI. Discover cô đọng sự đa dạng vô tận này thành một danh sách được thiết kế riêng cho từng người dùng.
The first filters
Các bộ lọc đầu tiên
Giống như Google Search, bước đầu tiên là lập chỉ mục. Google duy trì một cơ sở dữ liệu, nơi họ quét internet và áp dụng bộ lọc ban đầu để loại bỏ bất kỳ thứ gì không tuân thủ các chính sách của mình. Điều này đảm bảo rằng nội dung vi phạm các quy tắc bảo mật sẽ bị loại bỏ ngay từ đầu. Ví dụ: điều này bao gồm các bài đăng nhằm tuyển dụng người vào một tổ chức khủng bố, hoặc các hình ảnh bạo lực, phản cảm không có bất kỳ bối cảnh báo chí nào.
Tuy nhiên, việc vượt qua bộ lọc này chỉ có nghĩa là nội dung đủ điều kiện. Nó không đảm bảo nội dung đó sẽ có một vị trí trong bảng tin của bạn.
Để thu hẹp nhóm ban đầu này, hệ thống sau đó sẽ xác định nội dung nào có nhiều khả năng phù hợp với sở thích của bạn nhất. Google Discover thực hiện điều này bằng cách xác định các yếu tố cụ thể nào (được gọi là các thực thể) hiện diện trong các tìm kiếm hoặc tương tác của bạn – chẳng hạn như Ferràn Adriá, Pilar Rubio và Lidl – và liên kết chúng lại với nhau. Bằng cách này, hệ thống có thể diễn giải những tìm kiếm hoặc bài viết tưởng chừng như không liên quan lại là một phần của cùng một mối quan tâm, đồng thời sắp xếp chúng thành các chủ đề và chủ đề phụ rộng hơn hơn.
Một khi đã phác 𓄢họa hồ sơ sở thích của bạn, hệ thống cần chuyển đổi chúng sang một ngôn ngữ mà nó có thể dùng để so sánh và tìm kiếm nội dung liên quan trên quy mô lớn. Trong trường hợp của Google Discover, các nhà phân tích như Damien Andell đã gợi ý rằng hệ thống này sử dụng các biểu diễn toán học được gọi là các vector nhúng (embeddings) .
Các vector này chuyển đổi các nhóm thực thể (được gọi là các cụm) và sở thích của chính bạn thành các tọa độ trên một bảng duy nhất giống như trò chơi bắn tàu (Battleships) . Hai điểm càng gần nhau thì độ tương đồng càng lớn.
Leer más:
Đọc thêm: Hà Lan buộc Meta cho phép người dùng từ bỏ bảng tin thuật toán. Đây là những gì đã xảy ra
Tracking clicks , likes and zooms
Theo dõi các lượt nhấp, lượt thích và thao tác phóng to
Sau khi các cụm này được xác định, phễu sẽ thu hẹp lại thành các mô hình dự đoán. Tại đây, AI của hệ thống sẽ cố gắng dự đoán cách bạn phản ứng với từng lựa chọn.
Google’s
Các kỹ sư của Google mô tả 11 mục tiêu dự đoán, trong đó 7 mục tiêu được xác định cụ thể: 5 mục tiêu tích cực (nhấp vào, thích, phản hồi tích cực với khảo sát, nhấp để xem chi tiết, và nhấp để mở rộng văn bản) và 2 mục tiêu tiêu cực (bỏ qua hoặc chặn vĩnh viễn nội dung) .
Với tất cả các dự đoán này, hệ thống sẽ xử lý chúng để xếp hạng các lựa chọn tiềm năng. Cách tiếp cận thông thường là kết hợp chúng thành một điểm số duy nhất, gán trọng số lớn hơn cho một số tín hiệu so với các tín hiệu khác. Ví dụ, một bài báo có thể có xác suất cao bạn sẽ nhấp vào, nhưng cũng có xác suất cao bạn sẽ chặn nó; một bài báo khác có thể ít gợi sự tò mò tức thì hơn, nhưng lại tạo ra nhiều tín hiệu tích cực hơn.
Discover phải giải quyết sự đánh đổi này để quyết định nội dung nào xuất hiện trước và nội dung nào xuất hiện tiếp theo. Tuy nhiên, Google chưa tiết lộ cách họ kết hợp các dự đoán này.
Sau khi các lựa chọn tiềm năng đã được xếp hạng, một số hệ thống sẽ áp dụng bộ lọc cuối cùng để kết hợp các tiêu chí như tính đa dạng, tính cập nhật hoặc tính công bằng. Điều này ngăn việc cả 5 nội dung hàng đầu đều nói về, chẳng hạn như, cùng một thiết bị mới không thể bỏ qua từ Lidl.
An endless loop
Một vòng lặp vô tận
Bây giờ chúng ta đang ở cuối phễu, và Google Discover đã quyết định hiển thị gì cho bạn. Nhưng quá trình này không dừng lại ở đó. Hệ thống tự phản hồi, quan sát các tín hiệu bạn tạo ra cả một cách rõ ràng (khi bạn chặn một nguồn hoặc thích một nội dung) lẫn ngầm ẩn (dù bạn dừng lại đọc một bài báo hay chuyển sang bài tiếp theo) .
Dữ liệu mới này được đưa trở lại hệ thống để huấn luyện và cập nhật mô hình. Các gợi ý tạo ra tương tác, tương tác tạo ra dữ liệu mới, và dữ liệu đó lại nạp vào các gợi ý trong tương lai.
Chúng ta không thể biết chính xác sự kết hợp của các tín hiệu nào dẫn đến việc Ferràn Adrià, Pilar Rubio hay bất kỳ tên tuổi nào khác xuất hiện trên nguồn nguồn tin Discover của bạn. Những gì chúng ta biết là hệ thống này là một trò chơi may rủi không bao giờ kết thúc, nuôi dưỡng bằng lịch sử và vị trí của bạn, cũng như những hành vi nhỏ hàng ngày mà dù bạn không nhận ra, vẫn cung cấp dữ liệu vận hành hệ thống gợi ý khổng lồ này.
Một email hàng tuần bằng tiếng Anh mang đến chuyên môn từ các học giả và nhà nghiên cứu. Email này giới thiệu sự đa dạng của các nghiên cứu đến từ châu lục và xem xét một số vấn đề then chốt mà các quốc gia châu Âu đang phải đối mặt. Hãy đăng ký nhận bản tin!
Las personas firmantes
Những người ký tên không phải là người làm công ăn lương, không phải cố vấn, không sở hữu cổ phần và không nhận tài trợ từ bất kỳ công ty hay tổ chức nào có thể thu lợi từ bài viết này, và đã tuyên bố không có liên kết có hại nào ngoài chức danh học thuật đã nêu trên.
có thể bạn cũng quan tâm
-

Tại sao việc thấu hiểu chứng tự kỷ đòi hỏi phải nhìn vượt ra ngoài ngôn ngữ nói – hai nhà nghiên cứu giao tiếp là người tự kỷ giải thích
Why understanding autism means looking beyond spoken language – two autistic researchers of communication explain
-

Ngày càng có nhiều thanh niên sống cùng cha mẹ hơn so với các thế hệ trước
More young adults are living with their parents than previous generations did