Thuật toán đề xuất nội dung của Google là một chiếc hộp đen. Dưới đây là cách thức nó quyết định những gì hiển thị cho bạn

Google’s content recommendation algorithm is a black box. Here’s how it decides what to show you

Thuật toán đề xuất nội dung của Google là một chiếc hộp đen. Dưới đây là cách thức nó quyết định những gì hiển thị cho bạn
Olaya López Munuera, PhD en Comunicación y Periodismo, Universitat Autònoma de Barcelona Carlos Lopezosa, Profesor Lector, Universitat de Barcelona
Show
Hide
EN – VI
VI – EN
3000-5000 ▼
0-3000
3000-5000
5000-7000
7000-10000

If you’re one of Google Discover’s millions of daily users, you’ve doubtless come across all manner of content without actively searching for it. A Spanish user, for instance, might see headlines promising to reveal the secret recipes of avant-garde chef Ferràn Adrià, what time 46 year–old TV presenter Pilar Rubio goes to bed, the latest unmissable deals from Lidl, or the new car that will allow them to say “adiós” to annual inspections.

Nếu bạn là một trong hàng triệu người dùng Google Discover hằng ngày, chắc hẳn bạn đã từng bắt gặp đủ loại nội dung mà không cần phải chủ động tìm kiếm. Chẳng hạn, một người dùng ở Tây Ban Nha có thể nhìn thấy các tiêu đề hứa hẹn tiết lộ công thức bí mật của bếp trưởng tiên phong Ferràn Adrià, giờ đi ngủ của nữ MC 46 tuổi Pilar Rubio, các ưu đãi không thể bỏ lỡ mới nhất từ Lidl, hoặc mẫu ô tô mới sẽ giúp họ nói lời “vĩnh biệt” với các đợt kiểm tra định kỳ hàng năm.

We still tend to think of Google as a search engine first and foremost. The iconic search bar on a white background – Alphabet’s flagship product that underpins its substantial advertising revenue – has long been part of our vocabulary, as both a noun and a verb that has the final say in contentious debates.

Chúng ta vẫn có xu hướng coi Google trước hết và trên hết là một công cụ tìm kiếm. Thanh tìm kiếm mang tính biểu tượng trên nền trắng – sản phẩm chủ lực của Alphabet đóng vai trò là nền tảng cho nguồn doanh thu quảng cáo khổng lồ – từ lâu đã trở thành một phần trong từ vựng của chúng ta, đóng vai trò cả danh từ lẫn động từ mang tính quyết định trong các cuộc tranh luận đầy tranh cãi.

Figure
When we talk about ‘Google’, this page is usually what we’re referring to. Google.com
Khi chúng ta nói về ‘Google’, trang này thường là thứ mà chúng ta đang nhắc tới. Google.com

But over the years, Google has established another service, one that moves beyond traditional “searching” to algorithmic “finding”. Google Discover, its content recommendation system, has a similar interface to a social media feed, though without comments, retweets or visible interactions from other users.

Nhưng qua nhiều năm, Google đã thiết lập một dịch vụ khác, một dịch vụ vượt ra ngoài ranh giới “tìm kiếm” truyền thống để chuyển sang “khám phá” theo thuật toán. Google Discover, hệ thống đề xuất nội dung của hãng, có giao diện tương tự như bảng tin mạng xã hội, dù không có phần bình luận, lượt đăng lại (retweet) hay các tương tác hiển thị từ những người dùng khác.

Unlike other Google services like Maps, Drive or Photos, Discover does not have its own app. Instead, it comes pre-installed on Android phones as an integral part of the interface, usually accessed by swiping right on the home screen.

Không giống như các dịch vụ khác của Google như Maps, Drive hay Photos, Discover không có ứng dụng riêng. Thay vào đó, nó được cài đặt sẵn trên điện thoại Android như một phần không thể thiếu của giao diện, thường được truy cập bằng cách vuốt sang phải trên màn hình chính.

The big question regarding this and any other recommendation system – from controversial algorithms like those on Instagram and Facebook, to Netflix, YouTube and even seemingly innocuous services like Vinted – is how it decides what content to recommend to you. What have you, as a user, done to deserve this on your phone?

Câu hỏi lớn đối với hệ thống này cũng như bất kỳ hệ thống đề xuất nào khác – từ các thuật toán gây tranh cãi trên Instagram và Facebook, cho đến Netflix, YouTube và thậm chí cả các dịch vụ có vẻ vô hại như Vinted – là làm thế nào nó quyết định nội dung gì để đề xuất cho bạn. Bạn, với tư cách là một người dùng, đã làm gì để xứng đáng nhận được những nội dung này trên điện thoại của mình?

No magic formula

Không có công thức ma thuật

When people try to explain how platforms recommend content to us, they tend to lean on algorithmic imaginaries, gossip or unfounded beliefs. Some even attempt to train or manipulate the algorithm based on these reconstructions.

Khi mọi người cố gắng giải thích cách các nền tảng đề xuất nội dung cho chúng ta, họ thường dựa vào trí tưởng tượng thuật toán, những lời đồn đại hoặc niềm tin không có cơ sở. Thậm chí, một số người còn cố gắng huấn luyện hoặc thao túng thuật toán dựa trên những cách hiểu này.

However, the truth is that there is no single algorithm or grand equation that you can control. Recommendation systems like Google Discover are powered by a vast, opaque network of algorithmic infrastructure, a circuit of computer instructions hidden inside a metaphorical black box about which Google has revealed very few details.

Tuy nhiên, sự thật là không có một thuật toán đơn lẻ hay một phương trình vĩ đại nào mà bạn có thể kiểm soát. Các hệ thống đề xuất như Google Discover được vận hành bởi một mạng lưới cơ sở hạ tầng thuật toán vô cùng lớn và mơ hồ, một chuỗi các câu lệnh máy tính được ẩn giấu bên trong chiếc hộp đen ẩn dụ mà Google rất ít khi tiết lộ chi tiết.

Everything else that we know comes from either professional efforts to learn how it works, or from scientific literature, which has noted its impact on fields like journalism.

Mọi thứ khác mà chúng ta biết đều xuất phát từ các nỗ lực chuyên môn nhằm tìm hiểu cách thức hoạt động của nó, hoặc từ các tài liệu khoa học đã ghi nhận tác động của nó đối với các lĩnh vực như báo chí.

However, these systems’ ingredients cannot simply be read like the label on a bottle of ketchup or shampoo.

Tuy nhiên, các thành phần của những hệ thống này không thể đơn giản được đọc giống như nhãn trên một chai tương cà hoặc dầu gội.

Leer más: TikTok’s new owner puts app’s algorithm in the spotlight – a social media expert explains how the ‘For You’ page works

Đọc thêm: Chủ sở hữu mới của TikTok đưa thuật toán của ứng dụng lên bàn cân – một chuyên gia mạng xã hội giải thích cách trang ‘Dành cho bạn’ hoạt động

Funnelling content

Đưa nội dung vào phễu

Google’s webpage defines Discover as a personalised feed based on the user’s interests, determined by their activity on the web and in apps. Scientific studies published by Google’s own engineers have revealed it to be an industrial–scale content recommendation system, while independent academic research places it at the intersection between information retrieval and algorithmic curation.

Trang web của Google định nghĩa Discover là một nguồn cấp nội dung cá nhân hóa dựa trên sở thích của người dùng, được xác định thông qua hoạt động của họ trên web và trong các ứng dụng. Các nghiên cứu khoa học do chính các kỹ sư của Google công bố đã tiết lộ đây là một hệ thống đề xuất nội dung quy mô công nghiệp, trong khi các nghiên cứu học術 độc lập xếp nó vào điểm giao thoa giữa truy xuất thông tin và quản cur thuật toán.

While we do not know exactly how it works, we can explain why Google Discover shows you certain content by looking at the typical architecture of a recommendation system, along with the evidence and hypotheses we have about Google’s product.

Dù chúng ta không biết chính xác cách thức hoạt động của nó, chúng ta vẫn có thể giải thích lý do tại sao Google Discover hiển thị cho bạn một số nội dung nhất định bằng cách xem xét kiến trúc điển hình của một hệ thống đề xuất, cùng với các bằng chứng và giả thuyết mà chúng ta có về sản phẩm của Google.

A useful metaphor is that of a funnel divided into stages. Every day, millions of pieces of content of all kinds are published online, from articles and long–form videos to social media posts and AI summaries. Discover distils this immense variety into a list tailored specifically to every single user.

Một phép ẩn dụ hữu ích là chiếc phễu được chia thành nhiều giai đoạn. Mỗi ngày, hàng triệu mảnh nội dung đủ mọi thể loại được đăng tải trực tuyến, từ các bài báo và video dài cho đến các bài đăng trên mạng xã hội và bản tóm tắt bằng AI. Discover cô đọng sự đa dạng vô tận này thành một danh sách được thiết kế riêng cho từng người dùng.

The first filters

Các bộ lọc đầu tiên

As with Google Search, the first step is indexing. Google maintains a database where it crawls the internet and applies an initial filter to exclude anything that does not comply with its policies. This ensures that content which breaches security rules is excluded from the outset. This includes, for instance, posts seeking to recruit people to a terrorist organisation, or graphic images without any journalistic context.

Giống như Google Search, bước đầu tiên là lập chỉ mục. Google duy trì một cơ sở dữ liệu, nơi họ quét internet và áp dụng bộ lọc ban đầu để loại bỏ bất kỳ thứ gì không tuân thủ các chính sách của mình. Điều này đảm bảo rằng nội dung vi phạm các quy tắc bảo mật sẽ bị loại bỏ ngay từ đầu. Ví dụ: điều này bao gồm các bài đăng nhằm tuyển dụng người vào một tổ chức khủng bố, hoặc các hình ảnh bạo lực, phản cảm không có bất kỳ bối cảnh báo chí nào.

However, getting past this filter merely means that content is eligible. It does not guarantee it a place in your feed.

Tuy nhiên, việc vượt qua bộ lọc này chỉ có nghĩa là nội dung đủ điều kiện. Nó không đảm bảo nội dung đó sẽ có một vị trí trong bảng tin của bạn.

To narrow down this initial pool, the system then identifies which content is most likely to match your interests. Google Discover does this by identifying which specific elements (known as entities) are present in your searches or interactions – such as Ferràn Adriá, Pilar Rubio and Lidl – and linking them together. In this way, it can interpret which seemingly unrelated searches or articles form part of the same interest, and organise them into broader topics and subtopics.

Để thu hẹp nhóm ban đầu này, hệ thống sau đó sẽ xác định nội dung nào có nhiều khả năng phù hợp với sở thích của bạn nhất. Google Discover thực hiện điều này bằng cách xác định các yếu tố cụ thể nào (được gọi là các thực thể) hiện diện trong các tìm kiếm hoặc tương tác của bạn – chẳng hạn như Ferràn Adriá, Pilar Rubio và Lidl – và liên kết chúng lại với nhau. Bằng cách này, hệ thống có thể diễn giải những tìm kiếm hoặc bài viết tưởng chừng như không liên quan lại là một phần của cùng một mối quan tâm, đồng thời sắp xếp chúng thành các chủ đề và chủ đề phụ rộng hơn hơn.

Once it has profiled your interests, the system needs to translate them into a language in which it can compare and find related content on a large scale. In the case of Google Discover, analysts such as Damien Andell have suggested that it uses mathematical representations known as embeddings.

Một khi đã phác 𓄢họa hồ sơ sở thích của bạn, hệ thống cần chuyển đổi chúng sang một ngôn ngữ mà nó có thể dùng để so sánh và tìm kiếm nội dung liên quan trên quy mô lớn. Trong trường hợp của Google Discover, các nhà phân tích như Damien Andell đã gợi ý rằng hệ thống này sử dụng các biểu diễn toán học được gọi là các vector nhúng (embeddings) .

These vectors convert groups of entities (known as clusters) and your own interests into coordinates on a single board that resembles a game of Battleships. The closer two points are, the greater their affinity.

Các vector này chuyển đổi các nhóm thực thể (được gọi là các cụm) và sở thích của chính bạn thành các tọa độ trên một bảng duy nhất giống như trò chơi bắn tàu (Battleships) . Hai điểm càng gần nhau thì độ tương đồng càng lớn.

Leer más: The Netherlands forced Meta to let users ditch algorithmic feeds. Here’s what happened

Đọc thêm: Hà Lan buộc Meta cho phép người dùng từ bỏ bảng tin thuật toán. Đây là những gì đã xảy ra

Tracking clicks, likes and zooms

Theo dõi các lượt nhấp, lượt thích và thao tác phóng to

Once these clusters have been identified, the funnel narrows again into predictive models. Here, the system’s AI attempts to predict how you will react to each of the options.

Sau khi các cụm này được xác định, phễu sẽ thu hẹp lại thành các mô hình dự đoán. Tại đây, AI của hệ thống sẽ cố gắng dự đoán cách bạn phản ứng với từng lựa chọn.

Google’s engineers describe eleven predictive objectives, seven of which are specified: five positive (clicking, liking, responding positively to a survey, clicking to view details, and clicking to expand text) and two negative (dismissing or permanently blocking the content) .

Các kỹ sư của Google mô tả 11 mục tiêu dự đoán, trong đó 7 mục tiêu được xác định cụ thể: 5 mục tiêu tích cực (nhấp vào, thích, phản hồi tích cực với khảo sát, nhấp để xem chi tiết, và nhấp để mở rộng văn bản) và 2 mục tiêu tiêu cực (bỏ qua hoặc chặn vĩnh viễn nội dung) .

With all of these predictions on the table, the system then processes them to rank the candidates. The usual approach is to combine them into a single score, giving greater weight to some signals than others. One article may, for instance, have a high probability of you clicking on it, but also a high probability of you blocking it; another may arouse less immediate curiosity, but generate more positive signals.

Với tất cả các dự đoán này, hệ thống sẽ xử lý chúng để xếp hạng các lựa chọn tiềm năng. Cách tiếp cận thông thường là kết hợp chúng thành một điểm số duy nhất, gán trọng số lớn hơn cho một số tín hiệu so với các tín hiệu khác. Ví dụ, một bài báo có thể có xác suất cao bạn sẽ nhấp vào, nhưng cũng có xác suất cao bạn sẽ chặn nó; một bài báo khác có thể ít gợi sự tò mò tức thì hơn, nhưng lại tạo ra nhiều tín hiệu tích cực hơn.

Discover has to resolve this trade–off to decide what appears first and what appears next. However, Google has not disclosed how it combines these predictions.

Discover phải giải quyết sự đánh đổi này để quyết định nội dung nào xuất hiện trước và nội dung nào xuất hiện tiếp theo. Tuy nhiên, Google chưa tiết lộ cách họ kết hợp các dự đoán này.

Once the candidates have been ranked, some systems apply a final filter to incorporate criteria such as diversity, recency or fairness. This prevents the top five pieces of content from all being about, for example, the same unmissable new gadget from Lidl.

Sau khi các lựa chọn tiềm năng đã được xếp hạng, một số hệ thống sẽ áp dụng bộ lọc cuối cùng để kết hợp các tiêu chí như tính đa dạng, tính cập nhật hoặc tính công bằng. Điều này ngăn việc cả 5 nội dung hàng đầu đều nói về, chẳng hạn như, cùng một thiết bị mới không thể bỏ qua từ Lidl.

An endless loop

Một vòng lặp vô tận

We’re now at the end of the funnel, and Google Discover has decided what to show you. But the process doesn’t stop there. The system feeds back on itself, observing the signals you generate both explicitly (when you block a source or like a piece of content) and implicitly (whether you stop to read an article or move on to the next one) .

Bây giờ chúng ta đang ở cuối phễu, và Google Discover đã quyết định hiển thị gì cho bạn. Nhưng quá trình này không dừng lại ở đó. Hệ thống tự phản hồi, quan sát các tín hiệu bạn tạo ra cả một cách rõ ràng (khi bạn chặn một nguồn hoặc thích một nội dung) lẫn ngầm ẩn (dù bạn dừng lại đọc một bài báo hay chuyển sang bài tiếp theo) .

This new data is fed back into the system to train and update the model. Recommendations generate interactions, interactions produce new data, and that data feeds into future recommendations.

Dữ liệu mới này được đưa trở lại hệ thống để huấn luyện và cập nhật mô hình. Các gợi ý tạo ra tương tác, tương tác tạo ra dữ liệu mới, và dữ liệu đó lại nạp vào các gợi ý trong tương lai.

We cannot know exactly what mix of signals leads to Ferràn Adrià, Pilar Rubio, or any other name appearing in your Discover feed. What we do know is that the system is a never–ending game of chance, one that feeds on your history and location, as well as small, everyday behaviours that, while imperceptible to you, provide the data that fuels this vast recommendation system.

Chúng ta không thể biết chính xác sự kết hợp của các tín hiệu nào dẫn đến việc Ferràn Adrià, Pilar Rubio hay bất kỳ tên tuổi nào khác xuất hiện trên nguồn nguồn tin Discover của bạn. Những gì chúng ta biết là hệ thống này là một trò chơi may rủi không bao giờ kết thúc, nuôi dưỡng bằng lịch sử và vị trí của bạn, cũng như những hành vi nhỏ hàng ngày mà dù bạn không nhận ra, vẫn cung cấp dữ liệu vận hành hệ thống gợi ý khổng lồ này.

Figure

A weekly e-mail in English featuring expertise from scholars and researchers. It provides an introduction to the diversity of research coming out of the continent and considers some of the key issues facing European countries. Get the newsletter!

Một email hàng tuần bằng tiếng Anh mang đến chuyên môn từ các học giả và nhà nghiên cứu. Email này giới thiệu sự đa dạng của các nghiên cứu đến từ châu lục và xem xét một số vấn đề then chốt mà các quốc gia châu Âu đang phải đối mặt. Hãy đăng ký nhận bản tin!

Las personas firmantes no son asalariadas, ni consultoras, ni poseen acciones, ni reciben financiación de ninguna compañía u organización que pueda obtener beneficio de este artículo, y han declarado carecer de vínculos relevantes más allá del cargo académico citado anteriormente.

Những người ký tên không phải là người làm công ăn lương, không phải cố vấn, không sở hữu cổ phần và không nhận tài trợ từ bất kỳ công ty hay tổ chức nào có thể thu lợi từ bài viết này, và đã tuyên bố không có liên kết có hại nào ngoài chức danh học thuật đã nêu trên.