Gemini Spark: Google bước vào cuộc đua AI Agent – Phân tích những gì bài báo không nói

Trương Thảo
Layer2

Hook

Trong một bài phân tích dài tới hàng nghìn từ về tính năng mới mang tên Gemini Spark, tôi chỉ tìm thấy duy nhất một câu mô tả tính năng: "nó có thể duyệt web và thực hiện việc vặt cho bạn". Không có kiến trúc mô hình, không có tham số, không có con số về tốc độ, không có bảng xếp hạng benchmark. Chỉ có một lời khẳng định mơ hồ và hai nhận xét chủ quan. Kẻ đi săn luôn thấy dấu vết trước khi bầy đàn tới. Và dấu vết này, dù mờ nhạt, đang nói với tôi rằng Google – gã khổng lồ đã thống trị tìm kiếm suốt hai thập kỷ – đang chuẩn bị thay đổi cách chúng ta tương tác với toàn bộ thế giới số. Nhưng câu hỏi là: liệu họ có thực sự hiểu mình đang mở ra cánh cửa nào không?

Context

Gemini Spark, theo bài báo gốc, là một AI agent do Google phát triển, có khả năng tự duyệt web và thực hiện các tác vụ thay người dùng. Bài báo không nói rõ ngày phát hành, không cung cấp liên kết chính thức, và cái tên "Gemini Spark" cũng không xuất hiện trong các tài liệu công khai của Google trước đó. Có thể đây là một tên mã nội bộ, một biến thể khu vực, hoặc một lỗi dịch thuật. Nhưng hướng đi – AI agent thay thế con người duyệt web – là hoàn toàn phù hợp với lộ trình mà Google đã công bố kể từ khi ra mắt Gemini.

Trong lịch sử, Google thường không công bố sản phẩm khi chưa sẵn sàng. Nhưng kể từ khi ChatGPT xuất hiện vào tháng 11/2022, Google đã nhiều lần phá vỡ nguyên tắc này: từ mã màu đỏ cho các sản phẩm AI, đến việc phát hành Bard với tình huống dở khóc dở cười. Áp lực cạnh tranh từ OpenAI đang buộc Google phải vội vàng. Gemini Spark, nếu có thật, có thể là một sản phẩm được xây dựng trong vài tháng để đối phó với Operator của OpenAI – một agent có thể thao tác trình duyệt để đặt vé, điền form, mua sắm. Anthropic cũng tung ra Computer Use, cho phép Claude điều khiển toàn bộ máy tính. Perplexity giới thiệu Comet – trình duyệt agent-native. Google không thể đứng ngoài cuộc, nhưng cách họ bước vào – với một thông báo mơ hồ – cho thấy một sự vội vã không giống phong cách thận trọng của một công ty từng là "người gác cổng" Internet.

Core – Phân tích kỹ thuật và cấu trúc

Hãy tạm gác lại câu hỏi Gemini Spark có tồn tại hay không. Hãy phân tích nó như một sản phẩm kỹ thuật trong ngữ cảnh của hệ sinh thái Google. Thứ nhất, nó thuộc loại agentic AI – một hệ thống kết hợp mô hình ngôn ngữ lớn với khả năng gọi công cụ, thao tác trình duyệt, và lập kế hoạch đa bước. Người dùng không chỉ hỏi một câu và nhận câu trả lời; họ giao toàn bộ một quy trình – ví dụ như "tìm một khách sạn ở Đà Nẵng trong khoảng 2 triệu đồng mỗi đêm, so sánh giá trên ba trang web, rồi đặt phòng với ưu đãi tốt nhất" – cho AI thực hiện từ đầu đến cuối. Về mặt công nghệ, đây là một combo: mô hình Gemini hiện tại, một bộ công cụ duyệt web được điều khiển qua API, và một mô-đun lập kế hoạch tác vụ. Không có gì mới ở cấp độ kiến trúc. OpenAI và Anthropic đã làm điều này. Thiên tài của Google nằm ở chỗ họ có thể gắn tất cả vào Chrome – trình duyệt có khoảng 65% thị phần toàn cầu – và vào Android, với hơn 3 tỷ thiết bị đang hoạt động. Điều đó đưa Gemini Spark từ một ứng dụng AI thông thường lên thành một lớp điều khiển mới nằm giữa con người và toàn bộ Internet.

Về chi phí tính toán, đây là nơi mọi thứ trở nên thú vị. Một cuộc trò chuyện thông thường với chatbot tiêu tốn khoảng vài nghìn token mỗi lượt hỏi đáp. Nhưng một agent duyệt web phải thực hiện nhiều lượt suy luận: đọc trang web, trích xuất nội dung, quyết định bước tiếp theo, thực hiện hành động, rồi đánh giá kết quả. Quá trình này có thể tiêu tốn từ 10 đến 50 lần token so với một cuộc hội thoại chatbot thông thường. Tôi từng xây dựng một bot Telegram phân tích on-chain data – nó quét 200.000 giao dịch mỗi ngày – và tôi nhận ra rằng chi phí suy luận cho mỗi tác vụ là yếu tố quyết định sống còn. Nếu không tối ưu bằng cách sử dụng mô hình nhỏ để tiền xử lý trang web và chỉ gọi mô hình lớn ở các bước quyết định quan trọng, chi phí vận hành một agent duyệt web tự do sẽ nhanh chóng vượt qua mức chấp nhận được, ngay cả với quy mô Google. Tôi tin rằng Gemini Spark, nếu thực sự tồn tại, phải đi kèm một cơ chế kiểm soát chi phí rất chặt chẽ – hoặc giới hạn số lượt sử dụng mỗi ngày, hoặc chỉ mở cho người dùng trả phí cao cấp. Không có cách nào khác.

Về hạ tầng, Google có một lợi thế mà không đối thủ nào có được: hệ thống TPU tự phát triển. Trong khi OpenAI phụ thuộc vào GPU của NVIDIA – vẫn trong tình trạng khan hiếm – Google có thể sản xuất chip riêng và triển khai trên quy mô lớn trong các trung tâm dữ liệu toàn cầu. Điều này giúp giảm chi phí suy luận đáng kể. Nhưng có một vấn đề lớn hơn đang bị bỏ ngỏ: một agent xử lý tác vụ duyệt web dài hạn sẽ cần khả năng điều phối không đồng bộ. Nó không chỉ trả lời ngay lập tức; nó hoạt động trong nền, thực hiện các bước và chờ đợi kết quả. Kiến trúc này đặt ra yêu cầu lớn về quản lý trạng thái và phục hồi sau lỗi. Với một tên mã như "Spark", tôi không chắc Google đã sẵn sàng cho một hệ thống phức tạp đến vậy.

Một vấn đề kỹ thuật nữa là quản lý ngữ cảnh. Khi agent thực hiện một chuỗi hành động dài, bộ nhớ đệm ngữ cảnh phải đủ lớn để lưu trữ toàn bộ lịch sử duyệt web. Nhưng bộ nhớ càng lớn, độ trễ càng cao, khả năng sai lầm càng nhiều. Nghiên cứu của tôi về dữ liệu on-chain cho thấy điều tương tự: dữ liệu càng nhiều, độ nhiễu càng lớn, và các mô hình học máy càng dễ đưa ra quyết định sai. Với AI agent, lỗi tích lũy trở thành vấn đề nghiêm trọng nếu một hành động sai ở bước đầu tiên sẽ dẫn đến toàn bộ chuỗi sau đó bị hỏng. Điều khó khăn nhất đối với các nhà phát triển là thiết kế cơ chế rollback – nếu AI đã đặt một vé máy bay sai ngày, làm thế nào để tự phát hiện và thay đổi quyết định? Đây không phải là bài toán mà các mô hình ngôn ngữ hiện tại có thể giải quyết một cách đáng tin cậy.

Về bảo mật, tôi đến với một mối lo lớn hơn nhiều: prompt injection. Khi một agent duyệt web, nó không chỉ đọc các trang thông thường – nó còn đọc các trang có thể chứa nội dung được thiết kế để đánh lừa AI. Một trang web độc hại có thể chèn một đoạn văn bản ẩn trong mã HTML mà chỉ AI đọc được, hướng dẫn agent thực hiện các hành động như chuyển tiền, thay đổi mật khẩu, hoặc gửi email lừa đảo. Đây không phải là giả thuyết. Năm 2024, các nhà nghiên cứu đã chứng minh rằng chỉ cần một dòng chữ trắng trên nền trắng cũng khiến AI agent của một số hệ thống chuyển sang một trang giả và thực hiện các lệnh độc hại. Ngay bây giờ, chưa có một phương pháp hiệu quả nào để chống lại các cuộc tấn công này. Khi Google phát hành một agent duyệt web cho hàng tỉ người dùng, họ sẽ mở ra một bề mặt tấn công rộng lớn mà các hacker ở khắp nơi sẽ không ngừng khai thác. Người dùng có thể bị mất tiền, bị lộ dữ liệu, và niềm tin vào toàn bộ lĩnh vực AI agent sẽ bị tổn hại. Tôi chưa thấy bài báo nào đề cập đến vấn đề này, nhưng đây là rủi ro lớn nhất mà Gemini Spark phải đối mặt.

Phân tích kinh doanh

Hãy nhìn vào mô hình kinh doanh. Đây là nơi tôi tìm thấy mâu thuẫn sâu sắc nhất. Google đã kiếm được hàng chục tỷ đô la mỗi năm nhờ quảng cáo tìm kiếm. Người dùng truy cập Google, tìm kiếm một từ khóa – ví dụ "mua iPhone 15" – và nhìn thấy quảng cáo tài trợ ở đầu trang. Mỗi lần nhấp chuột, Google thu được một khoản tiền. Bây giờ, nếu Gemini Spark thực sự hoạt động, người dùng sẽ nói với AI "tìm cho tôi một chiếc iPhone giá tốt" và AI sẽ tự động truy cập các trang web, so sánh giá, và đưa ra gợi ý – hoàn toàn không cần nhấp vào bất kỳ quảng cáo nào. Điều đó đồng nghĩa với việc Google sẽ tự phá hủy mô hình kinh doanh của chính mình. Các nhà phân tích trên Phố Wall có thể tưởng tượng một kịch bản trong đó AI agent làm giảm lượng tìm kiếm trên Google xuống 30%. Nếu điều đó xảy ra, cổ phiếu Alphabet sẽ rơi tự do.

Vậy tại sao Google vẫn làm điều này? Câu trả lời có thể nằm ở chiến lược phòng thủ. Nếu Google không phát triển agent, người dùng sẽ chuyển sang sử dụng ChatGPT hoặc Claude cho các tác vụ phức tạp. OpenAI đã có hàng chục triệu người dùng trả phí và đang dần biến mình thành một "cổng vào Internet" thay thế. Nếu xu hướng này tiếp tục, Google sẽ chứng kiến một phần không nhỏ lưu lượng truy cập được chuyển hướng khỏi cổng tìm kiếm của mình. Do đó, Google buộc phải phát hành Gemini Spark – không phải để tạo ra doanh thu mới, mà để giữ chân người dùng ở lại trong hệ sinh thái của riêng nó. Đó là một canh bạc: chấp nhận phá hủy một phần mô hình quảng cáo để ngăn một đối thủ khác phá hủy toàn bộ nó.

Một lớp khác trong chiến lược này là khả năng tận dụng Chrome và Android như kênh phân phối độc quyền. Không như OpenAI, Google có thể đặt Gemini Spark ngay trong trình duyệt mà bạn đang sử dụng. Bạn không cần cài đặt bất cứ thứ gì; nó nằm đó ngay khi bạn mở Chrome. Với khoảng 65% thị phần trình duyệt, Google chỉ cần một thông báo nhỏ "Gemini có thể giúp bạn hoàn thành việc này" là đã có thể thu hút một lượng người dùng khổng lồ mà không ai trong số các đối thủ có thể cạnh tranh. Điều này đưa tôi trở lại với một thực tế đau đớn mà tôi đã gặp trong thời gian làm Web3 research: sản phẩm tốt nhất không phải lúc nào cũng thắng; sản phẩm có phân phối tốt nhất mới thắng. Trong thị trường PFP NFT, Bored Ape Yacht Club đã thắng nhiều dự án NFT có sản phẩm tốt hơn chỉ vì họ có cộng đồng và sức lan tỏa mạnh hơn. Google, với Chrome, Android, Gmail và hàng chục sản phẩm khác, đang nắm trong tay bộ phận phân phối lớn nhất lịch sử.

Gemini Spark: Google bước vào cuộc đua AI Agent – Phân tích những gì bài báo không nói

Phân tích ngành

Nhưng hệ quả của AI agent không dừng lại ở cổ phiếu Alphabet. Nếu chúng trở thành công cụ điều khiển mặc định để tương tác với Internet, chúng sẽ thay đổi cấu trúc của nền kinh tế kỹ thuật số. Hiện tại, hầu hết các trang web đều kiếm tiền từ lưu lượng truy cập của con người: họ hiển thị quảng cáo, theo dõi hành vi người dùng, và tối ưu hóa SEO. Trong một thế giới mà AI agent thay mặt bạn duyệt web, các trang web sẽ không còn thấy con người nữa – họ sẽ thấy một loạt các chương trình tự động gọi đến. Họ sẽ phải thiết kế lại hoàn toàn sản phẩm của mình để thân thiện với agent: cung cấp API công khai, dữ liệu có cấu trúc, giao diện mà máy đọc được. Điều này có lợi cho các nền tảng thương mại điện tử lớn như Amazon – vốn đã có API – nhưng sẽ gây khó khăn cho các trang tin tức, blog, và các doanh nghiệp nhỏ phụ thuộc vào quảng cáo.

Điều này giống với hiện tượng phân mảnh thanh khoản mà tôi đã thấy trong không gian cross-chain: càng nhiều giao thức cố gắng kết nối, thì tính thanh khoản càng bị phân tán, và người dùng càng gặp nhiều rắc rối. Theo cách tương tự, càng nhiều agent thay thế con người duyệt web, thì giá trị của các trang web thông thường càng giảm – trừ khi chúng thích nghi. Về mặt việc làm, những công việc như nhập liệu, trợ lý hành chính, nhân viên chăm sóc khách hàng cấp cơ bản, và cả những vị trí phân tích dữ liệu đơn giản sẽ phải đối mặt với áp lực thay thế rất lớn. Nhưng nó đồng thời tạo ra những vai trò mới: kỹ sư thiết kế quy trình người – AI, chuyên gia kiểm tra bảo mật cho agent, và những người "thuần hóa" agent để làm việc hiệu quả trong các ngành cụ thể. Trong lịch sử công nghệ, mỗi làn sóng tự động hóa lúc đầu đều tạo ra nỗi sợ hãi về thất nghiệp hàng loạt, nhưng nó cũng tạo ra những loại việc làm không thể tưởng tượng trước đó.

Vấn đề đạo đức và quyền riêng tư

Vấn đề đạo đức của AI agent cũng nghiêm trọng không kém. Khi tin tưởng giao cho agent duyệt web và thực hiện tác vụ, người dùng sẽ trao cho Google một lượng dữ liệu khổng lồ: lịch sử truy cập, thông tin cá nhân, mật khẩu có thể được lưu trữ để tự động đăng nhập, thậm chí cả dữ liệu tài chính nếu agent được phép thực hiện thanh toán. Điều này đặt ra những câu hỏi quan trọng: dữ liệu đó được lưu ở đâu? Ai có thể truy cập? Liệu nó có bị sử dụng để huấn luyện mô hình AI của Google không? Tại Liên minh châu Âu, Đạo luật AI đã phân loại các hệ thống AI tương tác với con người như thế nào? Nếu có bất kỳ vụ rò rỉ dữ liệu nào xảy ra, hậu quả pháp lý có thể nặng nề gấp nhiều lần so với một vụ hack thông thường, vì nó sẽ đánh vào đúng niềm tin của người dùng vào toàn bộ hệ thống AI agent.

Contrarian

Vậy điều gì có thể xảy ra theo hướng không ai đoán trước? Hãy để tôi kể một câu chuyện nhỏ. Root: Thất bại với dự án NFT Pixel Apes. Vào cuối năm 2021, tôi bị cuốn vào cơn sốt NFT và đầu tư một lượng ETH đáng kể vào "Pixel Apes" – một dự án hứa hẹn tạo ra một metaverse game lớn. Cộng đồng trên Telegram rất sôi động, đội ngũ phát triển liên tục đăng các bản đồ lộ trình đẹp mắt, và giá token tăng vọt sau khi được một vài KOL nổi tiếng quảng bá. Tôi mất cảnh giác. Khi tôi bắt đầu đào sâu hơn, tôi nhận ra đội ngũ có ba nhà phát triển và gần như không có một dòng sản phẩm thực sự chạy được. Giá sụp đổ, tôi bán lỗ, và tôi mất gần như toàn bộ số vốn đầu tư. Đau đớn, nhưng nó đã dạy cho tôi một bài học mà tôi giữ đến ngày nay: một câu chuyện đẹp mà không có sản phẩm vững chắc là một thứ vũ khí nguy hiểm nhất.

Gemini Spark, theo cách nhìn của tôi, hiện có cấu trúc giống hệt như vậy. Một cái tên đẹp. Một thông cáo mơ hồ. Một lời hứa rằng "AI sẽ làm việc vặt cho bạn". Nhưng chưa có ai nhìn thấy sản phẩm thực sự cả. Tôi có thể sai – Google có thể đang giữ bí mật cho đến một ngày ra mắt hoành tráng. Nhưng ngay cả khi Gemini Spark thật sự tồn tại, nó vẫn có thể thất bại vì lý do mà không ai ngờ tới: đó là chữ "Spark" – một cái tên cho thấy tính năng nhẹ, thử nghiệm, không phải một sản phẩm chủ lực. So với "Operator" của OpenAI hay "Computer Use" của Anthropic, cái tên này phản ánh một tham vọng nhỏ hơn. Liệu Google có đang thử nghiệm để hạn chế rủi ro, chứ không thực sự cam kết thay đổi cuộc chơi? Hoàn toàn có thể.

Còn một bài học nữa mà tôi rút ra từ thất bại Pixel Apes, và cả sự sụp đổ của nền kinh tế creator trên NFT khi OpenSea từ bỏ royalty: nền tảng có thể thay đổi luật chơi bất kỳ lúc nào, bất kể cộng đồng có yêu thích hay không. Gemini Spark cũng vậy. Hôm nay nó có thể là một tính năng AI nhỏ, nhưng ngày mai Google có thể nâng cấp để tích hợp sâu hơn vào Chrome, giới hạn quyền truy cập của agent trên các trang web có quảng cáo, hoặc thậm chí ép các trang web phải trả phí để được agent của Google "nhìn thấy". Những quyết định đó sẽ định hình lại toàn bộ nền kinh tế số, và người dùng – những người bỏ phiếu bằng dữ liệu của mình – sẽ không có tiếng nói nào.

Điểm mù lớn nhất mà tất cả các phân tích về AI agent bỏ qua là: không ai biết người dùng sẽ sẵn sàng giao quyền cho AI đến mức nào. Trong làn sóng DeFi năm 2020, tôi thấy nhiều người vội vã từ bỏ sàn giao dịch tập trung để chuyển sang các giao thức phi tập trung. Nhưng phần lớn, họ vẫn giữ một phần tài sản trên các sàn tập trung vì quen thuộc. Tương tự, có một khoảng cách lớn giữa "thích dùng thử tính năng AI agent" và "tin tưởng giao cho AI quyền truy cập vào tài khoản ngân hàng của mình". Tôi tin rằng AI agent sẽ tăng trưởng, nhưng tỷ lệ chuyển đổi từ "demo thú vị" thành "công việc hằng ngày" có thể thấp hơn nhiều so với kỳ vọng. Người dùng sẽ thử một lần, thấy một sai lầm, và quay lại làm thủ công. Và đó là lý do tại sao tôi không vội tin bất kỳ thông cáo nào về AI agent cả. Câu chuyện không có dữ liệu thì chỉ là hư cấu.

Takeaway

Nhìn lại, Gemini Spark – dù là thật hay giả – đang gửi một tín hiệu quan trọng về hướng đi của ngành. Google không tham gia AI agent vì tò mò. Họ tham gia vì họ nhìn thấy một hiểm họa tồn tại mang tên ChatGPT. Trong một thị trường mà mọi người đang nói về cơn sốt AI, kẻ đi săn thực thụ phải nhìn thấy dấu vết phía sau những con số. Săn câu chuyện là săn sự thật ẩn sau những con số. Điều tôi sẽ theo dõi không phải là thông cáo báo chí của Google, mà là những thay đổi trong Chrome và Android. Nếu Gemini Spark xuất hiện như một tính năng ẩn trong Chrome trên các thiết bị Android trong vòng 6 tháng tới, thì đó là dấu hiệu thật sự. Còn nếu nó chỉ là một cái tên hiếm hoi xuất hiện trong một blog vô danh, thì có lẽ nó sẽ chết yểu như Pixel Apes.

Còn với những bạn đang đọc bài viết này, tôi chỉ có một lời khuyên duy nhất: hãy giữ cho mình một kỹ năng mà không một ai có thể tự động hóa hoàn toàn – kỹ năng nghĩ phản biện. Vì khi AI bắt đầu làm thay bạn mọi việc, thứ duy nhất mà bạn thực sự sở hữu là khả năng quyết định xem điều gì là đúng. Sớm hay muộn, dòng chảy AI sẽ cuốn trôi tất cả những thứ cũ kỹ – cả những mô hình kinh doanh cổ xưa của Google lẫn những người dùng không chịu thích nghi. Đi săn, đừng đi theo đàn.

Giá thị trường

BTC Bitcoin
$77,419.8 +0.30%
ETH Ethereum
$2,446.21 +1.10%
SOL Solana
$94.81 +0.16%
BNB BNB Chain
$700 +0.70%
XRP XRP Ledger
$1.49 +0.10%
DOGE Dogecoin
$0.0920 +0.09%
ADA Cardano
$0.2211 -1.03%
AVAX Avalanche
$7.52 +0.60%
DOT Polkadot
$0.9088 -0.45%
LINK Chainlink
$11.47 -0.82%

Sợ & Tham

73

Tham lam

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

Vốn hóa thị trường

Tất cả →
1
Bitcoin
BTC
$77,419.8
1
Ethereum
ETH
$2,446.21
1
Solana
SOL
$94.81
1
BNB Chain
BNB
$700
1
XRP Ledger
XRP
$1.49
1
Dogecoin
DOGE
$0.0920
1
Cardano
ADA
$0.2211
1
Avalanche
AVAX
$7.52
1
Polkadot
DOT
$0.9088
1
Chainlink
LINK
$11.47

Công cụ

Tất cả →

Chỉ số mùa altcoin

41

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

🐋 Theo dõi cá voi

🔴
0xb475...721f
12 giờ trước
Chuyển ra
33,096 BNB
🔵
0x7539...204c
12 phút trước
Stake
3,618 ETH
🔴
0xf74f...7179
1 ngày trước
Chuyển ra
3,959.73 BTC

💡 Smart Money

0xa691...46e2
Bot chênh lệch giá
+$1.2M
64%
0xee4a...1e39
Nhà giao dịch on-chain dày dặn
+$4.9M
66%
0x56bc...328b
Nhà đầu tư sớm
+$0.5M
71%