Các công ty
Trung Quốc có đang vô tình giao dữ liệu cho Mỹ?
Đặng Duật Văn (Deng Yuwen)
- Foreign
Policy
Nguyễn
Thị Kim Phụng, biên dịch
https://nghiencuuquocte.org/2026/09/21/cac-cong-ty-trung-quoc-co-dang-vo-tinh-giao-du-lieu-cho-my/
Cuộc đua AI có thể vô tình trở thành một điểm
yếu của Bắc Kinh.
Một báo cáo gần đây của Anthropic, công ty
trí tuệ nhân tạo của Mỹ, cáo buộc một số công ty AI hàng đầu Trung Quốc, trong
đó có Moonshot AI và DeepSeek, đã tiến hành chắt lọc năng lực (distillation) từ
mô hình Claude trên quy mô lớn. Anthropic cho biết một số công ty không chỉ sử
dụng Claude để tạo dữ liệu huấn luyện mà, trong ít nhất một trường hợp, còn âm
thầm chuyển hướng hơn 300.000 yêu cầu của người dùng thực qua mô hình này chỉ
trong vòng 10 ngày.
Những dữ liệu được cho là đã gửi tới Claude
bao gồm các tài liệu giám sát do một người dùng mà Anthropic nghi ngờ có liên hệ
với Quân Giải phóng Nhân dân Trung Quốc cung cấp; mã nguồn nội bộ và thông tin
đăng nhập hợp lệ của các kỹ sư tại những doanh nghiệp nhà nước lớn của Trung Quốc;
dữ liệu từ hệ thống quản lý vụ án của cảnh sát; cùng thông tin chi tiết về các
dự án AI nội bộ tại các công ty công nghệ Trung Quốc.
Việc thông tin nhạy cảm bị rò rỉ đương nhiên
sẽ gióng lên hồi chuông cảnh báo đối với Bắc Kinh. Nhưng so với việc một vài
tài liệu nhạy cảm lọt vào tay Mỹ, mối lo lớn hơn có thể nằm ở chỗ: trong quá
trình chắt lọc năng lực từ những mô hình tiên tiến nhất của Mỹ, các công ty AI
Trung Quốc đồng thời có thể đang chuyển một lượng lớn dữ liệu thực tế của người
dùng Trung Quốc sang Mỹ.
Cuộc đua AI không chỉ là cuộc đua về sức mạnh
tính toán mà còn là cuộc đua về dữ liệu. Ngày nay, dữ liệu trên không gian mạng
mở ngày càng dễ thu thập. Thứ thực sự khan hiếm là dữ liệu chất lượng cao phát
sinh từ những tác vụ thực tế: vì sao người dùng tìm đến AI, họ đang cố giải quyết
vấn đề gì, họ cung cấp những tài liệu nền nào, công việc viết mã đang tiến triển
tới đâu, doanh nghiệp đang gặp những nút thắt kỹ thuật nào, và họ muốn AI giúp
hoàn thành nhiệm vụ gì. Những dữ liệu như vậy có giá trị vượt xa các mẩu thông
tin rời rạc thường thấy trên web.
Xét riêng lẻ, từng mẩu dữ liệu có thể không
mang nhiều ý nghĩa hay giá trị. Nhưng khi hàng trăm nghìn, hàng triệu, thậm chí
hàng chục triệu mẩu như vậy được tập hợp lại, bản chất của chúng thay đổi hoàn
toàn. Việc một lập trình viên Trung Quốc hỏi vì sao một đoạn mã bị lỗi có thể gần
như không mang giá trị tình báo. Nhưng nếu hàng nghìn kỹ sư Trung Quốc liên tục
gặp phải và đặt câu hỏi về những vấn đề tương tự, tập hợp dữ liệu đó có thể
phơi bày một nút thắt chung trong hệ thống công nghệ của Trung Quốc.
Tương tự, việc một nhân viên hỏi cách cải tiến
một thiết bị hay phần mềm cụ thể khó có thể được xem là đáng lo ngại, càng chưa
chắc là bí mật. Nhưng nếu một lượng lớn kỹ sư trong các ngành như bán dẫn,
robot, hàng không vũ trụ, viễn thông, điện lực và ô tô liên tục chia sẻ công việc
của mình với các mô hình AI, thì theo thời gian, những tương tác này có thể
giúp người ngoài dựng nên một bản đồ động về năng lực công nghiệp và công nghệ
của Trung Quốc.
Loại dữ liệu này tiết lộ nhiều hơn rất nhiều
so với các truy vấn tìm kiếm thông thường. Một lượt tìm kiếm thường chỉ cho thấy
người dùng muốn biết điều gì; trong khi tương tác với AI thường cho thấy họ thực
sự đang làm gì. Người dùng chủ động cung cấp bối cảnh công việc, tải lên mã nguồn
và tài liệu, mô tả dự án, giải thích những gì họ đã thử, xác định vấn đề đang gặp
phải và nêu rõ bước tiếp theo họ dự định thực hiện.
Đây là một loại dữ liệu rất đặc thù. Có thể gọi
nó là “dữ liệu ý định” (intent data): loại dữ liệu cho người ngoài biết không
chỉ Trung Quốc đang sở hữu những gì, mà còn cho thấy nước này đang làm gì.
Trong thời bình, những dữ liệu như vậy chủ yếu
có giá trị thương mại và công nghệ. Nhưng khi căng thẳng giữa hai siêu cường
gia tăng, giá trị chiến lược của một kho dữ liệu như vậy cũng sẽ tăng theo.
Hãy hình dung một kịch bản trong đó nguy cơ
chiến tranh ngày càng cận kề. Các cơ quan tình báo Mỹ sẽ cần biết không chỉ
Trung Quốc sở hữu bao nhiêu tên lửa hay tàu chiến, mà còn cần biết hệ thống
công nghiệp quốc phòng nước này có đang tăng tốc sản xuất hay không; các nút thắt
đang xuất hiện ở đâu; những doanh nghiệp dân sự nào đang bắt đầu chuyển sang sản
xuất thời chiến; những điểm yếu nào đang tồn tại trong các lĩnh vực bán dẫn,
máy bay không người lái, viễn thông, điện lực và giao thông; cũng như những viện
nghiên cứu nào đột nhiên tập trung vào các vấn đề cụ thể. Khối lượng lớn các
tương tác với AI có thể cung cấp chính xác loại thông tin này.
Khi tên các tổ chức, thiết bị, phần mềm, nhà
cung cấp và lỗi kỹ thuật xuất hiện trong các cuộc trò chuyện với AI được kết hợp
với ảnh vệ tinh, hồ sơ hải quan, dữ liệu đấu thầu, bằng sáng chế, tài liệu học
thuật, thông tin doanh nghiệp, dữ liệu mạng và những nguồn tình báo khác mà Mỹ
đã có sẵn, một truy vấn tưởng chừng rất bình thường có thể trở thành một mắt
xích trong một mạng lưới lớn hơn rất nhiều. Hàng trăm nghìn hay hàng triệu mắt
xích như vậy, khi được kết hợp, có thể mang lại giá trị vượt xa một vài tài liệu
mật theo nghĩa truyền thống.
Điều này đặt ra một câu hỏi gần như chưa từng
được chú ý: Liệu Bắc Kinh trước đây có biết rằng các công ty AI Trung Quốc,
trong quá trình chắt lọc các mô hình của Mỹ, đã và đang chuyển dữ liệu thực của
người dùng sang Mỹ hay không?
Trung Quốc có một hệ thống quy định dày đặc về
bảo mật dữ liệu. Trong những năm gần đây, Bắc Kinh liên tục siết chặt giám sát
đối với việc chuyển dữ liệu xuyên biên giới. Các Quy định về Thúc đẩy và Quản
lý Luồng Dữ liệu Xuyên Biên giới đặt ra yêu cầu đánh giá an ninh và nhiều hạn
chế khác đối với việc chuyển dữ liệu quan trọng ra nước ngoài — tức những dữ liệu
có thể đe dọa an ninh quốc gia, nền kinh tế hoặc ổn định xã hội — cũng như đối
với việc chuyển một lượng lớn thông tin cá nhân. Các quy định của Trung Quốc đối
với dịch vụ AI tạo sinh cũng yêu cầu nhà cung cấp phải bảo vệ thông tin cá nhân
của người dùng, bí mật thương mại và an ninh dữ liệu.
Vấn đề là liệu hệ thống quản lý hiện nay có
nhận diện được một hình thức chuyển dữ liệu xuyên biên giới mới hay không. Thay
vì một công ty Trung Quốc chính thức xuất khẩu một cơ sở dữ liệu cho doanh nghiệp
nước ngoài, một công ty AI muốn huấn luyện mô hình của mình có thể sử dụng tài
khoản ủy quyền (proxy) và các dịch vụ trung gian để âm thầm chuyển hàng loạt
yêu cầu của người dùng thực vào một mô hình nền tảng của Mỹ.
Nếu Bắc Kinh không biết điều này đang xảy ra,
báo cáo của Anthropic đã phơi bày một điểm mù lớn trong hệ thống quản lý AI của
Trung Quốc. Nước này có thể từ lâu vẫn giám sát rất chặt việc các tập đoàn đa
quốc gia chuyển cơ sở dữ liệu sang Mỹ, nhưng lại không nhận ra rằng chính các
công ty AI hàng đầu trong nước đang liên tục đưa công việc, mã nguồn, những khó
khăn kỹ thuật của người dùng, thậm chí cả tài liệu nhạy cảm, vào các mô hình của
Mỹ thông qua các lệnh gọi mô hình.
Nhưng ngay cả khi Trung Quốc đã nhận ra vấn đề,
việc xử lý cũng không hề đơn giản.
Một mặt, Bắc Kinh có thể yêu cầu các công ty
AI trong nước chấm dứt những hoạt động như vậy, hoặc ít nhất cấm họ gửi dữ liệu
người dùng thực chưa qua xử lý vào các mô hình của Mỹ. Với hệ thống luật về an
ninh dữ liệu và năng lực quản lý hiện nay của Trung Quốc, điều này về mặt hành
chính không quá khó thực hiện.
Mặt khác, tại sao Alibaba, Moonshot,
DeepSeek, Xiaomi và những công ty khác lại chấp nhận rủi ro lớn như vậy để truy
cập và chắt lọc Claude trên quy mô lớn? Câu trả lời dường như rất rõ ràng: năng
lực của các mô hình tiên phong của Mỹ vẫn mang lại giá trị rất lớn cho các công
ty Trung Quốc.
Theo Anthropic, hoạt động có liên quan đến chắt
lọc của Alibaba đã vượt 151 triệu lượt trao đổi trong giai đoạn từ tháng 5 đến
tháng 7; Moonshot vượt 23 triệu lượt; còn DeepSeek thực hiện hơn 12,1 triệu lượt
chỉ trong vòng 14 ngày vào tháng 7. Đây thực chất là quá trình hấp thụ năng lực
công nghệ ở quy mô công nghiệp. Moonshot và DeepSeek thậm chí còn bị cáo buộc
xây dựng các hệ thống kỹ thuật chuyên dụng nhằm trích xuất quá trình suy luận của
Claude để phục vụ việc huấn luyện các mô hình của riêng họ.
Điều này phơi bày tình thế lưỡng nan mà Trung
Quốc đang phải đối mặt. Việc chắt lọc các mô hình tiên tiến nhất của Mỹ đã trở
thành một phương thức quan trọng giúp một số công ty Trung Quốc thu hẹp khoảng
cách công nghệ. Bắc Kinh có kỹ sư, sức mạnh tính toán, các mô hình ngôn ngữ lớn
của riêng mình và một ngành công nghiệp AI quy mô lớn. Nhưng nếu các công ty
Trung Quốc bị cắt đứt hoàn toàn khỏi khả năng chắt lọc năng lực từ những mô
hình hàng đầu của Mỹ, việc tự tạo ra dữ liệu huấn luyện và năng lực suy luận có
chất lượng tương đương sẽ đòi hỏi nhiều thời gian, sức mạnh tính toán và quá
trình thử nghiệm – sửa sai hơn. Trong ngắn hạn, điều đó có thể làm chậm tốc độ
Trung Quốc bắt kịp các mô hình tiên phong của Mỹ.
Nếu các công ty AI Trung Quốc tiếp tục được
phép chắt lọc các mô hình của Mỹ trên quy mô lớn, Bắc Kinh sẽ phải chấp nhận
nguy cơ dữ liệu Trung Quốc tiếp tục chảy vào các hệ thống của Mỹ. Nhưng nếu con
đường này bị đóng lại vì lý do an ninh dữ liệu, chi phí bắt kịp sẽ tăng lên và
khoảng cách công nghệ có thể tiếp tục bị nới rộng.
Trong bối cảnh cuộc đua AI ngày càng phụ thuộc
vào hoạt động chắt lọc, dữ liệu và việc trao đổi năng lực giữa các mô hình,
Trung Quốc đang phải đối mặt với một câu hỏi nan giải: Làm thế nào để tận dụng
những năng lực AI tiên tiến nhất của Mỹ mà không biến chính dữ liệu của Trung
Quốc thành một tài sản chiến lược của Mỹ?
----------------
Đặng Duật Văn là một nhà văn và học giả người
Trung Quốc.
Nguồn: Đặng Duật Văn (Deng
Yuwen), “Are
Chinese Firms Handing the United States Data?”, Foreign Policy,
15/09/2026
No comments:
Post a Comment