Trung Quốc tăng tốc ‘vũ khí’ AI mới, cuộc đua với Mỹ có thể không còn nằm ở chatbot
Trung Quốc đang nổi lên như thế lực dẫn đầu trong AI tạo video, nhưng lợi thế này có thể mang ý nghĩa lớn hơn nhiều so với việc gây sức ép lên Hollywood, khi những công nghệ tương tự đang được kỳ vọng trở thành nền tảng cho robot hình người, xe tự hành và thế hệ AI có khả năng tương tác với thế giới thực.
Những mô hình ngôn ngữ lớn mới như Kimi K3 của Moonshot đang chiếm phần lớn sự chú ý trong cuộc tranh luận về tham vọng AI của Trung Quốc. Tuy nhiên, bằng chứng rõ ràng hơn về năng lực của quốc gia này có thể lại nằm ở một lĩnh vực khác: AI tạo video, và cuộc đua này có thể tác động xa hơn nhiều so với việc làm đảo lộn ngành công nghiệp Hollywood.
Ngoài Google của Alphabet, gần như toàn bộ các mô hình tạo video hàng đầu hiện nay đều đến từ Trung Quốc. Theo bảng xếp hạng của Artificial Analysis, các công ty Trung Quốc đang sở hữu 9 trong số 10 hệ thống chuyển văn bản thành video hàng đầu thế giới.
ByteDance và MiniMax gần đây liên tiếp tung ra các phiên bản nâng cấp cho những mô hình tạo video cạnh tranh trực tiếp với nhau. Trước đó, ngành AI từng bất ngờ xôn xao trước sự xuất hiện của “Happy Horse”, một hệ thống tạo video được phát triển trong bí mật và chỉ sau đó mới được xác nhận là dự án của Alibaba.

Cùng với Kling của Kuaishou Technology, Vidu của ShengShu Technology tại Bắc Kinh và hàng loạt startup khác, Trung Quốc đã hình thành một hệ sinh thái đặc biệt đông đảo các doanh nghiệp lớn trong lĩnh vực AI tạo video, trong khi những công ty Mỹ như OpenAI và Anthropic lại chưa dành ưu tiên tương xứng cho lĩnh vực này.
Từ video đến “bộ não” cho robot
Các công cụ này ngày càng được các công ty quảng cáo và hãng phim sử dụng, đồng thời góp phần thúc đẩy ngành microdrama, những bộ phim ngắn với thời lượng và chi phí sản xuất thấp, đang phát triển nhanh tại Trung Quốc cũng như nhiều thị trường quốc tế.
Một số chuyên gia coi AI tạo video là con đường khả thi để tạo doanh thu trong ngành giải trí vốn đang chịu sức ép từ cuộc chiến giá và những mô hình kinh doanh thiếu chắc chắn. Tuy nhiên, ý nghĩa chiến lược của công nghệ này có thể còn lớn hơn nhiều.
Lợi thế của Trung Quốc trong AI tạo video có thể giúp nước này tiến nhanh hơn trong việc phát triển “world models”, hay các mô hình AI có khả năng xây dựng và hiểu cách thế giới thực vận hành. Đây được xem là một trong những hướng phát triển quan trọng tiếp theo của AI.
Ngày càng nhiều lãnh đạo doanh nghiệp và giới nghiên cứu cho rằng các công cụ tạo video có thể trở thành nền móng cho những hệ thống AI vượt ra khỏi màn hình máy tính để tương tác với thế giới vật lý.
Một “world model” không chỉ cần hiểu ngôn ngữ mà còn phải nắm được các quy luật vật lý, cách các vật thể tương tác với nhau và cách thế giới vận hành trong những môi trường thực tế luôn chứa đựng yếu tố bất định.
Về lâu dài, những hệ thống này có thể trở thành nền tảng cho robot hình người, xe tự hành và nhiều loại máy móc có khả năng hoạt động độc lập. Một số nhà tiên phong trong lĩnh vực AI thậm chí cho rằng đây có thể là con đường khả thi hơn để tiến tới trí tuệ nhân tạo tổng quát (AGI) so với việc tiếp tục xây dựng những chatbot ngày càng lớn.
Muốn tạo video chân thực, AI phải hiểu thế giới thực
Để tạo ra một đoạn video đủ thuyết phục, mô hình AI không chỉ cần học về hình ảnh và thẩm mỹ. Nó phải có ít nhất một mức độ hiểu biết cơ bản về chuyển động, quan hệ nhân quả và các quy luật vật lý. Nếu không, kết quả có thể trở nên vô lý đến mức khó tin.

Khi các mô hình ngày càng được mở rộng, các nhà nghiên cứu nhận thấy khả năng suy luận vật lý ở mức sơ khai có thể tự hình thành ngay cả khi không được lập trình trực tiếp.
Những hệ thống này vẫn chưa “hiểu” thế giới theo cách con người hiểu, nhưng chúng ngày càng giỏi hơn trong việc dự đoán một sự vật nên trông như thế nào và điều gì có khả năng xảy ra tiếp theo.
Đây chính là lý do ngày càng nhiều nhóm nghiên cứu kết hợp mô hình video với các chỉ dẫn để huấn luyện robot.
Một số công ty AI tạo video hàng đầu Trung Quốc, trong đó có ShengShu, đã bắt đầu hướng tới việc phát triển các “world models” và những hệ thống AI đa phương thức có phạm vi rộng hơn.
Trung Quốc không phải quốc gia duy nhất nhận ra mối liên hệ này.
Runway AI của Mỹ và Black Forest Labs của Đức, 2 startup AI hình ảnh nổi bật của phương Tây, cũng đang đi theo hướng tương tự.
Cris Valenzuela, CEO Runway, cho rằng đây là một bước phát triển tự nhiên.
Theo ông, để một mô hình video hoạt động tốt, nó phải mô phỏng chính xác những gì con người kỳ vọng sẽ xảy ra trong thế giới thực. Chẳng hạn, một quả bóng phải lăn trên cánh đồng thay vì trượt lơ lửng trên bề mặt.
Tương tự, một robot không thể chỉ nhận diện được quần áo hay hàng hóa để thực hiện các nhiệm vụ như gấp quần áo hoặc xếp hàng hóa trong siêu thị. Nó phải dự đoán điều gì sẽ xảy ra khi di chuyển hoặc tương tác với những vật thể đó.
Trung Quốc đang tận dụng khoảng trống do Mỹ để lại
Việc chuyển từ tạo video sang xây dựng world model vẫn đang ở giai đoạn đầu và còn rất nhiều thách thức. Tuy nhiên, kể từ khi OpenAI loại bỏ công cụ tạo video Sora, các nhà phát triển Trung Quốc đã nhanh chóng tận dụng khoảng trống và ngày càng dẫn đầu về tốc độ phát triển.
Việc xây dựng các mô hình tạo video, chưa nói đến world model, đòi hỏi lượng dữ liệu và năng lực tính toán lớn hơn đáng kể.
Bản quyền cũng là một điểm yếu đối với các công ty trong lĩnh vực này. Đây là vấn đề mà toàn ngành AI đang phải đối mặt, nhưng với các mô hình tạo video, việc xác định dữ liệu nào được sử dụng để huấn luyện khó che giấu hơn so với chatbot.
Điều này đã trở thành một trở ngại lớn đối với tham vọng mở rộng ra nước ngoài của các nền tảng AI Trung Quốc.
Dù vậy, Trung Quốc đã sở hữu lợi thế đáng kể về phần cứng công nghiệp phục vụ robot.
Hàng trăm doanh nghiệp nước này đã có thể phát triển và lắp ráp những robot hình người ngày càng hoàn thiện. Nhưng thứ mà chúng vẫn thiếu là một “bộ não” đủ thông minh.
Ngày càng nhiều năng lực về dữ liệu và mô phỏng được phát triển từ các mô hình tạo video đang được tận dụng để giải quyết bài toán này.
Cuộc đua AI có thể không nằm ở chatbot
“World models” có thể sẽ không bao giờ tạo ra một khoảnh khắc ChatGPT tương tự như cuộc bùng nổ của chatbot trong những năm qua.
Tầm quan trọng chiến lược của chúng cũng khó được chứng minh bằng một sản phẩm dành cho người tiêu dùng mà hàng triệu người có thể trực tiếp sử dụng.
Trong khi Washington ngày càng lo ngại trước sự phát triển của các chatbot Trung Quốc, Mỹ có nguy cơ chỉ tập trung vào cuộc cạnh tranh dễ nhìn thấy nhất mà bỏ qua những tiến bộ khác có thể mang ý nghĩa lớn hơn về lâu dài.
Các doanh nghiệp và nhà đầu tư cũng cần lưu ý điều tương tự.
Các mô hình ngôn ngữ lớn vẫn đang thu hút phần lớn nguồn vốn đầu tư, nhưng bước đột phá tiếp theo của AI có thể đến từ những hệ thống có khả năng điều hướng và tương tác với thế giới thực, thay vì chỉ mô tả thế giới bằng ngôn ngữ.
Nếu AI tạo video thực sự trở thành “bãi tập” để huấn luyện những cỗ máy như vậy, lợi thế ban đầu của Trung Quốc sẽ không chỉ khiến Hollywood lo lắng. Nó có thể trở thành yếu tố quyết định quốc gia nào sẽ dẫn đầu kỷ nguyên AI tiếp theo.