HomeCông cụ AIGroq 3 LPX của Nvidia đạt 3.400 token mỗi giây

Groq 3 LPX của Nvidia đạt 3.400 token mỗi giây

Nvidia hôm 24/8 công bố tại hội nghị Hot Chips 2026 rằng chip tăng tốc suy luận Groq 3 LPX đã bước vào giai đoạn sản xuất hàng loạt. Đây là con chip đầu tiên của hãng được thiết kế riêng cho khâu sinh token, thay vì gánh cả huấn luyện lẫn suy luận như GPU truyền thống. Nebius là nhà cung cấp đám mây AI đầu tiên cam kết triển khai Groq 3 LPX trong hạ tầng thương mại.

Con chip được xây trên công nghệ Nvidia mua quyền sử dụng từ Groq Inc. hồi tháng 12/2025 với giá khoảng 20 tỷ USD, kèm việc tuyển nhà sáng lập Jonathan Ross và chủ tịch Sunny Madra. Groq 3 LPX không thay thế GPU mà bổ sung cho nền tảng Vera Rubin NVL72: GPU lo phần nạp và xử lý ngữ cảnh dài, còn chip mới lo phần bắn ra từng token một cách nhanh nhất có thể.

Groq 3 LPX tăng tốc sinh token cho hệ thống AI agent

Trong bài đo độc lập của Artificial Analysis, một hệ thống dùng Groq 3 LPX đạt kỷ lục 3.400 token đầu ra mỗi giây khi chạy mô hình mã nguồn mở Gemma 4 31B với cửa sổ ngữ cảnh 100.000 token. Nvidia cho biết đây là kết quả nhanh nhất từng ghi nhận với mô hình này, và nhanh gấp khoảng 4 lần nền tảng đối thủ gần nhất ở các tác vụ nhạy cảm với độ trễ.

Về cấu hình, mỗi tủ rack có thể gom tới 256 bộ tăng tốc LPU liên kết bằng đường truyền nội bộ băng thông rất cao. Mỗi bộ tăng tốc mang 500 MB bộ nhớ SRAM với băng thông 150 TB/giây, cùng 2,5 TB/giây băng thông mở rộng. Cách thiết kế này giúp Groq 3 LPX giữ toàn bộ trọng số cần cho khâu sinh token trong bộ nhớ tốc độ cao, thay vì phải liên tục đọc từ bộ nhớ ngoài như GPU.

Lý do Nvidia tách riêng khâu này nằm ở cách các AI agent vận hành. Một agent không trả lời một lần rồi thôi: nó đọc tệp, viết mã, chạy thử, gọi công cụ bên ngoài, kiểm tra kết quả rồi lặp lại. Chuỗi đó có thể trải qua hàng trăm tới hàng nghìn bước suy luận, mỗi bước lại sinh ra một lượng token lớn. Nếu tốc độ sinh token chậm, độ trễ tích lũy khiến người dùng phải chờ hàng giờ cho một tác vụ lẽ ra chỉ mất vài phút.

Đó cũng là điểm Nvidia nhấn mạnh khi giới thiệu Groq 3 LPX: một tác vụ lập trình tự động có thể rút từ nhiều giờ xuống còn vài phút. Ông Jensen Huang, nhà sáng lập kiêm CEO Nvidia, nói nền tảng Vera Rubin được cấu hình theo từng loại tải công việc cho kỷ nguyên AI agent, và Groq 3 LPX là mảnh ghép đẩy tốc độ sinh token lên mức mới.

Ngoài Nebius, chính công ty Groq — nay vận hành như một nhà cung cấp đám mây suy luận riêng — cũng nằm trong nhóm khách hàng sớm. Nvidia đồng thời giới thiệu tại Hot Chips loạt công nghệ đi kèm cho trung tâm dữ liệu: kiến trúc Ethernet Spectrum-X Multiplane mở rộng cụm tới 512.000 GPU, nền tảng phần mềm Scale-In, và NVLink Fusion cho phép CPU tùy biến kết nối vào hệ thống rack thế hệ sáu.

Cận cảnh tủ rack chip Groq 3 LPX trong trung tâm dữ liệu AI
Mỗi tủ rack có thể gom tới 256 bộ tăng tốc LPU chuyên cho khâu sinh token.

Vì sao độ trễ phản hồi lại quan trọng với người dùng Việt

Với người dùng phổ thông, thông số phần cứng nghe xa vời, nhưng hệ quả thì rất gần. Tốc độ sinh token là thứ quyết định bạn nhìn thấy câu trả lời chảy ra mượt mà hay giật cục khi hỏi một trợ lý AI. Với các công cụ lập trình tự động hay agent đặt lịch, tìm dữ liệu, tốc độ này quyết định luôn việc bạn có kiên nhẫn dùng tiếp hay không. Những con chip như Groq 3 LPX vì thế tác động trực tiếp tới trải nghiệm hằng ngày, dù người dùng không bao giờ nhìn thấy chúng.

Cuộc đua tốc độ suy luận đã nóng suốt năm 2026. Trước đó, OpenAI từng mở bản xem trước GPT-5.6 Sol Ultrafast chạy trên chip Cerebras với khoảng 750 token mỗi giây. Việc Nvidia đưa Groq 3 LPX vào sản xuất hàng loạt cho thấy hãng dẫn đầu thị trường GPU không muốn nhường mảng chip suy luận chuyên dụng cho bất kỳ ai, sau khi đã mở mã nguồn framework NOOA cho AI agent hồi đầu tháng 8.

Ở góc nhìn chi phí, phần cứng nhanh hơn thường kéo theo giá thuê API rẻ hơn theo thời gian, hoặc ít nhất là gói cùng giá nhưng phục vụ được nhiều lượt hơn. Đây là điều đáng chú ý với các nhóm phát triển tại Việt Nam đang gọi API nước ngoài, khi khoản chi cho hạ tầng AI toàn cầu vẫn tăng với tốc độ chóng mặt. Chip mới cũng nối dài dòng sản phẩm phần cứng AI mà Nvidia liên tục tung ra, sau thế hệ Blackwell B300.

Cần lưu ý Groq 3 LPX là sản phẩm dành cho trung tâm dữ liệu, không phải card đồ họa người dùng cuối, và hiệu năng thực tế còn phụ thuộc vào mô hình, độ dài ngữ cảnh cũng như cách nhà cung cấp đám mây cấu hình hệ thống. Con số 3.400 token mỗi giây là kết quả đo trên một mô hình mở 31 tỷ tham số, không phải mức áp dụng cho mọi mô hình lớn hơn. Nvidia cũng chưa công bố giá bán hay thời điểm các nhà cung cấp khác mở dịch vụ rộng rãi.

Nguồn: NVIDIA Newsroom, SiliconANGLE, Artificial Analysis (24/8/2026).

Xem thêm: Kho công cụ AI — tuyển tập công cụ AI cập nhật liên tục trên Nhịp AI.

Xem thêm: Gemini 3.5 Transcribe nhận diện hơn 85 ngôn ngữ.

Lê Minh Tâm
Lê Minh Tâm
Kỹ sư AI tại TP.HCM, chuyên Python và tự động hoá quy trình. Viết về workflow no-code, API LLM và cách ứng dụng AI vào sản phẩm thực tế.
Bài viết liên quan

LEAVE A REPLY

Please enter your comment!
Please enter your name here

- Advertisment -
Google search engine

Xem nhiều nhất

Bình luận gần đây