HomeCông cụ AIGemini 3.5 Transcribe nhận diện hơn 85 ngôn ngữ

Gemini 3.5 Transcribe nhận diện hơn 85 ngôn ngữ

Google vừa ra mật Gemini 3.5 Transcribe, mô hình chuyển giọng nói thành văn bản mà hãng gọi là chính xác nhất của mình cho tới nay. Theo công bố ngày 26/8 trên blog Google, Gemini 3.5 Transcribe tự động nhận diện hơn 85 ngôn ngữ, tự xoá từ đệm và tự căn chỉnh định dạng ngay trong lúc người dùng đang nói. Mô hình đã chạy trong bàn phím Gboard trên Android và ứng dụng Gemini cho macOS, sắp có mặt trên trình duyệt Chrome.

Khác với các hệ nhận dạng giọng nói truyền thống vốn hay vấp khi có tiếng ồn nền hoặc thuật ngữ chuyên ngành, Gemini 3.5 Transcribe chuyển thẳng âm thanh thô thành văn bản đã được làm sạch và định dạng. Người dùng nói “hẹn thứ Ba, à không, thứ Tư” thì bản ghi của Gemini 3.5 Transcribe chỉ giữ lại “thứ Tư”. Những tiếng “ừm”, “à” bị lược bỏ, câu được tự động chấm phẩy và xuống dòng.

Về độ chính xác, Google dẫn số đo của Artificial Analysis: tỷ lệ lỗi từ trung bình 4,0% ở chế độ phát trực tiếp và 2,6% ở chế độ xử lý file đã ghi sẵn. Trên bộ đo đa ngôn ngữ FLEURS, con số lần lượt là 5,50% và 5,04%. Thời gian cho ra bản ghi cuối cùng của Gemini 3.5 Transcribe giảm 70% so với Chirp 3, mô hình phiên âm trước đó của hãng.

Gemini 3.5 Transcribe khác gì mô hình Chirp 3 trước đây

Điểm tách biệt lớn nhất nằm ở chỗ Gemini 3.5 Transcribe không dừng ở việc chép lại lời nói. Mô hình hỗ trợ từ vựng tuỳ biến, tức người dùng nạp trước danh sách thuật ngữ, tên riêng hay cách viết đặc thù thì bản ghi sẽ bám theo đó. Nó cũng nhận diện được mã bưu chính, mã đơn hàng và các chuỗi vừa chữ vừa số — nhóm nội dung mà các mô hình phiên âm cũ hay chép sai nhất.

Với file ghi âm sẵn, Gemini 3.5 Transcribe gán được lời nói cho tối đa ba người kèm dấu thời gian ở cấp độ từng từ; hỗ trợ trên ba người vẫn ở dạng thử nghiệm. Google cung cấp mô hình qua hai API tách rời: bản phát trực tiếp hai chiều có độ trễ dưới một giây dành cho trợ lý thoại, và bản xử lý file ghi sẵn dành cho biên bản họp hay nhật ký cuộc gọi.

Một khả năng đáng chú ý khác là gọi hàm. Gemini 3.5 Transcribe có thể đẩy các tác vụ nặng như tạo ảnh hay phân tích tệp sang những mô hình Gemini khác chạy nền, hiện đã bật trong ứng dụng Gemini trên macOS. Nói cách khác, giọng nói không chỉ để gõ chữ mà thành cách ra lệnh. Cách tiếp cận này nối tiếp hướng đi mà Google theo đuổi từ đợt ra mắt Gemini 3.5 Flash, Omni và Spark tại I/O 2026trợ lý tự hành Gemini Spark.

Micro thu âm dùng với Gemini 3.5 Transcribe để bóc băng ghi âm
Mô hình mới xử lý tiếng ồn nền và thuật ngữ chuyên ngành tốt hơn hẳn thế hệ trước.

Người Việt dùng giọng nói thay bàn phím được đến đâu

Hiện tại, giới lập trình có thể thử mô hình ở bản xem trước công khai qua Gemini API trong Google AI Studio và trong môi trường lập trình Antigravity. Nhóm doanh nghiệp truy cập qua nền tảng Gemini Enterprise Agent Platform. Người dùng phổ thông thì tiếp cận gián tiếp: ứng dụng Gemini trên macOS mới chỉ hỗ trợ tiếng Anh, còn tính năng Rambler trên Gboard giới hạn ở một số quốc gia và ngôn ngữ nhất định.

Điều đó có nghĩa người Việt chưa chắc dùng được Gemini 3.5 Transcribe ngay ở mọi bề mặt, dù tiếng Việt nằm trong nhóm hơn 85 ngôn ngữ mà mô hình tự nhận diện. Cách khả thi nhất lúc này là gọi trực tiếp qua API để dựng công cụ riêng — chép biên bản họp, làm phụ đề, bóc băng phỏng vấn — thay vì chờ tính năng đóng gói sẵn.

Với người làm nội dung và nhân sự văn phòng trong nước, giá trị thực tế nằm ở hai chỗ. Thứ nhất là biên bản họp: dấu thời gian theo từ và phân tách người nói giúp cắt bớt khâu dò lại băng ghi âm. Thứ hai là khâu soạn thảo: nói ra ý rồi để máy dọn thành văn bản sạch thường nhanh hơn gõ, nhất là với những bản nháp dài.

Cũng cần thận trọng. Con số tỷ lệ lỗi từ là mức trung bình trên nhiều ngôn ngữ, không phải cam kết cho tiếng Việt, và Google chưa công bố số liệu riêng cho tiếng Việt. Nội dung nhạy cảm gửi lên API vẫn là dữ liệu rời khỏi máy, nên các đơn vị xử lý hồ sơ khách hàng cần đọc kỹ điều khoản trước khi đưa vào quy trình. Bạn có thể tham khảo thêm Cẩm nang công cụ AI 2026 để chọn công cụ phù hợp, hoặc hướng dẫn dùng ChatGPT cho người Việt nếu mới bắt đầu.

Nguồn: Google Blog, 9to5Google. Xem thêm: Groq 3 LPX của Nvidia đạt 3.400 token mỗi giây.

Lê Minh Tâm
Lê Minh Tâm
Kỹ sư AI tại TP.HCM, chuyên Python và tự động hoá quy trình. Viết về workflow no-code, API LLM và cách ứng dụng AI vào sản phẩm thực tế.
Bài viết liên quan

LEAVE A REPLY

Please enter your comment!
Please enter your name here

- Advertisment -
Google search engine

Xem nhiều nhất

Bình luận gần đây