Google Cloud ra mắt Gemini Live API: Xây dựng agent AI tương tác bằng giọng nói
Aug 4, 2026
-
35 views
Share:
Google Cloud đã công bố Gemini 2.0 Flash Live API, một công cụ mạnh mẽ cho phép các nhà phát triển xây dựng thế hệ ứng dụng AI tác tử (agentic AI) mới, có khả năng tương tác bằng giọng nói và hình ảnh theo thời gian thực. Giải pháp này giúp doanh nghiệp tạo ra các trợ lý thông minh, có khả năng chẩn đoán sự cố, truy cập thông tin và tự động hóa quy trình, đặc biệt trong các môi trường công nghiệp phức tạp.
Không giống các giải pháp chỉ xử lý một loại dữ liệu, API này tận dụng dữ liệu đa phương thức — âm thanh, hình ảnh và văn bản — trong một luồng streaming liên tục. Điều này cho phép xây dựng các trợ lý AI thực sự hiểu và đáp ứng nhuVàocác nhu cầu đa dạng của các chuyên gia trong ngành sản xuất, y tế, năng lượng và logistics. Bài viết này sẽ phân tích một trường hợp sử dụng trong giám sát tình trạng công nghiệp, cụ thể là bảo trì động cơ, được hỗ trợ bởi Gemini 2.0 Flash Live API.
Minh họa trí tuệ đa phương thức: Giám sát tình trạng thiết bị
Bản demo giới thiệu một backend streaming đa phương thức, hai chiều, được vận hành bởi Gemini 2.0 Flash Live API. Hệ thống này có khả năng xử lý âm thanh và hình ảnh theo thời gian thực, cho phép thực hiện các suy luận nâng cao và các cuộc hội thoại tự nhiên như người thật. Việc sử dụng khả năng agentic và function calling (gọi hàm) của API cùng với các dịch vụ Google Cloud khác cho phép xây dựng các hệ thống đa phương thức trực tiếp mạnh mẽ với giao diện người dùng gọn gàng, tối ưu cho di động để các nhân viên vận hành tại nhà máy sử dụng.
Luồng demo được tóm tắt trên điện thoại thông minh như sau:
Nhận dạng thiết bị qua hình ảnh theo thời gian thực: Khi hướng camera vào một động cơ, Gemini xác định model và tóm tắt ngay lập tức các thông tin liên quan từ tài liệu hướng dẫn, cung cấp quyền truy cập nhanh vào các chi tiết thiết bị quan trọng.
Phát hiện lỗi bằng hình ảnh theo thời gian thực: Với một lệnh thoại như “Kiểm tra động cơ này xem có lỗi nào không”, Gemini phân tích video trực tiếp, xác định và khoanh vùng lỗi, đồng thời giải thích lý do của nó.
Tự động hóa quy trình sửa chữa: Khi xác định được lỗi, hệ thống sẽ tự động chuẩn bị và gửi một email kèm theo hình ảnh lỗi đã được đánh dấu và thông tin phụ tùng, trực tiếp khởi tạo quy trình sửa chữa.
Phát hiện lỗi bằng âm thanh theo thời gian thực: Bằng cách phân tích âm thanh đã ghi sẵn của các động cơ hoạt động tốt và bị lỗi, Gemini phân biệt chính xác động cơ bị lỗi dựa trên hồ sơ âm thanh của nó và giải thích phân tích của mình.
Hỏi đáp đa phương thức về vận hành: Người vận hành có thể đặt các câu hỏi phức tạp về động cơ trong khi hướng camera vào các bộ phận cụ thể. Gemini kết hợp một cách thông minh bối cảnh hình ảnh với thông tin từ tài liệu hướng dẫn của động cơ để cung cấp câu trả lời chính xác bằng giọng nói.
Phân tích kiến trúc kỹ thuật
Giải pháp demo này tận dụng Gemini Multimodal Livestreaming API trên nền tảng Google Cloud Vertex AI. API này quản lý luồng công việc chính và agentic function calling, trong khi Gemini API thông thường xử lý việc trích xuất đặc trưng hình ảnh và âm thanh.
Luồng công việc bao gồm:
Agentic function calling: API diễn giải giọng nói và hình ảnh đầu vào của người dùng để xác định hành động mong muốn.
Phát hiện lỗi bằng âm thanh: Khi có yêu cầu từ người dùng, hệ thống ghi lại âm thanh của động cơ, lưu trữ chúng trong Google Cloud Storage (GCS), và kích hoạt một hàm sử dụng prompt với các ví dụ về âm thanh tốt và lỗi. Gemini Flash 2.0 API sẽ phân tích để chẩn đoán tình trạng của động cơ.
Kiểm tra bằng hình ảnh: API nhận diện ý định phát hiện lỗi hình ảnh, chụp ảnh và gọi một hàm sử dụng phương pháp zero-shot detection (phát hiện không cần mẫu) với một prompt văn bản, tận dụng khả năng hiểu không gian của Gemini Flash 2.0 API để xác định và đánh dấu các lỗi.
Hỏi đáp đa phương thức: Khi người dùng đặt câu hỏi, API xác định ý định truy xuất thông tin, thực hiện RAG trên tài liệu hướng dẫn của động cơ, kết hợp với bối cảnh đa phương thức và sử dụng Gemini API để cung cấp câu trả lời chính xác.
Gửi lệnh sửa chữa: Nhận biết ý định khởi tạo sửa chữa, API trích xuất số hiệu phụ tùng và hình ảnh lỗi, sử dụng một mẫu định sẵn để tự động gửi lệnh sửa chữa qua email.
Lợi ích cho doanh nghiệp và ứng dụng đa ngành
Bản demo này nhấn mạnh các khả năng chính của Gemini Multimodal Livestreaming API và những lợi ích mang tính chuyển đổi cho ngành công nghiệp:
Xử lý đa phương thức thời gian thực: Khả năng xử lý đồng thời các luồng âm thanh và hình ảnh trực tiếp của API cung cấp thông tin chi tiết ngay lập tức trong các môi trường năng động, rất quan trọng để ngăn ngừa thời gian chết và đảm bảo tính liên tục của hoạt động.
Suy luận âm thanh & hình ảnh nâng cao: Khả năng suy luận tinh vi của Gemini diễn giải các cảnh hình ảnh phức tạp và các tín hiệu âm thanh tinh vi để chẩn đoán chính xác.
Agentic function calling cho quy trình tự động: Bản chất agentic của API cho phép các trợ lý thông minh chủ động kích hoạt các hành động, như tạo báo cáo hoặc khởi tạo quy trình, giúp tinh gọn quy trình làm việc.
Tích hợp liền mạch và khả năng mở rộng: Được xây dựng trên Vertex AI, API này tích hợp với các dịch vụ khác của Google Cloud, đảm bảo khả năng mở rộng và độ tin cậy cho các đợt triển khai quy mô lớn.
Trải nghiệm người dùng tối ưu cho di động: Thiết kế ưu tiên cho thiết bị di động đảm bảo khả năng tiếp cận cho nhân viên tuyến đầu, cho phép họ tương tác với trợ lý AI tại nơi cần thiết bằng các thiết bị quen thuộc.
Bảo trì chủ động và tăng hiệu quả: Bằng cách cho phép giám sát tình trạng theo thời gian thực, các ngành công nghiệp có thể chuyển từ bảo trì phản ứng sang bảo trì dự đoán, giảm thời gian chết, tối ưu hóa việc sử dụng tài sản và cải thiện hiệu quả tổng thể.
Bắt đầu
Các nhà phát triển có thể khám phá giải pháp này trên GitHub. Bằng cách sao chép dự án và điều chỉnh các thành phần, doanh nghiệp có thể bắt đầu tạo ra các giải pháp AI đa phương thức mang tính chuyển đổi, mang lại cảm giác trò chuyện và nhận thức thực sự.