CMC Telecom cam kết hỗ trợ doanh nghiệp của bạn kịp thời
Hãy gửi phản hồi và câu hỏi của bạn cho chúng tôi để được giải đáp
Các nhà phát triển xây dựng ứng dụng Gen AI ngày càng bị thu hút bởi sức mạnh và sự linh hoạt của các mô hình mã nguồn mở. Tuy nhiên, việc tùy chỉnh và triển khai chúng có thể là một thách thức lớn, đòi hỏi phải xử lý các dependency phức tạp, quản lý hạ tầng và cạnh tranh để có được tài nguyên GPU đắt đỏ. Với nền tảng Vertex AI, Google Cloud cung cấp một quy trình toàn diện giúp doanh nghiệp đưa một mô hình mã nguồn mở từ giai đoạn khám phá đến một endpoint sẵn sàng cho môi trường production, cho phép đội ngũ tập trung vào đổi mới thay vì các công việc hạ tầng nặng nhọc.
Bài viết này, lấy ví dụ về việc tinh chỉnh và triển khai mô hình Qwen3, sẽ hướng dẫn chi tiết từng bước trong quy trình này trên Vertex AI.
Khi quyết định sử dụng một mô hình mã nguồn mở, doanh nghiệp phải đối mặt với nhiều câu hỏi: chọn mô hình nào, trên phần cứng gì, và với framework phục vụ (serving framework) nào. Việc tìm kiếm theo cách truyền thống rất tốn thời gian, có thể mất nhiều ngày chỉ để thiết lập môi trường và chạy một thử nghiệm duy nhất.
Vertex AI giải quyết vấn đề này bằng Vertex AI Model Garden, một trung tâm tuyển chọn giúp đơn giản hóa việc khám phá, tinh chỉnh và triển khai các mô hình mã nguồn mở tiên tiến. Với hơn 200 tùy chọn đã được xác thực (và đang tiếp tục tăng) bao gồm các lựa chọn phổ biến như Gemma, Qwen, DeepSeek và Llama, các doanh nghiệp có thể dễ dàng bắt đầu. Các thẻ thông tin (model card) toàn diện cung cấp thông tin quan trọng, bao gồm chi tiết về phần cứng đề xuất (như loại và kích thước GPU) để đạt hiệu năng tối ưu.

Quan trọng hơn, Vertex AI tiến hành quét bảo mật trên các mô hình này và container của chúng, mang lại một lớp tin cậy bổ sung và giảm thiểu các lỗ hổng tiềm ẩn ngay từ đầu. Khi đã tìm thấy một mô hình phù hợp như Qwen3, Model Garden cung cấp các tùy chọn triển khai chỉ bằng một cú nhấp chuột hoặc các notebook (mã nguồn) được cấu hình sẵn, giúp dễ dàng triển khai mô hình dưới dạng một endpoint tích hợp vào ứng dụng.

Ngoài ra, Model Garden còn cung cấp các serving container được tối ưu hóa — thường tận dụng vLLM, SGLang, hoặc Hex-LLM cho inference thông lượng cao. Sau khi mô hình được triển khai, bạn có thể bắt đầu thử nghiệm và thiết lập một đường cơ sở (baseline) để so sánh với mô hình đã được tinh chỉnh sau này.


Việc tích hợp đánh giá sớm trong quy trình là rất quan trọng. Doanh nghiệp có thể tận dụng dịch vụ đánh giá Gen AI của Vertex AI để thẩm định mô hình dựa trên dữ liệu và tiêu chí riêng, đảm bảo lựa chọn được mô hình nền tảng phù hợp nhất.
Sau khi chọn được mô hình nền tảng (trong ví dụ này là Qwen3), bước tiếp theo là làm cho nó trở nên độc đáo bằng cách tinh chỉnh (fine-tuning) trên dữ liệu cụ thể của doanh nghiệp. Đây là bước giúp mô hình có một “tính cách” riêng, học một kỹ năng chuyên biệt, hoặc thích ứng với lĩnh vực của bạn.
Bước 1: Chuẩn bị dữ liệu
Vertex AI giúp việc đọc dữ liệu trở nên đơn giản bằng cách cho phép kéo liền mạch các dataset trực tiếp từ Google Cloud Storage (GCS) và BigQuery (BQ). Đối với các tác vụ làm sạch và chuẩn bị dữ liệu phức tạp hơn, bạn có thể xây dựng một Vertex AI Pipeline tự động để điều phối công việc tiền xử lý.
Bước 2: Tinh chỉnh thực tế trong notebook
Đối với Qwen3, Model Garden cung cấp một notebook được cấu hình sẵn sử dụng Axolotl, một framework phổ biến cho fine-tuning. Notebook này đã bao gồm các cài đặt tối ưu cho các kỹ thuật như:
Bước 3: Mở rộng quy mô với Vertex AI Training
Khi cần nhiều tài nguyên GPU và sự linh hoạt hơn, doanh nghiệp có thể chuyển từ notebook sang một Vertex AI Training job chính thức. Thay vì bị giới hạn trong một notebook instance, bạn gửi cấu hình training của mình đến dịch vụ training được quản lý của Vertex AI, mang lại khả năng mở rộng, linh hoạt và kiểm soát tốt hơn:
Trong khi job đang chạy, bạn có thể theo dõi tiến trình của nó trong thời gian thực bằng TensorBoard để xem các chỉ số loss và accuracy của mô hình.

Sau khi tinh chỉnh mô hình Qwen3, việc đánh giá kỹ lưỡng là rất quan trọng để xác định mức độ sẵn sàng của nó. Kết quả đánh giá này sẽ được so sánh với đường cơ sở (baseline) đã tạo trong giai đoạn thử nghiệm.
Đối với các tác vụ Gen AI phức tạp, Dịch vụ Đánh giá Gen AI của Vertex AI sử dụng một “mô hình giám khảo” (judge model) để đánh giá các phẩm chất tinh tế (tính mạch lạc, mức độ liên quan, tính có cơ sở) và các tiêu chí cụ thể của tác vụ, đồng thời hỗ trợ đánh giá song song (side-by-side) bởi con người. Dịch vụ này cung cấp những hiểu biết sâu sắc, có thể hành động về hiệu suất của mô hình, vượt xa các chỉ số đơn giản.
Khi mô hình đã được tinh chỉnh và xác thực, bước cuối cùng là triển khai nó dưới dạng một endpoint. Với Vertex AI Inference, đây là một quy trình được tinh giản. Khi triển khai tới một Vertex AI Endpoint, bạn không chỉ nhận được một máy chủ mà là một serving stack hoàn chỉnh, được quản lý và tối ưu hóa cho hai yếu tố chính:
1. Hiệu năng nhanh
2. Mở rộng linh hoạt và tiết kiệm chi phí
Doanh nghiệp có toàn quyền kiểm soát ngân sách GPU của mình. Bạn có thể:
Nói tóm lại, Vertex AI Inference xử lý việc mở rộng, hạ tầng và tối ưu hóa hiệu suất, giúp bạn chỉ cần tập trung vào ứng dụng của mình.
Việc điều hướng thành công vòng đời của một mô hình mở như Qwen trên Vertex AI, từ ý tưởng ban đầu đến endpoint sẵn sàng cho sản xuất, là một thành tựu đáng kể. Nền tảng này cung cấp sự hỗ trợ mạnh mẽ cho việc thử nghiệm, tinh chỉnh, đánh giá và triển khai. Để bắt đầu khám phá workload mô hình mở của riêng bạn, Vertex AI Model Garden là một nơi tuyệt vời để bắt đầu.
Hãy gửi phản hồi và câu hỏi của bạn cho chúng tôi để được giải đáp