Vertex AI: Hướng dẫn triển khai mô hình AI mã nguồn mở lên môi trường production | CMC Telecom

Vertex AI: Hướng dẫn triển khai mô hình AI mã nguồn mở lên môi trường production

Jul 14, 2026
-
25 views

Các nhà phát triển xây dựng ứng dụng Gen AI ngày càng bị thu hút bởi sức mạnh và sự linh hoạt của các mô hình mã nguồn mở. Tuy nhiên, việc tùy chỉnh và triển khai chúng có thể là một thách thức lớn, đòi hỏi phải xử lý các dependency phức tạp, quản lý hạ tầng và cạnh tranh để có được tài nguyên GPU đắt đỏ. Với nền tảng Vertex AI, Google Cloud cung cấp một quy trình toàn diện giúp doanh nghiệp đưa một mô hình mã nguồn mở từ giai đoạn khám phá đến một endpoint sẵn sàng cho môi trường production, cho phép đội ngũ tập trung vào đổi mới thay vì các công việc hạ tầng nặng nhọc.

Bài viết này, lấy ví dụ về việc tinh chỉnh và triển khai mô hình Qwen3, sẽ hướng dẫn chi tiết từng bước trong quy trình này trên Vertex AI.

Phần 1: Nhanh chóng chọn lựa mô hình nền tảng phù hợp

Khi quyết định sử dụng một mô hình mã nguồn mở, doanh nghiệp phải đối mặt với nhiều câu hỏi: chọn mô hình nào, trên phần cứng gì, và với framework phục vụ (serving framework) nào. Việc tìm kiếm theo cách truyền thống rất tốn thời gian, có thể mất nhiều ngày chỉ để thiết lập môi trường và chạy một thử nghiệm duy nhất.

Vertex AI giải quyết vấn đề này bằng Vertex AI Model Garden, một trung tâm tuyển chọn giúp đơn giản hóa việc khám phá, tinh chỉnh và triển khai các mô hình mã nguồn mở tiên tiến. Với hơn 200 tùy chọn đã được xác thực (và đang tiếp tục tăng) bao gồm các lựa chọn phổ biến như Gemma, Qwen, DeepSeek và Llama, các doanh nghiệp có thể dễ dàng bắt đầu. Các thẻ thông tin (model card) toàn diện cung cấp thông tin quan trọng, bao gồm chi tiết về phần cứng đề xuất (như loại và kích thước GPU) để đạt hiệu năng tối ưu.

Thẻ thông tin của mô hình Qwen3 trên Vertex AI Model Garden.

Quan trọng hơn, Vertex AI tiến hành quét bảo mật trên các mô hình này và container của chúng, mang lại một lớp tin cậy bổ sung và giảm thiểu các lỗ hổng tiềm ẩn ngay từ đầu. Khi đã tìm thấy một mô hình phù hợp như Qwen3, Model Garden cung cấp các tùy chọn triển khai chỉ bằng một cú nhấp chuột hoặc các notebook (mã nguồn) được cấu hình sẵn, giúp dễ dàng triển khai mô hình dưới dạng một endpoint tích hợp vào ứng dụng.

Các tùy chọn triển khai Qwen3 từ Model Garden trên Vertex AI.

Ngoài ra, Model Garden còn cung cấp các serving container được tối ưu hóa — thường tận dụng vLLM, SGLang, hoặc Hex-LLM cho inference thông lượng cao. Sau khi mô hình được triển khai, bạn có thể bắt đầu thử nghiệm và thiết lập một đường cơ sở (baseline) để so sánh với mô hình đã được tinh chỉnh sau này.

Các tùy chọn framework cho Model Inference trên Vertex AI.
Giao diện triển khai nhanh Qwen3 ra Endpoint trên Vertex AI.

Việc tích hợp đánh giá sớm trong quy trình là rất quan trọng. Doanh nghiệp có thể tận dụng dịch vụ đánh giá Gen AI của Vertex AI để thẩm định mô hình dựa trên dữ liệu và tiêu chí riêng, đảm bảo lựa chọn được mô hình nền tảng phù hợp nhất.

Phần 2: Tinh chỉnh mô hình với dữ liệu riêng (Fine-tuning)

Sau khi chọn được mô hình nền tảng (trong ví dụ này là Qwen3), bước tiếp theo là làm cho nó trở nên độc đáo bằng cách tinh chỉnh (fine-tuning) trên dữ liệu cụ thể của doanh nghiệp. Đây là bước giúp mô hình có một “tính cách” riêng, học một kỹ năng chuyên biệt, hoặc thích ứng với lĩnh vực của bạn.

Bước 1: Chuẩn bị dữ liệu
Vertex AI giúp việc đọc dữ liệu trở nên đơn giản bằng cách cho phép kéo liền mạch các dataset trực tiếp từ Google Cloud Storage (GCS)BigQuery (BQ). Đối với các tác vụ làm sạch và chuẩn bị dữ liệu phức tạp hơn, bạn có thể xây dựng một Vertex AI Pipeline tự động để điều phối công việc tiền xử lý.

Bước 2: Tinh chỉnh thực tế trong notebook
Đối với Qwen3, Model Garden cung cấp một notebook được cấu hình sẵn sử dụng Axolotl, một framework phổ biến cho fine-tuning. Notebook này đã bao gồm các cài đặt tối ưu cho các kỹ thuật như:

  • QLoRA: Một phương pháp tinh chỉnh cực kỳ hiệu quả về bộ nhớ, hoàn hảo để chạy các thử nghiệm mà không cần GPU quá lớn.
  • FSDP (Fully Shared Data Parallelism): Một kỹ thuật để phân phối một mô hình lớn trên nhiều GPU cho việc training quy mô lớn hơn.

Bước 3: Mở rộng quy mô với Vertex AI Training
Khi cần nhiều tài nguyên GPU và sự linh hoạt hơn, doanh nghiệp có thể chuyển từ notebook sang một Vertex AI Training job chính thức. Thay vì bị giới hạn trong một notebook instance, bạn gửi cấu hình training của mình đến dịch vụ training được quản lý của Vertex AI, mang lại khả năng mở rộng, linh hoạt và kiểm soát tốt hơn:

  • Truy cập bộ tăng tốc theo yêu cầu: Tiếp cận một nhóm tài nguyên theo yêu cầu gồm các bộ tăng tốc mới nhất (như H100) hoặc các tùy chọn linh hoạt khác để tiết kiệm chi phí.
  • Hạ tầng được quản lý: Vertex AI xử lý toàn bộ việc cung cấp và quản lý máy chủ hoặc container.
  • Khả năng tái lập: Mỗi training job là một cấu phần có thể lặp lại, giúp dễ dàng tích hợp vào quy trình MLOps.

Trong khi job đang chạy, bạn có thể theo dõi tiến trình của nó trong thời gian thực bằng TensorBoard để xem các chỉ số loss và accuracy của mô hình.

Theo dõi pipeline tinh chỉnh mô hình trên giao diện Vertex AI.

Phần 3: Đánh giá mô hình đã tinh chỉnh

Sau khi tinh chỉnh mô hình Qwen3, việc đánh giá kỹ lưỡng là rất quan trọng để xác định mức độ sẵn sàng của nó. Kết quả đánh giá này sẽ được so sánh với đường cơ sở (baseline) đã tạo trong giai đoạn thử nghiệm.

Đối với các tác vụ Gen AI phức tạp, Dịch vụ Đánh giá Gen AI của Vertex AI sử dụng một “mô hình giám khảo” (judge model) để đánh giá các phẩm chất tinh tế (tính mạch lạc, mức độ liên quan, tính có cơ sở) và các tiêu chí cụ thể của tác vụ, đồng thời hỗ trợ đánh giá song song (side-by-side) bởi con người. Dịch vụ này cung cấp những hiểu biết sâu sắc, có thể hành động về hiệu suất của mô hình, vượt xa các chỉ số đơn giản.

Phần 4: Triển khai ra endpoint cho môi trường production

Khi mô hình đã được tinh chỉnh và xác thực, bước cuối cùng là triển khai nó dưới dạng một endpoint. Với Vertex AI Inference, đây là một quy trình được tinh giản. Khi triển khai tới một Vertex AI Endpoint, bạn không chỉ nhận được một máy chủ mà là một serving stack hoàn chỉnh, được quản lý và tối ưu hóa cho hai yếu tố chính:

1. Hiệu năng nhanh

  • Serving được tối ưu hóa: Mô hình của bạn được phục vụ bằng container xây dựng với các framework tiên tiến như vLLM, đảm bảo thông lượng cao và độ trễ thấp.
  • Khởi động nhanh: Các kỹ thuật như khởi động VM nhanh, streaming image container và streaming trọng số mô hình giúp mô hình của bạn có thể khởi động nhanh chóng.

2. Mở rộng linh hoạt và tiết kiệm chi phí
Doanh nghiệp có toàn quyền kiểm soát ngân sách GPU của mình. Bạn có thể:

  • Sử dụng GPU theo yêu cầu cho các workload tiêu chuẩn.
  • Áp dụng các chính sách giảm giá cam kết sử dụng (Committed Use Discounts – CUDs) và các tài nguyên đã đặt trước để giảm chi phí.
  • Sử dụng Dynamic Workload Scheduler (DWS) Flex Start để có được tài nguyên với giá chiết khấu trong tối đa 7 ngày.
  • Tận dụng Spot VMs cho các workload có khả năng chịu lỗi để truy cập tài nguyên tính toán với mức chiết khấu sâu.

Nói tóm lại, Vertex AI Inference xử lý việc mở rộng, hạ tầng và tối ưu hóa hiệu suất, giúp bạn chỉ cần tập trung vào ứng dụng của mình.

Bắt đầu ngay

Việc điều hướng thành công vòng đời của một mô hình mở như Qwen trên Vertex AI, từ ý tưởng ban đầu đến endpoint sẵn sàng cho sản xuất, là một thành tựu đáng kể. Nền tảng này cung cấp sự hỗ trợ mạnh mẽ cho việc thử nghiệm, tinh chỉnh, đánh giá và triển khai. Để bắt đầu khám phá workload mô hình mở của riêng bạn, Vertex AI Model Garden là một nơi tuyệt vời để bắt đầu.

Tin liên quan

CMC Telecom cam kết hỗ trợ doanh nghiệp của bạn kịp thời

Hãy gửi phản hồi và câu hỏi của bạn cho chúng tôi để được giải đáp

    Hi! Bạn đang cần tư vấn về dịch vụ của Google?