Để hỗ trợ các đội thi trong việc khai thác tối đa hạ tầng tính toán phục vụ các giải pháp AI đột phá, Ban tổ chức cuộc thi phối hợp cùng đội ngũ kỹ thuật FPT AI Factory đã giải đáp chi tiết những câu hỏi nóng hổi nhất về tài nguyên hệ thống. HimiTek xin tổng hợp lại các thông tin kỹ thuật cốt lõi này cùng phân tích chuyên sâu nhằm giúp các AI Builders tối ưu hóa hiệu năng ứng dụng trong đợt thi.
1. Serverless Inference và GPU Cloud (GPU Container / VM)
Một trong những hiểu nhầm phổ biến nhất của các đội thi là về cách thức cấp phát tài nguyên GPU. Dưới đây là phân tích chi tiết:
- Chính sách Serverless Inference (Gọi API có sẵn): Trong khuôn khổ cuộc thi, FPT AI Factory tài trợ tín dụng (credits) áp dụng cho dịch vụ Serverless Inference. Các đội thi sử dụng API này để truy cập và gọi các mô hình AI mã nguồn mở phổ biến được host sẵn trên Marketplace của FPT AI Factory. Tín dụng này không dùng để gọi các dịch vụ bên thứ ba như OpenAI hay Anthropic Claude.
- GPU Cloud (Tự host model tùy chỉnh): Nếu giải pháp của đội thi đòi hỏi sử dụng các mô hình AI đặc thù chưa có sẵn trên hệ thống, hoặc cần chạy fine-tuning, các bạn phải chủ động thuê GPU VM hoặc GPU Container trên cổng Portal của FPT AI Factory và tự chi trả chi phí.
"Trong môi trường Hackathon với thời gian giới hạn và áp lực vận hành, việc lựa chọn đúng model Serverless Inference như DeepseekFlash-V4 hay Qwen3.6-27B sẽ giúp tối ưu hóa hơn 60% độ trễ (latency) và tiết kiệm tài nguyên hệ thống so với việc cố gắng tự host model trên GPU Cloud." — Lương Xuân Hiếu, Founder HimiTek / VNPT-IT Infrastructure Specialist
| Tiêu chí | Serverless Inference (Khuyên dùng) | GPU Cloud (Container / VM) |
|---|---|---|
| Tài trợ cuộc thi | ✅ Áp dụng đầy đủ (Credits cấp sẵn) | ❌ Không áp dụng (Các đội tự nạp tiền) |
| Thời gian triển khai | ⚡ Tức thì (Chỉ cần gọi API qua SDK) | ⏳ Mất thời gian dựng môi trường, cài CUDA, host model |
| Tương thích API | ✅ Chuẩn OpenAI Chat Completions | Tùy thuộc framework tự dựng (vLLM, Ollama, TGI...) |
| Phù hợp cho | RAG, Structured JSON, Tool Calling, Agent Workflows | Fine-tuning, Custom model, Xử lý tác vụ nặng phi ngôn ngữ |
2. Quản lý Rate Limits và Giám sát Hiệu năng (Monitoring)
Thiết kế hệ thống chịu tải (Rate-limit evasion) là kỹ năng bắt buộc để tránh tình trạng ứng dụng bị treo hoặc báo lỗi trong quá trình chấm điểm tự động.
Cách tra cứu RPM và TPM
Mỗi mô hình trên Marketplace của FPT AI Factory được áp dụng một hạn mức giới hạn tốc độ (Rate Limit) riêng bao gồm TPM (Token Per Minute) và RPM (Request Per Minute). Để xem thông số cụ thể, các bạn thực hiện:
- Truy cập trực tiếp vào trang chi tiết của model trên Marketplace (ví dụ: Qwen3.6-27B trên FPT Marketplace).
- Chọn tab Rate Limit và Details để quan sát các chỉ số tối đa.
429 Too Many Requests. Đối với các tác vụ trích xuất JSON phức tạp, hãy tắt tính năng Streaming Response để đảm bảo cấu trúc JSON trả về nguyên vẹn, hoặc sử dụng JSON Guardrails để bọc dữ liệu đầu ra.
Giám sát lượng tiêu thụ thực tế
Các AI Builders có thể dễ dàng theo dõi lượng credit đã tiêu thụ cũng như kiểm tra lịch sử giao dịch tại mục Billing ngay trên Portal của FPT AI Factory. Để kiểm tra chi tiết hướng dẫn sử dụng, bạn có thể tham khảo Tài liệu FPT AI Inference chính thống.
3. Lựa chọn mô hình tối ưu cho Tiếng Việt & RAG
Dựa trên khảo sát thực tế và khuyến nghị của FPT AI Factory, dưới đây là bộ công cụ tối ưu cho các dự án Hackathon:
- Lọc mô hình ngôn ngữ (LLM): Nên ưu tiên sử dụng DeepseekFlash-V4 hoặc Qwen3.6-27B. Hai dòng mô hình này đạt độ cân bằng xuất sắc nhất giữa độ trễ (Latency), chi phí (Tokens) và chất lượng xử lý ngữ cảnh tiếng Việt (đặc biệt trong các tác vụ Reasoning, Structured JSON, Tool Calling và RAG).
- Mô hình nhúng ngữ cảnh (Embedding & Reranker): Khuyến nghị sử dụng mô hình Vietnamese Embedding có sẵn trên cổng Portal để mang lại kết quả trích xuất ngữ cảnh tiếng Việt chính xác nhất cho hệ thống RAG (Retrieval-Augmented Generation).
- Tương thích và Streaming: API của dịch vụ Serverless Inference tương thích 100% với endpoint Chat Completions chuẩn OpenAI. Bạn hoàn toàn có thể sử dụng cấu hình payload
"stream": trueđể kích hoạt phản hồi dạng streaming giúp tăng trải nghiệm người dùng cuối.
Kết luận
Hạ tầng FPT AI Factory mang đến cơ hội tuyệt vời để các AI Builders hiện thực hóa các ý tưởng sáng tạo với chi phí tối ưu nhất. Hãy tập trung khai thác thế mạnh của Serverless Inference kết hợp với các mô hình chuyên biệt cho tiếng Việt để tạo dựng sản phẩm demo ổn định và mượt mà nhất trước hội đồng ban giám khảo.
Nếu bạn quan tâm đến việc tích hợp hạ tầng AI vào quy trình vận hành và tuân thủ dữ liệu doanh nghiệp, hãy tham khảo cẩm nang Toàn tập AI Compliance & Luật AI cho doanh nghiệp Việt Nam của chúng tôi hoặc tìm hiểu giải pháp Ứng dụng AI Agent toàn diện cho doanh nghiệp SME.