Bảng giá API AI
Bảng giá API AI theo triệu token cho DeepSeek, Qwen và GLM, trình bày riêng đầu vào và đầu ra bằng VND.
Kiểm soát ngân sách
Tổng chi phí bằng input, output và các request chạy lại; dự toán tốt phải dựa trên log thật thay vì ước lượng số từ.
Chi phí request = input token × giá input / 1.000.000 + output token × giá output / 1.000.000. Nếu model có cache, tính phần cache theo đơn giá riêng. Cộng chi phí của request retry và request lỗi nếu upstream vẫn ghi nhận usage.
Lấy mẫu vài trăm request thật, tính p50 và p95 token thay vì chỉ lấy trung bình. Nhân với số request dự kiến và thêm biên an toàn cho đợt cao điểm. Tách theo feature vì chatbot, trích xuất và code có cấu trúc token rất khác nhau.
Rút gọn system prompt, chỉ gửi context liên quan và giới hạn output theo nhu cầu. Dùng model tiết kiệm cho tác vụ đơn giản, model mạnh cho trường hợp khó. Theo dõi retry để không trả tiền nhiều lần cho cùng một kết quả.
Câu hỏi thường gặp
Không. Tỷ lệ token/từ thay đổi theo ngôn ngữ và tokenizer của model.
Thường do lịch sử hội thoại dài, output không giới hạn, retry hoặc lưu lượng tăng. Hãy kiểm tra usage theo feature.
Đọc tiếp
Bảng giá API AI theo triệu token cho DeepSeek, Qwen và GLM, trình bày riêng đầu vào và đầu ra bằng VND.
Một API rẻ chỉ có ý nghĩa khi hoàn thành tác vụ với tỷ lệ lỗi thấp, đầu ra vừa đủ và chi phí dự đoán được.
Tạo khóa và gọi request đầu tiên.
Tạo tài khoản, chọn nhóm mô hình và theo dõi mức sử dụng trong cùng một bảng điều khiển.