Kiểm soát ngân sách

Cách tính chi phí token AI mà không bị thiếu khoản

Tổng chi phí bằng input, output và các request chạy lại; dự toán tốt phải dựa trên log thật thay vì ước lượng số từ.

Công thức cơ bản

Chi phí request = input token × giá input / 1.000.000 + output token × giá output / 1.000.000. Nếu model có cache, tính phần cache theo đơn giá riêng. Cộng chi phí của request retry và request lỗi nếu upstream vẫn ghi nhận usage.

Từ request đến dự toán tháng

Lấy mẫu vài trăm request thật, tính p50 và p95 token thay vì chỉ lấy trung bình. Nhân với số request dự kiến và thêm biên an toàn cho đợt cao điểm. Tách theo feature vì chatbot, trích xuất và code có cấu trúc token rất khác nhau.

Ba cách giảm chi phí

Rút gọn system prompt, chỉ gửi context liên quan và giới hạn output theo nhu cầu. Dùng model tiết kiệm cho tác vụ đơn giản, model mạnh cho trường hợp khó. Theo dõi retry để không trả tiền nhiều lần cho cùng một kết quả.

Checklist trước khi quyết định

  • Tách input và output
  • Tính cả retry
  • Dùng p50/p95 token
  • Tách chi phí theo feature
  • Đặt biên an toàn và hạn mức

Câu hỏi thường gặp

Trả lời ngắn, có thể kiểm tra

Token có bằng một từ không?

Không. Tỷ lệ token/từ thay đổi theo ngôn ngữ và tokenizer của model.

Tại sao hóa đơn cao hơn dự toán?

Thường do lịch sử hội thoại dài, output không giới hạn, retry hoặc lưu lượng tăng. Hãy kiểm tra usage theo feature.

Đọc tiếp

Nội dung liên quan

Bảng giá API AI

Bảng giá API AI theo triệu token cho DeepSeek, Qwen và GLM, trình bày riêng đầu vào và đầu ra bằng VND.

Bắt đầu với một khóa API

Tạo tài khoản, chọn nhóm mô hình và theo dõi mức sử dụng trong cùng một bảng điều khiển.

Tạo tài khoản