DeepSeek V4 Flash rẻ đến mức nào? Hiểu đúng giá và 31 provider trên OpenRouter
Khi nhìn trang DeepSeek V4 Flash trên OpenRouter, có hai câu hỏi xuất hiện gần như ngay lập tức:
- Vì sao cùng một model DeepSeek lại có hàng chục công ty cùng bán?
- Mức giá
$0.065 input / $0.18 outputcó thật sự rẻ hơn Muse Spark, MiMo V2.5 và Hy3 không?
Mình đã ngồi đối chiếu model ID, bảng giá, context window, provider routing và một workload coding mẫu. Kết quả khá rõ: nếu chỉ xét API trả phí trên OpenRouter tại ngày 22/08/2026, DeepSeek V4 Flash 0731 là lựa chọn rẻ nhất trong nhóm này.
Nhưng giá thấp nhất trên đầu trang chưa phải toàn bộ câu chuyện. Muốn dùng model này hiệu quả trong OpenCode, bạn cần hiểu OpenRouter đang route request qua ai, chế độ nào phù hợp, và khi nào bản Vision Exp mới thực sự đáng dùng.
Giá, khuyến mãi, provider và trạng thái model có thể thay đổi. Các con số trong bài được kiểm tra ngày 22/08/2026; hãy xem lại trang model trước khi đưa vào production.
Tóm tắt nhanh
- DeepSeek V4 Flash 0731 có giá thấp nhất khoảng $0.065/M input và $0.18/M output trên OpenRouter.
- Model có 1.31M context, hỗ trợ tool calling và structured output, phù hợp coding và agent workflow.
- Một model có nhiều provider vì các công ty khác nhau có thể tự host cùng open weights trên hạ tầng của họ.
- OpenRouter là lớp gateway đứng giữa OpenCode và các provider, tự chọn endpoint theo giá, tốc độ, độ ổn định hoặc chất lượng tool calling.
- Balanced hợp nhu cầu thông thường; Nitro ưu tiên tốc độ; Exacto ưu tiên tool calling; Floor ưu tiên giá thấp nhất.
- Bản Vision Exp là model ID khác, hỗ trợ ảnh nhưng đắt hơn và đang experimental. Không nên chọn làm mặc định nếu chỉ làm việc với text và code.
So sánh giá: DeepSeek V4 Flash, Muse Spark, MiMo V2.5 và Hy3
Bảng dưới chuẩn hóa giá theo một triệu token trên OpenRouter tại thời điểm kiểm tra:
| Model | Input / 1M | Output / 1M | Context | Điểm đáng chú ý |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.065 | $0.18 | 1.31M | Rẻ nhất, tập trung coding và agent |
| Muse Spark 1.2 Contributor | $0.10 | $0.20 | 1M | Rẻ thứ hai; prompt và output có thể được dùng để cải thiện sản phẩm Meta |
| MiMo V2.5 | $0.119 | $0.238 | 1.05M | Multimodal, giá vẫn thấp |
| Hy3 | $0.1254 | $0.5016 | 262K | Output đắt hơn MiMo khoảng hai lần |
| Muse Spark 1.2 | $1.25 | $4.25 | 1M | Đắt vượt trội, nhắm tới agent workflow dài và phức tạp |
Nếu chỉ nhìn input, khoảng cách giữa DeepSeek và Muse Spark Contributor không quá lớn. Nhưng coding agent thường sinh nhiều vòng trả lời, tool call, patch và giải thích. Khi đó giá output bắt đầu tạo khác biệt rõ hơn.
Ví dụ một workload coding thực tế
Giả sử trong một tháng, team dùng:
- 100 triệu input token;
- 20 triệu output token.
Chi phí ước tính:
| Model | Chi phí ước tính |
|---|---|
| DeepSeek V4 Flash | $10.10 |
| Muse Spark Contributor | $14.00 |
| MiMo V2.5 | $16.66 |
| Hy3 | $22.57 |
| Muse Spark 1.2 | $210.00 |
Xếp hạng thuần về giá:
- DeepSeek V4 Flash 0731
- Muse Spark 1.2 Contributor
- MiMo V2.5
- Hy3
- Muse Spark 1.2
Đây chưa phải bảng xếp hạng chất lượng. Model rẻ nhất không tự động là model tốt nhất cho mọi task. Nhưng với coding hằng ngày, tác vụ nhỏ và agent chạy nhiều vòng, chênh lệch giá này đủ lớn để DeepSeek V4 Flash trở thành một default đáng thử.
Vì sao một model DeepSeek lại có 31 provider?
Trang OpenRouter liệt kê Sail Research, Baidu Qianfan, Relace, DeepInfra, Together, Cloudflare và nhiều tên khác dưới cùng model deepseek/deepseek-v4-flash-0731.
Có ba lớp khác nhau:
| Lớp | Vai trò |
|---|---|
| DeepSeek | Nghiên cứu, huấn luyện và phát hành model weights |
| Baidu, DeepInfra, Together, Relace... | Tự vận hành inference trên GPU và hạ tầng riêng |
| OpenRouter | Cung cấp một API chung, chọn provider và chuyển request tới endpoint phù hợp |
Luồng request có thể trông như sau:
OpenCode
↓
OpenRouter
↓
Baidu / Relace / DeepInfra / provider khác
↓
DeepSeek V4 Flash 0731
Bạn không cần mở tài khoản và nạp tiền ở cả 31 nơi. Bạn dùng một OpenRouter API key; OpenRouter xử lý phần routing và failover phía sau.
Có thật sự là cùng một model không?
Về nền tảng, các provider phục vụ cùng weights của DeepSeek V4 Flash 0731. Tuy nhiên, trải nghiệm không nhất thiết giống nhau tuyệt đối vì mỗi bên có thể khác về:
- quantization như BF16, FP8 hoặc INT8;
- engine inference như vLLM, SGLang hoặc hệ thống riêng;
- loại GPU, batching và cách chia tải;
- phiên bản checkpoint đang được triển khai;
- prompt template hoặc system wrapper;
- cách hỗ trợ tool calling và structured output;
- context/output limit thực tế;
- latency, throughput và độ ổn định khi tải cao.
Vì vậy, cùng một model ID vẫn có thể cho kết quả benchmark, tốc độ và độ tin cậy khác nhau giữa các provider. Với chat đơn giản, chênh lệch có thể khó nhận ra. Với coding agent gọi tool liên tục, khác biệt này đáng quan tâm hơn.
OpenRouter chọn provider như thế nào?
Nếu request chỉ khai báo model:
{
"model": "deepseek/deepseek-v4-flash-0731"
}
OpenRouter sẽ route theo chế độ mặc định. Hệ thống ưu tiên endpoint ổn định và có giá tốt, đồng thời có thể chuyển sang provider khác khi endpoint đầu tiên lỗi hoặc không đáp ứng tham số request.
Điểm quan trọng là giá $0.065 / $0.18 trên đầu trang là mức thấp nhất đang có, không phải cam kết rằng mọi request đều được tính đúng mức ấy. Request có thể sang provider đắt hơn khi provider rẻ nhất:
- đang lỗi hoặc quá tải;
- không hỗ trợ parameter được gửi;
- không đáp ứng context cần thiết;
- không hỗ trợ tool calling theo yêu cầu;
- không phù hợp với chính sách privacy của tài khoản.
OpenRouter đổi lại sự bất định nhỏ về endpoint bằng một lợi ích lớn: khả năng failover. Theo số liệu trên trang model tại thời điểm kiểm tra, availability trong 24 giờ đạt khoảng 99.81% khi có routing, so với 90.46% nếu không dùng routing qua nhiều provider.
Balanced, Nitro, Exacto và Floor khác nhau ra sao?
Balanced hoặc Standard
Đây là chế độ mặc định, cân bằng giá, tốc độ và độ ổn định. Phù hợp cho phần lớn nhu cầu coding hằng ngày.
deepseek/deepseek-v4-flash-0731
Nitro
Nitro ưu tiên provider có tốc độ sinh token cao. Hữu ích khi bạn muốn phản hồi nhanh hoặc agent phải chạy nhiều bước tuần tự.
deepseek/deepseek-v4-flash-0731:nitro
Đổi lại, provider nhanh nhất không nhất thiết là provider rẻ nhất.
Exacto
Exacto ưu tiên độ chính xác của tool calling. Đây là lựa chọn đáng thử cho OpenCode, Cline hoặc workflow cần structured output và nhiều tool call.
deepseek/deepseek-v4-flash-0731:exacto
Nếu model trả lời text tốt nhưng thường xuyên gọi sai tool, truyền sai schema hoặc bỏ sót bước, tiết kiệm vài cent ở inference không còn nhiều ý nghĩa. Exacto giải quyết đúng bài toán đó.
Floor
Floor ưu tiên mức giá thấp nhất:
deepseek/deepseek-v4-flash-0731:floor
Chế độ này hợp tác vụ khối lượng lớn, ít nhạy cảm với latency và không phụ thuộc tool calling phức tạp.
Đọc đúng các cột giá và hiệu năng
Input /M
Chi phí cho một triệu token gửi vào model, gồm system prompt, lịch sử chat, code, tài liệu và kết quả tool từ các vòng trước.
Output /M
Chi phí cho một triệu token model sinh ra. Với một số endpoint, reasoning token cũng có thể ảnh hưởng đến phần được tính phí.
Cache read /M
Giá đọc lại phần prompt đã được cache. Coding agent thường lặp lại system prompt, instruction và code context qua nhiều vòng, nên cache hit có thể làm effective input price thấp hơn giá niêm yết.
Latency
Thời gian chờ trước khi phản hồi bắt đầu xuất hiện. Latency thấp tạo cảm giác model phản hồi nhanh hơn.
Throughput
Tốc độ sinh token sau khi bắt đầu trả lời, thường đo bằng token mỗi giây. Provider có latency thấp chưa chắc có throughput cao, và ngược lại.
Uptime
Tỷ lệ endpoint phản hồi được trong giai đoạn đo. Khi pin cứng một provider có uptime thấp, production workflow dễ lỗi hơn. Khi cho phép OpenRouter route, endpoint khác có thể tiếp quản.
Vì sao giá giữa các provider chênh nhau nhiều?
Cùng weights không có nghĩa cùng chi phí vận hành. Mỗi provider có cấu trúc khác nhau:
- giá GPU và điện theo khu vực;
- sở hữu GPU hay thuê cloud;
- hiệu quả của batching và scheduler;
- quantization và engine inference;
- mức latency hoặc throughput cam kết;
- chương trình khuyến mãi, trợ giá hoặc sử dụng tài nguyên nhàn rỗi;
- chính sách cache, lưu log và data retention;
- mức hỗ trợ, location và service-level agreement.
Một vài mức giá và hiệu năng đáng chú ý trên trang DeepSeek V4 Flash 0731 tại thời điểm kiểm tra:
| Provider | Input | Output | Latency | Throughput | Uptime |
|---|---|---|---|---|---|
| Sail Research | $0.065 | $0.18 | 6.04s | 13 tps | 98.20% |
| Relace | $0.07 | $0.14 | 0.60s | 101 tps | 99.91% |
| Baidu Qianfan | $0.0686 | $0.1372 | 0.87s | 124 tps | 99.90% |
| DeepInfra | $0.08 | $0.18 | 0.50s | 51 tps | 99.53% |
| DeepSeek chính chủ | $0.22 | $0.66 | 0.70s | 72 tps | 94.53% |
| Cloudflare | $0.44 | $1.32 | 0.80s | 71 tps | 99.97% |
Baidu nhận tỷ trọng traffic lớn không chỉ vì rẻ. Nó có tổ hợp hấp dẫn giữa giá, latency, throughput, uptime và cache hit. Đây cũng là lý do không nên chọn provider chỉ bằng một cột giá.
Weighted Average không phải bảng giá cho request tiếp theo
Trang OpenRouter còn hiển thị weighted average input/output. Đây là chi phí trung bình có trọng số từ traffic đã chạy, không phải mức giá cố định.
Input trung bình có thể thấp hơn giá niêm yết nhờ prompt caching. Output trung bình có thể cao hơn vì traffic được route qua cả provider đắt, output không được cache như input, hoặc có thêm token được tính phí.
Vì vậy:
- dùng listed price để hiểu giá công bố của từng provider;
- dùng effective price để xem cache và traffic thực tế đã tạo ra chi phí thế nào;
- không xem weighted average là cam kết cho request tiếp theo.
Đừng nhầm DeepSeek V4 Flash 0731 với Vision Exp
URL người dùng mở có thể chứa deepseek-v4-flash-vision-exp, nhưng nội dung được dán lại là trang của deepseek-v4-flash-0731. Đây là hai model ID khác nhau.
| Tiêu chí | DeepSeek V4 Flash 0731 | DeepSeek V4 Flash Vision Exp |
|---|---|---|
| Model ID | deepseek/deepseek-v4-flash-0731 | deepseek/deepseek-v4-flash-vision-exp |
| Input | Text | Text + image |
| Provider | Nhiều provider | DeepSeek chính chủ tại thời điểm kiểm tra |
| Giá | Từ khoảng $0.065 / $0.18 | Khoảng $0.22 / $0.66 |
| Context | 1.31M | Khoảng 1.05M |
| Trạng thái | General availability | Experimental |
Nếu OpenCode chủ yếu đọc code, sửa file, chạy test và gọi tool, bản 0731 hợp lý hơn. Chỉ chọn Vision Exp khi workflow thật sự cần đọc:
- screenshot lỗi;
- wireframe hoặc giao diện;
- biểu đồ và bảng dạng ảnh;
- PDF scan;
- ảnh chụp code;
- màn hình web hoặc mobile.
Dùng Vision Exp làm model mặc định cho tác vụ text thuần sẽ làm chi phí tăng khoảng ba đến bốn lần mà không tận dụng được năng lực hình ảnh.
Cấu hình routing nên bắt đầu từ đâu?
Với coding thông thường, hãy bắt đầu bằng model mặc định:
deepseek/deepseek-v4-flash-0731
Nếu agent gọi tool nhiều và bạn ưu tiên độ ổn định hơn vài phần chi phí:
deepseek/deepseek-v4-flash-0731:exacto
Khi gọi trực tiếp OpenRouter API, có thể yêu cầu ưu tiên giá và từ chối provider thu thập dữ liệu:
{
"model": "deepseek/deepseek-v4-flash-0731",
"provider": {
"sort": "price",
"data_collection": "deny",
"require_parameters": true
}
}
Với code khách hàng hoặc dữ liệu nhạy cảm, cân nhắc thêm yêu cầu zero data retention nếu provider hỗ trợ:
{
"model": "deepseek/deepseek-v4-flash-0731",
"provider": {
"sort": "price",
"data_collection": "deny",
"zdr": true,
"require_parameters": true
}
}
Hãy kiểm tra lại policy và khả năng hỗ trợ của provider thay vì mặc định rằng giá rẻ nhất luôn đáp ứng yêu cầu bảo mật.
Nên chọn model nào?
Chọn DeepSeek V4 Flash 0731 khi
- ưu tiên chi phí cho coding và agent;
- cần context rất dài;
- workload chủ yếu là text và code;
- muốn tận dụng nhiều provider và automatic failover;
- cần một model phụ cho tác vụ nhỏ hoặc khối lượng lớn.
Chọn MiMo V2.5 khi
- cần multimodal nhưng vẫn muốn giữ chi phí thấp;
- workflow có ảnh, audio hoặc video;
- context dài và dữ liệu đa phương thức quan trọng hơn mức giá thấp nhất.
Chọn Muse Spark Contributor khi
- muốn thử Muse Spark với chi phí thấp;
- dữ liệu không nhạy cảm;
- chấp nhận điều khoản dữ liệu có thể được dùng để cải thiện sản phẩm.
Chọn Muse Spark 1.2 thường khi
- chất lượng agent dài hạn quan trọng hơn chi phí;
- đã benchmark trên chính workload của mình và thấy lợi ích đủ bù mức giá cao hơn;
- task phức tạp đến mức model rẻ hơn tạo quá nhiều vòng sửa sai.
Kết luận
DeepSeek V4 Flash 0731 đáng chú ý không chỉ vì con số $0.065 / $0.18. Giá trị thực nằm ở tổ hợp:
- chi phí thấp;
- context 1.31M;
- phù hợp coding và agent;
- nhiều provider;
- automatic failover;
- có lựa chọn ưu tiên giá, tốc độ hoặc tool calling.
Khuyến nghị thực tế cho người dùng OpenCode là: bắt đầu với DeepSeek V4 Flash 0731 ở chế độ mặc định, chuyển sang Exacto nếu workflow gọi tool nhiều, và chỉ dùng Vision Exp khi thật sự có input hình ảnh.
Cuối cùng, đừng chọn model bằng bảng giá một mình. Hãy chạy cùng một nhóm task thật của bạn, đo tỷ lệ hoàn thành, số vòng sửa, latency và tổng token. Model rẻ nhất theo một triệu token chỉ thực sự rẻ khi nó hoàn thành được công việc.