Chi phí thực tế khi sử dụng DeepSeek Cache Hit
Trên DeepSeek-V4-Pro, một token đầu vào được phục vụ từ bộ nhớ cache có giá 0,022 đô la cho mỗi triệu token ngoài giờ cao điểm, so với 0,66 đô la cho trường hợp bỏ lỡ bộ nhớ cache. Đó là mức giảm giá 30 lần cho việc gửi cùng một tiền tố hai lần.
Hầu hết các trang định giá chỉ đưa ra một con số đầu vào và chuyển sang phần tiếp theo. DeepSeek có bốn con số, vì hai hệ số nhân riêng biệt áp dụng cho mọi lệnh gọi: liệu tiền tố có khớp với bộ nhớ cache hay không và bạn gửi nó vào thời điểm nào trong ngày.
| Mô hình và cửa sổ | Đầu vào khớp bộ nhớ cache | Đầu vào bỏ lỡ bộ nhớ cache | Đầu ra |
|---|---|---|---|
| DeepSeek-V4-Pro-0813, ngoài giờ cao điểm | 0,022 đô la | 0,66 đô la | 1,98 đô la |
| DeepSeek-V4-Pro-0813, giờ cao điểm | 0,044 đô la | 1,32 đô la | 3,96 đô la |
| DeepSeek-V4.1-Flash, ngoài giờ cao điểm | 0,003 đô la | 0,15 đô la | chưa xác minh |
| DeepSeek-V4.1-Flash, giờ cao điểm | 0,006 đô la | 0,30 đô la | chưa xác minh |
Tất cả các số liệu đều là USD cho mỗi triệu token, từ tài liệu API chính thức tính đến tháng 9 năm 2026. Giá đầu ra V4.1-Flash không được xác minh ở đây, vì vậy hãy kiểm tra trang chính thức trước khi lập ngân sách cho nó.
Tỷ lệ Flash còn rộng hơn so với mẫu hàng đầu: 0,003 đô la so với 0,15 đô la là khoảng cách 50 lần (suy ra từ tỷ lệ ở trên). AI Perks theo dõi cơ chế nhà cung cấp loại này cùng với các chương trình tín dụng bù đắp cho nó.

Giờ cao điểm và ngoài giờ cao điểm: Nhà cung cấp duy nhất tính phí theo đồng hồ
Giờ cao điểm của DeepSeek là 01:00-04:00 và 06:00-10:00 UTC vào các ngày trong tuần. Mọi thứ khác, bao gồm cả Thứ Bảy và Chủ Nhật, đều được tính phí với giá bằng một nửa.
Không có nhà cung cấp mô hình lớn nào khác định giá theo thời gian trong ngày, điều này khiến nó trở thành đòn bẩy bị bỏ qua nhiều nhất trong công việc chi phí LLM. Không có hướng dẫn tối ưu hóa nào được viết cho OpenAI hoặc Anthropic có lý do để đề cập đến nó.
Suy ra từ các cửa sổ đó: giờ cao điểm là 7 giờ mỗi ngày trong 5 ngày làm việc, tức là 35 trong số 168 giờ của tuần. Khoảng 79% lịch là đã ngoài giờ cao điểm, vì vậy hầu hết các nhóm đều nhận được khoản giảm giá một cách ngẫu nhiên và có thể nhận được nhiều hơn nữa một cách có chủ đích.
Vị trí của bạn quyết định bao nhiêu thời gian làm việc của bạn bị ảnh hưởng:
| Vị trí nhóm | Cửa sổ cao điểm, giờ địa phương | Thời gian làm việc bị ảnh hưởng |
|---|---|---|
| Miền Đông Hoa Kỳ (UTC-4) | 21:00-00:00, 02:00-06:00 | Không có, toàn bộ ngày làm việc là ngoài giờ cao điểm |
| Thái Bình Dương Hoa Kỳ (UTC-7) | 18:00-21:00, 23:00-03:00 | Không có |
| Trung Âu (UTC+2) | 03:00-06:00, 08:00-12:00 | Toàn bộ buổi sáng |
| Ấn Độ (UTC+5:30) | 06:30-09:30, 11:30-15:30 | Phần lớn ngày làm việc |
| Trung Quốc (UTC+8) | 09:00-12:00, 14:00-18:00 | Hầu hết mọi thứ |
Giờ địa phương được chuyển đổi từ các cửa sổ UTC đã công bố với độ lệch được hiển thị, và giờ tiết kiệm ánh sáng ban ngày di chuyển chúng thêm một giờ. Mô hình này không phải là ngẫu nhiên: các cửa sổ cao điểm tương ứng với ngày làm việc của Trung Quốc, vì vậy lưu lượng truy cập tương tác của một nhóm Hoa Kỳ sẽ nằm trong nửa giờ rẻ của đồng hồ miễn phí.
Kết hợp cả hai khoản giảm giá: Chênh lệch 60 lần đối với một mô hình
Một token đầu vào ngoài giờ cao điểm trong bộ nhớ cache với giá 0,022 đô la so với token đầu vào giờ cao điểm bị bỏ lỡ bộ nhớ cache với giá 1,32 đô la là chênh lệch 60 lần đối với đầu ra giống hệt nhau từ cùng một mô hình.
Đây là những gì nó trông giống như trên một khối lượng công việc tác nhân thực tế: ngữ cảnh 200.000 token được gửi lại 1.000 lần mỗi ngày, tức là 200 triệu token đầu vào hàng ngày trên V4-Pro.
| Kịch bản | Tỷ lệ mỗi 1 triệu | Chi phí đầu vào hàng ngày |
|---|---|---|
| Giờ cao điểm, mỗi lệnh gọi đều bỏ lỡ bộ nhớ cache | 1,32 đô la | 264,00 đô la |
| Ngoài giờ cao điểm, mỗi lệnh gọi đều bỏ lỡ bộ nhớ cache | 0,66 đô la | 132,00 đô la |
| Giờ cao điểm, mỗi lệnh gọi đều khớp bộ nhớ cache | 0,044 đô la | 8,80 đô la |
| Ngoài giờ cao điểm, mỗi lệnh gọi đều khớp bộ nhớ cache | 0,022 đô la | 4,40 đô la |
Cả bốn hàng đều được suy ra bằng cách nhân các tỷ lệ đã công bố với 200. Khoảng cách giữa hàng trên cùng và hàng dưới cùng là khoảng 260 đô la mỗi ngày, hoặc khoảng 95.000 đô la mỗi năm, trên một khối lượng công việc không thay đổi chút nào.
Hai điều sau đây mà hầu hết các bài viết về chi phí đều bỏ lỡ:
Một mô hình hàng đầu được cache tốt hơn một mô hình nhỏ không được cache. Đầu vào V4-Pro được cache với giá 0,022 đô la ngoài giờ cao điểm rẻ hơn khoảng 7 lần so với đầu vào V4.1-Flash không được cache với giá 0,15 đô la (suy ra). Giảm cấp mô hình để tiết kiệm tiền là sai lầm nếu vấn đề thực sự là một bộ nhớ cache mà bạn chưa bao giờ làm nóng.
Đầu ra không bao giờ được cache. Với giá 1,98 đô la ngoài giờ cao điểm, một token đầu ra có giá gấp khoảng 90 lần một token đầu vào được cache (suy ra). Một khi bộ nhớ cache hoạt động, bạn không còn hóa đơn đầu vào nữa, bạn có hóa đơn đầu ra, và mọi khoản tiết kiệm tiếp theo đều đến từ các phản hồi ngắn hơn hoặc ngân sách suy nghĩ bị giới hạn. Các nhóm tài trợ hóa đơn đầu ra đó bằng tín dụng của nhà cung cấp có thể so sánh những gì có sẵn tại getaiperks.com.

Những gì đã thay đổi kể từ Hướng dẫn Định giá DeepSeek trước đó của chúng tôi
Ba điều đã thay đổi vào năm 2026: V4-Pro-0813 đã sẵn sàng chung vào ngày 13 tháng 8, định giá giờ cao điểm và ngoài giờ cao điểm thay thế tỷ lệ cố định vào giữa tháng 8, và V4.1-Flash ra mắt vào khoảng ngày 10 tháng 9.
Trang định giá DeepSeek trước đó của chúng tôi báo giá cố định cho mỗi token mà không có thành phần thời gian trong ngày. Những điều đó có trước sự thay đổi và nên được coi là lịch sử.
Dòng thời gian, với mức độ tin cậy được đánh dấu trung thực:
- Ngày 24 tháng 4 năm 2026 (mức độ tin cậy trung bình): Bản xem trước V4-Pro và V4-Flash, với cửa sổ ngữ cảnh 1 triệu token, tối đa 384 nghìn token đầu ra và chế độ suy nghĩ và không suy nghĩ có thể chuyển đổi.
- Ngày 31 tháng 7 năm 2026 (mức độ tin cậy trung bình): DeepSeek-V4-Flash-0731, bản phát hành Flash ổn định. Giá cuối cùng được biết đến trước khi thay đổi là 0,14 đô la cho mỗi triệu token đầu vào bỏ lỡ bộ nhớ cache và 0,28 đô la cho mỗi triệu token đầu ra, cả hai đều là cố định. Chỉ lịch sử.
- Ngày 13 tháng 8 năm 2026: DeepSeek-V4-Pro-0813 sẵn sàng chung, mô hình suy luận và tác nhân hàng đầu hiện tại.
- Khoảng ngày 10 tháng 9 năm 2026: DeepSeek-V4.1-Flash, được liệt kê trong tài liệu là "DeepSeek-Flash".
Nếu bạn đang làm việc từ một hướng dẫn hoặc mô hình chi phí được viết trước tháng 8 năm 2026, mọi con số đầu vào trong đó đều sai ở cả hai hướng: quá cao đối với trường hợp khớp bộ nhớ cache, quá thấp đối với trường hợp bỏ lỡ bộ nhớ cache trong giờ cao điểm.
Việc đổi tên điểm cuối làm hỏng mã cũ
DeepSeek-V4.1-Flash đã âm thầm loại bỏ các tên mô hình deepseek-v4-flash và deepseek-v4-flash-vision-exp. Các yêu cầu vẫn gửi các chuỗi đó sẽ thất bại.
Đây là loại thay đổi xuất hiện dưới dạng sự cố sản xuất thay vì vé di chuyển, vì tên mô hình thường nằm trong tệp cấu hình mà không ai mở trong nhiều tháng. Các mẫu mã cũ, gói SDK và hướng dẫn của bên thứ ba vẫn tham chiếu đến các tên đã bị loại bỏ.
Đáng để thực hiện trước lần triển khai tiếp theo của bạn:
- Tìm kiếm toàn bộ kho lưu trữ cho cả hai chuỗi đã bị loại bỏ, bao gồm cấu hình cơ sở hạ tầng và sổ tay
- Kiểm tra bất kỳ SDK hoặc khung tác nhân nào được cung cấp mà mã hóa cứng một mô hình DeepSeek mặc định
- Xác nhận đường dẫn thị giác riêng, vì điểm cuối thị giác thử nghiệm cũng đã được đổi tên
- Chạy lại mô hình chi phí của bạn sau đó, vì mô hình thay thế nằm trên lịch trình giờ cao điểm và ngoài giờ cao điểm mới

Ưu đãi miễn phí và tín dụng DeepSeek: Những gì thực sự đúng
Ứng dụng trò chuyện DeepSeek miễn phí sử dụng. API thì không, và không có bậc miễn phí nào được nêu trên trang định giá chính thức.
Đây là nơi hầu hết các bài báo mắc sai lầm. Các tuyên bố rằng tài khoản API mới nhận được tín dụng miễn phí lan truyền rộng rãi, được báo cáo không nhất quán và không được xác nhận trên trang định giá chính thức. Nếu bạn cần số dư ban đầu, hãy giả định bạn phải trả tiền cho nó.
Quan trọng hơn đối với những người sáng lập: DeepSeek không chạy chương trình tín dụng khởi nghiệp chuyên dụng. Không có đơn đăng ký, không có bậc dựa trên giai đoạn, không có theo dõi đối tác. Định giá mỗi token thấp là toàn bộ ưu đãi, điều này tạo ra một khoảng trống thực sự nếu bạn đang tập hợp một ngăn xếp tín dụng.
Khoảng trống đó chính xác là lý do tại sao quyết định định tuyến lại quan trọng. Có rất nhiều nhà cung cấp chạy các chương trình khởi nghiệp, và AI Perks theo dõi 7,7 triệu đô la tín dụng trên 194 công ty bao gồm những công ty thực hiện điều đó. Mô hình thực tế là định tuyến lưu lượng truy cập khối lượng lớn, thân thiện với bộ nhớ cache đến DeepSeek với giá 0,022 đô la mỗi triệu và chi tiêu tín dụng được cấp cho các nhà cung cấp đắt tiền hơn, nơi một token miễn phí có giá trị hơn nhiều.
Mua DeepSeek từ người khác
Các máy chủ của bên thứ ba không sao chép lịch trình giờ cao điểm và ngoài giờ cao điểm của DeepSeek, có nghĩa là họ có thể bán phá giá API của họ trong giờ cao điểm và thua nặng nề với nó ngoài giờ cao điểm.
Baseten liệt kê đầu vào DeepSeek V4.1 Flash với giá 0,30 đô la mỗi triệu (mức độ tin cậy trung bình, xác minh trước khi lập ngân sách), và số liệu đầu ra không được xác nhận một cách đáng tin cậy. Baseten cũng cung cấp tín dụng dùng thử không gian làm việc mới trị giá 30 đô la cố định.
Lưu ý $0,30 tương đương với điều gì: nó chính xác là tỷ lệ bỏ lỡ bộ nhớ cache trong giờ cao điểm của DeepSeek, và gấp đôi tỷ lệ ngoài giờ cao điểm (suy ra). Đối với một nhóm Hoa Kỳ hoặc Châu Âu có lưu lượng truy cập chủ yếu rơi vào ngoài giờ cao điểm, một tỷ lệ cố định của bên thứ ba không rõ ràng là tiết kiệm.
OpenRouter, Together và Fireworks cũng lưu trữ các mô hình DeepSeek. Chúng tôi không báo giá của họ ở đây vì chúng tôi chưa xác minh chúng, và bất kỳ điều gì khác bạn đọc cũng không nên. Tuy nhiên, sự đánh đổi định tính là nhất quán:
- API chính thức: nơi duy nhất áp dụng toàn bộ xếp chồng khớp bộ nhớ cache và ngoài giờ cao điểm, và con đường rẻ nhất với biên độ lớn khi cả hai cùng hoạt động
- Máy chủ của bên thứ ba: tỷ lệ cố định, các khu vực khác nhau, thanh toán hợp nhất và thường không tiếp xúc với cấp độ khớp bộ nhớ cache của DeepSeek
- Bộ tổng hợp: hữu ích cho việc chuyển đổi dự phòng, với một khoản phí bảo hiểm mà bạn nên đo lường thay vì giả định
Định giá lưu lượng truy cập của riêng bạn so với cả hai, sau đó so sánh kết quả với các khoản tín dụng có sẵn trên các nhà cung cấp khác tại getaiperks.com. Một token miễn phí tốt hơn một token rẻ.

Câu hỏi thường gặp
Khớp bộ nhớ cache DeepSeek rẻ hơn bao nhiêu?
Trên DeepSeek-V4-Pro, một lần khớp bộ nhớ cache có giá 0,022 đô la cho mỗi triệu token đầu vào ngoài giờ cao điểm so với 0,66 đô la cho một lần bỏ lỡ bộ nhớ cache, chênh lệch 30 lần. Trên V4.1-Flash, khoảng cách còn rộng hơn nữa, 0,003 đô la so với 0,15 đô la, chênh lệch 50 lần (suy ra). Tỷ lệ từ tài liệu API chính thức tính đến tháng 9 năm 2026.
Giờ cao điểm DeepSeek là khi nào?
Giờ cao điểm là 01:00-04:00 và 06:00-10:00 UTC chỉ vào các ngày trong tuần. Mọi thứ khác, bao gồm cả hai ngày cuối tuần, đều được tính phí bằng một nửa tỷ lệ giờ cao điểm. Điều đó tương đương với khoảng 79% tuần là ngoài giờ cao điểm (suy ra), vì vậy các nhóm có trụ sở tại Hoa Kỳ được giảm giá trong suốt ngày làm việc của họ mà không thay đổi bất cứ điều gì.
DeepSeek có bậc API miễn phí không?
Không có bậc API miễn phí nào được nêu trên trang định giá chính thức. Ứng dụng trò chuyện dành cho người tiêu dùng là miễn phí, nhưng API được thanh toán từ token đầu tiên. Các báo cáo về tín dụng miễn phí cho tài khoản mới không nhất quán và chưa được xác nhận. Các nhà cung cấp có cấp tín dụng được theo dõi tại getaiperks.com.
DeepSeek có cung cấp tín dụng khởi nghiệp không?
DeepSeek không chạy chương trình tín dụng khởi nghiệp chuyên dụng. Định giá mỗi token thấp là toàn bộ ưu đãi. Đối với những người sáng lập xây dựng ngăn xếp tín dụng, đó là một khoảng trống đáng để lấp đầy ở nơi khác: AI Perks bao gồm 7,7 triệu đô la tín dụng trên 194 công ty từ các nhà cung cấp có chạy chương trình.
Tại sao lệnh gọi API DeepSeek của tôi ngừng hoạt động?
Nguyên nhân có khả năng xảy ra nhất là tên mô hình. DeepSeek-V4.1-Flash đã loại bỏ các tên điểm cuối deepseek-v4-flash và deepseek-v4-flash-vision-exp, và các hướng dẫn cũ và tệp cấu hình vẫn tham chiếu đến chúng. Tìm kiếm kho lưu trữ của bạn cho cả hai chuỗi, bao gồm các SDK và sổ tay được cung cấp, sau đó kiểm tra lại mô hình chi phí của bạn so với tỷ lệ hiện tại.
Tôi có nên sử dụng DeepSeek V4-Pro hay V4.1-Flash không?
Thực hiện phép tính trước khi giả định Flash rẻ hơn. Đầu vào V4-Pro được cache với giá 0,022 đô la ngoài giờ cao điểm rẻ hơn khoảng 7 lần so với đầu vào Flash không được cache với giá 0,15 đô la (suy ra), vì vậy một mô hình hàng đầu được cache tốt có thể vượt trội hơn hẳn một mô hình nhỏ không được cache trên dòng đầu vào. Khối lượng đầu ra, không phải kích thước mô hình, thường quyết định hóa đơn.
Cache tiền tố, vận chuyển ngoài giờ cao điểm và để tín dụng của người khác chi trả phần còn lại.