DeepSeek Context Caching 2026: Diskon Input 30x

DeepSeek mengenakan biaya 30x lebih murah untuk input yang di-cache daripada untuk cache miss dan memotong setengah setiap harga di luar jam sibuk. Tarif V4-Pro dan V4.1-Flash, dijelaskan dengan benar.

DeepSeekContext CachingLLM PricingAI API CostsAI Perks
Author Avatar
Andrew
AI Perks Team
9,532

Quick Answer

Cache hit pada DeepSeek-V4-Pro berharga $0,022 per juta token input di luar jam sibuk, dibandingkan dengan $0,66 untuk cache miss, diskon 30x untuk model yang sama. DeepSeek juga mengurangi separuh setiap harga di luar jam sibuk, sehingga token cache di luar jam sibuk 60x lebih murah daripada cache miss di jam sibuk. Kredit dari penyedia yang menjalankan program startup dilacak di getaiperks.com.

Berapa Sebenarnya Biaya Cache Hit DeepSeek

Pada DeepSeek-V4-Pro, token input yang disajikan dari cache berharga $0,022 per juta di luar jam sibuk dibandingkan dengan $0,66 untuk cache miss. Itu adalah diskon 30x untuk mengirim awalan yang sama dua kali.

Sebagian besar halaman harga mencantumkan satu angka input dan melanjutkan. DeepSeek memiliki empat, karena dua pengali terpisah berlaku untuk setiap panggilan tunggal: apakah awalan tersebut mengenai cache, dan jam berapa Anda mengirimnya.

Model dan jendelaInput cache hitInput cache missOutput
DeepSeek-V4-Pro-0813, di luar jam sibuk$0,022$0,66$1,98
DeepSeek-V4-Pro-0813, jam sibuk$0,044$1,32$3,96
DeepSeek-V4.1-Flash, di luar jam sibuk$0,003$0,15belum diverifikasi
DeepSeek-V4.1-Flash, jam sibuk$0,006$0,30belum diverifikasi

Semua angka dalam USD per juta token, dari dokumentasi API resmi per September 2026. Harga output V4.1-Flash tidak diverifikasi di sini, jadi periksa halaman resmi sebelum membuat anggaran untuknya.

Rasio Flash bahkan lebih lebar dari model unggulannya: $0,003 dibandingkan dengan $0,15 adalah kesenjangan 50x (berdasarkan tarif di atas). AI Perks melacak mekanisme penyedia semacam ini bersama dengan program kredit yang mengimbanginya.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Jam Sibuk dan Luar Jam Sibuk: Satu-satunya Vendor yang Menagih Berdasarkan Jam

Jam sibuk DeepSeek adalah 01:00-04:00 dan 06:00-10:00 UTC pada hari kerja. Segala sesuatu yang lain, termasuk seluruh hari Sabtu dan Minggu, ditagih dengan setengah harga.

Tidak ada vendor model besar lainnya yang menetapkan harga berdasarkan waktu, yang menjadikannya tuas yang paling diabaikan dalam pekerjaan biaya LLM. Tidak ada panduan optimasi yang ditulis untuk OpenAI atau Anthropic yang memiliki alasan untuk menyebutkannya.

Diturunkan dari jendela tersebut: jam sibuk adalah 7 jam sehari selama 5 hari kerja, jadi 35 dari 168 jam dalam seminggu. Sekitar 79% kalender sudah di luar jam sibuk, jadi sebagian besar tim mendapatkan diskon secara tidak sengaja dan bisa mendapatkannya lebih banyak dengan sengaja.

Lokasi Anda menentukan seberapa banyak jam kerja Anda terpapar:

Lokasi TimJendela jam sibuk, waktu lokalEksposur hari kerja
US Eastern (UTC-4)21:00-00:00, 02:00-06:00Tidak ada, seluruh hari kerja di luar jam sibuk
US Pacific (UTC-7)18:00-21:00, 23:00-03:00Tidak ada
Eropa Tengah (UTC+2)03:00-06:00, 08:00-12:00Seluruh pagi
India (UTC+5:30)06:30-09:30, 11:30-15:30Sebagian besar hari kerja
Tiongkok (UTC+8)09:00-12:00, 14:00-18:00Hampir seluruhnya

Waktu lokal dikonversi dari jendela UTC yang diterbitkan pada offset yang ditunjukkan, dan penghematan siang hari memindahkannya satu jam. Pola ini bukan kebetulan: jendela jam sibuk sesuai dengan hari kerja Tiongkok, jadi lalu lintas interaktif tim AS masuk ke paruh jam yang murah dengan gratis.


Menumpuk Kedua Diskon: Selisih 60x pada Satu Model

Token input jam sibuk yang di-cache seharga $0,022 dibandingkan dengan cache miss jam sibuk seharga $1,32 adalah selisih 60x pada output identik dari model yang sama.

Beginilah tampilannya pada beban kerja agen yang realistis: konteks 200.000 token dikirim ulang 1.000 kali sehari, jadi 200 juta token input setiap hari pada V4-Pro.

SkenarioTarif per 1 jutaBiaya input harian
Jam sibuk, setiap panggilan cache miss$1,32$264,00
Luar jam sibuk, setiap panggilan cache miss$0,66$132,00
Jam sibuk, setiap panggilan cache hit$0,044$8,80
Luar jam sibuk, setiap panggilan cache hit$0,022$4,40

Semua empat baris diturunkan dengan mengalikan tarif yang diterbitkan dengan 200. Kesenjangan antara baris atas dan bawah adalah sekitar $260 per hari, atau sekitar $95.000 per tahun, pada beban kerja yang sama sekali tidak berubah.

Dua hal berikut yang dilewatkan oleh sebagian besar tulisan biaya:

Model unggulan yang di-cache mengalahkan model kecil yang tidak di-cache. Input V4-Pro yang di-cache seharga $0,022 di luar jam sibuk sekitar 7x lebih murah daripada input V4.1-Flash yang tidak di-cache seharga $0,15 (diturunkan). Menurunkan versi model untuk menghemat uang adalah langkah yang salah jika masalah sebenarnya adalah cache yang tidak pernah Anda hangatkan.

Output tidak pernah di-cache. Pada $1,98 di luar jam sibuk, token output berharga sekitar 90x token input yang di-cache (diturunkan). Setelah caching berfungsi, Anda tidak lagi memiliki tagihan input, Anda memiliki tagihan output, dan setiap penghematan lebih lanjut berasal dari respons yang lebih pendek atau anggaran pemikiran yang dibatasi. Tim yang mendanai tagihan output tersebut dengan kredit penyedia dapat membandingkan apa yang tersedia di getaiperks.com.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Apa yang Berubah Sejak Panduan Harga DeepSeek Sebelumnya

Tiga hal berubah pada tahun 2026: V4-Pro-0813 mencapai ketersediaan umum pada 13 Agustus, harga jam sibuk dan luar jam sibuk menggantikan tarif tetap pada pertengahan Agustus, dan V4.1-Flash diluncurkan sekitar 10 September.

Halaman harga DeepSeek kami sebelumnya mencantumkan tarif per-token tetap tanpa komponen waktu. Itu mendahului perubahan dan harus dibaca sebagai sejarah.

Garis waktu, dengan kepercayaan yang ditandai secara jujur:

  • 24 April 2026 (kepercayaan sedang): Pratinjau V4-Pro dan V4-Flash, dengan jendela konteks 1 juta token, hingga 384K token output, dan mode berpikir dan non-berpikir yang dapat dialihkan.
  • 31 Juli 2026 (kepercayaan sedang): DeepSeek-V4-Flash-0731, rilis Flash yang stabil. Harga terakhir yang diketahui sebelum perubahan adalah $0,14 per juta input cache-miss dan $0,28 per juta output, keduanya tetap. Hanya historis.
  • 13 Agustus 2026: Ketersediaan umum DeepSeek-V4-Pro-0813, model penalaran dan agen andalan saat ini.
  • Sekitar 10 September 2026: DeepSeek-V4.1-Flash, terdaftar dalam dokumentasi sebagai "DeepSeek-Flash".

Jika Anda bekerja dari tutorial atau model biaya yang ditulis sebelum Agustus 2026, setiap angka input di dalamnya salah dalam kedua arah: terlalu tinggi untuk cache hit, terlalu rendah untuk cache miss jam sibuk.


Penggantian Nama Endpoint yang Merusak Kode Lama

DeepSeek-V4.1-Flash diam-diam memensiunkan nama model deepseek-v4-flash dan deepseek-v4-flash-vision-exp. Permintaan yang masih menggunakan string tersebut akan gagal.

Ini adalah jenis perubahan yang muncul sebagai insiden produksi daripada tiket migrasi, karena nama model biasanya terletak di file konfigurasi yang tidak pernah dibuka siapa pun selama berbulan-bulan. Sampel kode lama, wrapper SDK, dan tutorial pihak ketiga masih mereferensikan nama yang dipensiunkan.

Layak dilakukan sebelum penerapan Anda berikutnya:

  • Pindai seluruh repositori untuk kedua string yang dipensiunkan, termasuk konfigurasi infrastruktur dan notebook
  • Periksa SDK yang di-vendored atau kerangka kerja agen apa pun yang mengkodekan secara default model DeepSeek
  • Konfirmasikan jalur visi secara terpisah, karena endpoint visi eksperimental juga diganti namanya
  • Jalankan kembali model biaya Anda setelahnya, karena penggantinya duduk di jadwal jam sibuk dan luar jam sibuk yang baru

Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Tingkat Gratis dan Kredit DeepSeek: Apa yang Sebenarnya Benar

Aplikasi obrolan DeepSeek gratis untuk digunakan. API tidak gratis, dan tidak ada tingkat gratis yang disebutkan di halaman harga resmi.

Di sinilah sebagian besar artikel salah. Klaim bahwa akun API baru menerima kredit gratis beredar luas, dilaporkan secara tidak konsisten, dan tidak dikonfirmasi di halaman harga resmi. Jika Anda membutuhkan saldo awal, asumsikan Anda membayarnya.

Lebih penting bagi para pendiri: DeepSeek tidak menjalankan program kredit startup khusus. Tidak ada aplikasi, tidak ada tingkatan berbasis tahap, tidak ada jalur mitra. Harga per token yang murah adalah seluruh penawaran, yang merupakan celah nyata jika Anda menyusun tumpukan kredit.

Celah itulah yang membuat keputusan perutean menjadi penting. Banyak penyedia menjalankan program startup, dan AI Perks melacak $7,7 juta dalam bentuk kredit di 194 perusahaan yang mencakup yang melakukannya. Pola praktisnya adalah merutekan lalu lintas bervolume tinggi dan ramah cache ke DeepSeek seharga $0,022 per juta dan menghabiskan kredit yang diberikan pada penyedia yang lebih mahal, di mana token gratis jauh lebih berharga.


Membeli DeepSeek dari Orang Lain

Host pihak ketiga tidak mereplikasi jadwal jam sibuk dan luar jam sibuk DeepSeek, yang berarti mereka dapat merusak API pihak pertama selama jam sibuk dan kalah telak darinya di luar jam sibuk.

Baseten mencantumkan input DeepSeek V4.1 Flash seharga $0,30 per juta (kepercayaan sedang, verifikasi sebelum membuat anggaran), dan angka output tidak dapat diandalkan dikonfirmasi. Baseten juga membawa kredit percobaan ruang kerja baru senilai $30.

Perhatikan apa arti $0,30: itu adalah persis tarif cache-miss jam sibuk DeepSeek sendiri, dan dua kali lipat tarif luar jam sibuk (diturunkan). Untuk tim AS atau Eropa yang lalu lintasnya sebagian besar masuk di luar jam sibuk, tarif pihak ketiga yang tetap tidak secara jelas merupakan penghematan.

OpenRouter, Together, dan Fireworks juga menghosting model DeepSeek. Kami tidak mencantumkan harga mereka di sini karena kami belum memverifikasinya, dan begitu pula hal lain yang Anda baca. Namun, perdagangan kualitatifnya konsisten:

  • API pihak pertama: satu-satunya tempat tumpukan cache-hit dan luar jam sibuk penuh berlaku, dan jalur termurah dengan selisih yang lebar ketika keduanya menyala
  • Host pihak ketiga: tarif tetap, wilayah berbeda, penagihan terpadu, dan biasanya tidak ada paparan terhadap tingkatan cache-hit DeepSeek
  • Agregator: berguna untuk failover, dengan premi yang harus Anda ukur daripada berasumsi

Harga lalu lintas Anda sendiri terhadap keduanya, lalu bandingkan hasilnya dengan kredit yang tersedia di penyedia lain di getaiperks.com. Token gratis mengalahkan token yang murah.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Pertanyaan yang Sering Diajukan

Seberapa murah cache hit DeepSeek?

Pada DeepSeek-V4-Pro, cache hit berharga $0,022 per juta token input di luar jam sibuk dibandingkan dengan $0,66 untuk cache miss, perbedaan 30x. Pada V4.1-Flash kesenjangannya lebih lebar, $0,003 dibandingkan dengan $0,15, perbedaan 50x (diturunkan). Tarif berasal dari dokumentasi API resmi per September 2026.

Kapan jam sibuk DeepSeek?

Jam sibuk adalah 01:00-04:00 dan 06:00-10:00 UTC hanya pada hari kerja. Segala sesuatu yang lain, termasuk kedua hari akhir pekan, ditagih dengan setengah tarif jam sibuk. Itu setara dengan sekitar 79% minggu di luar jam sibuk (diturunkan), jadi tim yang berbasis di AS mendapatkan diskon selama seluruh hari kerja mereka tanpa mengubah apa pun.

Apakah DeepSeek memiliki tingkat API gratis?

Tidak ada tingkat API gratis yang disebutkan di halaman harga resmi. Aplikasi obrolan konsumen gratis, tetapi API berbayar sejak token pertama. Laporan tentang kredit gratis untuk akun baru tidak konsisten dan belum dikonfirmasi. Penyedia yang memberikan kredit dilacak di getaiperks.com.

Apakah DeepSeek menawarkan kredit startup?

DeepSeek tidak menjalankan program kredit startup khusus. Harga per token yang rendah adalah seluruh penawaran. Bagi para pendiri yang menyusun tumpukan kredit, itu adalah celah yang patut diisi di tempat lain: AI Perks mencakup $7,7 juta dalam bentuk kredit di 194 perusahaan dari penyedia yang menjalankan program.

Mengapa panggilan API DeepSeek saya berhenti berfungsi?

Penyebab yang paling mungkin adalah nama model. DeepSeek-V4.1-Flash memensiunkan nama endpoint deepseek-v4-flash dan deepseek-v4-flash-vision-exp, dan tutorial serta file konfigurasi lama masih mereferensikannya. Pindai repositori Anda untuk kedua string tersebut, termasuk SDK yang di-vendored dan notebook, lalu periksa kembali model biaya Anda terhadap tarif saat ini.

Haruskah saya menggunakan DeepSeek V4-Pro atau V4.1-Flash?

Jalankan aritmatika sebelum mengasumsikan Flash lebih murah. Input V4-Pro yang di-cache seharga $0,022 di luar jam sibuk kira-kira 7x lebih murah daripada input Flash yang tidak di-cache seharga $0,15 (diturunkan), jadi model unggulan yang di-cache dengan baik dapat mengalahkan model kecil yang tidak di-cache pada baris input sepenuhnya. Volume output, bukan ukuran model, biasanya menentukan tagihan.


Berlangganan di getaiperks.com →

Cache awalan, kirim di luar jam sibuk, dan biarkan kredit orang lain menanggung sisanya.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.