Matriks Harga API Provider AI 2026: OpenAI, Claude, Gemini,...
Matriks Harga API Provider AI 2026: OpenAI, Claude, Gemini, DeepSeek, dan Lainnya
Matriks harga API dari OpenAI, Anthropic, Google, DeepSeek, xAI, dan lainnya per Agustus 2026 — lengkap dengan simulasi biaya per 1.000 request dan jebakan tarif yang tidak terlihat di halaman harga.
Memilih model AI untuk aplikasi produksi sekarang bukan lagi soal "mana yang paling pintar", tapi "mana yang paling masuk akal per tagihan bulan depan". Selisih harga antar penyedia API sudah melampaui 100 kali lipat, dan angka di halaman harga sering menyesatkan karena aturan tambahan seperti caching, konteks panjang, dan token berpikir tidak terlihat di sana.
Artikel ini merangkum matriks harga API dari penyedia AI utama per Agustus 2026, lengkap dengan simulasi biaya dan jebakan yang paling sering meleset dari perhitungan.
Cara membaca tabel ini
Semua angka adalah dolar AS per satu juta token, tarif standar (bukan batch, bukan cache hit). Kolom input adalah biaya prompt yang Anda kirim, kolom output adalah biaya jawaban yang dihasilkan.
Satu hal yang wajib dipahami sejak awal: output hampir selalu jauh lebih mahal daripada input, umumnya 2 sampai 6 kali lipat. Artinya, memangkas panjang jawaban biasanya lebih berdampak pada tagihan daripada memangkas prompt.
Sebagai patokan kasar, satu juta token setara sekitar 750 ribu kata.
Tier frontier
Model paling mampu, untuk penalaran berat dan pekerjaan agentic multi-langkah.
| Provider | Model | Input | Output |
|---|---|---|---|
| Anthropic | Claude Fable 5 | 10,00 | 50,00 |
| OpenAI | GPT-5.6 Sol | 5,00 | 30,00 |
| Anthropic | Claude Opus 5 | 5,00 | 25,00 |
| Anthropic | Claude Opus 4.8 | 5,00 | 25,00 |
Perhatikan rasionya: Sol menagih output enam kali harga input, sementara Opus 5 hanya lima kali. Untuk beban kerja yang banyak menghasilkan teks, selisih itu terasa.
Tier menengah
Ini kelas "kuda beban" untuk sebagian besar aplikasi produksi.
| Provider | Model | Input | Output |
|---|---|---|---|
| OpenAI | GPT-5.6 Terra | 2,00 | 12,00 |
| Gemini 3.1 Pro | 2,00 | 12,00 | |
| Anthropic | Claude Sonnet 5 | 2,00\* | 10,00\* |
| xAI | Grok 4.5 | 2,00 | 6,00 |
| Moonshot | Kimi K3 | 3,00 | 15,00 |
| Z.AI | GLM 5.2 | 1,40 | 4,40 |
\* Tarif perkenalan sampai 31 Agustus 2026. Setelah itu naik ke 3,00 / 15,00 — kenaikan 50% yang perlu Anda masukkan ke anggaran sekarang, bukan nanti.
Grok 4.5 menonjol karena rasio outputnya cuma tiga kali input, salah satu yang paling ramah untuk aplikasi yang banyak menulis.
Tier hemat dan volume tinggi
Untuk klasifikasi, ekstraksi, routing, dan pekerjaan batch berskala besar.
| Provider | Model | Input | Output |
|---|---|---|---|
| Anthropic | Claude Haiku 4.5 | 1,00 | 5,00 |
| Gemini 3.7 / 3.6 Flash | 0,75† | 3,75† | |
| DeepSeek | V4-Pro (off-peak) | 0,66 | 1,98 |
| Gemini 3.5 Flash-Lite | 0,30 | 2,50 | |
| MiniMax | M2 | 0,30 | 1,20 |
| OpenAI | GPT-5.6 Luna | 0,20 | 1,20 |
| Alibaba | Qwen3.6 Flash | 0,19 | 1,13 |
| Mistral | Small 4 | 0,15 | 0,60 |
| Gemini 2.5 Flash-Lite | 0,10 | 0,40 |
† Harga perkenalan sampai 31 Desember 2026, lalu naik jadi 1,50 / 7,50 pada 1 Januari 2027.
Yang tidak terlihat di harga sticker
Di sinilah anggaran biasanya jebol. Lima hal berikut mengubah tagihan riil secara signifikan:
1. Meteran konteks panjang. OpenAI menerapkan tarif terpisah untuk prompt sangat panjang: Sol naik ke 10 / 45, Terra ke 4 / 18, Luna ke 0,40 / 1,80. Gemini juga menaikkan tarif Pro di atas 200 ribu token, dari 2 / 12 menjadi 4 / 18. Kalau beban kerja Anda kadang menyentuh konteks besar, modelkan lonjakan ini secara eksplisit.
2. Prompt caching. Cache hit umumnya ditagih hanya 10% dari tarif input normal. Untuk aplikasi dengan system prompt panjang yang berulang, ini penghematan terbesar yang bisa Anda dapat tanpa mengganti model.
3. Batch API. Diskon 50% untuk pekerjaan yang tidak butuh jawaban seketika. Sangat cocok untuk pemrosesan dokumen, evaluasi, dan pembuatan konten terjadwal.
4. Tokenizer yang berbeda. Model Claude generasi terbaru memakai tokenizer yang menghasilkan sekitar 30% lebih banyak token untuk teks yang sama. Harga per token yang lebih murah tidak otomatis berarti tagihan lebih murah — ukur token dengan tokenizer model yang benar-benar Anda pakai.
5. Token berpikir. Pada Gemini, token penalaran dihitung sebagai output dan ditagih dengan tarif output. Tagihan Anda akan lebih tinggi dari yang tertera di tabel.
Bonus jebakan: DeepSeek sejak 16 Agustus 2026 menerapkan tarif jam sibuk. V4-Pro di jam sibuk menjadi 1,32 / 3,96, dua kali lipat tarif off-peak. Kalau job batch Anda kebetulan jalan di jendela tersebut, biayanya berlipat tanpa ada perubahan kode.
Simulasi: 1.000 request
Asumsikan satu request berisi 4.000 token input dan menghasilkan 800 token output — profil khas asisten dokumen atau ringkasan. Untuk 1.000 request, totalnya 4 juta token input dan 800 ribu token output.
| Model | Biaya per 1.000 request |
|---|---|
| Claude Fable 5 | $80,00 |
| GPT-5.6 Sol | $44,00 |
| Claude Opus 5 | $40,00 |
| GPT-5.6 Terra | $17,60 |
| Gemini 3.1 Pro | $17,60 |
| Claude Sonnet 5 (intro) | $16,00 |
| Grok 4.5 | $12,80 |
| GLM 5.2 | $9,12 |
| Claude Haiku 4.5 | $8,00 |
| Gemini 3.6 Flash | $6,00 |
| DeepSeek V4-Pro (off-peak) | $4,22 |
| GPT-5.6 Luna | $1,76 |
| Gemini 2.5 Flash-Lite | $0,72 |
Rentangnya lebih dari 100 kali lipat untuk pekerjaan yang sama. Pada volume 100 ribu request per bulan, selisih antara Fable 5 dan Flash-Lite adalah sekitar $8.000 versus $72.
Tentu saja kualitas jawabannya tidak sama. Poinnya bukan "pilih yang termurah", tapi bahwa memakai model frontier untuk tugas yang bisa diselesaikan model kelas ringan adalah pemborosan yang mudah dihindari.
Strategi menekan biaya
- Routing bertingkat. Pakai model murah sebagai lapisan pertama untuk klasifikasi dan tugas sederhana, eskalasi ke model mahal hanya ketika benar-benar perlu. Ini pengungkit terbesar, jauh melebihi tawar-menawar tarif.
- Batasi output secara agresif. Set
max_tokenssesuai kebutuhan riil dan minta format ringkas di prompt. Karena output 2-6 kali lebih mahal, ini berdampak langsung. - Pindahkan kerja ke sisi input. Prompt yang lebih tegas dan terstruktur sering menghasilkan jawaban lebih pendek — hemat dua kali.
- Aktifkan caching untuk system prompt. Nyaris selalu menguntungkan kalau prompt dasar Anda panjang dan tetap.
- Pisahkan beban kerja yang bisa asinkron ke Batch API atau jendela off-peak.
- Ukur, jangan asumsikan. Jalankan 100 request nyata di dua atau tiga kandidat model, catat token aktual dan kualitas hasilnya, baru putuskan.
Penutup
Matriks di atas adalah potret per Agustus 2026, dan potret ini cepat basi. Dalam beberapa bulan terakhir saja OpenAI memangkas tarif dua tier, Google memperpanjang harga perkenalan, DeepSeek memperkenalkan tarif jam sibuk, dan Anthropic menjadwalkan berakhirnya harga promo Sonnet 5.
Karena itu, perlakukan tabel ini sebagai titik awal untuk menyusun daftar pendek, bukan sebagai sumber kebenaran final. Sebelum menandatangani anggaran, verifikasi ke halaman harga resmi masing-masing penyedia dan hitung ulang dengan profil token aplikasi Anda sendiri.
Post Terkait
Perang AI 2026: Ulasan Lengkap dan Matriks Perbandingan Semua Platform
Perang AI 2026 bukan lagi cuma soal model mana yang paling pintar. Pertarungannya pecah jadi lima front sekaligus: valua...
Suno Pro 2026: Fitur Terbaru, Batas Download Baru, dan Deretan Isu yang Wajib Anda Tahu
Suno Pro tumbuh pesat dengan model v5.5 yang makin meyakinkan, tapi belakangan diguncang tiga isu besar: batas download...
DeepSeek Terbaru 2026: V4-Pro Resmi GA, Reasoning Effort, dan Harga Peak/Off-Peak
DeepSeek menaikkan V4-Pro ke status GA lewat checkpoint 0813, lengkap dengan kontrol reasoning effort, DSpark speculativ...