Budgeting Token dan Biaya AI
Mengelola biaya AI: membaca harga model, memperkirakan biaya agent, dan strategi hemat yang nyata.
AI Tidak Gratis (Kecuali Kamu Tahu Caranya)
Cepat atau lambat, pemakaian AI serius menyentuh uang: tagihan API, langganan tools, atau sewa GPU. Kabar baik: dengan pemahaman token (modul token-dan-context-window) + strategi di modul ini, kamu bisa memangkas biaya 5-10x tanpa mengorbankan banyak kualitas. Modul ini adalah panduan hemat yang konkret, bukan teori.
Contoh 1: Membaca Harga dan Menghitung (Praktik)
Harga model ditulis per 1 juta token, terpisah input vs output. Contoh (angka ilustrasi, cek harga aktual):
- Model murah: input $0.15/1M, output $0.60/1M
- Model premium: input $3/1M, output $15/1M (20-25x lebih mahal!)
Hitung biaya satu tugas agent: misal agent menyelesaikan tugas dalam 20 putaran, tiap putaran konteks rata-rata 30K token input + 1K token output, pakai model murah:
- Input: 20 x 30.000 = 600.000 token = 0,6M x $0.15 = $0,09
- Output: 20 x 1.000 = 20.000 token = 0,02M x $0,60 = $0,012
- Total: ~$0,10 per tugas (sekitar Rp1.600)
Dengan model premium untuk tugas yang sama: ~$2,50 (Rp40 ribu) per tugas! Pelajaran pertama: pilih model sesuai kesulitan tugas. Tugas rutin = model murah. Hanya eskalasi ke premium saat model murah gagal (dan verifikasi dulu bahwa gagalnya karena model, bukan karena prompt yang buruk).
Contoh 2: 7 Strategi Hemat Nyata (Praktik)
- Konteks ramping. Konteks 100K token vs 10K token = 10x biaya per putaran. Potong yang tidak relevan (modul context-engineering). Ini penghematan TERBESAR.
- Model bertingkat (routing). Aturan: mulai dengan model murah; hanya eskalasi ke mahal jika hasil gagal 2x. Banyak tools mendukung ini otomatis.
- Cache prompt. Untuk system prompt/instruksi yang sama diulang ribuan kali (bot CS), fitur prompt caching provider (misal Anthropic) memangkas biaya input berulang hingga 90%.
- Batasi putaran agent. "Maksimal 15 langkah" mencegah agent berputar-putar menghabiskan token. Setiap putaran = ribuan token.
- Batch dan ringkas. Daripada 100 request kecil (tiap request mengulang system prompt), gabungkan jadi 10 request besar.
- Lokal untuk eksperimen. Uji prompt 200x dengan Ollama (gratis), baru validasi final 5x dengan model cloud. Modul self-hosting-ollama.
- Monitor dan budget. Pasang batas spending di dashboard SEJAK HARI PERTAMA. Review tagihan mingguan: tugas apa yang paling mahal? Seringkali 1-2 pola boros yang bisa diperbaiki.
Catatan teknis: Struktur biaya AI: (a) per token (API): bayar sesuai pakai, cocok untuk volume fluktuatif; (b) langganan (ChatGPT Plus, Copilot): flat per bulan, cocok untuk pemakaian personal intensif (hitung titik impasnya vs API!); (c) infrastruktur (GPU): biaya tetap tinggi, cocok untuk volume sangat besar atau butuh privat (modul vllm-gambaran). Jebakan tersembunyi: output token (2-4x harga input: minta jawaban ringkas!), gambar/audio (token gambar mahal), agent loop panjang (biaya = putaran x konteks: dua-duanya dioptimasi), dan retry (setiap "coba lagi" = bayar lagi; perbaiki prompt daripada spam retry). Untuk tim/produk: alokasikan budget per fitur, bukan per orang, agar terlihat fitur mana yang boros.
Kesalahan Umum
- Tidak memasang batas spending. Tagihan kejutan ratusan ribu dari agent yang "rajin" semalaman adalah cerita horor yang umum. Batas dulu, pakai kemudian.
- Satu API key untuk semua. Key bocor/terpakai berlebihan = tagihan tak terkendali. Key terpisah per proyek dengan limit masing-masing.
- Premium untuk semuanya. "Biar bagus." 80% tugas tidak butuh premium. Uji buta: bisakah kamu bedakan hasil model murah vs mahal untuk tugasmu? Kalau tidak, pakai yang murah.
- Mengabaikan biaya waktu. Kadang "hemat" token tapi boros waktu (menunggu model lambat, memperbaiki output jelek). Hitung total: biaya token + nilai waktumu.
Rangkuman
Biaya AI terkendali dengan: pilih model sesuai kesulitan (murah dulu, eskalasi bila perlu), rampingkan konteks (penghematan terbesar), batasi putaran agent, manfaatkan caching dan lokal untuk eksperimen, dan pasang budget sejak hari pertama. Prinsipnya: bayar untuk KECERDASAN yang kamu butuhkan, bukan untuk token yang terbuang.
Tantangan
Audit Biaya Mingguan
Selama seminggu, catat pemakaian AI-mu: tools apa, perkiraan token/request, dan biaya (atau 0 jika gratis). Di akhir minggu hitung total. Lalu identifikasi 1 pola boros (misal: retry berulang, konteks raksasa) dan 1 strategi hemat dari modul ini untuk mengatasinya. Terapkan minggu berikutnya dan bandingkan.