Token dan Context Window
Memahami unit terkecil bahasa AI (token) dan batas ingatan percakapan (context window), fondasi untuk semua teknik lanjutan.
Analogi: Lego Kata dan Papan Tulis
Bayangkan AI membaca teks bukan sebagai kata utuh, melainkan sebagai potongan Lego kecil bernama token. Kata "belajar" mungkin 1 token, tapi kata "pembelajaran" bisa pecah jadi 3 token: "pem", "belajar", "an". Bahasa Inggris rata-rata 1 token = 4 karakter, bahasa Indonesia sedikit lebih boros karena model lebih banyak dilatih dengan bahasa Inggris.
Lalu bayangkan AI punya papan tulis (context window) tempat ia menaruh semua token percakapan: prompt-mu, jawabannya, riwayat chat. Papan tulis ini ukurannya terbatas. Kalau penuh, tulisan paling lama terhapus. Itulah kenapa AI "lupa" awal percakapan yang sangat panjang.
Dua konsep ini menjelaskan hampir semua batasan praktis AI: kenapa ada biaya per token, kenapa konteks panjang bikin jawaban menurun, dan kenapa kamu harus hemat kata.
Kenapa Ini Penting Buat Kamu
Setiap teknik lanjutan di track ini (RAG, agent, prompt chaining) pada dasarnya adalah manajemen token dan context window. Tanpa paham ini, kamu akan: kaget tagihan API membengkak, frustrasi AI "lupa" instruksi, atau tempel kode raksasa lalu heran kenapa jawabannya ngawur. Dengan paham ini, kamu bisa memperkirakan biaya, merancang prompt yang efisien, dan tahu kapan harus memecah pekerjaan.
Contoh 1: Menghitung Token Sendiri (Praktik)
Kamu tidak perlu tools khusus untuk intuisi dasar. Aturan praktis:
- Bahasa Inggris: ~4 karakter = 1 token. Paragraf 100 kata = ~130 token.
- Bahasa Indonesia: ~3 karakter = 1 token (lebih boros). Paragraf 100 kata = ~180 token.
- Kode program: simbol dan indentasi memakan token ekstra. 50 baris kode JS = ~800-1200 token.
Latihan: buka tokenizer online gratis (misal tiktokenizer), tempel 1 paragraf tulisanmu, lihat jumlah tokennya. Lalu tempel 50 baris kodemu, bandingkan. Kamu akan kaget betapa "mahal" kode dalam token. Pelajaran langsung: jangan tempel seluruh file 1000 baris ke AI (modul context-engineering menjelaskan kenapa, ini angka di baliknya).
Implikasi biaya: model API menagih per 1 juta token. Prompt 2000 token + jawaban 500 token ke model Rp150/1jt token = Rp375 per pertanyaan. Kecil sekali, tapi kalau agent menjalankan 100 putaran dengan konteks 50 ribu token tiap putaran, tagihannya jadi puluhan ribu per tugas. Modul budgeting-token membahas ini mendalam.
Contoh 2: Merasakan Context Window Penuh (Eksperimen)
Lakukan eksperimen ini di AI chat gratis mana pun:
- Di awal chat, tulis: "Ingat baik-baik: kata sandiku adalah MANGGA. Aku akan bertanya lagi nanti."
- Lanjutkan percakapan panjang: minta ia menjelaskan 5 konsep pemrograman, satu per satu, dengan penjelasan panjang.
- Setelah ~15-20 pesan panjang, tanya: "apa kata sandi yang tadi aku berikan?"
Ada kemungkinan ia lupa atau mengarang. Itu bukan bug, itu context window yang kepenuhan: informasi lama terdorong keluar (atau "tenggelam" di tengah konteks panjang, fenomena lost in the middle). Pelajaran praktisnya:
- Taruh instruksi penting di awal DAN ulangi saat dibutuhkan, jangan andalkan ia ingat dari 50 pesan lalu.
- Untuk tugas panjang, ringkas progres secara berkala: "ringkas apa yang sudah kita capai dalam 5 bullet, kita lanjut di chat baru dengan ringkasan ini."
- Satu chat = satu topik (aturan dari modul context-engineering, ini alasan teknisnya).
Catatan teknis: Ukuran context window bervariasi: model kecil 8K-32K token, model besar modern 128K-1M token. Tapi riset konsisten menunjukkan akurasi menurun untuk informasi di tengah konteks sangat panjang, bahkan di model 1M token. Jadi window besar bukan izin untuk tempel semuanya. Teknik profesional: kompresi konteks (ringkasan progres), retrieval (ambil yang relevan saja, modul rag-gambaran), dan struktur (taruh instruksi penting di awal/akhir, bukan terkubur di tengah).
Kesalahan Umum Pemula
- Mengira AI ingat selamanya. Tidak. Ia ingat selama masih muat di papan tulis. Percakapan kemarin = sudah hilang (kecuali fitur memori khusus yang menyimpan ringkasan).
- Menempel terlalu banyak "biar aman". "Biar AI paham, aku tempel semua file." Hasilnya: mahal, lambat, dan jawaban menurun. Relevansi > kuantitas, selalu.
- Tidak tahu model yang dipakai punya window berapa. Cek di dokumentasi/OpenRouter sebelum merancang workflow. Merancang untuk 128K lalu jalan di model 8K = error di tengah jalan.
- Mengabaikan token output. Biaya output biasanya 2-4x lebih mahal dari input per token. "Jelaskan sedetail mungkin" untuk 50 pertanyaan = boros. Minta ringkas kecuali butuh detail.
Rangkuman
Token = potongan kecil bahasa, unit biaya dan ingatan AI. Context window = papan tulis terbatas tempat percakapan ditulis; kalau penuh, yang lama hilang. Pahami keduanya dan kamu bisa: memperkirakan biaya, merancang prompt efisien, dan mencegah AI "lupa". Ini fondasi yang membuat semua modul lanjutan terasa masuk akal.
Tantangan
Audit Token
Ambil satu prompt panjang yang pernah kamu kirim ke AI (atau tulis yang baru, ~300 kata). Hitung perkiraan tokennya dengan aturan 3 karakter = 1 token untuk Indonesia. Lalu tulis ulang prompt itu menjadi setengah panjang tanpa menghilangkan informasi penting. Bandingkan: informasi apa yang ternyata tidak perlu?