Fine-Tuning: Gambaran
Melatih ulang model dengan datamu: kapan fine-tuning tepat, kapan RAG/prompt cukup, dan biayanya.
Apa Itu Fine-Tuning
Sejauh ini kita mengubah PERILAKU AI tanpa mengubah MODELnya: lewat prompt, contoh, dan konteks. Fine-tuning naik satu level: melatih ulang model dengan data khusus sehingga perilakunya berubah permanen. Analoginya: prompting = memberi instruksi ke karyawan; fine-tuning = menyekolahkan karyawan dengan kurikulum khusus perusahaanmu.
Hasilnya: model yang "tahu" gaya, format, dan domainmu tanpa perlu contoh panjang di setiap prompt. Contoh: perusahaan dengan 10 ribu tiket support historis men-fine-tune model agar menjawab dengan gaya dan pengetahuan produk mereka secara otomatis.
Contoh 1: Kapan Fine-Tuning Tepat (Kerangka Keputusan)
Fine-tuning mahal (waktu, data, biaya, keahlian). Gunakan kerangka ini sebelum memutuskan:
Pilih PROMPTING kalau: tugas bisa dijelaskan dengan instruksi + contoh, kebutuhan berubah-ubah, data contoh < 50. Ini 90% kasus. Murah, cepat, fleksibel.
Pilih RAG kalau: butuh pengetahuan dari dokumen besar/berubah (modul rag-gambaran). RAG + prompting menyelesaikan masalah "AI tidak tahu dataku" tanpa training.
Pilih FINE-TUNING kalau SEMUA ini benar:
- Pola yang diinginkan KONSISTEN dan dipakai BERULANG (ratusan kali sehari). Contoh: format laporan khusus perusahaan, gaya penulisan brand.
- Prompt + few-shot sudah dicoba tapi: terlalu panjang (boros token), tidak konsisten, atau butuh contoh terlalu banyak.
- Kamu punya 100-1000+ contoh berkualitas baik (input -> output ideal).
- Perilaku yang diinginkan STABIL (tidak berubah tiap minggu; kalau berubah, harus training ulang).
Contoh keputusan: "Bot CS dengan gaya bahasa perusahaan X, dipakai 1000x sehari, gaya stabil" = kandidat fine-tuning. "Bantu aku ngoding akhir pekan ini" = prompting cukup.
Contoh 2: Gambaran Prosesnya (Tanpa Kode Berat)
Alur fine-tuning modern (misal via API OpenAI atau tools open source):
- Siapkan dataset: 100-1000 pasang (prompt, jawaban ideal) dalam format JSONL. Kualitas > kuantitas: 200 contoh bagus mengalahkan 2000 contoh asal-asalan.
- Pilih model dasar: mulai dari model kecil yang bagus (lebih murah, lebih cepat). Fine-tuning model raksasa jarang worth it untuk pemula.
- Training: jalankan proses training (puluhan menit hingga jam). Teknik populer: LoRA (melatih sebagian kecil parameter saja: murah dan cepat, standar untuk open model).
- Evaluasi: uji dengan eval set (modul eval-prompting!) yang TIDAK ada di data training. Bandingkan vs prompt biasa: apakah benar lebih baik?
- Deploy dan monitor: pakai untuk kasusnya, pantau kualitas berkala (model bisa "drift" saat kebutuhan berubah).
Jebakan terbesar: overfitting. Model menghafal data training dan gagal pada input baru yang sedikit berbeda. Gejalanya: skor eval training 100%, tapi di dunia nyata biasa saja. Solusi: data beragam, jangan terlalu banyak epoch, selalu ada eval set terpisah.
Catatan teknis: Fine-tuning TIDAK menambah pengetahuan faktual baru secara andal (model bisa "menghafal" fakta tapi juga bisa mengarang; untuk pengetahuan, RAG lebih tepat). Yang fine-tuning ubah: GAYA, FORMAT, dan PERILAKU (tone, struktur output, kepatuhan instruksi khusus). Karena itu kombinasi profesional modern adalah: RAG untuk pengetahuan + fine-tuning untuk perilaku. Biaya gambaran: via API, training model kecil bisa puluhan-ratusan ribu rupiah; self-training butuh GPU (sewa cloud GPU per jam). Dan satu peringatan: model hasil fine-tuning mewarisi SEMUA kelemahan model dasar (halusinasi, bias) plus risiko baru dari datamu (kalau data training bias/kotor, model ikut bias/kotor).
Kesalahan Umum
- Fine-tuning untuk masalah prompting. "Prompt-ku panjang banget" bukan alasan fine-tuning kalau masalahnya prompt yang berantakan. Rapikan prompt dulu (sering selesai di situ).
- Data training berkualitas buruk. "Pokoknya banyak." Model meniru kualitas datamu: contoh jelek = perilaku jelek permanen. Kurasi ketat.
- Tidak ada baseline. Fine-tuning tanpa membandingkan vs prompt biasa = tidak tahu apakah biayanya worth it. Selalu ada pembanding.
- Mengira sekali jadi. Kebutuhan berubah = training ulang. Fine-tuning adalah komitmen maintenance, bukan proyek sekali jalan.
Rangkuman
Fine-tuning = melatih ulang model dengan datamu agar perilaku (gaya, format) menjadi permanen. Tepat untuk pola stabil yang dipakai berulang dalam skala besar; untuk kebanyakan kasus, prompting + RAG cukup dan jauh lebih murah. Keputusan pakai kerangka 4 syarat, dataset berkualitas, selalu ada eval dan baseline. Ini tools spesialis, bukan palu untuk semua paku.
Tantangan
Keputusan: Fine-Tune atau Tidak?
Ambil 3 skenario: (1) bot yang menjawab FAQ produk dengan gaya brand tertentu, dipakai 500x sehari; (2) asisten pribadi untuk merapikan catatan mingguanmu; (3) penerjemah istilah medis Inggris-Indonesia yang konsisten. Untuk tiap skenario, putuskan dengan kerangka 4 syarat: prompting, RAG, atau fine-tuning? Tulis alasanmu.
Kuis Bab
Uji pemahamanmu: Bab 4: Konteks dan Data
Jawab 5 soal berikut, lalu tekan "Periksa Jawaban".
1.Prinsip utama context engineering yang baik adalah...
2.Alur RAG yang benar adalah...
3.Keunggulan pencarian embedding dibanding pencarian kata kunci adalah...
4.Kapan fine-tuning adalah pilihan yang TEPAT?
5.Kombinasi profesional modern untuk pengetahuan + perilaku adalah...