AIfine-tuningmahirMahir4 mnt baca

Fine-Tuning: Gambaran

Melatih ulang model dengan datamu: kapan fine-tuning tepat, kapan RAG/prompt cukup, dan biayanya.

Apa Itu Fine-Tuning

Sejauh ini kita mengubah PERILAKU AI tanpa mengubah MODELnya: lewat prompt, contoh, dan konteks. Fine-tuning naik satu level: melatih ulang model dengan data khusus sehingga perilakunya berubah permanen. Analoginya: prompting = memberi instruksi ke karyawan; fine-tuning = menyekolahkan karyawan dengan kurikulum khusus perusahaanmu.

Hasilnya: model yang "tahu" gaya, format, dan domainmu tanpa perlu contoh panjang di setiap prompt. Contoh: perusahaan dengan 10 ribu tiket support historis men-fine-tune model agar menjawab dengan gaya dan pengetahuan produk mereka secara otomatis.

Contoh 1: Kapan Fine-Tuning Tepat (Kerangka Keputusan)

Fine-tuning mahal (waktu, data, biaya, keahlian). Gunakan kerangka ini sebelum memutuskan:

Pilih PROMPTING kalau: tugas bisa dijelaskan dengan instruksi + contoh, kebutuhan berubah-ubah, data contoh < 50. Ini 90% kasus. Murah, cepat, fleksibel.

Pilih RAG kalau: butuh pengetahuan dari dokumen besar/berubah (modul rag-gambaran). RAG + prompting menyelesaikan masalah "AI tidak tahu dataku" tanpa training.

Pilih FINE-TUNING kalau SEMUA ini benar:

  1. Pola yang diinginkan KONSISTEN dan dipakai BERULANG (ratusan kali sehari). Contoh: format laporan khusus perusahaan, gaya penulisan brand.
  2. Prompt + few-shot sudah dicoba tapi: terlalu panjang (boros token), tidak konsisten, atau butuh contoh terlalu banyak.
  3. Kamu punya 100-1000+ contoh berkualitas baik (input -> output ideal).
  4. Perilaku yang diinginkan STABIL (tidak berubah tiap minggu; kalau berubah, harus training ulang).

Contoh keputusan: "Bot CS dengan gaya bahasa perusahaan X, dipakai 1000x sehari, gaya stabil" = kandidat fine-tuning. "Bantu aku ngoding akhir pekan ini" = prompting cukup.

Contoh 2: Gambaran Prosesnya (Tanpa Kode Berat)

Alur fine-tuning modern (misal via API OpenAI atau tools open source):

  1. Siapkan dataset: 100-1000 pasang (prompt, jawaban ideal) dalam format JSONL. Kualitas > kuantitas: 200 contoh bagus mengalahkan 2000 contoh asal-asalan.
  2. Pilih model dasar: mulai dari model kecil yang bagus (lebih murah, lebih cepat). Fine-tuning model raksasa jarang worth it untuk pemula.
  3. Training: jalankan proses training (puluhan menit hingga jam). Teknik populer: LoRA (melatih sebagian kecil parameter saja: murah dan cepat, standar untuk open model).
  4. Evaluasi: uji dengan eval set (modul eval-prompting!) yang TIDAK ada di data training. Bandingkan vs prompt biasa: apakah benar lebih baik?
  5. Deploy dan monitor: pakai untuk kasusnya, pantau kualitas berkala (model bisa "drift" saat kebutuhan berubah).

Jebakan terbesar: overfitting. Model menghafal data training dan gagal pada input baru yang sedikit berbeda. Gejalanya: skor eval training 100%, tapi di dunia nyata biasa saja. Solusi: data beragam, jangan terlalu banyak epoch, selalu ada eval set terpisah.

Catatan teknis: Fine-tuning TIDAK menambah pengetahuan faktual baru secara andal (model bisa "menghafal" fakta tapi juga bisa mengarang; untuk pengetahuan, RAG lebih tepat). Yang fine-tuning ubah: GAYA, FORMAT, dan PERILAKU (tone, struktur output, kepatuhan instruksi khusus). Karena itu kombinasi profesional modern adalah: RAG untuk pengetahuan + fine-tuning untuk perilaku. Biaya gambaran: via API, training model kecil bisa puluhan-ratusan ribu rupiah; self-training butuh GPU (sewa cloud GPU per jam). Dan satu peringatan: model hasil fine-tuning mewarisi SEMUA kelemahan model dasar (halusinasi, bias) plus risiko baru dari datamu (kalau data training bias/kotor, model ikut bias/kotor).

Kesalahan Umum

  1. Fine-tuning untuk masalah prompting. "Prompt-ku panjang banget" bukan alasan fine-tuning kalau masalahnya prompt yang berantakan. Rapikan prompt dulu (sering selesai di situ).
  2. Data training berkualitas buruk. "Pokoknya banyak." Model meniru kualitas datamu: contoh jelek = perilaku jelek permanen. Kurasi ketat.
  3. Tidak ada baseline. Fine-tuning tanpa membandingkan vs prompt biasa = tidak tahu apakah biayanya worth it. Selalu ada pembanding.
  4. Mengira sekali jadi. Kebutuhan berubah = training ulang. Fine-tuning adalah komitmen maintenance, bukan proyek sekali jalan.

Rangkuman

Fine-tuning = melatih ulang model dengan datamu agar perilaku (gaya, format) menjadi permanen. Tepat untuk pola stabil yang dipakai berulang dalam skala besar; untuk kebanyakan kasus, prompting + RAG cukup dan jauh lebih murah. Keputusan pakai kerangka 4 syarat, dataset berkualitas, selalu ada eval dan baseline. Ini tools spesialis, bukan palu untuk semua paku.

Tantangan

Keputusan: Fine-Tune atau Tidak?

Ambil 3 skenario: (1) bot yang menjawab FAQ produk dengan gaya brand tertentu, dipakai 500x sehari; (2) asisten pribadi untuk merapikan catatan mingguanmu; (3) penerjemah istilah medis Inggris-Indonesia yang konsisten. Untuk tiap skenario, putuskan dengan kerangka 4 syarat: prompting, RAG, atau fine-tuning? Tulis alasanmu.

Kuis Bab

Uji pemahamanmu: Bab 4: Konteks dan Data

Jawab 5 soal berikut, lalu tekan "Periksa Jawaban".

1.Prinsip utama context engineering yang baik adalah...

2.Alur RAG yang benar adalah...

3.Keunggulan pencarian embedding dibanding pencarian kata kunci adalah...

4.Kapan fine-tuning adalah pilihan yang TEPAT?

5.Kombinasi profesional modern untuk pengetahuan + perilaku adalah...