Chain-of-Thought Mendalam
Memaksa AI berpikir langkah demi langkah: varian CoT, kapan efektif, dan cara memverifikasi penalarannya.
Inti Teknik: Biarkan Ia Berpikir Keras Dulu
Pernah mengerjakan soal matematika dengan "jalan ke bawah"? Menulis langkahnya membuat jawaban akhirmu lebih benar, karena tiap langkah bisa diperiksa. Chain-of-thought (CoT) menerapkan prinsip yang sama ke AI: daripada langsung melompat ke jawaban, suruh ia menuliskan proses berpikirnya langkah demi langkah. Yang mengejutkan: teknik sesederhana "berpikirlah langkah demi langkah" terbukti meningkatkan akurasi secara signifikan pada tugas penalaran (matematika, logika, debugging).
Kenapa ini bekerja sudah dibahas di modul prompting-lanjutan: model menghasilkan kata per kata, jadi "pikiran" yang ditulis menjadi fondasi untuk kata berikutnya. Tanpa CoT, model seperti siswa yang langsung menulis jawaban akhir tanpa coretan: lebih cepat, lebih sering salah.
Contoh 1: CoT Klasik untuk Penalaran (Praktik)
Tugas: menentukan apakah sebuah fungsi rekursif benar.
Prompt tanpa CoT: "Apakah fungsi faktorial rekursif ini benar? [paste kode]" Hasil: "Ya, benar." (atau "Tidak." tanpa alasan yang bisa kamu periksa)
Prompt dengan CoT: "Periksa fungsi faktorial rekursif ini LANGKAH DEMI LANGKAH:
- Tulis apa yang terjadi saat dipanggil dengan n=3 (telusuri tiap pemanggilan)
- Tulis apa yang terjadi dengan n=0 (kasus basis)
- Tulis apa yang terjadi dengan n=-1 (input tidak valid)
- Baru simpulkan: benar atau ada bug, dan di mana. [paste kode]"
Hasilnya: kamu bisa MEMERIKSA tiap langkah penelusurannya. Kalau langkah 2 salah, kamu tahu persis di mana penalaran AI meleset, dan bisa mengoreksi spesifik ("langkah 2-mu salah, untuk n=0 seharusnya..."). Tanpa CoT, kamu hanya dapat vonis tanpa jejak.
Contoh 2: Varian CoT dan Kapan Memakainya
Zero-shot CoT (paling sederhana): tambahkan "berpikirlah langkah demi langkah" ke prompt biasa. Cocok untuk pertanyaan cepat sehari-hari.
Structured CoT (yang dipakai di contoh 1): kamu menentukan LANGKAHNYA secara eksplisit. Cocok untuk tugas yang kamu sudah tahu alur pemeriksaannya (debug, review, verifikasi). Ini yang paling powerful untuk coding.
Self-consistency (varian mahal): minta AI menjawab dengan CoT 3 kali (temperature sedang), lalu ambil jawaban yang paling sering muncul. Cocok untuk keputusan penting yang tidak bisa diverifikasi langsung. Mahal (3x token) tapi meningkatkan keandalan.
CoT terbalik (verifikasi): setelah AI memberi jawaban TANPA CoT, minta: "sekarang periksa jawabanmu sendiri langkah demi langkah, cari kesalahan." Kadang ia menemukan kesalahannya sendiri. Tidak selalu berhasil (model cenderung membenarkan diri), tapi murah untuk dicoba.
Aturan pemilihan: tugas simpel/faktual = tidak perlu CoT (malah bertele-tele). Tugas penalaran (debug, perencanaan, perbandingan, matematika) = CoT. Keputusan kritis = pertimbangkan self-consistency.
Catatan teknis: CoT meningkatkan akurasi tapi juga meningkatkan biaya (lebih banyak token output) dan risiko: penalaran yang SALAH tapi meyakinkan bisa menyesatkanmu lebih dalam daripada jawaban langsung yang salah. Karena itu CoT harus dipasangkan dengan verifikasi langkah: baca jejak penalarannya, bukan cuma kesimpulan akhirnya. Untuk tugas kritis, ada teknik "verifier": model kedua (atau kamu) memeriksa tiap langkah CoT model pertama. Dan catatan penting: CoT yang ditulis model tidak selalu mencerminkan "proses berpikir sebenarnya" (interpretabilitas masih area riset aktif), tapi sebagai alat praktis untuk akurasi dan keterperiksaan, ia sangat berguna.
Kesalahan Umum
- CoT untuk semua hal. "Berpikir langkah demi langkah: apa ibukota Prancis?" = buang token. CoT untuk penalaran, bukan hafalan.
- Tidak membaca jejak penalarannya. Meminta CoT lalu hanya membaca kesimpulan = membuang 90% nilainya. Nilai CoT ada di langkah-langkah yang bisa diperiksa.
- Langkah yang terlalu umum. "Pikirkan langkah demi langkah" kadang kurang; untuk tugas spesifik, tentukan langkahnya eksplisit seperti contoh 1.
- Percaya penalaran yang rapi = benar. Penalaran bisa rapi dan salah. Verifikasi langkah kunci secara independen, terutama yang melibatkan fakta atau perhitungan.
Rangkuman
Chain-of-thought = suruh AI menuliskan langkah berpikirnya sebelum menyimpulkan. Terbukti meningkatkan akurasi tugas penalaran. Varian: zero-shot CoT (cepat), structured CoT (tentukan langkahnya, terbaik untuk coding), self-consistency (mahal tapi andal), CoT terbalik (verifikasi). Selalu baca dan verifikasi jejak langkahnya, bukan cuma kesimpulan.
Tantangan
Debug dengan Structured CoT
Ambil satu bug (nyata atau buatan). Minta AI menganalisis dengan structured CoT 4 langkah: (1) telusuri eksekusi baris per baris, (2) identifikasi 3 titik mencurigakan, (3) untuk tiap titik tulis bukti yang mendukung/menolak, (4) simpulkan. Bandingkan kualitasnya dengan prompt 'kenapa error?' biasa.