Self-Hosting Model dengan Ollama
Menjalankan model AI di komputermu sendiri dengan Ollama: instalasi, memilih model, dan kapan lokal lebih baik.
Kenapa Menjalankan AI di Komputer Sendiri
Semua AI yang kita bahas sejauh ini berjalan di server orang lain (cloud): datamu dikirim ke sana, kamu bayar per pakai, dan butuh internet. Self-hosting membalik itu: model AI berjalan di komputermu sendiri. Keuntungannya tiga: (1) privasi total: tidak ada data keluar, cocok untuk kode rahasia; (2) gratis selamanya: tidak ada tagihan per token; (3) offline: jalan tanpa internet.
Harganya: butuh hardware yang kuat (RAM/VRAM besar), kualitas di bawah model raksasa cloud untuk tugas tersulit, dan kamu yang mengurus semuanya. Ollama (ollama.com) membuat self-hosting semudah install aplikasi: ia mengurus download model, optimasi hardware, dan menyediakan API lokal.
Contoh 1: Instalasi dan Pemakaian Harian (Praktik)
# 1. Download dan install dari ollama.com (Windows/Mac/Linux)
# 2. Unduh model (contoh: llama3.1 8B, butuh ~5GB disk, ~8GB RAM)
ollama pull llama3.1
# 3. Chat langsung di terminal
ollama run llama3.1
# 4. Lihat model yang terinstall
ollama list
# 5. Hapus model yang tidak dipakai
ollama rm nama-modelSetelah ollama run, kamu chat seperti biasa di terminal. Coba tugas coding ringan: "buatkan fungsi Python untuk membaca CSV". Untuk model 8B, hasilnya cukup bagus untuk tugas sehari-hari.
Memilih model: nama model + angka parameter (8B, 70B) = ukuran/kepintaran. Aturan RAM: butuh kira-kira 1GB RAM per 1B parameter (8B ~ 8GB RAM). Varian "instruct" untuk chat/instruksi, varian "code" (misal codellama, qwen-coder) untuk coding. Mulai dari yang kecil (7B-8B); naik kalau hasilnya kurang.
Contoh 2: Ollama sebagai Backend untuk Tools-mu (Praktik)
Kekuatan sebenarnya: Ollama menyediakan API lokal yang kompatibel dengan format OpenAI di http://localhost:11434. Artinya tools yang biasa bicara ke OpenAI bisa dialihkan ke model lokalmu tanpa ubah kode:
# Contoh: pakai via curl seperti API OpenAI
curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "llama3.1",
"messages": [{"role": "user", "content": "Jelaskan apa itu API"}]
}'Pola pakai nyata:
- OpenCode + Ollama: coding agent gratis 100% (modul opencode), cocok untuk latihan tanpa biaya.
- RAG lokal: embedding + LLM lokal = chatbot dokumen yang datanya tidak pernah keluar dari komputermu.
- Eksperimen prompt: uji prompt ratusan kali tanpa khawatir tagihan (modul prompt-versioning).
Kapan TETAP pakai cloud? Tugas yang butuh penalaran terdalam (arsitektur kompleks, debug sulit), model dengan context window raksasa, atau saat hardware-mu tidak cukup. Strategi profesional: lokal untuk 80% tugas rutin, cloud untuk 20% tugas berat. Ini juga pola hemat biaya terbaik.
Catatan teknis: Ollama memakai format GGUF (model terkuantisasi: presisi angka diturunkan agar muat di RAM biasa, misal Q4 = 4-bit). Kuantisasi sedikit menurunkan kualitas tapi drastis menurunkan kebutuhan memori: model 8B yang aslinya butuh 16GB+ bisa jalan di 8GB RAM versi Q4. Untuk GPU NVIDIA, Ollama otomatis memakai akselerasi GPU (jauh lebih cepat dari CPU). Istilah penting: VRAM (RAM khusus GPU) adalah yang paling menentukan kecepatan; context window model lokal biasanya lebih kecil (4K-32K); dan throughput diukur token/detik (20+ tok/s terasa lancar untuk chat). Cek juga lisensi model: tidak semua model bebas untuk komersial (Llama punya syarat khusus).
Kesalahan Umum
- Download model terbesar yang muat. Model 70B yang jalan 2 token/detik = tidak usable. Pilih yang berjalan LANCAR di hardware-mu, bukan yang terbesar yang bisa di-install.
- Membandingkan langsung dengan GPT-4. Kecewa "kok bodoh". Bandingkan yang adil: model lokal 8B vs tugas yang sesuai kelasnya. Untuk draf, boilerplate, dan Q&A dokumen, ia sangat mumpuni.
- Lupa update. Model open source berkembang cepat; versi 6 bulan lalu bisa jauh tertinggal. Cek pembaruan berkala (
ollama pullulang untuk versi terbaru). - Menaruh secret di prompt lokal lalu santai. Memang tidak keluar dari komputermu, TAPI riwayat chat tersimpan lokal dan model tidak "lupa". Untuk secret, tetap jangan dimasukkan ke mana pun.
Rangkuman
Ollama = cara termudah self-hosting: install, pull model, jalan offline gratis. Pilih model sesuai RAM (1GB per 1B parameter), manfaatkan API lokalnya untuk agent dan RAG privat, dan pakai strategi 80/20 (lokal untuk rutin, cloud untuk berat). Privasi total dan gratis selamanya adalah keuntungan yang sulit dikalahkan untuk latihan dan data sensitif.
Tantangan
Instalasi dan Benchmark Mini
Install Ollama, pull satu model kecil (7B-8B). Uji dengan 3 tugas: (1) jelaskan konsep coding, (2) buatkan fungsi sederhana, (3) pertanyaan penalaran sulit. Nilai tiap tugas 1-5. Bandingkan dengan AI cloud favoritmu untuk tugas yang sama. Untuk tugas apa model lokal sudah cukup?