vLLM: Menjalankan Model Besar
Gambaran vLLM untuk menjalankan model besar secara efisien: kapan dibutuhkan dan konsep kuncinya.
Masalah: Model Besar Itu Lambat dan Mahal
Ollama hebat untuk model kecil di laptop. Tapi bagaimana kalau kamu butuh model 70B untuk tim, atau melayani ratusan request per detik? Model besar butuh GPU mahal, dan cara menjalankannya yang naif boros memori dan lambat. vLLM adalah library open source yang menjalankan LLM besar secara JAUH lebih efisien: throughput bisa belasan kali lipat dibanding cara biasa, dengan hardware yang sama.
Posisinya: Ollama = gampang untuk pribadi; vLLM = serius untuk server/tim/produk. Kamu tidak wajib memakainya sekarang, tapi pahami konsepnya agar tahu apa yang terjadi "di balik" API AI yang kamu pakai.
Contoh 1: Memahami Masalah yang Dipecahkan (Konsep)
Bayangkan restoran: koki (GPU) memasak, pelayan mengantar. Cara naif: setiap pesanan dimasak sendiri-sendiri dari nol, bahan (memori) disiapkan berlebihan "buat jaga-jaga", banyak yang terbuang. vLLM seperti manajer restoran jenius yang:
- PagedAttention: mengelola "memori perhatian" model seperti sistem operasi mengelola RAM: alokasi dinamis, tidak ada yang terbuang. Hasil: memori yang sama bisa melayani JAUH lebih banyak request bersamaan.
- Continuous batching: tidak menunggu satu batch selesai; request baru langsung disisipkan ke antrean yang sedang berjalan. Hasil: GPU tidak pernah menganggur, latensi turun.
- Kuantisasi + optimasi kernel: versi model yang dioptimasi untuk hardware spesifik tanpa mengorbankan banyak kualitas.
Angka kasarnya: untuk model yang sama di GPU yang sama, vLLM bisa melayani 10-20x lebih banyak request per detik dibanding server naif (seperti HuggingFace Transformers biasa). Inilah kenapa hampir semua provider API murah memakai vLLM (atau yang sejenis) di belakang layar.
Contoh 2: Kapan Kamu Butuh Ini (Keputusan Praktis)
Jujur: 95% pembaca modul ini TIDAK butuh vLLM langsung. Tapi pahami pemicunya agar tahu kapan naik kelas:
Tetap di Ollama/API kalau: pemakaian pribadi, request sesekali, model <= 30B cukup. Jangan over-engineering.
Pertimbangkan vLLM kalau:
- Tim/produk butuh model privat (data tidak boleh ke cloud) dengan BANYAK user.
- Kamu membayar API mahal dan volume tinggi: self-hosting dengan vLLM bisa 5-10x lebih murah per token pada skala tertentu.
- Butuh latensi rendah + throughput tinggi (misal: fitur AI real-time di aplikasi).
Gambaran menjalankan (konsep, bukan tutorial instalasi):
# Konsepnya sesederhana ini (butuh GPU NVIDIA + Linux):
vllm serve NousResearch/Hermes-3-Llama-3.1-8B
# Lalu API OpenAI-compatible tersedia di localhost:8000Setelah jalan, semua tools yang bicara format OpenAI (OpenCode, aplikasi RAG-mu, dsb) bisa diarahkan ke server ini. Kamu mendapat "OpenAI pribadi": API cepat, privat, tanpa tagihan per token (tapi bayar GPU-nya).
Catatan teknis: vLLM adalah salah satu dari beberapa "inference engine" (pesaing: TensorRT-LLM dari NVIDIA, TGI dari HuggingFace, llama.cpp untuk CPU/kecil). Pilih berdasarkan: hardware (NVIDIA? AMD? CPU?), ukuran model, dan kebutuhan fitur (function calling, structured output, multimodal: tidak semua engine mendukung semua). Istilah penting: throughput (token/detik total) vs latency (waktu sampai token pertama, penting untuk chat interaktif); KV cache (memori yang menyimpan "ingatan" percakapan sedang berjalan: inilah yang dioptimasi PagedAttention); quantization (GPTQ/AWQ: versi model terkompresi agar muat di GPU lebih kecil). Untuk memulai serius, awali dari dokumentasi vLLM + kalkulator kebutuhan VRAM agar tidak salah beli/sewa GPU.
Kesalahan Umum
- Langsung ke vLLM untuk belajar. Seperti belajar nyetir langsung pakai truk tronton. Kuasai Ollama + API dulu; vLLM saat ada kebutuhan nyata.
- Salah hitung kebutuhan VRAM. Model 70B butuh ~140GB VRAM versi full (atau ~40GB versi kuantisasi): butuh GPU kelas data center, bukan RTX gaming biasa. Hitung dulu sebelum sewa/beli.
- Mengabaikan total cost. "Gratis per token!" tapi sewa GPU Rp50 ribu/jam x 24 jam = Rp36 juta/bulan. Bandingkan jujur dengan biaya API untuk volumenya.
- Lupa maintenance. Server AI butuh monitoring, update model, handling error. Ini pekerjaan operasional nyata, bukan sekali install.
Rangkuman
vLLM = mesin pelayan model besar yang efisien (PagedAttention + continuous batching = throughput belasan kali lipat). Kamu kemungkinan belum butuhnya sekarang, tapi pahami konsepnya: inilah yang berjalan di balik API murah, dan inilah jalanmu saat butuh AI privat berskala. Naik kelas saat pemicunya nyata: volume tinggi, butuh privat, dan hitungan biaya mendukung.
Tantangan
Hitung Kapan Self-Hosting Worth It
Asumsikan kamu memakai API 2 juta token/bulan dengan biaya Rp150/1K token (= Rp300 ribu/bulan). Bandingkan dengan sewa GPU Rp15 ribu/jam yang jalan 8 jam/hari (= Rp3,6 juta/bulan). Di volume berapa self-hosting jadi lebih murah? Tulis perhitungannya dan kesimpulannya.