Menjalankan Large Language Model (LLM) secara lokal memberikan kontrol penuh atas privasi data, menghilangkan biaya API, dan memungkinkan kustomisasi sesuai kebutuhan infra Anda. Ollama adalah salah satu tool CLI paling efisien saat ini untuk mengelola dan menjalankan model AI open-source di lingkungan Linux.
Prasyarat
Sebelum memulai, pastikan sistem Anda memenuhi spesifikasi berikut:
- System OS: Ubuntu 24.04 LTS
- RAM: Minimal 8 GB (direkomendasikan 16 GB+ untuk model 8B)
- GPU: Nvidia GPU dengan CUDA support (opsional, tetapi sangat direkomendasikan untuk inferensi cepat)
- Akses sudo dan cURL terinstal
Peringatan Keamanan: Secara bawaan, daemon Ollama hanya mendengarkan koneksi dari 127.0.0.1 (localhost). Jika Anda mengonfigurasi OLLAMA_HOST ke 0.0.0.0 untuk diakses eksternal, pastikan menggunakan UFW firewall atau Reverse Proxy (seperti Nginx) dengan autentikasi ketat.
1. Instalasi Ollama CLI
Jalankan skrip instalasi resmi Ollama untuk Linux:
curl -fsSL https://ollama.com/install.sh | sh
Skrip ini akan otomatis mendownload biner Ollama dan mengonfigurasi systemd service.
2. Verifikasi Status Layanan
Pastikan service Ollama berjalan otomatis saat boot:
sudo systemctl status ollama
Cek versi Ollama yang terpasang:
ollama --version
3. Menjalankan Model AI (Llama 3 / Mistral)
Untuk mendownload dan langsung masuk ke sesi interaktif CLI Llama 3:
ollama run llama3
Jika Anda lebih memilih model Mistral:
ollama run mistral
Ketik pesan di prompt CLI yang muncul. Ketik /bye untuk keluar dari CLI.
4. Manajemen Model Ollama
Melihat daftar model yang sudah terunduh di sistem:
ollama list
Mendownload model tanpa langsung menjalankannya:
ollama pull llama3
Menghapus model yang tidak lagi digunakan untuk menghemat ruang penyimpanan:
ollama rm llama3
5. Mengonsumsi REST API Lokal
Ollama menyediakan HTTP API bawaan di port 11434 yang siap diintegrasikan ke aplikasi Next.js, Python, atau cURL.
Generate Completion API
curl http://localhost:11434/api/generate -d '{"model": "llama3", "prompt": "Jelaskan apa itu Docker secara singkat", "stream": false}'
Chat Completion API
curl http://localhost:11434/api/chat -d '{"model": "llama3", "messages": [{"role": "user", "content": "Halo!"}], "stream": false}'
6. Konfigurasi Environment & Listener Port
Jika ingin mengubah variabel lingkungan seperti lokasi penyimpanan model atau IP binding, edit override file systemd:
sudo systemctl edit ollama
Tambahkan konfigurasi berikut di dalam file override:
[Service] Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_NUM_PARALLEL=2"
Simpan file, lalu muat ulang daemon systemd dan restart service:
sudo systemctl daemon-reload sudo systemctl restart ollama
Rangkuman Checklist
- Ollama CLI terinstal di Ubuntu 24.04
- Layanan systemd aktif dan berjalan
- Model Llama 3 / Mistral berhasil di-pull
- REST API lokal merespons request HTTP
- Pengaturan binding IP dan firewall terkonfigurasi aman
