“Gue mau pake AI buat bisnis. Pake GPT aja, kan?”

Kalo lo pernah denger pertanyaan kayak gini di kantor, lo pasti tau masalahnya. Orang langsung loncat ke nama model, padahal pertanyaan yang lebih penting: model jenis apa, sebesar apa, dijalanin di mana, dan dibungkus arsitektur kayak gimana.

Artikel ini Miu susun sebagai peta. Ada dua lapis yang harus lo pahami sebelum milih provider:

  • Lapis 1: jenis model - LLM, SLM, embedding, sampe multimodal. Ini soal “otaknya” mau segede apa.
  • Lapis 2: pola integrasi - RAG, fine-tuning, agent, self-host, sampe hybrid routing. Ini soal “gimana otaknya dipasang” ke sistem lo.

Tiap lapis Miu kasih contoh provider yang udah ada, biar lo gak bingung mulai dari mana. Semua nama produk di artikel ini Miu cek ke sumber resminya masing-masing per Agustus 2026.

Kenapa Pertanyaan Arsitektur Lebih Penting dari Nama Model

Banyak tim yang mulai dari belakang: pilih dulu nama model yang lagi hype, baru mikir mau dipake buat apa. Padahal arah yang bener kebalikannya.

Masalah yang sering muncul pas orang langsung pake LLM gede:

  1. Biaya per request tinggi - model frontier itu mahal, apalagi kalo volume request-nya puluhan ribu per hari
  2. Latency gak selalu cocok - aplikasi real-time kayak auto-reply atau chat di sistem internal gak butuh “mikir 10 detik”
  3. Privasi data - data pelanggan atau data internal yang sensitif gak bisa asal dikirim ke API cloud
  4. Skill tim - self-host butuh orang yang ngerti GPU, inference, dan tuning. Gak semua tim punya itu

Kabar baiknya: sekarang spektrum pilihannya lebar banget, dan buat tiap opsi udah ada provider yang siap pake. Justru ini yang bikin bingung. Makanya Miu bagi jadi dua lapis biar lo bisa milih secara sistematis.

Lapis 1: Jenis Model

LLM - Large Language Model

Ini yang paling dikenal. Model gede dengan parameter ratusan miliar, dilatih di data super luas, dan bisa ngerjain tugas general-purpose: nulis, coding, analisis, reasoning kompleks.

Ciri khasnya: kuat, tapi butuh resource gede. Kebanyakan diakses lewat API cloud, atau di-self-host kalo perusahaannya punya GPU.

Provider API yang aktif per Agustus 2026:

  • OpenAI - GPT-5.6 (varian Sol, Terra, Luna)
  • Anthropic - Claude Fable 5, Opus 5, Sonnet 5, Haiku 4.5
  • Google - Gemini 3.6 Flash (seri 3.1 Flash, 3.5 Flash juga masih jalan)
  • DeepSeek - DeepSeek V4 (Flash dan Pro)
  • Mistral - Mistral Medium 3.5, Large 3, Small 3.2
  • Cohere - Command A+
  • xAI - Grok 4.5

Kapan pake: tugas yang butuh penalaran dalam, kualitas jawaban tinggi, atau bikin konten yang butuh nuansa. Kalo budget gak masalah dan data lo aman dikirim ke cloud.

SLM - Small Language Model

Nah, ini yang paling sering kelewat. SLM itu model ramping, umumnya di bawah 10 miliar parameter, yang didesain khusus buat efisien: hemat memori, cepet, bisa jalan di laptop biasa, edge device, bahkan di HP.

SLM bukan “LLM yang jelek”. Ini kategori tersendiri yang dibangun dengan trade-off sadar: kemampuan dikorbankan dikit, tapi dapet kecepatan, biaya, dan privasi.

Contoh SLM yang aktif per 2026:

  • Microsoft Phi - keluarga Phi-4, termasuk Phi-4-mini
  • Google Gemma - Gemma 4 dengan varian E2B, E4B, 12B, sampe 26B-A4B (MoE)
  • Meta Llama - Llama 3.2 versi 1B dan 3B
  • Alibaba Qwen - Qwen3.5 dengan ukuran 0.8B, 2B, 4B, 9B
  • Mistral (Ministral 3) - varian 3B, 8B, 14B, dipasarkan khusus buat edge deployment
  • Apple - model on-device sekitar 3B parameter yang ngejalanin Apple Intelligence

Catatan penting: SLM itu soal ukuran aktif, bukan cuma label. Model kayak Llama 4 Scout punya 17B parameter aktif tapi totalnya sekitar 109B karena arsitekturnya MoE - itu bukan SLM, itu model frontier yang dikemas efisien.

Kapan pake: proses yang repetitif dan butuh cepet, jalan offline, perangkat terbatas, atau data sensitif yang harus stay di device.

Embedding Model

Jenis model yang paling jarang dibahas padahal paling banyak dipake di balik layar. Embedding model gak generate teks - dia mengubah teks jadi vektor (deretan angka) yang merepresentasikan makna.

Kenapa penting: vektor ini yang bikin semantic search dan RAG bisa kerja. Lo ubah semua dokumen perusahaan jadi vektor, simpen di vector database, trus pas ada pertanyaan, sistem nyari dokumen yang “maknanya paling dekat” sama pertanyaan itu.

Provider embedding yang aktif:

  • OpenAI - text-embedding-3-small dan text-embedding-3-large
  • Cohere - Embed v4.0
  • Open-source - BGE (BAAI), E5 (Microsoft), dan tooling sentence-transformers

Kapan pake: hampir semua sistem yang butuh “nyari dokumen berdasarkan makna” - knowledge base, search internal, rekomendasi.

VLM - Vision Language Model

Model multimodal yang bisa baca gambar, dokumen scan, bahkan video. Buat industri yang banyak dokumen fisik atau visual, ini game changer: laporan scan, formulir, screenshot, foto produk - semua bisa diolah.

VLM yang aktif per 2026:

  • OpenAI - GPT-5.6 (semua varian terbaru support input gambar)
  • Anthropic - semua model Claude terbaru support vision
  • Google - Gemini (native multimodal, teks + gambar + audio + video)
  • Meta - Llama 4 (natively multimodal, teks dan gambar)
  • Microsoft - Phi-4-reasoning-vision-15B
  • Alibaba - Qwen3-VL

Kapan pake: otomasi dokumen, OCR cerdas, inspeksi visual, atau sistem yang user-nya sering upload gambar.

Lapis 2: Pola Integrasi & Deployment

Model udah dipilih. Sekarang pertanyaannya: gimana nyambunginnya ke sistem lo? Lima pola ini yang umum dipake di industri.

RAG - Retrieval-Augmented Generation

Pola paling populer buat bisnis. Konsepnya: sebelum model jawab, sistem nyari dulu informasi relevan dari knowledge base perusahaan (dokumen, SOP, database), trus informasi itu disuntikin ke prompt sebagai konteks. Hasilnya: jawaban model grounded ke data lo sendiri, bukan ngarang.

RAG ini jawaban buat masalah klasik: “model gak tau data internal kita”. Lo gak perlu training ulang model - cukup siapin knowledge base dan mekanisme retrieval.

Provider managed yang nyediain RAG siap pake:

  • AWS - Amazon Bedrock Knowledge Bases (ingestion, indexing, retrieval dikelola AWS)
  • Azure - Azure AI Search (full-text + vector + hybrid search). Catatan: fitur lama “Azure OpenAI On Your Data” udah deprecated dan bakal retired Oktober 2026, pindah ke Azure AI Search
  • Google Cloud - sekarang jadi bagian dari Gemini Enterprise Agent Platform, dengan RAG Engine dan Vector Search sebagai komponen intinya

Kalo mau lebih fleksibel, bisa rakit sendiri pake komponen open-source: LangChain atau LlamaIndex buat orkestrasi, plus vector database kayak Qdrant, Pinecone, Weaviate, atau pgvector kalo udah pake PostgreSQL.

Kapan pake: sistem yang jawabannya harus akurat dan bisa dipertanggungjawabkan berdasarkan data internal - support desk, internal search, compliance assistant.

Fine-tuning / LoRA

Kalo RAG bikin model “tau data”, fine-tuning bikin model “paham gaya dan domain”. Model dilatih ulang (atau di-tuning sebagian dengan metode LoRA yang lebih hemat) pake data khusus: tone tulisan perusahaan, format jawaban, istilah industri.

Pertanyaan yang sering muncul: RAG atau fine-tuning? Jawabannya bukan “salah satu”, tapi keduanya buat kebutuhan yang beda. RAG buat fakta yang berubah-ubah (kebijakan baru, harga terbaru). Fine-tuning buat perilaku yang stabil (gaya jawaban, format, istilah). Banyak sistem production pake keduanya.

Provider managed fine-tuning:

  • OpenAI - Fine-tuning API (SFT, vision, DPO, reinforcement)
  • Azure OpenAI - lewat Microsoft Foundry
  • AWS - Bedrock custom model (model customization)
  • Together AI - fine-tuning managed, termasuk LoRA

Tools open-source yang aktif: Unsloth dan Axolotl - dua-duanya masih dirawat aktif di GitHub.

Catatan: kalo lo liat tutorial “fine-tuning pake LM Studio” - itu keliru. LM Studio itu aplikasi buat jalanin model lokal (inference), bukan tool training. Fine-tuning di ekosistem lokal biasanya pake Unsloth.

Kapan pake: model yang harus konsisten dengan gaya atau format tertentu - brand voice, format laporan, istilah teknis internal.

Agent-based / Workflow

Level di atasnya: model gak cuma jawab pertanyaan, tapi jadi otak yang bisa manggil tools, ngejalanin beberapa langkah, dan nyelesaiin tugas kompleks sendiri. Contoh: agent yang ngecek jadwal, ambil data dari sistem internal, trus nyusun laporan otomatis.

Framework agent yang aktif:

  • LangGraph - dari ekosistem LangChain, fokus ke agent yang resilient
  • CrewAI - orkestrasi beberapa agent yang role-play bareng
  • Microsoft Agent Framework - ini suksesor AutoGen. AutoGen sendiri udah maintenance mode, gak dapat fitur baru lagi

Platform no-code / low-code kalo tim lo bukan engineer:

  • Microsoft Copilot Studio - platform bikin dan manage AI agent
  • n8n - workflow automation dengan AI agent builder
  • Zapier Agents - agent yang nyambung ke ribuan aplikasi

Kapan pake: proses multi-langkah yang selama ini manual dan repetitif - triase tiket support, riset internal, otomasi operasional.

Self-hosted Serving

Model dijalanin di infra lo sendiri. Ini bukan “training” - model yang udah jadi di-download, di-serve di server lo (biasanya GPU), dan dipanggil via API internal. Bedanya sama API cloud: data gak keluar, kontrol penuh, bisa offline.

Tool self-host yang paling umum:

  • Ollama - paling gampang mulai, cocok buat single machine sampe internal team
  • vLLM - serving engine buat production, throughput tinggi, hemat memori
  • llama.cpp - jalan di CPU doang juga bisa, cocok buat perangkat terbatas
  • LM Studio - desktop app buat develop dan eksperimen model lokal

Catatan: Hugging Face TGI (Text Generation Inference) udah masuk maintenance mode - HF sendiri nyaranin pindah ke vLLM, SGLang, atau llama.cpp.

Kapan pake: data sensitif yang gak boleh keluar, kebutuhan offline, atau biaya per request yang udah gak masuk akal di volume tinggi.

Hybrid / Multi-Model Routing

Pola terakhir ini kombinasi: lo punya beberapa model (SLM lokal + LLM cloud, atau beberapa provider sekaligus), dan ada lapisan yang mutusin request mau dilempar ke mana. Rule-nya bisa simpel: data sensitif ke lokal, sisanya ke cloud. Atau berdasarkan biaya: request gampang ke model murah, request susah ke model mahal.

Platform yang nyediain lapisan routing ini:

  • OpenRouter - satu API buat akses banyak model dari banyak provider
  • LiteLLM - proxy/gateway open-source buat standardisasi API
  • Portkey - gateway dengan routing dan guardrails
  • Cloudflare AI Gateway - unified API, caching, rate limiting, dan routing ke banyak provider

Kapan pake: tim yang udah mulai scale dan mau kontrol biaya + fleksibilitas provider, tanpa mau ketergantungan ke satu vendor.

Gimana Milih: 5 Pertanyaan Sebelum Beli

Semua opsi di atas sah. Yang beda cuma kesesuaiannya sama kebutuhan lo. Coba jawab 5 pertanyaan ini sebelum mutusin:

  1. Data lo sensitif gak? - Sensitif atau ada regulasi? Mulai dari self-host atau SLM on-device. Aman dikirim ke cloud? API LLM atau managed RAG bisa jadi pilihan.
  2. Butuh cepet gak? - Real-time chat atau auto-reply? SLM atau model kecil lebih cocok. Analisis mendalam yang bisa nunggu? LLM gede fine.
  3. Budget berapa? - Per request LLM frontier itu mahal. Kalo volume gede, hitung dulu: mungkin SLM + routing hybrid lebih hemat.
  4. Skill tim apa? - Ada engineer yang ngerti GPU dan inference? Self-host layak dipertimbangkan. Tim bisnis murni? Managed API atau platform no-code lebih masuk akal.
  5. Volume request berapa? - 100 request per hari mah gak masalah pake API apa pun. 1 juta per hari? Lo harus mikirin arsitektur yang efisien dari awal.

Satu saran: mulai dari yang paling sederhana yang bisa nyelesaiin masalah, jangan langsung pasang arsitektur paling canggih. Banyak tim yang debut pake RAG + agent + fine-tuning sekaligus, trus tenggelam di kompleksitasnya sendiri. Mulai dari API sederhana atau RAG dasar, ukur hasilnya, baru naik level kalo kebutuhan udah nuntut.

Kesimpulan

Spektrum arsitektur AI bahasa itu lebar: dari SLM yang hemat dan bisa jalan di edge, sampai LLM frontier yang kuat di cloud; dari API yang tinggal panggil, sampai self-host yang full kontrol. Tiap opsi nyelesaiin masalah yang beda, dan gak ada yang universal - yang ada cuma yang paling cocok sama data, budget, dan kapasitas tim lo.

Kuncinya: kenali kebutuhan dulu, baru pilih dari peta. Provider-nya udah siap semua, tinggal lo yang mutusin.

Terima kasih sudah meluangkan waktu buat baca artikel ini, semoga ada manfaat yang bisa diambil. 🐾