Memperkenalkan Bonsai-27B di Neosantara: Konteks 262k

Neosantara kini menyediakan akses API langsung ke PrismML Bonsai-27B, model multimodal andalan dari keluarga Bonsai. Satu panggilan API memberi Anda penalaran 27 miliar parameter, pemahaman gambar, dan function calling di balik context window 262.144 token, semuanya melalui endpoint terpadu kami yang kompatibel dengan OpenAI dengan tagihan Rupiah.
Poin Kunci
- PrismML mengompres Bonsai-27B dengan kuantisasi ternary 1.58-bit end-to-end, menjadikannya salah satu model paling efisien di kelasnya.
- Benchmark yang dipublikasikan mempertahankan 94,6% kualitas baseline FP16 (Hugging Face, Juli 2026) [2].
- Context window 262K token, vision native, dan structured tool calling langsung siap pakai.
- Tersedia hari ini, gratis untuk waktu terbatas, untuk semua akun Neosantara.
Kenapa Bonsai-27B?
Kebanyakan model kapabel menuntut hardware serius. Bonsai-27B mengambil jalur berbeda: PrismML menerapkan kuantisasi ternary {-1, 0, +1} end-to-end pada backbone Qwen3.6-27B, mencakup embeddings, attention, MLP, dan LM head tanpa jalur presisi tinggi, sehingga model 27 miliar parameter muat di tempat yang tidak bisa dijangkau setup besar. Ini adalah model pertama di kelas kemampuannya yang cukup kecil untuk berjalan di ponsel (PrismML, Juli 2026) [1], dan dirilis di bawah lisensi Apache 2.0.
Yang Anda dapatkan di Neosantara:
- Context 262K token: seluruh codebase, tumpukan kontrak, atau ribuan baris log dalam satu prompt.
- Vision native: OCR diagram dan pemahaman screenshot lewat vision tower bawaan.
- Structured tool calling: loop agent multi-langkah tanpa scaffolding tambahan.
- Kompatibel OpenAI: drop-in untuk LangChain, LlamaIndex, Cursor, atau workflow SDK mentah.
Selama periode peluncuran, Bonsai-27B gratis untuk semua pengguna Neosantara dalam waktu terbatas (3 RPM pada akun Free murni, dan terbuka ke 10 RPM penuh setelah top-up saldo awal minimal Rp 15.000), jadi Anda bisa menguji penalaran, vision, dan agent loop sebelum menentukan budget. Tarif saat ini setelah masa preview ada di halaman pricing.
Angkanya berbicara. Dalam rangkaian 15 benchmark dari PrismML, Ternary Bonsai 27B mencetak skor keseluruhan 80,5 dibandingkan 85,0 untuk baseline presisi penuh Qwen3.6, retensi 95% dengan skor matematika dan coding yang hampir tak tersentuh (PrismML, Juli 2026) [1]:

Gambar: Intelligence density (per GB) Bonsai 27B dibandingkan model lain di kelas parameternya. (Sumber: PrismML, 2026)
Cara Memulai
Jika Anda sudah terbiasa dengan OpenAI SDK, integrasinya hanya butuh beberapa menit:
from openai import OpenAI
client = OpenAI(
base_url="https://api.neosantara.xyz/v1",
api_key="API_KEY_NEOSANTARA_ANDA"
)
# Text & Deep Reasoning
response = client.chat.completions.create(
model="bonsai-27b",
messages=[
{"role": "system", "content": "Anda adalah asisten AI analitis yang teliti dan cerdas."},
{"role": "user", "content": "Jelaskan perbandingan kelebihan dan kekurangan arsitektur B-Tree vs LSM-Tree untuk database write-heavy."}
],
temperature=0.6,
max_tokens=1000
)
print(response.choices[0].message.content)Lihat galeri model untuk daftar lengkap, atau baca bagaimana Kimi K2 menangani beban agentic skala triliunan parameter.
Bagaimana Menghubungkan Bonsai-27B ke Coding Agent?
Karena endpoint-nya memahami dialek OpenAI sekaligus Anthropic, coding agent terminal bisa langsung jalan tanpa wrapper.
OpenCode mengenali Neosantara sebagai custom provider lewat opencode.json (dokumen custom provider):
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"neosantara": {
"npm": "@ai-sdk/openai-compatible",
"name": "Neosantara",
"options": {
"baseURL": "https://api.neosantara.xyz/v1"
},
"models": {
"bonsai-27b": { "name": "Bonsai 27B" }
}
}
}
}Tambahkan API key lewat perintah /connect atau export OPENAI_API_KEY=..., lalu pilih model dengan /models.
Claude Code terhubung lewat base URL yang kompatibel Anthropic:
export ANTHROPIC_BASE_URL="https://api.neosantara.xyz/anthropic"
export ANTHROPIC_AUTH_TOKEN="API_KEY_NEOSANTARA_ANDA"
export ANTHROPIC_API_KEY=""
export ANTHROPIC_MODEL="bonsai-27b"ANTHROPIC_API_KEY yang kosong itu penting: Claude Code mengecek variabel ini lebih dulu dan kalau tidak kosong akan mengabaikan auth token Anda (Anthropic-Compatible API, dokumentasi Neosantara). Setup per tool untuk Cursor, Cline, dan lainnya ada di panduan AI Coding Tools.
Framework agent dengan dukungan native Neosantara hanya butuh beberapa baris:
# LiteLLM (provider native, membaca NEOSANTARA_API_KEY)
import litellm
resp = litellm.completion(
model="neosantara/bonsai-27b",
messages=[{"role": "user", "content": "Rancang rate limiter untuk API multi-tenant."}],
)
# Agno
from agno.agent import Agent
from agno.models.neosantara import Neosantara
agent = Agent(model=Neosantara(id="bonsai-27b"))
agent.print_response("Ringkas stack trace ini dan usulkan perbaikannya.", stream=True)
# any-llm
from any_llm import completion
resp = completion(
"neosantara/bonsai-27b",
messages=[{"role": "user", "content": "Review diff ini untuk race condition."}],
)Seberapa Cepat Bonsai-27B di Neosantara?
Kami menjalankan benchmark sendiri melalui gateway produksi pada 21 Agustus 2026, lima run per skenario. Permintaan warm menghasilkan token pertama dalam sekitar 6 detik untuk prompt pendek, naik ke sekitar 9 detik dengan input 9.700 token, sambil mempertahankan sekitar 60 hingga 80 output token per detik secara end-to-end:
| Skenario | Median token pertama | Throughput efektif |
|---|---|---|
| Prompt pendek (~50 token input) | ~6,1 dtk | ~64 tok/dtk |
| Prompt menengah (~500 token input) | ~7,9 dtk | ~76 tok/dtk |
| Prompt panjang (~9.700 token input) | ~9,3 dtk | ~64 tok/dtk |
Sebagian besar waktu tunggu itu bukan waktu menganggur. Bonsai-27B adalah thinking model: ia memakai 400 hingga 800 reasoning token tersembunyi untuk memproses masalah sebelum jawaban yang terlihat mulai streaming, dan di situlah kekuatan benchmark-nya berasal. Anda juga dapat mengatur atau membatasi kedalaman nalar ini menggunakan parameter reasoning_effort ("low", "medium", atau "high") atau thinking_budget_tokens di payload:
# Mengontrol kedalaman proses nalar (Reasoning Control)
response = client.chat.completions.create(
model="bonsai-27b",
messages=[{"role": "user", "content": "Jelaskan konsep arsitektur event-driven."}],
extra_body={
"reasoning_effort": "low", # Pilihan: 'low', 'medium', 'high'
# ATAU menggunakan token budget eksplisit:
# "thinking_budget_tokens": 512 # 512 (Low), 2048 (Medium), -1 (Unconstrained)
},
max_tokens=1500 # Disarankan >= 1000 agar jawaban teks tidak terpotong fase reasoning
)💡 Tips max_tokens: Karena Bonsai-27B memerlukan ruang token untuk proses berpikir (CoT) sebelum menulis jawaban, selalu gunakan
max_tokens >= 1000. Jika Anda menyetel token terlalu sedikit (misalmax_tokens: 100), seluruh kuota bisa habis saat masih berpikir sehingga teks jawaban tampak kosong (content: null).
Di balik layar, inferensi live dan benchmark Bonsai-27B di Neosantara di-host langsung di atas infrastruktur Daytona Spot GPU sandbox bertenaga hardware NVIDIA RTX PRO 6000 (96GB VRAM) dengan orkestrasi scale-to-zero otomatis, menghasilkan throughput kelas enterprise tanpa biaya komputasi idle yang terbuang. Perhitungkan budget reasoning saat men-set max_tokens, dan baca panduan memahami rate limits kami jika Anda sedang menghitung throughput untuk produksi. Siapkan satu permintaan cold-start sekitar 74 detik setelah deploy baru.
Vision dan Tool Calling
Input gambar bekerja lewat antarmuka chat yang sama, mendukung URL publik maupun string Base64 (data:image/png;base64,...). Sertakan gambar bersama prompt Anda dan Bonsai-27B membaca diagram, screenshot, serta dokumen [3]:
# Analisis Gambar Multimodal
response = client.chat.completions.create(
model="bonsai-27b",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Jelaskan alur arsitektur sistem pada gambar diagram berikut:"},
{"type": "image_url", "image_url": {"url": "https://example.com/diagram-arsitektur.png"}}
]
}]
)Tool calling memakai skema function-calling OpenAI yang sudah Anda kenal:
# Structured Tool Calling
response = client.chat.completions.create(
model="bonsai-27b",
messages=[{"role": "user", "content": "Bagaimana cuaca di Jakarta saat ini?"}],
tools=[{
"type": "function",
"function": {
"name": "get_weather",
"description": "Mendapatkan cuaca terkini untuk sebuah kota",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
)
call = response.choices[0].message.tool_calls[0]
print(call.function.name, call.function.arguments)Pertanyaan yang Sering Diajukan
Model 27B standar dalam format FP16 membutuhkan lebih dari 54 GB memori. Ternary Bonsai-27B menyimpan bobot pada 1,71 bit efektif per bobot, menghasilkan sekitar 7,2 GB saat deployed, reduksi kurang lebih 9x.
Evaluasi PrismML memberi skor Ternary Bonsai 27B sebesar 80,49 dibandingkan 85,07 untuk baseline FP16, mempertahankan 94,6% kualitas baseline. Kuantisasi konvensional 2-bit pada backbone yang sama hanya mempertahankan 85,5%.
Ya. Bobot dirilis di bawah lisensi Apache 2.0 di Hugging Face dalam format GGUF dan MLX. Perlu dicatat, kernel ternary-nya membutuhkan fork llama.cpp milik PrismML, bukan build standar, selain opsi MLX dan CUDA, sedangkan API Neosantara tidak memerlukan hardware lokal.
Referensi
- [1] PrismML, "Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone," Juli 2026. URL: https://prismml.com/news/bonsai-27b (diakses 21 Agustus 2026)
- [2] PrismML, "prism-ml/Ternary-Bonsai-27B-gguf Model Card," Hugging Face, Juli 2026. URL: https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf (diakses 21 Agustus 2026)
- [3] PrismML, "Bonsai 27B: Multimodal & Tool Use Docs," PrismML Docs, 2026. URL: https://docs.prismml.com/models/bonsai-27b (diakses 21 Agustus 2026)
Coba Bonsai-27B Gratis untuk Waktu Terbatas
Daftar akun gratis Neosantara AI dan akses context 262k, vision, serta tool calling Bonsai-27B melalui satu endpoint kompatibel OpenAI tanpa biaya selama periode peluncuran.



