Liquid AI Rilis Drafter yang Percepat VLM Sampai 3x
Liquid AI ngerilis DSpark, model kecil pendamping yang bikin decode VLM 3B jadi sampai 3.13x lebih cepat di device tanpa ubah hasil akhirnya.
Kalian yang pernah nyobain jalanin vision-language model di MacBook sendiri pasti ngerasain jeda panjang antara upload foto dan jawaban keluar. Liquid AI baru ngerilis komponen kecil yang katanya bisa motong jeda itu tanpa ganti model utamanya sama sekali.
Apa yang baru
- Drafter baru buat model vision: Liquid AI merilis LFM2.5-VL-DSpark, model speculative decoding pendamping untuk VLM 3B parameter mereka, dengan klaim decode sampai 3.13x lebih cepat di perangkat lokal dan 2.66x di GPU H100.
- Gain end-to-end lebih realistis: total latensi (bukan cuma decode) naik sampai 2.62x di on-device dan 2.27x di H100 — angka ini yang lebih relevan buat pengalaman pakai sehari-hari.
- Overhead kecil: drafter cuma nambah 280M parameter, atau 8.9% dari ukuran model target 3B — jauh lebih ringan dari nambah model kedua yang penuh.
- Langsung jalan di tiga runtime: dukungan day-one sudah tersedia di llama.cpp, MLX-VLM, dan SGLang, jadi gak perlu nunggu integrasi komunitas.
- Bukan cuma teks, sekarang gambar juga: drafter ini pakai arsitektur yang sama dengan drafter teks LFM2.5-DSpark, tapi patch gambar dan token teks diproyeksikan ke representasi yang sama sebelum masuk layer yang di-tap.
Cara kerjanya
Drafter ini nebak beberapa token sekaligus berdasarkan hidden state model utama, lalu model utama cuma perlu verifikasi sekali jalan — mirip asisten yang udah nyiapin draft balasan email lengkap, dan bos-nya tinggal baca sekali buat setuju atau coret bagian yang salah, bukan nulis ulang dari nol tiap baris. Karena verifikasinya exact, output greedy tetap identik dengan kalau model utama jalan sendirian — cuma lebih cepat sampainya.
Bagian yang jujur perlu disebut: speculative decoding cuma mempercepat tahap decode, bukan vision encoding atau prefill. Di edge device, dua tahap itu makan porsi waktu yang lebih besar dibanding di GPU datacenter, jadi speedup decode yang besar gak otomatis bikin total waktu tunggu ikut turun sebesar itu — ini yang disebut Amdahl's law, di mana kecepatan keseluruhan dibatasin oleh bagian yang gak ikut dipercepat. Prinsip milih komponen yang tepat buat tugas yang tepat ini sama kayak logika membagi tugas biar model mahal cuma dipakai pas benar-benar perlu — bedanya di sini yang dihemat bukan biaya API, tapi waktu tunggu di layar kalian sendiri.
Bacaan berguna, sekali seminggu.
Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.
Kenapa ini penting
Buat developer atau creator Indonesia yang mau eksperimen VLM tanpa nyewa GPU cloud, ini artinya aplikasi kayak image QA atau captioning bisa jalan lebih responsif di laptop atau server lokal seadanya. Gak perlu biaya token per-request, dan gak perlu ganti model yang udah kalian kenal — cukup pasang drafter-nya di samping model utama.
Tapi jangan langsung berharap semua kasus dapet speedup 3x. Kalau tugas kalian berat di sisi baca gambar resolusi tinggi atau prompt panjang, bottleneck-nya ada di prefill dan vision encoding — bagian yang gak disentuh drafter ini sama sekali. Ekspektasi yang realistis penting biar kalian gak salah alokasikan waktu benchmark ke hal yang gak akan berubah.
Buat kalian
- Yang harus peduli: kalian yang lagi bangun aplikasi vision real-time — captioning otomatis, deteksi konten gambar, chatbot yang baca screenshot — dan pengin jalanin di device lokal biar hemat biaya cloud.
- Yang boleh santai: kalian yang workload-nya didominasi gambar resolusi besar atau prompt panjang, karena speedup decode di sini gak nolong banyak kalau bottleneck kalian ada di encoding, bukan decode.
- Langkah kecil pertama: coba pasang drafter-nya di runtime yang udah kalian pakai (llama.cpp, MLX-VLM, atau SGLang), lalu ukur end-to-end latency di task nyata kalian sendiri — bukan cuma percaya angka benchmark dari task lain.
Angka speedup yang gede itu godaan buat langsung dipakai tanpa mikir, padahal pertanyaan yang lebih penting selalu "bagian mana dari alur kerja gw yang sebenarnya lambat?" — sebelum pilih tools, ukur dulu di mana waktu kalian benar-benar abis. Cara mikir kayak gini yang gw latih bareng murid-murid di kelas gw.
Sumber primer: blog resmi Liquid AI (huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark).
Lanjut membaca
Belajar build sistem AI yang bekerja buat kalian
Lihat akademi