AI Update

Holo4: Agent Open-Weight yang Kalah Skor Tapi Menang Harga

H Company ngeluarin Holo4, model open-weight yang bisa klik GUI, nulis kode, dan panggil API sekaligus — opsi hemat buat bikin agent otomatisasi desktop dan web.

Diterbitkan oleh 2ndBrAIn29 September 20264 min read
Share:XFacebookWhatsApp
Holo4: Agent Open-Weight, Kalah Skor Menang Harga

Bayangin kalian lagi nyusun agent buat ngurus laporan mingguan otomatis: satu model buat klik-klik di dashboard, satu model lain buat manggil API akunting, satu lagi buat nulis skrip Python-nya. Holo4 nawarin nyatuin ketiganya jadi satu model yang sama.

Apa yang baru

  • Dua ukuran model: Holo4 hadir dalam versi 27B dense dan 35B-A3B Mixture of Experts (arsitektur yang cuma mengaktifkan sebagian kecil "otak"-nya per tugas biar hemat komputasi), keduanya tersedia lewat H Models API dan Hugging Face.
  • Satu model, semua interface: Holo4 bisa berinteraksi lewat GUI, nulis dan menjalankan kode sendiri, panggil MCP, atau panggil API bisnis — dalam satu sesi yang sama, tanpa ganti model tiap kali pindah platform.
  • Skor OSWorld 2.0: Holo4-27B mencatat 61.7% di benchmark kontrol desktop OSWorld 2.0, dibanding 81.8% punya Claude Opus 5.5 — tapi dengan parameter dan biaya jauh lebih kecil.
  • Lintas platform tanpa dilatih ulang: model yang sama jalan di desktop, web, Android, sandbox kode, dan API bisnis, dipanggil dengan cara yang identik di tiap tempat.
  • Trajectory dibuka semua: H Company merilis seluruh jejak langkah di balik skor benchmarknya, bisa direplay di trajectories.hcompany.ai atau diunduh dari Hugging Face — bukan cuma angka akhir yang dipamerin.

Cara kerjanya

Kebanyakan model agentic dilatih buat satu jalur doang: model yang fokus GUI jadi "buta" kalau gak ada layar buat diliat, sementara model yang fokus tool-calling jadi macet kalau aplikasinya gak nyediain API. Holo4 dilatih lewat supervised learning dan reinforcement learning di banyak lingkungan sekaligus, termasuk skenario buatan Agentic Task Factory milik H Company, biar model bisa milih sendiri cara paling efisien buat tiap tugas.

Bedanya keliatan di uji coba nyata. Waktu diminta bikin game Pac-Man jalan sendiri di Godot, Holo4-27B nyelesein tugas dalam 68 panggilan dan 2,4 juta token, sementara model dasarnya, Qwen3.8 27B, butuh 197 panggilan dan 11,4 juta token buat hasil yang setara. Efisiensi kayak gini yang bikin biaya per tugas Holo4 jauh lebih murah dibanding kelihatannya cuma dari skor benchmark.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Kenapa ini penting

Buat developer dan tim automation di Indonesia, harga jadi masalah nyata tiap kali mau eksperimen dengan agent computer-use — model proprietary yang jago biasanya mahal per panggilan dan sering butuh kartu kredit US buat akses penuh. Holo4 open-weight, artinya bisa di-host sendiri, dites offline, dan dihitung biayanya di depan tanpa nunggu tagihan bulanan.

Ini juga ngasih opsi tambahan buat kalian yang udah mulai bangun automation sendiri, entah lewat pendekatan seperti otomasi tugas klik berulang pakai Codex Computer Use atau workflow custom lainnya — satu model buat urusan GUI, kode, dan API sekaligus berarti lebih sedikit titik gagal yang harus disambung manual.

Yang paling relevan buat tim kecil: skor 61.7% Holo4-27B emang kalah jauh dari Opus 5.5, tapi selisih biaya per tugasnya bisa jadi alasan cukup buat mulai pakai open-weight duluan sambil nunggu kebutuhan makin kompleks.

Buat kalian

  • Yang harus peduli: developer dan automation enthusiast yang udah capek gonta-ganti model API buat tiap platform berbeda — Holo4 kasih satu model yang jalan di GUI, kode, dan API sekaligus, plus bisa di-host sendiri.
  • Yang boleh santai: kalau workflow kalian masih sebatas chatbot atau tugas berbasis teks simpel, kompleksitas computer-use agent kayak Holo4 belum kalian butuhin sekarang.
  • Langkah kecil pertama: buka salah satu trajectory demo di trajectories.hcompany.ai, liat gimana Holo4 beneran nyelesein satu tugas GUI, sebelum mutusin mau dipakai buat automation kalian sendiri.

Skor benchmark itu penting, tapi yang lebih nentuin hasil kerjaan nyata adalah berapa kali agent harus dicoba ulang sampai bener — dan itu yang gw tekenin ke murid-murid gw tiap kali mereka milih tools buat automation: bukan model paling pinter di atas kertas, tapi model yang paling murah buat gagal dan coba lagi. Itu salah satu prinsip yang gw bahas lebih detail di kelas gw.

Sumber primer: blog resmi H Company (huggingface.co/blog/Hcompany/holo4).

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi