AI Update

Olmo-core 3: Allen AI Buka Infrastruktur Training MoE Raksasa

Allen AI rilis Olmo-core 3, infrastruktur open-source buat training model MoE sampai triliunan parameter, throughput naik 2.7x dibanding versi sebelumnya.

Diterbitkan oleh 2ndBrAIn2 Oktober 20264 min read
Share:XFacebookWhatsApp
Olmo-core 3: Training MoE Raksasa Jadi Open

Ngelatih model AI sampai triliunan parameter biasanya butuh anggaran GPU segede startup unicorn. Allen Institute for AI baru aja buka infrastruktur yang bikin ongkos itu jauh lebih masuk akal — dan semuanya open-source.

Apa yang baru

  • Arsitektur training baru: Olmo-core 3 ganti sistem fully sharded data parallelism yang lama jadi distributed data parallelism — expert tetap nempel di GPU-nya masing-masing, gak perlu dikumpulin ulang tiap batch kecil.
  • Throughput 2.7x lebih cepat: di uji coba 8 GPU B300 dengan model MoE 47 miliar parameter, stack baru ini ngejar 52.000 token per detik per GPU, dibanding 19.400 di implementasi lama Allen AI.
  • Skala sampai triliunan parameter: kombinasi expert parallelism, pipeline parallelism, dan distributed optimizer bikin framework ini udah dites di model 1,2 triliun parameter lewat 512 GPU, dengan throughput puncak 858 TFLOP/s per GPU.
  • Presisi rendah MXFP8: format angka yang lebih hemat bit ini naikin throughput 21% dibanding BF16, sambil motong memori puncak dari 103 GiB ke 95 GiB.
  • Full open-source: tech report dan kode semuanya dirilis gratis, bagian dari komitmen Allen AI buat buka infrastruktur di balik tiap generasi model Olmo mereka.

Cara kerjanya

Bayangin dapur restoran besar dengan 128 koki spesialis — satu buat pasta, satu buat kari, satu buat panggangan. Tiap pesanan cuma dikirim ke 3-4 koki yang relevan, bukan seluruh dapur masak bareng tiap kali ada pesanan masuk. Itu kira-kira cara kerja mixture-of-experts: model punya banyak "expert" tapi cuma sebagian kecil yang aktif per token yang diproses.

Masalahnya, ngatur rute pesanan ke koki yang tepat — dan nyimpen resep semua koki di memori dapur yang terbatas — makin ribet kalau koki yang direkrut makin banyak. Olmo-core 3 nyelesein ini lewat tiga trik: expert parallelism (sebar koki ke beberapa dapur/GPU), pipeline parallelism (bagi tahapan masak ke kelompok dapur beda), dan distributed optimizer (sebar catatan resep update ke banyak dapur, bukan disalin penuh di tiap dapur). Allen AI juga nambahin rowwise expert parallelism dan grouped GEMM biar rute pesanan dan hitungan matematika expert jalan lebih efisien.

Dalam satu uji coba, Allen AI naikin jumlah expert dari 8 ke 128 — tapi tetap cuma pilih 4 per token — dan kapasitas total model meloncat dari 4,6 miliar ke 47 miliar parameter, sementara throughput cuma turun kurang dari 5%.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Kenapa ini penting

Buat tim riset atau developer di Indonesia yang mau eksperimen bikin model sendiri, biaya infrastruktur training selama ini jadi tembok paling tinggi — bukan cuma soal beli GPU, tapi soal nulis sistem distribusi yang bener biar GPU-GPU itu kerja efisien. Olmo-core 3 ngasih sebagian dari pekerjaan berat itu gratis, lengkap dengan tech report yang jelasin trade-off di tiap keputusan desain.

Ini juga ngingetin gw ke riset Anthropic soal J-space di Claude — sama-sama hal penting yang ketauan justru pas ngulik dalaman proses training, bukan dari spec di atas kertas. Institusi akademik yang kemarin cuma bisa baca paper soal MoE, sekarang bisa buka kodenya langsung dan coba modifikasi sendiri.

Yang perlu diinget: ini infrastruktur, bukan model jadi. Butuh cluster GPU B300 atau setara buat ngerasain manfaat penuhnya — bukan sesuatu yang langsung jalan di laptop kantor.

Buat kalian

  • Yang harus peduli: kalian yang kerja di lab riset, kampus, atau tim engineering yang lagi mikirin bangun model AI sendiri — infrastruktur training yang biasanya proprietary sekarang ada versi terbukanya, lengkap dengan dokumentasi trade-off-nya.
  • Yang boleh santai: kalau kerjaan kalian sehari-hari cuma pakai API model yang udah jadi (ChatGPT, Claude, Gemini), rilis ini gak ngubah apa-apa di workflow kalian — ini urusan tim yang ngelatih model dari nol.
  • Langkah kecil pertama: kalau penasaran, baca tech report-nya dulu buat ngerti trade-off expert parallelism vs pipeline parallelism — itu lebih berguna daripada langsung coba jalanin di cluster yang belum tentu kalian punya.

Infrastruktur canggih kayak gini keren, tapi yang bikin kerjaan kalian beda bukan akses ke tools paling canggih — kemampuan milih tools yang pas buat masalah spesifik kalian lah yang nentuin hasil. Itu prinsip yang sama gw latih bareng murid-murid di kelas gw.

Sumber primer: blog resmi Allen Institute for AI di Hugging Face (huggingface.co/blog/allenai/olmocore3).

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi