AI Update

Falcon-Emirati: Model Arab yang Paham Dialek, Bukan Cuma Bahasa Baku

TII rilis Falcon-Emirati-7B, model open-source yang dilatih paham dialek Emirati, bukan cuma Bahasa Arab baku — pelajaran buat bahasa daerah Indonesia.

Diterbitkan oleh 2ndBrAIn6 Oktober 20264 min read
Share:XFacebookWhatsApp
Falcon-Emirati: LLM yang Paham Dialek

Chatbot yang jago Bahasa Indonesia resmi bisa langsung blingsatan begitu diajak ngobrol pakai basa Jawa ngoko atau logat Betawi. Masalah yang sama baru aja ditangani serius oleh TII buat Bahasa Arab — lewat dialek, bukan lewat bahasa baku.

Apa yang baru

  • Falcon-Emirati-7B: model 7 miliar parameter yang dibangun di atas Falcon-H1-Arabic, memakai arsitektur hybrid yang menjalankan State Space Models (Mamba) dan Transformer attention secara paralel di tiap blok.
  • Fokus ke dialek, bukan bahasa baku: model ini dilatih khusus supaya paham kosakata, tata bahasa, dan konteks budaya dialek Emirati — hal yang gak kebawa kalau model cuma belajar Modern Standard Arabic (MSA), versi "resmi" ala berita dan buku pelajaran.
  • Falcon-H1-Arabic hadir 3 skala: 3B, 7B, dan 34B parameter, dengan context window sampai 128K-256K token, udah dilatih campuran MSA plus dialek Gulf, Levantine, Egyptian, dan Maghrebi.
  • Tiga sumber data dipakai bareng: teks asli dari forum dan situs Emirati (bukan terjemahan dari MSA), materi budaya/heritage berbahasa MSA soal Emirati, dan data sintetis yang dipaksa ikut glosarium serta kamus dialek biar gak ngarang kosakata.
  • Gak ada resep baku: tim TII ngaku proses adaptasi dialek ini penuh trial-and-error — nyobain macam-macam campuran data dan tahap training, dicek pakai skor otomatis plus review penutur asli.

Cara kerjanya

Bayangin pelajar asing yang hafal semua tata bahasa dan kosakata di buku teks, tapi begitu nyampe pasar lokal, dia bingung denger orang nawar pakai pantun atau sindiran yang maknanya gak ketebak dari arti harfiah kata per kata. Itu persis masalah yang dicoba diselesaikan Falcon-Emirati — puisi nabati, pepatah, dan obrolan sehari-hari Emirati sering gak "selamat" kalau diterjemahkan kata demi kata.

TII gak mulai dari nol. Mereka pakai Falcon-H1-Arabic sebagai fondasi, lalu dorong lebih spesifik ke arah dialek lewat tiga jalur data di atas. Bagian paling rumit ada di data sintetis — generator model dipaksa ikut aturan ketat dan kamus dialek Emirati, biar hasilnya gak cuma "kedengeran Gulf-ish" tapi beneran kena di telinga penutur asli.

Mereka juga sengaja pilih skala 7B, bukan 34B yang lebih besar atau 3B yang lebih kecil — titik tengah antara kedalaman nuansa yang dibutuhkan dialek dan biaya training/inference yang masih masuk akal buat model chat spesifik dialek.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Kenapa ini penting

Buat developer Indonesia yang lagi bikin chatbot atau asisten berbahasa daerah — basa Jawa, Sunda, Batak, atau bahkan slang Jaksel — pola kerja Falcon-Emirati ini bisa langsung jadi referensi. Masalahnya mirip: data dialek/bahasa daerah jauh lebih sedikit online dibanding Bahasa Indonesia baku, dan maknanya sering gak ketebak lewat terjemahan literal.

Pendekatan tiga sumber data — teks asli, konteks budaya, plus data sintetis yang dikunci glosarium — adalah resep yang bisa ditiru skala kecil pakai model open-source yang udah ada, tanpa harus bangun model dari nol. Ini juga nunjukin kenapa milih skala model yang tepat itu penting, mirip logika milih tier model sesuai biaya dan risiko tugas — gak selalu model terbesar yang paling masuk akal buat kebutuhan spesifik.

Satu hal yang perlu dicatat: proses ini butuh review manusia yang paham dialeknya asli, bukan cuma andelin skor otomatis. Itu ongkos yang sering diremehin tim yang pengen buru-buru rilis chatbot bahasa daerah.

Buat kalian

  • Yang harus peduli: kalian yang lagi atau berencana bikin chatbot/asisten berbahasa daerah (Jawa, Sunda, Minang, dll) dan ngerasa model umum selalu "kaku" atau salah nangkep nuansa lokal.
  • Yang boleh santai: kalau produk kalian cuma perlu Bahasa Indonesia baku buat dokumen formal atau customer service umum, teknik dialect-specific fine-tuning ini belum jadi prioritas.
  • Langkah kecil pertama: kumpulin dulu 50-100 contoh teks asli dialek/bahasa daerah target kalian (bukan terjemahan), lalu lihat di mana model umum paling sering salah nangkep maknanya — itu peta buat tahu bagian mana yang butuh data tambahan.

Milih model paling canggih itu gampang; yang susah adalah tau kapan harus berhenti nambah ukuran model dan mulai nambah kualitas data. Prinsip itu yang gw latih bareng murid-murid di kelas gw, biar keputusan teknis kalian gak cuma ngejar parameter gede tapi ngejar hasil yang beneran kepake.

Sumber primer: blog resmi TII (huggingface.co/blog/tiiuae/falcon-emirati).

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi