Hugging Face Rilis Leaderboard TTS Pakai Metrik Objektif
Hugging Face bikin Open TTS Leaderboard yang nilai model text-to-speech pakai angka konkret, bukan voting komunitas — evaluasi yang tadinya berminggu-minggu sekarang kelar dalam hitungan jam.
Gw pernah nungguin dua minggu cuma buat tau model TTS mana yang paling natural buat teks bahasa Indonesia, karena leaderboard yang ada mengandalkan voting manusia satu per satu. Sekarang prosesnya kelar dalam hitungan jam.
Apa yang baru
- Tiga metrik objektif gantiin voting manual: Open TTS Leaderboard dari Hugging Face ngukur Intelligibility (word/character error rate pakai Qwen3 ASR), Speed (RTFx dan time-to-first-audio di H200 GPU), dan Speaker Similarity (cosine similarity embedding WavLM) — tiga angka konkret, bukan opini terkumpul.
- Waktu evaluasi turun drastis: proses yang tadinya butuh beberapa minggu buat ngumpulin suara voting komunitas sekarang kelar dalam beberapa jam karena semuanya dihitung otomatis lewat metrik di atas.
- Fokus ke model open-source: per 30 September 2026 ada lebih dari 8.000 model TTS di Hugging Face Hub, tapi leaderboard arena-style populer cuma nampilin 16 dari 92 model open-weights — sisanya didominasi model API berbayar yang lebih gampang didaftarin.
- Model open-source yang unggul: hexgrad/Kokoro-82M, Supertone/supertonic-3, dan fishaudio/s2-pro memimpin di word error rate bahasa Inggris, sementara k2-fsa/OmniVoice dan FunAudioLLM/Fun-CosyVoice3-0.5B-2512 kuat di performa multilingual.
- Ada tab Listen dan Streaming: biar angka gak jadi satu-satunya acuan, ada tab buat dengerin langsung output tiap model dan bandingin kecepatan streaming lewat metrik time-to-first-audio.
Cara kerjanya
Setiap model dites pakai teks prompt yang sama, lalu hasil suaranya ditranskrip balik pakai Qwen3 ASR buat dibandingkan dengan teks aslinya — selisihnya itu yang jadi skor Intelligibility. Semakin kecil selisihnya, semakin jelas suara yang dihasilkan.
Buat voice cloning, sistemnya ngukur cosine similarity antara embedding suara yang dihasilkan dengan clip referensi — angka ini nunjukkin seberapa mirip suara klonaan sama suara aslinya. Kecepatan diukur dua cara: RTFx buat proses batch offline, dan time-to-first-audio buat skenario streaming satu-per-satu kayak voice agent.
Leaderboard ini gak menggantikan telinga manusia sepenuhnya — tab Listen tetap disediakan karena metrik otomatis cuma proksi buat intelligibility dan kemiripan suara, bukan ukuran naturalness atau ekspresi. Kalau kalian lagi bangun produk suara sendiri, pendekatan serupa — metrik cepat plus telinga manusia di akhir — juga yang gw bahas waktu nulis soal bikin TTS lewat satu API key di OpenRouter.
Bacaan berguna, sekali seminggu.
Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.
Kenapa ini penting
Buat developer dan creator Indonesia, ini artinya milih model TTS gak perlu lagi nebak-nebak atau nunggu thread komunitas rame duluan. Kalian bisa langsung cek angka WER buat bahasa Indonesia (lewat splis multilingual CV3 Eval), cek kecepatan di hardware yang relevan, dan dengerin langsung sample-nya sebelum pasang di produksi.
Ini juga ngubah kalkulasi biaya. Selama ini banyak yang langsung lari ke API berbayar karena gak ada cara cepat buat validasi model open-source. Dengan leaderboard yang transparan soal trade-off ukuran model vs kecepatan vs akurasi, keputusan pakai model gratis yang jalan di server sendiri jadi lebih masuk akal buat proyek lokal yang budget-nya terbatas.
Yang perlu diingat: metrik ini ngukur kejelasan dan kemiripan suara, bukan rasa atau ekspresi emosional dari suatu dialog. Kalau proyek kalian butuh narasi yang hidup — bukan cuma jelas — tetap pakai tab Listen buat cek rasa, bukan cuma angka di tabel.
Buat kalian
- Yang harus peduli: kalian yang lagi bangun produk dengan fitur suara — voice assistant, dubbing otomatis, audiobook — dan selama ini milih model TTS cuma berdasarkan nama besar atau testimoni orang lain.
- Yang boleh santai: kalau kalian udah punya model TTS yang jalan stabil dan hasilnya udah divalidasi manual, ini bukan alasan buru-buru ganti — anggap aja referensi tambahan buat benchmarking berkala.
- Langkah kecil pertama: buka leaderboard-nya, toggle bahasa Indonesia atau multilingual, terus dengerin minimal tiga model lewat tab Listen sebelum milih mana yang mau kalian integrasikan ke workflow.
Angka yang bagus di atas kertas gak selalu sama dengan suara yang kalian percaya buat mewakili brand kalian — itu alasan kenapa validasi dua lapis (metrik dulu, telinga manusia kemudian) selalu lebih aman daripada percaya salah satunya doang. Prinsip itu yang gw latih bareng murid-murid buat milih tools AI apa pun, bukan cuma TTS, di kelas gw.
Sumber primer: blog resmi Hugging Face (huggingface.co/blog/open-tts-leaderboard).
Lanjut membaca
Belajar build sistem AI yang bekerja buat kalian
Lihat akademi