AI Update

Gemini 3.8 TTS: Bikin Suara Karakter Sendiri, Tanpa Voice Actor

Google rilis Gemini 3.8 Flash TTS dan Flash-Lite TTS — bikin suara karakter dari nol pakai teks, dukung 100+ bahasa dan dialek regional macam Skotlandia.

Diterbitkan oleh 2ndBrAIn25 September 20263 min read
Share:XFacebookWhatsApp
Gemini 3.8 TTS: Suara Karakter Tanpa Voice Actor

Gw pernah nunggu lima hari buat satu revisi kecil di narasi audiobook—voice actor-nya lagi syuting proyek lain, dan budget udah kepakai buat take pertama. Gemini 3.8 baru aja bikin proses kayak gitu selesai dalam hitungan menit, bukan hitungan minggu.

Apa yang baru

  • Gemini 3.8 Flash TTS: model text-to-speech baru dari Google DeepMind yang bisa bikin suara karakter dari nol pakai natural language prompt, dengan kontrol line-by-line atas pacing, emosi, dan dialek di lebih dari 100 bahasa.
  • Gemini 3.8 Flash-Lite TTS: versi yang dioptimalkan buat skala tinggi dan biaya rendah—cocok buat dubbing massal atau voice agent yang harus ekspresif tapi murah dijalankan terus-menerus.
  • Perpustakaan 2.000+ suara siap pakai dengan varian regional kayak Spanyol Meksiko, Prancis Quebec, dan Inggris Skotlandia.
  • Voice replication dari sampel 30 detik: rekam suara sendiri (atau suara yang kalian punya izin pakai) buat direplikasi, dengan verifikasi consent, watermark SynthID, dan kredensial C2PA.
  • Rangking benchmark: Flash TTS ambil posisi #1 di Hume AI Voice Design Benchmark (71.4) dan #1 di accent modeling (60.8); Flash dan Flash-Lite masing-masing ambil #1 dan #2 di Overall Quality Index Hume AI.

Cara kerjanya

Prosesnya mirip kerja sutradara teater kecil yang ngasih arahan ke aktor baris demi baris, bukan sekali arahan buat seluruh naskah. Kalian tulis siapa karakternya lewat prompt teks—umur, aksen, kepribadian—lalu Gemini render suaranya. Habis itu, tiap baris dialog bisa dikasih cue sendiri: bisikan buat adegan tegang, jeda lebih panjang buat momen dramatis, atau reaksi non-verbal kayak tawa pendek dan helaan napas yang ditandai lewat tag khusus di skrip.

Buat proyek dua orang ngobrol—podcast atau adegan dialog—ada fitur native two-speaker scene staging yang jaga dua suara tetap beda karakter dari satu skrip, lengkap dengan jeda natural kayak orang beneran gantian ngomong. Buat konten panjang kayak audiobook berjam-jam, modelnya diklaim tetep konsisten timbre-nya tanpa suara "melenceng" di tengah jalan.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Kenapa ini penting

Selama ini, bikin konten audio custom—audiobook, podcast berkarakter, atau dubbing video—berarti nyewa voice talent per proyek, nunggu jadwal, dan bayar per revisi. Buat kreator Indonesia yang budget-nya pas-pasan, itu sering jadi alasan kenapa ide bagus gak pernah jadi konten jadi.

Dukungan lebih dari 100 bahasa dan dialek regional ngubah kalkulasinya. Kalian bisa bikin narator dengan logat daerah spesifik, atau dubbing konten ke beberapa bahasa sekaligus dari satu skrip, tanpa nunggu antrean studio rekaman. Ini juga relevan buat yang lagi bikin voice agent customer service tanpa coding—suara agent yang lebih hidup bikin interaksi kerasa kurang kayak robot baca skrip.

Yang perlu diinget: fitur voice replication butuh rekaman consent verbal dari pemilik suara asli sebelum bisa dipakai, jadi ini bukan celah buat niru suara orang tanpa izin.

Buat kalian

  • Yang harus peduli: kalian yang bikin konten audio/video rutin—podcast, audiobook, dubbing, atau voice agent—dan selama ini budget/jadwal jadi penghalang buat eksperimen suara.
  • Yang boleh santai: kalau proyek kalian butuh nuance akting manusia level tinggi (film, iklan besar), voice actor manusia masih punya kelebihan yang belum tergantikan sepenuhnya.
  • Langkah kecil pertama: buka Google AI Studio audio playground, bikin satu karakter suara buat konten pendek yang udah ada naskahnya, dan bandingin hasilnya sama biaya sewa voice talent biasa.

Alat makin murah dan makin cepat itu bagus, tapi yang bikin konten kalian beda bukan suaranya doang—arahan yang jelas ke alatnya yang nentuin hasil kedengeran hidup atau datar. Prinsip itu yang gw latih bareng murid-murid di kelas gw, gimana ngasih instruksi presisi ke AI apa pun jenisnya.

Sumber primer: blog resmi Google DeepMind (deepmind.google, "Gemini 3.8 text-to-speech says hello").

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi