Memperkenalkan Gemini 3.8 Live dan 3.8 Live Extended Thinking

15 Sep 2026

|

Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking merupakan model percakapan real-time paling canggih yang kami hadirkan sejauh ini. Peningkatan signifikan pada kemampuan kecerdasan dan penalaran paralel membuat keduanya lebih intuitif, tugas kompleks bisa terbantu dengan menggunakan suara.


Tom Ouyang

Principal Engineer

Malini Jaganathan

Member of Technical Staff, on behalf of the Gemini Audio Team


Gemini 3.8 Live & 3.8 Live Extended Thinking

Hari ini, kami memperkenalkan dua model baru yang menghadirkan kemampuan penalaran hampir secara real-time. Keduanya dirancang untuk mendukung voice agents secara lebih efektif dan membuat interaksi dengan AI terasa lebih natural dan cerdas.

  • Gemini 3.8 Live: Dirancang untuk penggunaan berskala besar dengan biaya yang lebih efisien, memadukan kemampuan memahami percakapan dengan dialog yang lebih natural serta kemampuan memahami konteks visual.
  • Gemini 3.8 Live Extended Thinking: Dirancang untuk menangani tugas-tugas yang lebih kompleks, dengan kemampuan kecerdasan dan penalaran multi-langkah yang lebih tinggi.

Bagi developer dan perusahaan, kedua model ini menyediakan fondasi untuk membangun voice agents yang andal dan siap digunakan dalam skala produksi. Keduanya juga membuat interaksi suara dengan Gemini di aplikasi Gemini, Google Workspace, dan Search terasa lebih natural dan kolaboratif—sehingga Anda dapat menyelesaikan berbagai tugas kompleks cukup dengan menggunakan suara.

Hadirkan percakapan yang lebih natural dan cerdas

Gemini 3.8 Live Extended Thinking menghadirkan kemampuan intelligence dan penyelesaian tugas berstandar enterprise. Model ini menempati posisi pertama secara keseluruhan dalam Speech to Speech Quality Index dari Artificial Analysis dengan skor 82,6, serta mencatat performa tertinggi dalam penyelesaian tugas agentic, dengan skor 68,6% pada τ-Voice dan 35,1% pada benchmark τ-Voice-banking dari Sierra. Model ini juga memiliki kemampuan penalaran yang kuat, dengan skor 97,7% pada Big Bench Audio, sekaligus menawarkan harga yang tetap kompetitif dibandingkan model frontier lainnya.

Gemini 3.8 Live juga menunjukkan tingkat preferensi pengguna yang tinggi, dengan menempati posisi kedua di Speech Agent Arena. Selain performanya, model ini juga dirancang agar tetap efisien dari sisi biaya, sehingga developer dan perusahaan dapat memanfaatkan model yang mumpuni dan efisien untuk penggunaan dalam skala besar.

Catatan: Ini dijalankan pada Live API di Gemini Enterprise Agent Platform.

ggemini-audio__benchmarks__eva-bench__pareto_1.original.png

Pada EVA-Bench dari ServiceNow, sebuah benchmark untuk mengevaluasi voice agents, model kami mampu mencapai Pareto Frontier untuk alur kerja yang kompleks dengan menyeimbangkan akurasi dan kualitas percakapan secara efektif.

Gemini 3.8 Live dapat memproses input visual hampir secara real-time, sehingga percakapan menjadi lebih kaya konteks dan menghasilkan respons yang lebih relevan. Model ini juga dapat secara otomatis mendeteksi dan beralih bahasa saat percakapan berlangsung, dengan dukungan hingga 97 bahasa. Sambil tetap melanjutkan percakapan, Gemini 3.8 Live dapat menjalankan tools dan API calls di latar belakang. Dengan begitu, model dapat langsung merespons permintaan pengguna dan tetap melanjutkan percakapan sementara tugas tersebut diproses.

Untuk tugas yang membutuhkan penalaran lebih mendalam, 3.8 Live Extended Thinking dapat berpikir dan berbicara secara bersamaan. Model ini memiliki kemampuan yang lebih tinggi untuk menangani alur kerja yang kompleks, tanpa mengganggu kelancaran percakapan. Misalnya, model dapat memberikan respons awal seperti “Biar saya cek dulu…” untuk menanggapi permintaan secara natural, sekaligus menjelaskan progresnya saat menyelesaikan tugas yang terdiri dari beberapa langkah di latar belakang.

Di Google Workspace, Search, dan aplikasi Gemini, model Live kami menghadirkan pengalaman yang lebih intuitif dan kolaboratif, terutama saat membantu menyelesaikan tugas-tugas yang paling kompleks.

Mendukung pengembangan ekosistem berbasis suara untuk developer dan perusahaan

Dengan memanfaatkan Gemini Live API, berbagai platform developer seperti Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, dan Vision Agents membantu developer membangun dan menghadirkan pengalaman interaksi berbasis suara dengan performa tinggi secara lebih mudah. Platform-platform ini mengelola infrastruktur streaming media real-time yang kompleks di balik layar, sehingga developer dapat fokus sepenuhnya pada pengembangan pengalaman pengguna.

Kami juga bekerja sama dengan perusahaan seperti Salesforce, Genspark, dan Lumeris yang menyambut positif Gemini 3.8 Live dan 3.8 Live Extended Thinking. Mereka menyoroti kemampuan kedua model tersebut dalam menghadirkan latensi rendah, percakapan yang lebih natural, serta kemampuan menjalankan tool calls.

Memastikan transparansi dengan watermark SynthID

Semua audio yang dihasilkan oleh produk AI kami dilengkapi watermark SynthID. Watermark yang tidak terlihat ini disisipkan langsung ke dalam output audio, sehingga konten yang dihasilkan AI tetap dapat dikenali untuk membantu mencegah penyebaran informasi yang keliru. Untuk mengetahui lebih lanjut tentang pendekatan kami terhadap keamanan dan penggunaan AI yang bertanggung jawab, lihat model card.

Mulai gunakan model Gemini audio terbaru kami:

3.8 Live sudah tersedia hari ini:

3.8 Live Extended Thinking juga mulai tersedia hari ini:

  • Untuk developer: melalui Gemini API dan Google AI Studio
  • Untuk perusahaan: tersedia dalam private preview di Gemini Enterprise, dan akan segera hadir di Gemini Enterprise for Customer Experience serta Google Workspace untuk pelanggan bisnis
  • Untuk semua pengguna: melalui Gemini Live; pelanggan Google AI Pro dan Ultra juga dapat menggunakannya di Workspace melalui Docs, sementara seluruh pelanggan Google AI dapat menggunakannya di Gmail dan Keep