Gemini 3.5 Transcribe konuşmayı temiz metne çeviriyor: Türkçe ve gizlilikte ne beklenmeli?
Gerçek zamanlı sürüm saniyenin altında gecikme, kayıt sürümü konuşmacı ve kelime zaman damgası vadediyor; 85'ten fazla dil desteği her aksanda aynı doğruluk demek değil.
2 okunma4 dk okumaGoogle — Introducing Gemini 3.5 Transcribe

Google, Gemini 3.5 Transcribe modelini 26 Ağustos 2026'da canlı ve kayıtlı ses için iki ayrı API yüzeyiyle tanıttı. `gemini-3.5-transcribe-live`, Live API üzerinden saniyenin altında gecikmeyle akış sunuyor. `gemini-3.5-transcribe` ise Interactions API'de kayıtlı toplantı ve çağrıları konuşmacı atfı ile kelime düzeyinde zaman damgasına dönüştürüyor.
Model dolgu seslerini temizleyebiliyor, “Salı—hayır, Çarşamba” gibi kendi kendine düzeltmeleri yorumlayabiliyor, özel terim sözlüğü alabiliyor ve 85'ten fazla dili otomatik tanıyabiliyor. Kayıtlı seste üç konuşmacıya kadar atıf destekleniyor; üçten fazlası deneysel olarak tanımlanıyor.
Doğruluk iddiası ne anlama geliyor?
Google, Artificial Analysis ölçümüne dayanarak kelime hata oranını canlı kullanımda ortalama yüzde 4,0, kayıtlı seste yüzde 2,6 olarak açıklıyor. Chirp 3'e göre son metne ulaşma süresinde yüzde 70 iyileşme bildiriliyor. FLEURS testindeki oranlar canlıda yüzde 5,50, kayıtlı seste yüzde 5,04.
Bu değerler bütün Türkçe aksanlar, gürültülü salonlar ve özel adlar için garanti değildir. Kelime hata oranı noktalama, konuşmacı ayrımı ve anlamlı yanlış ad gibi her kalite unsurunu tek başına göstermez. Yerel örneklerle test gerekir.
Nasıl başlanır?
Geliştirici Google AI Studio üzerinden genel önizlemedeki modeli seçer. Canlı altyazı için Live API, toplantı kaydı için Interactions API örneği kullanılır. İlk deneme kişisel bilgi içermeyen kısa sesle yapılır; insan tarafından hazırlanmış doğru metinle karşılaştırılır.
Örnek iş akışı:
“Bu kaydı Türkçe olarak yazıya çevir. Konuşmacıları yalnız ses yeterince ayırıyorsa etiketle; emin değilsen ‘belirsiz konuşmacı’ yaz. Özel terim listesi: [izinli liste]. Dolgu seslerini kaldır fakat anlamı değiştiren tekrarları koru. Her bölüm için zaman damgası ver.”
Üç somut kullanım örneği
- Canlı etkinlikte gecikmesi düşük altyazı üretip editör ekranında düzeltme kuyruğu oluşturmak.
- Müşteri çağrısını açık rıza ve saklama politikasıyla konuşmacı-zaman damgalı inceleme metnine dönüştürmek.
- Doktor, avukat veya mühendislik gibi özel terimli alanda izinli sözlükle taslak üretip uzman kontrolüne vermek.
Erişim ve maliyet
Model geliştiriciler için Gemini API ve Google AI Studio'da, kurumlar için Gemini Enterprise Agent Platform'da genel önizlemede. macOS Gemini uygulamasında İngilizce, Android Rambler'da seçili ülke ve dillerde kullanılıyor; Chrome'a gelmesi planlanıyor. Önizleme kapsamı ve fiyat değişebilir. Bilgiler 1 Eylül 2026'da doğrulandı; API fiyat sayfası kullanılmadan maliyet tahmini yapılmamalı.
Sınırlar ve gizlilik
Ses; biyometrik, sağlık, müşteri ve özel konuşma verisi içerebilir. Kayıt için hukuki dayanak ve katılımcı bilgilendirmesi gerekir. Ses ile metnin nerede işlendiği, ne kadar saklandığı ve kimlerin eriştiği belgelenmeli. Model çıktısı ham kaydın güvenli kopyası değildir.
Yanlış isim, tutar veya olumsuzluk ciddi sonuç yaratabilir. Kritik bölüm insan tarafından sesle karşılaştırılmalı; güven puanı düşük parçalar işaretlenmeli. Otomatik konuşmacı atfı kimlik doğrulama amacıyla kullanılmamalıdır.
Türkçe pilotu nasıl ölçülür?
En az otuz kısa kayıt; sakin oda, sokak gürültüsü, telefon hattı, hızlı konuşma ve farklı bölgesel söyleyişlerden dengeli seçilir. Kayıtlar için insan tarafından doğrulanmış referans metin hazırlanır. Kelime hata oranının yanında kişi adı, para, tarih, olumsuzluk, soru işareti ve konuşmacı değişimi ayrı puanlanır. Bir yanlış rakamın etkisi sıradan bağlaç hatasından daha ağır sayılır.
Özel sözlük testi için yalnız gerçek kullanımda geçen izinli terimler eklenir. Sözlük açık ve kapalı sonuçları karşılaştırılır; modelin terimi yanlış yerde zorla kullanıp kullanmadığı görülür. Canlı sürümde ilk parça gecikmesi, son metne ulaşma süresi ve ara metnin ne kadar değiştiği ölçülür. Kayıt sürümünde zaman damgası, konuşmacı ayrımı ve uzun sessizlik davranışı incelenir.
Pilot sonucu ürün başına yayımlanmalıdır: toplantı notunda kabul edilen hata, canlı altyazı ve tıbbi dikte için aynı olmayabilir. Yüksek riskli alanlarda insan düzeltmesi ve ses kaydına geri dönme zorunlu tutulur. Dil modeliyle sonradan “düzeltme” özgün anlamı değiştirebileceği için değişiklik izi saklanmalıdır.
Canlı altyazıda bağlantı kesilirse ekranda eski metnin yeniymiş gibi kalmaması gerekir. Uygulama çevrimdışı ve yeniden bağlanma durumunu açıkça göstermeli, kayıp ses bölümünü işaretlemelidir. Kayıt işleminde dosya biçimi, kanal sayısı ve örnekleme hızı standartlaştırılmalı. Çok uzun kayıtlar bölünürken konuşmacı kimliğinin parçalar arasında tutarsızlaşabileceği hesaba katılmalıdır.
Kullanıcıya ham sesin saklanıp saklanmadığı, düzeltmenin kim tarafından yapıldığı ve nihai metnin hukuki kayıt sayılıp sayılmadığı açıklanmalı. Bir müşteri talimatı, sözleşme onayı veya tıbbi karar yalnız otomatik metne dayanarak işleme alınmamalıdır. Şüpheli tutar ve özel adlar sesle ikinci kez doğrulanmalıdır.
Altyazı erişilebilirlik amacıyla kullanılıyorsa konuşma dışı önemli sesler ve konuşmacı değişimi için insan editör standardı belirlenmelidir. Otomatik temizleme, dolgu sesini kaldırırken konuşmacının anlamını ve üslubunu değiştirebilir. Ham ve düzeltilmiş sürüm ayrı tutulmalı; alıntı yayımlanacaksa ses kaydıyla doğrulanmalıdır.
Okuyucu bugün bir dakikalık kamuya açık Türkçe kaydı elle yazıp model çıktısıyla kelime, özel ad ve zaman damgası açısından karşılaştırabilir. Ses yapay zekâsını ölçerek ve mahremiyeti koruyarak kullanmak için Mülk Rehberi Gazetesi'ni takip edin.
