IBM'den hızlı ses modeli Granite Speech 5: Tarayıcıda deneyin, lisansı seçerken dikkat edin
İki yeni 470 milyon parametreli model İngilizce konuşmayı metne çeviriyor; ticari kullanıma açık sürüm ile daha isabetli fakat ticari olmayan sürümün lisansları farklı.
1 okunma4 dk okumaIBM Granite / Hugging Face — Granite Speech 5.0 TurboCTC duyurusu

IBM Granite ekibi, konuşmayı yazıya dönüştürmek için hız odaklı iki yeni açık model yayımladı. Granite Speech 5.0 TurboCTC ailesindeki iki model de 470 milyon parametreli ve yalnız İngilizce otomatik konuşma tanıma görevi için tasarlandı. En kritik ayrım yalnız başarı oranı değil, lisans: ana sürüm Apache 2.0 ile ticari kullanıma açıkken “nc” uzantılı sürüm CC BY-NC-SA 4.0 lisansı nedeniyle ticari kullanıma uygun değil.
Bu ayrıntı, model sayfasındaki ilk indirme düğmesinden daha önemli olabilir. Bir şirket prototipte daha düşük hata oranı gördüğü ticari olmayan sürümü seçerse ürünü yayına alırken lisans sorunu yaşayabilir. Bu nedenle model kimliği ve lisans, kod deposunda sabitlenmeli ve hukuk ekibiyle doğrulanmalı.
Hız iddiası ne anlama geliyor?
IBM'in Hugging Face'te yayımladığı ölçüme göre iki model, NVIDIA H200 üzerinde toplu çıkarımda 12 bin 600 RTFx'in üzerine çıktı. Başka bir ifadeyle uygun toplu iş yükünde bir saniyede 3,5 saatten fazla ses işleyebilecek bir tepe hız raporlandı. Bu, tek bir kullanıcının canlı konuşmasında aynı oranın görüleceği anlamına gelmiyor; donanım, toplu iş büyüklüğü, ses süresi ve veri aktarımı sonucu değiştirir.
25 Ağustos 2026 tarihli açık OpenASR testlerinde Apache 2.0 sürümü yüzde 5,00, ticari olmayan sürüm yüzde 4,85 toplu kelime hata oranı bildirdi. Daha düşük değer daha iyi kabul edilir. Sonuçlar İngilizce ve belirli test kümeleri için resmî üretici ölçümleridir; Türkçe doğruluğu hakkında kanıt sunmaz.
Modelin hızında yalnız boyut değil, mimari tercih de etkili. Yeni TurboCTC sürümleri dil modeli bağlayan önceki Granite Speech yapısından farklı olarak yalnız kodlayıcı kullanıyor. Bu seçim belleği ve işlem süresini düşürürken konuşma çevirisi ve anahtar kelime yönlendirme gibi bazı özelliklerden vazgeçiyor.
Kimler kullanabilir?
İngilizce toplantı kaydı, çağrı merkezi dökümü, podcast altyazısı veya cihaz üzerinde sesli not geliştiren ekipler modeli değerlendirebilir. Ağırlıklar Hugging Face'ten ücretsiz indirilebiliyor; fakat GPU, barındırma ve bakım maliyeti ücretsiz değil. Hassas seslerde yerel çalıştırma, üçüncü tarafa ham kayıt göndermemek açısından avantaj sağlayabilir.
Kod yazmadan bakmak isteyenler Chrome veya Edge üzerinde çalışan WebGPU akış demosunu açabilir. Geliştirici tarafında model Transformers ile kullanılabiliyor. Duyuru tarihinde destek bir sonraki kararlı Transformers sürümünü beklediği için kaynak koddan kurulum öneriliyor:
```bash pip install git+https://github.com/huggingface/transformers.git datasets ```
Ardından `ibm-granite/granite-speech-5.0-470m-turboctc` kimliğiyle işlemci ve model yüklenebiliyor. Üretime geçmeden önce paket sürümlerini kilitlemek, ses örnekleme hızını doğrulamak ve gerçek kurum verisiyle ölçüm yapmak gerekiyor.
Üç somut kullanım örneği
- İngilizce bir çevrim içi toplantının taslak tutanağını hızla çıkarmak, ardından kişi ve karar adlarını insan kontrolünden geçirmek.
- Büyük bir podcast arşivini gece toplu işleyip bölüm içinde aranabilir zaman damgalı metin üretmek.
- İnternete sürekli bağlı olmayan bir saha cihazında kısa İngilizce sesli notları yerel olarak metne çevirmek.
Örnek iş akışı; sesi 16 kHz'e dönüştürme, sessizlik ve kanal kontrolü, modelle taslak döküm, özel adlar için sözlük tabanlı son işlem, düşük güvenli bölümleri işaretleme ve insan onayı adımlarından oluşabilir. Modelde yerleşik anahtar kelime yönlendirme olmadığı için marka ve kişi adlarında son işlem özellikle önemlidir.
Kendi verinizle nasıl kıyaslanır?
Bir modeli yalnız yayımlanan ortalama WER değerine göre seçmek yerine 30-50 temsilî kayıtla küçük bir değerlendirme yapılabilir. Temiz mikrofon, telefon hattı, arka plan gürültüsü, farklı aksanlar ve birden çok konuşmacı ayrı gruplara konulmalı. Her grupta kelime hata oranının yanında kişi adı, tarih, tutar ve olumsuzluk sözcükleri gibi anlamı değiştiren hatalar ayrıca sayılmalı.
Aynı kayıtlar mevcut çözümle de çalıştırılarak gerçek hız, bellek, ilk çıktı süresi ve toplam maliyet karşılaştırılabilir. Toplu arşiv dökümünde H200 tepe hızı önemliyken canlı altyazıda ilk parçanın ne kadar hızlı geldiği daha değerlidir. Model kartındaki ortalama sonuç, kurumun kendi ses koşullarındaki bu iki farklı ihtiyacın yerini tutmaz.
Başarı eşiği önceden yazılmalı: örneğin özel adlarda insan onayı zorunlu, düşük güvenli bölümler işaretli ve ham ses belirli sürede siliniyor. Böylece “hızlı model” tercihi ölçülebilir bir ürün kararına dönüşür.
Sınırlar ve gizlilik
Granite Speech 5 TurboCTC İngilizce odaklıdır; Türkçe için doğru araç gibi sunulamaz. Gürültü, ağır aksan, üst üste konuşma, telefon hattı ve alan terimleri hata oranını yükseltebilir. Yayımlanan WER değeri her kullanıcının kaydında aynı sonucu garanti etmez.
Ses kaydı biyometrik ve kişisel bilgi taşıyabilir. Katılımcıların bilgilendirilmesi, saklama süresi, erişim yetkisi ve silme politikası model seçiminden önce belirlenmeli. Otomatik döküm; mahkeme, sağlık veya işe alım gibi yüksek etkili alanlarda tek başına kanıt veya karar temeli yapılmamalı.
Bilgiler 1 Eylül 2026'da kontrol edildi. Model ağırlıkları ücretsiz erişilebilir; ticari kullanım için Apache 2.0 sürümü ile “nc” sürümü kesin biçimde ayrılmalı. Okuyucu bugün tarayıcı demosuyla kendi İngilizce kaydını deneyip hızdan önce hata türlerini not ederek gerçek ihtiyacını ölçebilir.
Sesli yapay zekâ araçlarını gösterişli demoların ötesinde, lisans ve kullanım pratiğiyle izlemek için Mülk Rehberi Gazetesi'ni takip edin.
