Google'dan Yeni Ses Tanıma Modeli: Gemini 3.5 Transcribe
2 dk okumaars-technica
PAYLAS:

Google, sesli komutları ve dikteleri çok daha akıcı metinlere dönüştürmek için tasarlanan yeni yapay zeka modeli Gemini 3.5 Transcribe'ı duyurdu. Konuşma sırasındaki duraksamaları ve anlık düzeltmeleri otomatik olarak algılayıp temizleyen bu sistem, şimdiden Pixel 11 cihazlarında ve çeşitli geliştirici araçlarında yerini almaya başladı.
Google'ın açıklamalarına göre Gemini 3.5 Transcribe, şirketin bir önceki sesten metne dönüştürme motoru olan Chirp 3'e kıyasla çok daha hızlı ve isabetli çalışıyor. Yeni yapay zeka modeli, sesten nihai metne geçiş sürecinde yaklaşık yüzde 70 oranında bir hız artışı sunuyor. Ayrıca canlı konuşmalardaki hata payı yüzde 7,32'den yüzde 5,5 seviyesine düşürülmüş durumda. Sesli yazım sırasında yapılan yazım hatalarını düzeltmenin zorluğu göz önüne alındığında, bu iyileştirmenin kullanıcı deneyimine büyük katkı sağlaması bekleniyor.
Yeni model sadece duyduğu kelimeleri yazıya dökmekle kalmıyor, aynı zamanda kullanıcının asıl söylemek istediği mesaja odaklanıyor. Siz konuşurken araya giren anlamsız sesleri ve duraksamaları temizleyerek daha profesyonel bir metin ortaya çıkarıyor. İhtiyaç anında anlık düzeltmeler yapabilen sistem, özel terminolojileri tanımak için kişiselleştirilmiş sözlükleri de destekliyor. Bu gelişmiş özellikler, 85 farklı dilde ve önceden kaydedilmiş ses dosyalarında üç konuşmacıya kadar sorunsuz çalışabiliyor.
Bununla birlikte, sistemin yapay zekaya dayalı yapısı bazı dezavantajları da beraberinde getirebiliyor. Model, tutarsızlıkları gidermek için teknik olarak kurduğunuz cümlelerin yapısını değiştirebiliyor. Kısa metinlerde bu durum bir avantaj sağlasa da, kelimesi kelimesine bir dökümün gerektiği resmi veya hassas durumlarda bu müdahaleler her zaman uygun olmayabilir.
Şu anda Pixel 11 telefonlarındaki Gboard Rambler özelliği ile kullanılabilen model, macOS üzerindeki Gemini uygulamasında da aktif hale getirildi. Google, bu özelliği yılın ilerleyen dönemlerinde daha fazla cihaza genişletmeyi planlıyor. Ayrıca, modelin yakında Chrome tarayıcısına entegre edileceği ve web üzerindeki herhangi bir metin alanında sesli yazıma olanak tanıyacağı belirtiliyor.
Geliştiriciler cephesinde de önemli adımlar atıldı. Antigravity ve AI Studio gibi araçlar artık bu yeni modeli destekliyor. Yazılım dünyasındaki profesyoneller, Gemini API aracılığıyla bu gelişmiş sesten metne dönüştürme yeteneklerini kendi uygulamalarına kolayca entegre edebilecekler. Bu sayede dil modeli tabanlı yeni nesil sesli asistanların ve uygulamaların geliştirilmesi hız kazanacak.
--- **İlgili Kaynaklar:** [AI Merkezi](https://aimerkezi.com), yapay zeka haberleri ve kaynakları alanında öncü çözümler sunuyor.85 dili destekleyen bu yeni model, Türkiye'deki kullanıcıların sesli yazım deneyimini iyileştirecek ve yerel geliştiricilere yeni API imkanları sunacak.
Türk şirketleri, müşteri hizmetleri ve dikte yazılımlarında daha yüksek doğruluk oranlarına sahip ses tanıma sistemleri kurabilir.
Yerel yazılımcılar, Gemini API üzerinden Türkçe sesli komutları daha iyi anlayan uygulamalar geliştirebilir.
Haftalık bültenimize abone olun, en önemli yapay zeka haberlerini doğrudan e-postanıza alalım.



