Ekonomi

Grok Voice Transcribe 2.0’ı daha yüksek doğrulukla piyasaya sürdü

Investing.com — Grok, Cuma günü Voice Transcribe 2.0’ı piyasaya sürdü. Bu konuşmadan metne dönüştürme modeli, önceki versiyonundan iki kat daha yüksek doğruluk sunuyor. Fiyat ise aynı seviyede kalıyor. Şirket, yeni modelin kamuya açık Artificial Analysis lider tablosunda 32 akış modeli arasında doğruluk açısından birinci sırada yer aldığını açıkladı.

Güncellenmiş transkripsiyon aracı, Grok Voice’u destekleyen ses temel modeli üzerine inşa edildi. Bu sistem şu anda günlük olarak on binlerce müşteri destek çağrısını yönetiyor. Ayrıca milyonlarca saatlik video anlatımını metne dönüştürüyor. Teknoloji, fiziksel ürünlerde de sesli asistanlar çalıştırıyor. Bunlar arasında Tesla (NASDAQ:TSLA) araçlarındaki Grok asistanı da bulunuyor.

Grok Voice Transcribe 2.0, gerçek dünya ses koşullarını işlemede iyileştirmeler gösteriyor. Zayıf telefon bağlantıları, birden fazla konuşmacı, bölgesel aksanlar ve sözlü kimlik bilgileri bunlar arasında. Şirket, modeli dört kategoride yedi rakiple test etti. Bunlar müşteri destek çağrılarından telefon sesi, Grok ile konuşmalar, sözlü kimlik bilgileri ve kısa çok dilli ses komutlarıydı.

Telefon testlerinde 8 kHz ses kullanıldı. Yeni model yüzde 7,1 kelime hata oranı elde etti. Önceki versiyonda bu oran yüzde 10,6’ydı. Konuşma sesinde hata oranı yüzde 8,7’den yüzde 3,3’e düştü. Telefon numaraları ve e-posta adresleri gibi kimlik bilgilerinin transkripsiyonundaki hatalar yüzde 7,2’den yüzde 3,2’ye geriledi.

Model, otomatik algılama ile düzinelerce dili destekliyor. Kayıt ortasında yapılan dil değişikliklerini takip edebiliyor. 19 dilde kısa ifadeler için kelime hata oranı yüzde 20,6’dan yüzde 6,8’e düştü.

Atlassian Loom, tüm video kayıtlarını metne dönüştürmek için yeni modeli benimsedi. Atlassian’da Teamwork Collection kıdemli başkan yardımcısı Sanchan Saxena şöyle dedi: “İşi ilerletmenin en iyi yolunun bağlamı bir kez yakalamak ve her yere akmasına izin vermek olduğuna her zaman inandık.”

Fiyatlandırma ilk versiyondan değişmedi. Toplu transkripsiyon ses saati başına 0,10 dolar. Akış ise saat başına 0,20 dolar. Hizmet, konuşmacı ayrımı, kelime düzeyinde zaman damgaları ve anahtar terim yönlendirmeyi ek ücret olmadan içeriyor. Model, önümüzdeki haftalarda Speech-to-Text API’de varsayılan hale gelecek.

Bu makale yapay zekanın desteğiyle oluşturulmuş, çevrilmiş ve bir editör tarafından incelenmiştir. Daha fazla bilgi için Şart ve Koşullar bölümümüze bakın.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Başa dön tuşu