Pilot çalıştı. Üretim dağıtımı gerçekleşmedi. Çoğu işletme için fark, planlamadıkları tek bir şeyden kaynaklanmaktadır: konuşma katmanı.
Sesli yapay zeka aracısı oluşturmak hiç bu kadar kolay olmamıştı. Yüksek Lisans, metinden konuşmaya ve konuşmayı metne dönüştürme, ikna edici kavram kanıtlamanın birkaç gün içinde gerçekleştirilebileceği noktaya kadar olgunlaştı. Sorun bundan sonra ne olacağıdır. Bu aracının gerçek telefon altyapısına, arka uç sistemlerine ve insani yükseltme iş akışlarına bağlanması, üretken yapay zeka tarafından hızlandırılmaz. Bu iş hâlâ zordur ve boşluk da tam burada ortaya çıkıyor.
Yehuda Herscovici, AudioCodes Ürün Başkan Yardımcısıbu oyunu defalarca gördü:
“Çok etkileyici bir sesli yapay zeka aracısı tasarlamak ve ona sahip olmak, pilot uygulamaları başlatmak, POC'ler yapmak neredeyse önemsiz hale geldi. Ancak geliştirdiğiniz sesli yapay zeka aracısından memnun olduğunuzda, onu üretime koymanız gerekiyor. Burası onu arka uç sistemlerinizle, bilgi tabanınızla ve telefon sistemleriyle entegre etmeniz gereken yer.”
Uyumluluk çalışması, telefon yığını entegrasyonu, yükseltme tasarımı: LLM daha iyi hale geldiği için hiçbiri daha hızlı değil. Uygulamalar yapay zekanın başarısız olması nedeniyle değil, etrafındaki her şeyin henüz hazır olmaması nedeniyle başarısız oluyor.
Telefon entegrasyonu göründüğünden daha zordur
Pilotta bir telefon numarası verirsiniz ve ayrı olarak test edersiniz. Üretimde, kuruluşun halihazırda sahip olduğu şeylerle entegre olursunuz: SIP hatları, yerel iletişim merkezleri, UC platformları; hepsi tutarsız uygulamalara sahip VoIP protokolleri üzerine kuruludur. Voice AI yığını tamamen farklı bir mimari dünyada var.
“İyi bir ses kalitesi ve yedeklilik ile geniş ölçekte yapsanız bile bu iki dünya arasında köprü kurmak çok zordur” diyor Ilan Avner, AudioCodes ürün yönetimi direktörü.
Sorun, geçişin ortasında olan ve bulut platformlarına geçerken şirket içi altyapı çalıştıran kuruluşlar için daha da kötüleşiyor. Çoğu, ses yapay zeka yatırımlarının bu geçişe zaten taahhütte bulunana kadar hayatta kalamayacağının farkında değil.
Ses katmanı başarısız olana kadar görünmez
Dağıtımın başarısız olmasına neden olana kadar nadiren ortaya çıkan bir altyapı sorunu vardır. Aktarım katmanındaki ses kalitesi zayıfsa onun üzerine inşa edilen AI yığını başarısız olur. Böyle bir durumda suç yapay zekaya düşüyor.
“Ulaşım ve altyapı katmanlarında yüksek kaliteli sese sahip bir sesli yapay zeka aracısı sağlamazsanız başarısız olur. İyi çalışırsa kimse bunun hakkında konuşmaz. Ancak başarısız olursa herkes yapay zekayı suçlar ve onun prime time'a hazır olmadığını söyler.”
Herscovici'nin benzetmesi elektriktir: Bir veri merkezi birinci sınıf olabilir, ancak güvenilir bir güç kaynağı olmadan hiçbir şey çalışmaz. Aktarım katmanındaki gürültü filtreleme, gecikme kontrolü ve ses netliği iyileştirmeler değildir. Temeli oluştururlar. AudioCodes, hem Live Hub hem de Voice AI Connect'in konumlandırılmasında merkezi öneme sahip olan bu katmana 30 yıllık VoIP altyapı deneyimini getiriyor.
Ölçek, çoğu uygulamanın aslında başarısız olduğu yerdir
Beş veya on eş zamanlı seanstan sonra görülmeyen sorunlar, yüzlerce seansta kritik hale gelir. Telefon kanalları sınırlarına ulaşıyor. Konuşmayı metne dönüştürme motorları zaman zaman başarısız olmaya başlar. LLM yanıt süreleri yük altında yavaştır. Düzenleme katmanı bir darboğaz haline gelir. Her parçanın bir tavanı var ve üretim hacmi hepsini buluyor.
“Sesli yapay zeka uygulamasının nerede sıkışıp kaldığını merak ediyorsanız bu pilotla ilgili değil. Her zaman ölçeklendirme ve yüksek kullanılabilirlikle ilgili.”
AudioCodes, dağıtımları on binlerce eşzamanlı oturumda yürütüyor ve Herscovici, bunun dünyadaki en büyük konuşma yapay zekası dağıtımları arasında yer aldığını söylüyor. Bu hacimle birlikte coğrafi yedeklilik ve kesintisiz yük devretme hoş eklemeler değildir. Bunlar, başlangıçtan itibaren tasarlanması gereken ve devreye alma sonrasında sonradan donatılmaması gereken teknik gereksinimlerdir.
Günümüz teknolojisine bağlı kalmak başlı başına bir risktir
Bugün sınıfının en iyisi olarak kabul edilen ASR ve TTS sağlayıcıları, bundan on iki ay sonra doğru seçim olmayabilir. LLM ödülleri ve performansı kısa bir döngüyü takip eder. Her katmanda tek bir sağlayıcı etrafında oluşturulan dağıtım mimarisi, bu değişiklikleri yeterince özümsememeniz veya daha iyi bir şey ortaya çıktığında yeniden inşa etmeniz gerektiği anlamına gelir.
“Şu anda sadece en iyi teknolojiyi seçmeniz önemli değil. Çalışmanızı koruyabilmeniz ve bu bileşenleri, yeni teknoloji satıcıları ortaya çıktıkça veya daha düşük gecikme süresi veya daha düşük maliyetlere sahip bir şey seçebildikçe değiştirebilmeniz gerekiyor.”
Yığının her katmanındaki satıcı bilinmezliği, AudioCodes Live Hub'ın arkasındaki temel tasarım ilkelerinden biridir.
Yayına geçmeden önce doğrulamanız gerekenler
Avner ve Herscovici, şirketlerin üretime geçmeden önce sürekli olarak test etmekte başarısız oldukları çeşitli alanlara dikkat çekiyor:
- Telefon entegrasyon derinliği. Sağlanan bir test numarasına göre değil, gerçek yığınınıza göre test edilmiştir.
- Eşzamanlılık sınırları. Her bileşen (ASR, TTS, LLM, orkestratör ve ses altyapısı), bozulmaya başlayacağı eşiğe kadar test edilir.
- Yük altında gecikme. Pilot ölçekte üretim hacmini sınırlayan faktör hangisidir?
- Artıklık ve yük devretme. Bir TTS veya STT sağlayıcısı yanıt vermeyi durdurursa sistemin ne yapacağı.
- Sağlayıcının esnekliği. Veya ASR, TTS veya LLM sağlayıcıları, dağıtımı yeniden oluşturmaya gerek kalmadan değiştirilebilir.
- Bulut geçişi sürekliliği. Yatırımın gelecekte şirket içinden bulut iletişim merkezi altyapısına geçişte hayatta kalıp kalamayacağı.
Sesli yapay zekayı üretime sokan şirketlerin mutlaka en iyi yapay zekaya sahip olanlar olması gerekmiyor. Model katmanı kadar altyapı katmanını da ciddiye alan onlardır. AudioCodes Canlı Merkezi Ve Voice AI Connect Enterprise Sesli yapay zekayı üretim düzeyinde dağıtmanın bir yapay zeka sorunu olduğu kadar bir altyapı sorunu olduğu önermesi etrafında inşa ediliyoruz.

Bir yanıt yazın