NVIDIA PersonaPlex-7B, aynı anda konuşup dinleyebilen, gerçek zamanlı full-duplex sesli yapay zeka modelidir. Klasik sesli asistanların kullanıcı bitene kadar bekleyen yapısının aksine; araya girmeleri, kısa geri bildirimleri ve doğal konuşma ritmini yönetmeyi hedefler. Model 15 Ocak 2026’da açık erişimli kod ve ağırlıklarla duyuruldu; ancak ağırlıklara erişim için Hugging Face üzerinde NVIDIA Open Model License koşullarının kabul edilmesi gerekiyor (gated model erişimi hakkında detaylı bilgi rehberimizde).
Kısaca PersonaPlex-7B
- Model: 7 milyar parametreli speech-to-speech (konuşmadan konuşmaya) model.
- Temel fark: Dinleme ve konuşma akışları eş zamanlı çalışır.
- Kontrol: Metinle rol/persona, ses örneğiyle konuşma tarzı yönlendirilebilir.
- Kullanım: Şu anki model kartına göre İngilizce ses girdisi ve İngilizce ses çıktısı için tasarlanmıştır.
NVIDIA PersonaPlex-7B nedir?
PersonaPlex-7B, NVIDIA Research tarafından geliştirilen tam çift yönlü bir konuşma modeli. Full-duplex yaklaşımda model, kullanıcının sesi akmaya devam ederken kendi sesli yanıtını da üretebilir. Böylece karşılıklı konuşmadaki kısa “evet”, “anladım”, “devam et” gibi geri bildirimler; uygun duraklamalar ve kullanıcının söze girmesiyle yanıtı kesip yeni bağlama geçme gibi davranışlar tek konuşma akışında ele alınır.
Bu yaklaşım, özellikle sesli asistanların “sor–bekle–yanıt al” kalıbından çıkması açısından önemli. Sesli asistan deneyimini karşılaştırmak için ChatGPT ile sesli konuşma rehberimize ve Google ekosistemindeki alternatifler için Gemini sesli komut rehberimize de göz atabilirsiniz.
Klasik sesli asistanlardan farkı
Geleneksel sesli yapay zeka ürünleri çoğunlukla üç ayrı aşamayı sırayla yürütür: konuşmayı metne çevirme (ASR), metinden yanıt üretme (LLM) ve yanıtı tekrar sese dönüştürme (TTS). Bu yapı özelleştirilebilirlik sağlar; fakat aşamalar arasındaki geçiş, gecikmeye ve konuşmada yapay boşluklara neden olabilir.
| Özellik | Geleneksel zincir | PersonaPlex-7B yaklaşımı |
|---|---|---|
| Konuşma biçimi | Sıralı: kullanıcı biter, model yanıtlar | Eş zamanlı dinleme ve konuşma |
| Kesinti (barge-in) | Genellikle ayrı mantıkla yönetilir | Modelin temel konuşma davranışının parçası |
| Persona kontrolü | Sistem promptu ve ayrı TTS sesi | Metinle rol + ses örneğiyle vokal stil |
| Gecikme kaynağı | ASR → LLM → TTS geçişleri | Tek modelde akış tabanlı ses üretimi |
Teknik mimari nasıl çalışıyor?
Model, Kyutai’nin Moshi mimarisi üzerine kurulu. 24 kHz ses, Mimi encoder ile ses token’larına dönüştürülüyor; temporal ve depth transformer katmanları konuşma akışını işliyor; Mimi decoder ise sesli yanıtı üretiyor. Alttaki Helium dil modeli, anlam ve bağlam takibini destekliyor. Çift akış (dual-stream) yapısı sayesinde kullanıcı sesi modele parça parça beslenirken modelin çıkışı da eş zamanlı üretilebiliyor.
Persona kontrolü iki katmandan oluşuyor: Metin promptu; rolü, arka planı ve konuşma bağlamını tanımlar. Ses promptu ise ses rengi, konuşma stili ve prozodi gibi vokal özellikleri yönlendirir. Bu nedenle aynı teknik altyapı; müşteri temsilcisi, öğretmen veya belirli bir senaryo karakteri gibi farklı roller için uyarlanabilir.
Ölçülen performans sonuçları
NVIDIA’nın model kartında yer alan FullDuplexBench sonuçları, modelin konuşma dinamikleri açısından test edildiğini gösteriyor. Bu metrikler genel bilgi doğruluğundan çok, sıra alma, kesintiye tepki, duraklama yönetimi ve konuşma akışına odaklanır.
| Metrik | Sonuç | Ne anlatıyor? |
|---|---|---|
| Smooth turn-taking | 0,908 | Akıcı sıra alma başarısı |
| Sıra alma gecikmesi | 0,170 sn | Konuşma sırasındaki yanıt hızı |
| Kullanıcı kesintisini yönetme | 0,950 | Araya giren kullanıcıya uyum |
| Kesinti gecikmesi | 0,240 sn | Kesinti sonrası tepki süresi |
| GPT-4o ile değerlendirilen yanıt kalitesi | 4,290 | Benchmark içindeki yanıt kalitesi puanı |
Bu rakamlar NVIDIA’nın yayımladığı benchmark sonuçlarıdır; gerçek bir ürün deneyiminde ağ gecikmesi, kullanılan GPU, ses giriş kalitesi ve uygulamanın ses zinciri sonuçları doğrudan etkiler. Bu nedenle sonuçları, “her donanımda garanti edilen uçtan uca gecikme” yerine modelin laboratuvar/benchmark davranışı olarak okumak daha doğrudur.
Hangi kullanım alanlarına uygun?
- Müşteri hizmetleri: Kullanıcı sözünü kesmeden dinleyen, doğal geri bildirim verebilen ve role uygun konuşan sesli temsilciler.
- Eğitim: Öğrencinin araya girebildiği, anlatım temposu daha doğal olan sesli öğretici deneyimleri.
- Oyun ve karakter tasarımı: Metin promptuyla persona, ses promptuyla vokal tarz kontrollü etkileşimli karakterler.
- Araştırma ve prototipleme: Açık kod sayesinde sesli ajan deneyimlerini kendi altyapısında test etmek isteyen ekipler.
İçerik üretiminde sesin nasıl kullanılabileceğini ayrıca yapay zeka seslendirme araçları karşılaştırmamızda inceleyebilirsiniz.
Nasıl kullanılır?
PersonaPlex, tek tıkla çalışan tüketici uygulaması değil; yerel veya sunucu tabanlı kurulum gerektiren bir geliştirici modelidir. NVIDIA’nın resmi deposu Linux, PyTorch, Moshi paketi ve Opus geliştirme kütüphanesiyle çalışacak bir ortam tarif ediyor. Model ağırlıklarını kullanmak için Hugging Face hesabıyla lisans koşullarını kabul etmek ve erişim belirteci tanımlamak gerekiyor.
- NVIDIA’nın resmî GitHub deposunu indirin ve ortam bağımlılıklarını kurun.
- Hugging Face model sayfasında NVIDIA Open Model License koşullarını kabul edin ve erişim token’ını yapılandırın.
- Sunucuyu başlatıp tarayıcı arayüzüne bağlanın; donanım belleği sınırlıysa CPU offload seçeneğini değerlendirin.
- Bir ses promptu ve rolü tarif eden metin promptu vererek senaryonuzu test edin.
Kurulum gerçeği: Resmî model kartı, test edilen donanım olarak NVIDIA A100 80 GB’ı listeliyor; desteklenen sistemler NVIDIA Ampere/Hopper GPU’lar ve Linux. Kod deposundaki CPU offload seçeneği bellek darboğazında yardımcı olabilir ancak gerçek zamanlı deneyim için GPU gereksinimini ortadan kaldırmaz. Üretime geçmeden önce kendi kullanım senaryonuz, veri güvenliği ve gecikme hedeflerinizle test yapmalısınız.
Lisans, dil ve sınırlamalar
- İngilizce odaklıdır: Model kartında, İngilizce konuşma girdisiyle İngilizce ses çıktısı üretmek için tasarlandığı belirtilir. Türkçe sesli ajan projesi için doğrudan hazır çözüm olarak düşünülmemeli; ayrıca test edilmelidir.
- Model dosyaları erişim kısıtlıdır: Sayfa herkese açık olsa da dosyalar için lisans koşullarının kabul edilmesi ve iletişim bilgisinin paylaşılması istenir.
- Lisanslar ayrıdır: Kod MIT lisansıyla yayımlanırken, model ağırlıkları NVIDIA Open Model License kapsamındadır. Bu nedenle “tamamen MIT lisanslı model” ifadesi doğru değildir.
- Güvenlik değerlendirmesi gerekir: NVIDIA, gerçek kullanıma alınmadan önce kullanım senaryosuna özgü birim ve sistem testleri yapılmasını önerir. Sağlık, finans ve müşteri verisi içeren alanlarda ek uyumluluk süreçleri zorunlu olabilir.
Sıkça sorulan sorular
PersonaPlex-7B ücretsiz mi?
Kaynak kodu MIT lisanslıdır. Model ağırlıkları NVIDIA Open Model License ile sağlanır; Hugging Face’te koşulları kabul ederek erişim talep etmeniz gerekir. Kullanımın ticari uygunluğunu kendi projeniz için lisans metninden doğrulamalısınız.
PersonaPlex Türkçe konuşuyor mu?
Resmî model kartı İngilizce ses girdisi ve İngilizce ses çıktısı kullanımını tanımlıyor. Türkçe için resmî performans iddiası bulunmadığından, Türkçe sesli müşteri hizmetleri projesinde önce kapalı test yapılmalıdır.
PersonaPlex ses klonlama modeli mi?
Model, ses promptuyla vokal karakter ve konuşma tarzını yönlendirebilir. Ancak bir sesin kullanılmasından önce açık izin alınması, taklit/kimlik yanıltma risklerinin önlenmesi ve yerel mevzuata uyulması gerekir.
ChatGPT veya Gemini’nin yerine geçer mi?
Hayır; PersonaPlex bir sesli konuşma altyapısıdır. Genel amaçlı sohbet, web araştırması, görsel üretimi veya ofis entegrasyonları gibi ürün katmanlarını tek başına sunmaz. En gerçekçi değerlendirme, onu sesli ajan sisteminizin konuşma motoru olarak düşünmektir.
Yapay zeka haberleri, sesli ajan gelişmeleri ve pratik rehberleri kaçırmamak için Dijipedya bültenine ücretsiz abone olun.
İlgili içerikler
Kaynaklar: NVIDIA Research PersonaPlex, Hugging Face model kartı, NVIDIA GitHub deposu. Son kontrol: 24 Ağustos 2026.




