
2026'nın En İyi 6 Açık Kaynak Sesli Ajan Framework'ü (Sıralandı)
Geçen çeyrekte Pipecat üzerinde telefon tabanlı üç sesli ajan yayına aldık, ardından müşteri eşzamanlı çağrı sayısını 20'den 400'e çıkarınca birini LiveKit Agents ile yeniden kurduk. İkisi de açık kaynak sesli ajan framework'ü. Hiçbiri tek başına "en iyisi" değil. Farklı işlerde iyiler ve yanlış seçim size haftalar kaybettirir.
Bu sıralama, README'de iyi okunan değil, gerçekten üretime giren şeylere dayanıyor. 14 Temmuz 2026 itibarıyla canlı GitHub verilerine baktık: Pipecat 13,416 yıldızda, LiveKit Agents 11,356'da, TEN Framework ise 10,898'de. Yıldız sayısı tek başına bir şey söylemiyor, bu yüzden commit sıklığını, telefon desteğini, lisans şartlarını ve her birinin gerçek çağrı hacmi altında nasıl davrandığını da değerlendirdik.
Hızlı yanıt: 2026'da çoğu ekip için Pipecat, geniş entegrasyon kütüphanesi ve neredeyse her gün gelen geliştirmeleriyle en güçlü açık kaynak sesli ajan framework'ü. LiveKit Agents ölçek ve native telefon desteğinde, TEN Framework multimodal graph orkestrasyonunda, Bolna ise bir öğleden sonrada canlı bir telefon ajanı çıkarmakta öne geçiyor.
Bir şeyler bir araya getirmek yerine hazır bir ürün satın almayı tercih ediyorsanız, ElevenLabs, Vapi ve Synthflow gibi yönetilen platform karşılaştırmamız ve Retell AI vs Vapi vs Bland yazımız daha iyi bir başlangıç noktası. Bu alana yeniyseniz, yapay zeka sesli ajanın gerçekte ne olduğunu anlatan yazımızla başlayın.
Bu framework'leri nasıl sıraladık
Her framework'ü gerçek bir projenin başarısını ya da başarısızlığını belirleyen beş kritere göre puanladık: geliştirme ne kadar aktif (son 90 gündeki commit sayısı), STT/LLM/TTS entegrasyonlarının genişliği, telefon desteği (gerçek bir telefon numarasını yanıtlayabiliyor mu), lisans şartları ve eşzamanlılık altındaki davranışı. İşte kısa liste bir bakışta.
| Sıra | Framework | Yıldız (Tem 2026) | Lisans | Dil | Telefon Desteği | En iyi olduğu alan |
|---|---|---|---|---|---|---|
| 1 | Pipecat | 13,416 | BSD-2-Clause | Python | Twilio, Daily, Telnyx | Genel amaçlı üretim projeleri |
| 2 | LiveKit Agents | 11,356 | Apache-2.0 | Python, Node | Native SIP + phone numbers | Ölçek ve gerçek zamanlılık |
| 3 | TEN Framework | 10,898 | Apache-2.0 (hybrid) | C, Go, Python, JS | Via Agora RTC | Multimodal ve edge kullanım |
| 4 | Bolna | 695 | MIT | Python | Twilio, Plivo, Exotel, SIP | Hızlı telefon ajanları |
| 5 | FastRTC | 4,618 | MIT | Python | WebRTC (bring your own) | Prototip ve demolar |
| 6 | Vocode | 3,773 | MIT | Python | Twilio, Vonage | Referans niteliğinde, dikkatli kullanın |
1. Pipecat — en iyi genel amaçlı seçim
Daily'nin arkasındaki ekip tarafından geliştirilen Pipecat, bir konuşmayı bir pipeline olarak modelleyen Python tabanlı bir framework: ses içeri girer, konuşmadan metne dönüşüm, bir dil modeli ve metinden konuşmaya dönüşümden geçer, ardından ses tekrar dışarı çıkar. Bu zihinsel model üzerinde akıl yürütmek kolay ve framework, Nisan 2026'da kararlı v1.0 sürümüne ulaştı.
Onu diğerlerinden ayıran şey entegrasyon kütüphanesi. Deepgram, AssemblyAI, OpenAI, Gemini, Cartesia, ElevenLabs ve daha onlarcası zaten bağlı durumda; bu yüzden TTS sağlayıcınızı değiştirmek, kod tabanını baştan yazmak yerine tek satırlık bir değişiklik. Telefon desteği Twilio, Daily veya Telnyx üzerinden çalışıyor. 13,416 yıldız ve neredeyse her gün gelen commit'lerle bu listedeki en hızlı ivmelenen framework de bu.
Ödünleşim şu: Pipecat size hazır bir ajan değil, parçaları verdiği için orkestrasyon mantığı tamamen sizde kalıyor. Sürükle-bırak bir builder yok. Python kodu yazıyorsunuz. Zaten kod yazan bir ekip için bu bir kusur değil, bir özellik.
Şunu seçin: Satıcıdan bağımsız, üretime hazır ve en geniş model desteğine sahip bir temel istiyorsanız ve Python yazmakta rahatsanız. Çoğu müşteri projesinde varsayılan başlangıç noktamız bu.
2. LiveKit Agents — ölçek ve gerçek zamanlılık için tasarlandı
LiveKit Agents farklı bir yaklaşım benimsiyor. Doğrusal bir pipeline yerine, ajanınız WebRTC üzerinden bir odaya katılımcı olarak katılıyor; bu, Zoom tarzı görüşmelerin arkasındaki aynı teknoloji. Düşük gecikme ve çok sayıda eşzamanlı konuşmaya ihtiyaç duyduğunuzda bu mimarinin parladığı yer tam olarak burası.
2026'nın büyük hikayesi telefon desteği. LiveKit, native SIP ve telefon numarası desteğini devreye aldı; artık gelen ve giden aramalar için araya bir Twilio köprüsü koymanıza gerek yok. Ayrıca OpenAI Realtime API için birinci taraf desteği ve 1.5.x sürüm serisinden itibaren native Model Context Protocol araçları ile uyarlanabilir kesinti (interruption) yönetimi sunuyor. Ayrıntıları LiveKit Agents dokümantasyonunda okuyabilirsiniz. Sardığı realtime API'yi anlamak isterseniz, OpenAI'nin sesli ajanlar için Realtime API'sini ayrı bir yazıda ele aldık.
LiveKit'in açık kaynak WebRTC medya sunucusu üzerinde çalıştığı için tüm stack'i kendi sunucularınızda barındırabilirsiniz. Öğrenme eğrisi Pipecat'inkinden daha dik ve oda-katılımcı mantığının oturması biraz zaman alıyor.
Şunu seçin: Gerçek eşzamanlılık bekliyorsanız, köprüsüz native telefon desteği istiyorsanız veya trafik patlamalarına dayanması gereken bir OpenAI Realtime ajanı kuruyorsanız.
3. TEN Framework — multimodal ve graph tabanlı
Agora tarafından desteklenen TEN Framework (Transformative Extensions Network), ajanınızı bir düğüm grafiği olarak tanımlıyor: STT, LLM, araçlar, hafıza, görüntü. Grafiği bir workflow builder içinde oluşturuyorsunuz, TEN da onu çalıştırıyor. Düz sesin ötesine geçen her şey için buradaki en esnek seçenek bu ve C++ çekirdeği düşük gecikmeli ses için ayarlanmış.
Ayrıca bu listedeki en geniş dil desteğine sahip; C, Go, Python, JavaScript ve TypeScript uzantılarının yanı sıra Dify ve Coze için hazır konnektörler de sunuyor. Agora'nın TEN Framework sayfası, neler yapabildiğine dair en net genel bakışı veriyor.
İki uyarı var. Birincisi, lisans hibrit: framework'ün büyük kısmı Apache-2.0, ancak bazı klasörlerde ek kısıtlamalar var; bu yüzden ticari olarak yayınlamadan önce LICENSE dosyasını okuyun. İkincisi, gerçek zamanlı taşıma Agora'nın ağına dayanıyor; bu da bir Agora App ID gerektiği ve ücretsiz katmanın ötesinde Agora kullanım maliyetleri doğacağı anlamına geliyor.
Şunu seçin: Multimodal bir ajan kuruyorsanız (ses artı görüntü veya avatar), graph tabanlı kompozisyona değer veriyorsanız veya açık kaynakta bulunabilecek en düşük seviye ses performansını istiyorsanız.
4. Bolna — bir telefon ajanına giden en hızlı yol
Bolna ilk üçe göre daha küçük (695 yıldız) ve daha keskin kararlarla tasarlanmış; asıl gücü de burada. Telefon desteği önceliği var. Diğer framework'ler arama altyapısını sizin kurmanızı beklerken, Bolna bunu hazır getiriyor: küresel çağrılar için Twilio, Hindistan için Plivo ve Exotel, ayrıca özel SIP trunk'ları — hepsi kod yerine JSON tarzı bir ajan tanımıyla yapılandırılıyor.
Bu konfigürasyon odaklı kurulum sayesinde gelen veya giden bir telefon ajanını buradaki neredeyse her şeyden daha hızlı gerçek çağrıları yanıtlar hale getirebilirsiniz. Arka planda ASR, LLM ve TTS sağlayıcılarını websocket'ler üzerinden orkestre ediyor; yani modellerinizi yine siz seçiyorsunuz. Geliştirme, 2026'nın ortasına kadar aktif kaldı.
Bu hızın bedeli, Pipecat veya LiveKit'e göre daha küçük bir topluluk ve daha az entegrasyon. Sınır bir durumla karşılaşırsanız, o issue'yu açan ilk kişi siz olabilirsiniz. Telefon ağırlıklı projeler için, seçeneklerinizi sesli ajan telefon altyapısı karşılaştırmamızdaki alternatiflerle tartın.
Şunu seçin: Kullanım senaryonuz önce telefon çağrılarıysa (randevu hatırlatmaları, giden ön yeterlilik görüşmeleri, gelen destek) ve telefon altyapısı işini tamamen atlamak istiyorsanız.
5. FastRTC — hafif prototipleme seçeneği
Hugging Face ve Gradio ekibinden gelen FastRTC, tam kapsamlı bir ajan framework'ü değil; zaten mesele de bu. WebRTC veya websocket üzerinden gerçek zamanlı ses ve video için bir Python kütüphanesi. Kendi STT, LLM ve TTS'inizi getiriyorsunuz, FastRTC ise sadece birkaç satır kodla streaming taşımayı hallediyor.
Bir proof of concept, demo veya araştırma denemesi için bu minimalizm tam bir nimet. Ağır bir framework'ün kurallarına bağlanmadan bir öğleden sonrada konuşan bir prototip ayağa kaldırabilirsiniz. Hugging Face ekosistemiyle doğal biçimde uyumlu çalıştığı için açık modelleri eklemek de kolay.
Madalyonun diğer yüzünde, normalde bir framework'ün sizin için hallettiği her şeyden siz sorumlusunuz: konuşma sırası tespiti, kesinti yönetimi, telefon desteği, durum yönetimi. Küçük ölçekte gayet güzel çalışıyor, büyük ölçekte can yakıyor.
Şunu seçin: Prototip yapıyor, ders anlatıyor veya bir tarayıcı demosu kuruyorsanız ve minimum framework yükü ile maksimum kontrol istiyorsanız.
6. Vocode — tarihsel önemi büyük, ama bakım konusunda dikkat
Vocode, bu kategorinin tanımlanmasına yardımcı olan isimlerden biri. Modüler STT/LLM/TTS tasarımı ve dahili Twilio ile Vonage telefon desteği, onu gerçekten kullanılabilir ilk açık kaynak sesli framework'lerden biri yaptı ve 3,773 yıldızla hâlâ pek çok eğitim içeriğinde karşınıza çıkıyor.
İşte dürüst kısım ve son sırada olmasının nedeni de bu: açık kaynak çekirdek sessizliğe büründü. vocode-core'a gelen son commit Kasım 2024'te atıldı ve repoda sadece iki açık issue var; bu genellikle dikkatin sağlıklı bir backlog'a değil, şirketin barındırılan ürününe kaydığının işaretidir. Kod hâlâ çalışıyor ve tasarımı incelemeye değer, ama üzerine inşa ettiğiniz temeli artık kimse aktif olarak yamalamıyor.
Şunu seçin: Sesli ajan mimarisini inceliyorsanız, mevcut bir Vocode projesini sürdürüyorsanız veya özellikle tasarım desenlerini istiyorsanız ve temeli kendiniz bakımda tutmayı kabul ediyorsanız.
Bilmekte fayda var
Sıralamanın hemen dışında kalan ama radarınızda olması gereken birkaç araç daha var:
- OpenAI Agents SDK (27,900+ yıldız) bir sesli pipeline eklentisiyle geliyor. Sesli-öncelikli değil, genel amaçlı bir ajan SDK'sı, ama zaten bunu standart olarak kullanıyorsanız makul bir seçim.
- Gabber, görebilen, duyabilen ve konuşabilen ajanlar için daha yeni bir multimodal framework; ekran ve kamera kullanım senaryolarını hedefliyor.
- Jambonz, açık kaynak bir telefon altyapısı omurgası. Ajanın "beynini" kurmuyor, ama herhangi bir framework'ü gerçek telefon şebekelerine bağlamanın operatör sınıfı bir yolu.
- Rasa (21,000+ yıldız), metin ve ses genelinde kurumsal diyalog ve NLU için hâlâ ağır sıklet isim, ama yukarıdakilerin hepsinden daha meşakkatli çalıştırılıyor.
- Ultravox ise bir orkestrasyon framework'ü değil, hızlı bir konuşma dil modeli; bu yüzden onu bir rakip değil, takılabilir bir bileşen olarak düşünün.
Bir müşteri projesinde biz gerçekte neyi kullanırız
Techsy'de B2B müşteriler için sesli ajanlar geliştiriyoruz, dolayısıyla sıralamanın arkasındaki pek de gösterişli olmayan gerçek şu.
Varsayılan stack'imiz, konuşmadan metne için Deepgram Nova-3'ü, dil modeli için GPT-4o-mini'yi ve metinden konuşmaya için Cartesia Sonic'i bağlayan Pipecat. Konuşma sırası tespiti ayarlandıktan sonra sesten sese gecikme genellikle 0.7 ile 1.1 saniye arasında oturuyor; bu da insan sohbetine yeterince yakın olduğu için arayanlar bunu fark etmeyi bırakıyor. Bu bileşenlerden herhangi birini daha yavaş bir modele geçirirseniz bunu hemen hissedersiniz.
Projelerin dağıldığı yer telefon desteği. Üretimde iki farklı yapıyı çalıştırdık: yüksek hacimli gelen destek için LiveKit'in native SIP'ine köprülenen bir Twilio SIP trunk'ı ve müşteri sadece giden hatırlatma çağrıları istediğinde Bolna'nın dahili Plivo desteği. LiveKit yolu başlangıçta daha fazla mühendislik saati gerektiriyor, ama aynı dakikada 300 çağrı geldiğinde dimdik ayakta kalıyor. Bolna ise sizi cuma gününe kadar canlıya alıyor.
Kendi sunucunuzda barındırma matematiği çoğu kişiyi şaşırtıyor. Tek bir A10G GPU üzerinde yerel STT ve TTS çalıştırmak, tek bir çağrı gelse de gelmese de saatte kabaca $0.50 ile $0.90 arasına mal oluyor. Deepgram ve Cartesia gibi dakika başı ödemeli API'ler boştayken hiçbir şeye mal olmuyor ama ayda birkaç bin dakikayı geçtiğinde hızla birikiyor. Aylık yaklaşık 15,000 dakikanın altında API'ler neredeyse her zaman kazanıyor ve çoğu müşteriye önerdiğimiz de bu. LiveKit'i Pipecat yerine esas olarak eşzamanlılık birkaç yüz aramayı aştığında tercih ediyoruz.
Geliştir mi al mı sorusu sizin tarafınızda hâlâ açıksa, tüm maliyet dökümünü yapay zeka sesli ajanı geliştirmek mi almak mı rehberimizde ele alıyoruz. Gecikme, telefon desteği ve ölçeklendirmeyi sizin için bir ekibin kurmasını tercih ediyorsanız, Techsy'nin sesli ajan hizmetinde tam olarak bunu yapıyoruz.
Bir dakikada nasıl seçersiniz
Analiz felcine gerek yok. İşte karar maddeler halinde:
- En güvenli genel amaçlı varsayılanı istiyorsunuz: Pipecat.
- Gerçek eşzamanlılığa veya native telefon desteğine ihtiyacınız var: LiveKit Agents.
- Multimodal'a geçiyorsunuz (ses artı görüntü veya avatar): TEN Framework.
- Bu hafta canlıya alınmış bir telefon ajanına ihtiyacınız var: Bolna.
- Prototip yapıyor veya ders anlatıyorsunuz: FastRTC.
- Kurmak yerine satın almayı tercih ediyorsunuz: Vapi, Retell veya Synthflow gibi yönetilen bir platform — framework değil.
Sıkça Sorulan Sorular
Açık kaynak sesli ajan framework'ü nedir?
Yazılımın sözlü bir konuşma yürütebilmesi için konuşmadan metne dönüşümü, bir dil modelini ve metinden konuşmaya dönüşümü birbirine bağlayan, kendi sunucunuzda barındırılabilen bir kod tabanı. Yönetilen platformların aksine, kendi altyapınızda çalıştırır, kendi modellerinizi seçer ve dakika başı bir kâr marjı yerine yalnızca altta yatan servisler için ödeme yaparsınız.
Hangi açık kaynak sesli ajan framework'ünün gecikmesi en düşük?
TEN Framework, C++ çekirdeği sayesinde ham ses pipeline'ı performansında öne çıkıyor, ama pratikte toplam gecikmeye ağ ve model gecikmesi hâkim oluyor. Hızlı bir model üzerinde iyi ayarlanmış bir Pipecat veya LiveKit stack'i sesten sese düzenli olarak 0.7 ile 1.1 saniye arasına iniyor; bu da çoğu gerçek dağıtımda TEN'e eşit sonuç veriyor.
Açık kaynak, Vapi veya Retell'den gerçekten daha ucuz mu?
Her zaman değil. Açık kaynak, platformun dakika başı kâr marjını ortadan kaldırıyor, ama mühendislik, barındırma ve bakım maliyetlerini size yüklüyor. Ayda birkaç bin çağrı dakikasının altında, geliştirici zamanını da sayınca yönetilen bir platform genellikle daha ucuz kalıyor. On binlerce dakikanın üzerinde ise bir framework'ü kendi sunucunuzda barındırmak öne geçiyor.
Bu framework'ler gerçek telefon çağrılarını yanıtlayabilir mi?
Evet. Pipecat, Twilio, Daily veya Telnyx üzerinden bağlanıyor; LiveKit Agents native SIP ve telefon numarası desteğiyle geliyor; Bolna'da Twilio, Plivo ve Exotel dahili olarak var; Vocode ise Twilio ve Vonage'ı destekliyor. FastRTC tarayıcı odaklı ve telefon şebekesi için Jambonz gibi harici bir köprüye ihtiyaç duyuyor.
Kullanmak için makine öğrenmesi uzmanlığına ihtiyacım var mı?
Hayır. Çoğunlukla Python olmak üzere yazılım mühendisliği becerilerine ihtiyacınız var. Ağır işi (transkripsiyon, muhakeme, konuşma sentezi) bir API üzerinden bağladığınız modeller yapıyor. Bilinçli olarak açık ağırlıklı modelleri kendi sunucunuzda barındırmayı seçmediğiniz sürece, modelleri eğitmiyor, servisleri orkestre ediyorsunuz.
Yeni başlayanlar için hangi framework en uygun?
Pipecat, çünkü pipeline modeli üzerinde akıl yürütmesi en kolay olanı ve dokümantasyonu ile örnekleri en eksiksiz olanı. Tam kapsamlı bir framework'e geçmeden önce daha da küçük başlayıp ham taşıma katmanını anlamak isterseniz FastRTC iyi bir ikinci seçenek.
2026'da açık kaynak sesli framework'ler üretime hazır mı?
İlk üçü öyle. Pipecat v1.0'a ulaştı, LiveKit Agents 1.5.x sürüm serisinde ve TEN Framework, Agora üzerinden ticari dağıtımlara güç veriyor. Asıl risk framework'lerin kendisi değil, daha küçük projelerin bakım durumu; Vocode'un durma noktasına gelen çekirdeğine dikkat çekmemizin nedeni de bu.
Bu, ElevenLabs gibi bir TTS API'sinden nasıl farklı?
Bir TTS API'si yalnızca metni konuşmaya çeviriyor, bu da tek bir bileşen. Bir sesli ajan framework'ü ise tüm döngüyü orkestre eder: dinler, metne çevirir, metni bir dil modeline gönderir, bir yanıt alır ve bunu geri seslendirirken kesintileri ve konuşma sırasını da yönetir. TTS API'sini çağıran framework'tür, tam tersi değil.
Yazar hakkında
Mert Batur, ekibin B2B müşteriler için yapay zeka ajanları, otomasyon sistemleri ve sesli/SDR pipeline'ları geliştirdiği Techsy.io'nun Kurucu Ortağı. Techsy ekibinin üretimde gerçekten kullandığı LLM araç setini konu alan yazılar yazıyor. LinkedIn üzerinden bağlantı kurabilirsiniz.