Açık kaynaklı yerel sesli ajanlar
Hugging Face tarafından geliştirilen speech-to-speech kütüphanesi, açık kaynaklı modeller kullanarak yerel sesli ajanlar (voice agents) oluşturulmasına olanak tanıyor. Python tabanlı bu araç, geliştiricilerin cihaz üzerinde çalışan gerçek zamanlı sesli etkileşim sistemleri kurmasını sağlıyor.
Güncelleme
- 7 Eylül 2026: Yıldız 12.310 → 13.072, son sürüm v1.0.0 (6 Eylül 2026).
- 12 Ağustos 2026: Yıldız 11.283 → 12.310, son sürüm v0.2.12 (5 Ağustos 2026).
- 6 Ağustos 2026: Yıldız 10.774 → 11.283, son sürüm v0.2.12 (5 Ağustos 2026).
- 4 Ağustos 2026: Yıldız 10.402 → 10.774, son sürüm v0.2.11 (3 Ağustos 2026).
Ne kazandırır?
- Düşük gecikmeli modüler ses hattı
- OpenAI Realtime uyumlu WebSocket desteği
- Farklı donanımlarda yerel çalışma imkânı
Kurulum
pip install speech-to-speechgit clone https://github.com/huggingface/speech-to-speech.git
cd speech-to-speech
uv syncÇalıştırma
pip install speech-to-speech
export OPENAI_API_KEY=...
speech-to-speechpython scripts/listen_and_play_realtime.py --host 127.0.0.1 --port 8765Kod bilmiyorsanız
Bu aracı kullanarak kendi yerel sesli ajanımı kurmak istiyorum. VAD, STT, LLM ve TTS bileşenlerini kullanarak düşük gecikmeli bir ses hattı oluşturmak için izlemem gereken temel adımlar nelerdir? Hangi komutla sunucuyu ayağa kaldırabilirim ve OpenAI Realtime uyumlu bir istemci ile nasıl bağlantı kurabilirim?
Bağlantılar
TreScout bu aracı geliştirmedi · GitHub trendlerinde keşfedip Türkçe tanıttı. Bu sayfa deponun 2026-07-29 tarihindeki hâlini anlatır: Yıldız sayısı ve yazdığımız metin o güne aittir, depo sonrasında değişmiş olabilir. Güncel durum için depo bağlantısına bakın.