Yapay zekâ ile uzun ses kayıtlarını çözümleme
Microsoft tarafından yayınlanan VibeVoice, açık kaynaklı bir sesli yapay zekâ (voice AI) çerçevesi olarak geliştirildi. Sistem, Python tabanlı yapısıyla kullanıcıların kendi ses modellerini eğitmelerine ve uygulamalarına entegre etmelerine olanak tanıyor.
Güncelleme
- 2 Ağustos 2026: Yıldız 48.569 → 51.860.
Ne kazandırır?
- Tek seferde 60 dakikaya kadar ses kaydını metne dönüştürür.
- Konuşmacı kimliği, zaman damgası ve içerik detaylarını yapılandırılmış şekilde sunar.
- Özel terimler ve isimler için kullanıcı tanımlı anahtar kelime desteği sağlar.
Kurulum
git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice
pip install -e .Çalıştırma
python demo/vibevoice_asr_gradio_demo.py --model_path microsoft/VibeVoice-ASR --sharepython demo/vibevoice_asr_inference_from_file.py --model_path microsoft/VibeVoice-ASR --audio_files [ses-dosyasi]Kaynak: Resmî depo · docs/vibevoice-asr.md (microsoft/VibeVoice). Kurulabilir model VibeVoice-ASR; TTS kodu depodan çıkarıldı.
Kod bilmiyorsanız
VibeVoice modelini kullanarak elimdeki 60 dakikalık ses kaydını çözümlemek istiyorum. Konuşmacıların kim olduğunu, ne zaman konuştuklarını ve söyledikleri içeriği yapılandırılmış bir metin dosyası olarak almam gerekiyor. Ayrıca modelin teknik terimleri daha doğru tanıması için özel anahtar kelimeler eklemek istiyorum, bu süreci nasıl yapılandırabilirim?
Bağlantılar
TreScout bu aracı geliştirmedi · GitHub trendlerinde keşfedip Türkçe tanıttı. Bu sayfa deponun 2026-06-07 tarihindeki hâlini anlatır: Yıldız sayısı ve yazdığımız metin o güne aittir, depo sonrasında değişmiş olabilir. Güncel durum için depo bağlantısına bakın.