Lange Audioaufnahmen mit künstlicher Intelligenz analysieren
VibeVoice wurde von Microsoft veröffentlicht und als Open-Source-Sprach-KI-Framework entwickelt. Mit seiner Python-basierten Struktur ermöglicht das System Benutzern, eigene Klangmodelle zu trainieren und in ihre Anwendungen zu integrieren.
Aktualisierungen
- 2. August 2026: Sterne 48,569 → 51,860.
Was es bringt
- Konvertiert bis zu 60 Minuten Audioaufnahme gleichzeitig in Text.
- Es stellt Sprecher-ID, Zeitstempel und Inhaltsdetails auf strukturierte Weise bereit.
- Bietet benutzerdefinierte Schlüsselwortunterstützung für benutzerdefinierte Begriffe und Namen.
Installation
git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice
pip install -e .Ausführung
python demo/vibevoice_asr_gradio_demo.py --model_path microsoft/VibeVoice-ASR --sharepython demo/vibevoice_asr_inference_from_file.py --model_path microsoft/VibeVoice-ASR --audio_files [ses-dosyasi]Wenn Sie nicht programmieren
Ich möchte meine 60-minütige Audioaufnahme mit dem VibeVoice-Modell analysieren. Ich muss als strukturierte Textdatei abrufen, wer die Sprecher sind, wann sie gesprochen haben und welchen Inhalt sie gesagt haben. Ich möchte auch benutzerdefinierte Schlüsselwörter hinzufügen, damit das Modell technische Begriffe genauer erkennt. Wie kann ich diesen Prozess strukturieren?
Verwandte Begriffe aus dem Glossar
Links
TreScout hat dieses Werkzeug nicht entwickelt · wir haben es in den GitHub-Trends gefunden und stellen es vor. Diese Seite beschreibt das Repository so, wie es am 2026-06-07 war: Die Anzahl der Sterne und unser Text stammen von diesem Tag, das Repository kann sich seitdem geändert haben. Den aktuellen Stand finden Sie über den Link zum Repository. Diese Seite wurde maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung.