Agentes de voz nativos de código abierto
La biblioteca de voz a voz desarrollada por Hugging Face permite crear agentes de voz locales utilizando modelos de código abierto. Esta herramienta basada en Python permite a los desarrolladores crear sistemas de interacción de voz en tiempo real que se ejecutan en el dispositivo.
Actualizaciones
- 7 de septiembre de 2026: Estrellas 12,310 → 13,072, última versión v1.0.0 (6 de septiembre de 2026).
- 12 de agosto de 2026: Estrellas 11,283 → 12,310, última versión v0.2.12 (5 de agosto de 2026).
- 6 de agosto de 2026: Estrellas 10,774 → 11,283, última versión v0.2.12 (5 de agosto de 2026).
- 4 de agosto de 2026: Estrellas 10,402 → 10,774, última versión v0.2.11 (3 de agosto de 2026).
Qué aporta
- Línea de audio modular de baja latencia
- Compatibilidad con WebSocket compatible con OpenAI Realtime
- Oportunidad de trabajar localmente en hardware diferente.
Instalación
pip install speech-to-speechgit clone https://github.com/huggingface/speech-to-speech.git
cd speech-to-speech
uv syncEjecución
pip install speech-to-speech
export OPENAI_API_KEY=...
speech-to-speechpython scripts/listen_and_play_realtime.py --host 127.0.0.1 --port 8765Si no programa
Quiero configurar mi propio agente de voz local usando esta herramienta. ¿Cuáles son los pasos básicos que debo seguir para crear una canalización de audio de baja latencia utilizando componentes VAD, STT, LLM y TTS? ¿Con qué comando puedo poner en marcha el servidor y conectarme con un cliente compatible con OpenAI Realtime?
Términos relacionados del glosario
Enlaces
TreScout no desarrolló esta herramienta · la encontramos en las tendencias de GitHub y la presentamos. Esta página describe el repositorio tal como estaba el 2026-07-29: El número de estrellas y nuestro texto son de ese día, el repositorio puede haber cambiado desde entonces. Consulte el enlace del repositorio para ver el estado actual. Esta página se tradujo automáticamente del original en turco · prevalece la versión turca.