Voicebox es un estudio de voz local: dictado, clonación y síntesis en tu máquina. Se presenta como alternativa open source a ElevenLabs (generar voz) y Wispr Flow (dictar).
Mantienes un atajo global, hablas y el texto se pega en el campo activo (IDE, correo, chat). Con 10–30 segundos de audio limpio puedes crear un perfil de voz. Los agentes que hablen MCP pueden llamar a voicebox. speak y responder en una voz tuya.
Qué aporta
- Dictado global (pulsar, hablar, soltar) con transcripción tipo Whisper.
- Clonación zero-shot y varios motores TTS (todo en local si descargas los modelos).
- API REST y MCP en 127.0.0.1 para que Cursor o Claude Code hablen.
- Sin cuota por carácter de un SaaS: el coste es disco, RAM y GPU de tu equipo.
- macOS, Windows y Linux. Sitio: https: //voicebox. sh/ · código: https: //github. com/jamiepine/voicebox
Lectura OCA-I
Para el día a día, lo útil es el dictado: menos teclear el prompt. La clonación es otro producto. Solo con consentimiento de quien habla; no clones voces de terceros ni de clientes.
No lo instalaríamos en un VPS compartido (París u otro): los modelos pesan y el audio no debe salir de un servidor de producción. Encaja en el portátil del operador. Si ya hay TTS en el IDE, Voicebox suma entrada de voz y voces propias, no un segundo agente de código.
Enlaces
Producto: https: //voicebox. sh/
Documentación: https: //docs. voicebox. sh/
Código: https: //github. com/jamiepine/voicebox
También en el blog de OCA-I: https: //oca-i. net/blog/voicebox-local-voice-cloning-and-dictation-for-agents/