Skip to main content
Voice Changer es de voz a voz: vuelve a grabar un archivo de origen en una voz diferente, preservando la entrega, el ritmo y la sincronización. Es asíncrono y usa sus propios endpoints, no /audio/queue, ni texto a voz ni clonación de voz. Elige un modelo de cambiador de voz, solicita una cotización de precio, encola la conversión y luego consulta el estado hasta que Venice devuelva el audio convertido.
Una conversión encolada se cobra inmediatamente. Si la respuesta de la cola se pierde, consulta /audio/voice-changer/retrieve con el mismo queue_id. No vuelvas a encolar la misma grabación.

Elige un modelo

Los modelos de cambiador de voz se devuelven mediante GET /models?type=music con model_spec.voice_changer establecido en true. No existe un filtro ?type=voice-changer. Los ejemplos siguientes usan elevenlabs-voice-changer.
Consulta los metadatos de cada modelo antes de establecer campos opcionales: Los campos no admitidos provocan una respuesta HTTP 400. Las grabaciones más largas que max_source_audio_duration_seconds se rechazan con HTTP 422 antes de cualquier cargo.

Flujo de conversión

1. Obtén una cotización de precio

Voice Changer se factura a partir de la duración de la grabación de origen, redondeada al minuto entero superior. Cotiza la duración que esperas enviar; el cargo se calcula a partir de la duración que Venice mide cuando la grabación se encola.
La respuesta contiene el coste estimado en USD y la duración para la que se calculó la cotización:

2. Encola la conversión

Proporciona la grabación de origen exactamente de una de estas dos maneras: como una carga file multipart, o como un audio_url en un cuerpo JSON. Proporcionar ambos, o ninguno, se rechaza. Cuando pasas una URL, Venice obtiene y valida los bytes por sí mismo y solo reenvía esos bytes al proveedor. La URL nunca se transfiere.
Campos opcionales, cuando el modelo indica soporte:
  • remove_background_noise: elimina el ruido de fondo antes de la conversión
  • seed: entero ≥ 0 para un resultado reproducible
Una solicitud correcta devuelve el modelo, un ID de cola y la duración medida del origen:
Guarda model y queue_id; los endpoints de recuperación y finalización los requieren. Compara duration_seconds con tu cotización si necesitas reconciliar la estimación con la duración facturada.
No es seguro reintentar queue. Una solicitud queue correcta ya ha sido cobrada.

3. Consulta el estado y descarga

Llama a /audio/voice-changer/retrieve con los valores de la respuesta de la cola:
Inspecciona el Content-Type de la respuesta: Una respuesta en proceso se ve así:
Ambos valores de tiempo están en milisegundos. Una respuesta completada también incluye x-venice-audio-format, x-venice-audio-duration, x-venice-inference-time, x-venice-model-id y x-venice-model-name. Si el proveedor falla la conversión, el cargo se reembolsa automáticamente y el cuerpo del error incluye credits_refunded. Volver a consultar reproduce el mismo resultado en lugar de reembolsar dos veces. Para eliminar los medios almacenados en la misma llamada que devuelve el audio, establece delete_media_on_completion en true en retrieve. El audio no se puede recuperar de nuevo después.

Ejemplo completo

Este ejemplo en Python cotiza una conversión, sube un archivo de origen, consulta el estado cada cinco segundos y guarda el resultado como MP3.
El endpoint de cotización no requiere autenticación, pero las solicitudes a queue, retrieve y complete sí.

Recursos relacionados