/agents → tu agente → Pipeline de voz. Cuatro controles: Pipeline, Proveedor, Modelo y la voz.
La mayoría debería dejarlo tranquilo hasta que algo concreto falle. Esta página es para cuando algo concreto falla. Todo lo de aquí también se puede cambiar pidiéndoselo a Octo, que suele ser el camino más seguro — ver la última restricción más abajo para saber por qué.
Los tres pipelines
Los tres gestionan de principio a fin tanto a una persona como un menú telefónico interactivo. Se diferencian en coste, en lo inspeccionables que son y en lo naturales que suenan.
| Pipeline | Qué es | Cuándo es el adecuado |
|---|---|---|
| Standard (STT + LLM + TTS) | Voz a texto → modelo de lenguaje → texto a voz | El predeterminado. El más barato y el más fácil de inspeccionar, porque cada etapa deja un rastro escrito. El mejor para grandes volúmenes de llamadas. |
| OpenAI Realtime | Un modelo, audio nativo | Razonable si tu organización ya está estandarizada en OpenAI. |
| Gemini Live | Un modelo, audio nativo | La arquitectura en tiempo real más limpia, y la que suena más natural de las tres. |
La división que importa es estándar frente a tiempo real, no qué proveedor. Un pipeline estándar transcribe, piensa y luego habla — tres pasos que puedes cambiar por separado. Un pipeline en tiempo real escucha y responde como una sola operación, y por eso interrumpe y se recupera más como lo hace una persona.
Modelos
Cada pipeline tiene su propia familia de modelos, y un modelo de la familia equivocada se rechaza en lugar de sustituirse en silencio.
En el estándar, un modelo pequeño y rápido es el valor recomendado por defecto — barato, y responde bien a la recepción ordinaria. Hay modelos mayores y conviene alcanzarlos cuando el agente no entiende bien, no por defecto.
En los pipelines en tiempo real, toma el modelo recomendado actual. Los más antiguos siguen aceptándose por compatibilidad, y al menos uno de ellos maneja los menús telefónicos notablemente peor. Si vas a pedir un pipeline en tiempo real por su nombre, pide con él el modelo actual.
Cuatro cosas que la elección cambia por debajo
Estas producen un resultado confuso en lugar de un mensaje de error.
Cambiar de pipeline no se lleva la voz por delante. Los pipelines en tiempo real tienen sus propias voces integradas — Alloy, Ash, Coral, Marin, Cedar en OpenAI; otro conjunto distinto en Gemini. El estándar usa el catálogo de tu proveedor de texto a voz, con “Escuche una vista previa de las voces en elevenlabs.io.” Cambias y estás eligiendo otra vez de una lista que no contiene lo que tenías.
Una voz pertenece a quien produce el audio. Una voz del proveedor equivocado se rechaza de plano. Es el mismo hecho visto desde el otro lado, y la razón por la que las dos preguntas llegan siempre juntas.
Las opciones de STT y TTS solo existen en el estándar. El control Proveedor tiene sentido ahí y casi desaparece en tiempo real — no hay paso de transcripción separado que configurar.
No todo proveedor aceptado está cableado. El filo del cuchillo. Algunas combinaciones se validan, se guardan sin quejas y luego fallan cuando la llamada se hace de verdad — el peor momento posible para enterarse. Octo te aparta de esas, que es la razón principal para cambiar la voz pidiéndolo en vez de editar la configuración directamente.
Cuando se atasca en un menú telefónico
Si el agente pulsa teclas equivocadas, o habla por encima de una persona que acaba de descolgar, sube la escalera en lugar de adivinar:
- Un modelo mayor dentro del mismo pipeline. A menudo es el arreglo completo, y lo más barato de probar.
- Si el estándar sigue sufriendo, pásate a Gemini Live. La comprensión de audio nativa lleva mejor un menú continuo que transcribirlo y leer la transcripción — en el paso de transcripción es donde se tira la información de tiempos que necesitas.
- Sabe qué estás pagando por ello. Los pipelines en tiempo real facturan por segundo de audio de entrada y de salida, así que cuestan más que el estándar en llamadas largas. Merece la pena para un menú que tienes que atravesar de forma fiable. No como predeterminado para llamadas que son sobre todo una persona hablando.
Para las campañas salientes hay un control equivalente en el compositor — Menú telefónico (IVR), junto a Destinatarios, porque si hay un menú que atravesar es un dato sobre a quién llamas.
Una voz personalizada o clonada
Un ID de voz que no esté en la lista estándar vale en el pipeline estándar, siempre que pertenezca al proveedor de texto a voz que tengas configurado. La regla del proveedor de arriba sigue aplicando — es la única regla sin excepciones.
Con cuál empezar
Empieza donde se creó el agente y cámbialo solo por una razón que sepas nombrar. «Suena algo mejor» no lo es; «habla por encima de quien llama» o «no entiende el nombre de nuestra calle» sí.
Prueba el cambio en el teléfono
Iniciar prueba de micrófono en /agents es el ciclo rápido y te dirá cómo suena la voz. No te dirá si el pipeline funciona por el camino telefónico, porque “WebRTC funciona para pruebas en el navegador. Las rutas telefónicas necesitan un número.”
Después de cualquier cambio de pipeline, llama al número una vez desde un teléfono de verdad. Es el paso que caza al proveedor que validó y luego no marcó.