Pipelines de voz: o que escolher e quanto custa

Três opções em um menu suspenso, a família de modelos que cada uma carrega, e a escada para subir quando o agente se perde num menu de telefone.

Atualizado

/agents → seu agente → Pipeline de voz. Quatro controles: Pipeline, Provedor, Modelo e a voz.

A maioria das pessoas deveria deixar isso quieto até algo específico dar errado. Esta página é para quando algo específico dá errado. Tudo aqui também pode ser mudado pedindo à Octo, o que normalmente é o caminho mais seguro — veja a última restrição abaixo para o porquê.

Os três pipelines

Os três lidam de ponta a ponta tanto com uma pessoa quanto com um menu de telefone interativo. Eles diferem em custo, em como dá para inspecioná-los e no quão naturais soam.

PipelineO que éQuando é o certo
Standard (STT + LLM + TTS)Fala em texto → modelo de linguagem → texto em falaO padrão. O mais barato e o mais fácil de inspecionar, porque cada etapa deixa um rastro escrito. O melhor para grandes volumes de ligações.
OpenAI RealtimeUm modelo, áudio nativoFaz sentido se a sua organização já é padronizada no OpenAI.
Gemini LiveUm modelo, áudio nativoA arquitetura em tempo real mais limpa, e a que soa mais natural das três.

A divisão que importa é padrão versus tempo real, não qual fornecedor. Um pipeline padrão transcreve, pensa e depois fala — três passos que você pode trocar separadamente. Um pipeline em tempo real escuta e responde como uma única operação, e é por isso que interrompe e se recupera mais como uma pessoa faz.

Modelos

Cada pipeline tem a sua própria família de modelos, e um modelo da família errada é recusado em vez de trocado em silêncio.

No padrão, um modelo pequeno e rápido é o recomendado por padrão — barato, e dá conta da recepção comum. Existem modelos maiores e vale alcançar por eles quando o agente está entendendo mal, não por padrão.

Nos pipelines em tempo real, pegue o modelo recomendado atual. Os mais antigos ainda são aceitos por compatibilidade, e pelo menos um deles lida notoriamente pior com menus de telefone. Se você vai pedir um pipeline em tempo real pelo nome, peça junto o modelo atual.

Quatro coisas que a escolha muda por baixo

Estas produzem um resultado confuso em vez de uma mensagem de erro.

Trocar de pipeline não leva a voz junto. Os pipelines em tempo real têm as próprias vozes embutidas — Alloy, Ash, Coral, Marin, Cedar no OpenAI; outro conjunto de novo no Gemini. O padrão usa o catálogo do seu provedor de texto em fala, com “Ouça as vozes em elevenlabs.io.” Troque, e você está escolhendo outra vez de uma lista que não contém o que tinha.

Uma voz pertence a quem produz o áudio. Uma voz do provedor errado é recusada de cara. O mesmo fato visto do outro lado, e a razão de as duas perguntas chegarem sempre juntas.

As escolhas de STT e TTS só existem no padrão. O controle Provedor tem sentido lá e quase não aparece no tempo real — não há etapa de transcrição separada para configurar.

Nem todo provedor aceito está de fato ligado. O fio cortante. Algumas combinações validam, salvam sem reclamar e depois falham quando a ligação é realmente feita — o pior momento possível para descobrir. A Octo te afasta delas, e essa é a principal razão para mudar a voz pedindo em vez de editar a configuração direto.

Quando ele se perde num menu de telefone

Se o agente aperta teclas erradas, ou fala por cima de uma pessoa que acabou de atender, suba a escada em vez de adivinhar:

  1. Um modelo maior no mesmo pipeline. Muitas vezes é o conserto inteiro, e a coisa mais barata de tentar.
  2. Se o padrão continuar sofrendo, vá para o Gemini Live. A compreensão de áudio nativa lida melhor com um menu contínuo do que transcrevê-lo e ler a transcrição — é no passo de transcrição que a informação de tempo de que você precisa é jogada fora.
  3. Saiba o que está pagando por isso. Pipelines em tempo real cobram por segundo de áudio de entrada e de saída, então custam mais que o padrão em ligações longas. Vale para um menu que você precisa atravessar com confiabilidade. Não vale como padrão para ligações que são principalmente uma pessoa falando.

Para campanhas ativas há um controle equivalente no compositor — Menu telefônico (IVR), ao lado de Destinatários, porque existir ou não um menu para atravessar é um fato sobre quem você está ligando.

Uma voz personalizada ou clonada

Um ID de voz que não está na lista padrão funciona no pipeline padrão, desde que pertença ao provedor de texto em fala que você tem configurado. A regra do provedor acima continua valendo — é a única regra sem exceções.

Com qual começar

Comece onde o agente foi criado e mude apenas por um motivo que você consiga nomear. «Soa um pouco melhor» não é um; «fala por cima de quem liga» ou «não entende o nome da nossa rua» é.

Teste a mudança no telefone

Iniciar teste de microfone em /agents é o ciclo rápido e vai dizer como a voz soa. Não vai dizer se o pipeline funciona pelo caminho telefônico, porque “O WebRTC funciona para testes no navegador. As rotas de telefone precisam de um número.”

Depois de qualquer mudança de pipeline, ligue para o número uma vez de um telefone de verdade. É o passo que captura o provedor que validou e depois não discou.