語音管線:怎麼選,要花多少錢

一個下拉選單裡的三個選項,各自對應的模型家族,以及智慧體應付不好電話選單時該爬的那把梯子。

更新於

/agents → 你的智慧體 → 語音管線。四個控制項:管線供應商模型,以及語音。

大多數人應該保持原樣,直到有具體的東西出了問題。這一頁講的是具體的東西出了 問題的時候。這裡的一切也都可以透過請 Octo 來改,那通常是一條更穩妥的路徑—— 原因見本頁最後一條約束。

三條管線

三者都能端到端地處理真人通話和互動式電話選單。差別在成本、可檢查的程度,以及 聽起來的自然程度。

管線它是什麼什麼時候選它
Standard (STT + LLM + TTS)語音轉文字 → 語言模型 → 文字轉語音預設選項。最便宜,也最容易檢查,因為每一環都留下書面紀錄。適合通話量大的場景。
OpenAI Realtime單一模型,原生音訊如果你的組織已經全面使用 OpenAI,這是合理選擇。
Gemini Live單一模型,原生音訊三者中最乾淨的即時架構,聽起來也最自然。

真正重要的分野是標準還是即時,而不是選哪家供應商。標準管線先轉寫,再 思考,然後開口——三個環節,每一個都可以單獨替換。即時管線把聽和答合為一次 操作,這就是它插話和恢復得更像人的原因。

模型

每條管線都有自己的模型家族,選錯家族的模型會被直接拒絕,而不是悄悄替換。

標準管線,小而快的模型是建議的預設——便宜,普通接待綽綽有餘。更大的模型 存在,值得在智慧體聽岔了的時候去用,而不是預設就用。

即時管線,用目前的建議模型。舊模型基於相容性仍然可用,但其中至少一個 處理電話選單的效果明顯更差。如果你要指名某條即時管線,請連同目前的模型 一起指名。

這個選擇在水面下改變的四件事

它們產生的不是錯誤訊息,而是令人困惑的結果。

切換管線不會把語音帶走。 即時管線有各自內建的語音——OpenAI 上是 AlloyAshCoralMarinCedar;Gemini 上是另一套。標準 管線用的是你的文字轉語音供應商的目錄,並附一句 “在 elevenlabs.io 試聽語音。” 一切換,你就得重新從一個不含你原有語音的清單裡挑。

語音屬於產生音訊的那一方。 來自錯誤供應商的語音會被當場拒絕。同一件事從 另一頭看,也是為什麼這兩個問題總是成對出現。

STT 和 TTS 的選項只存在於標準管線。 供應商控制項在標準管線上有意義, 在即時管線上幾乎消失——沒有獨立的轉寫環節可供設定。

並非每個被接受的供應商都已接上。 最鋒利的邊緣。有些組合驗證通過、儲存 順利,然後在真正撥打電話時失敗——這是最壞的發現時機。Octo 會引導你避開它們, 這正是「用說的來換語音」比「直接改設定」更值得做的最大理由。

當它應付不好電話選單時

如果智慧體按錯了按鍵,或者對著剛剛接起的人滔滔不絕,照梯子一級級爬,別瞎猜:

  1. 同一條管線裡換更大的模型。 往往整件事就解決了,而且是最便宜的嘗試。
  2. 如果標準管線還是吃力,換到 Gemini Live。 原生音訊理解對付連綿的選單, 比轉寫成文字再讀文本強得多——你需要的時間資訊,正是在轉寫環節被丟掉的。
  3. 知道你為此付出什麼。 即時管線按進出兩側的音訊秒數計費,長通話比標準 管線貴。對必須可靠打通的選單,這錢花得值;對以人說話為主的普通通話,不值得 當預設。

對行銷活動而言,編輯器裡有一個對應的控制項——電話選單(IVR),就在收件人 旁邊,因為有沒有選單要過,是關於你在打給誰的事實。

自訂語音或複製語音

不在標準清單裡的語音 ID,在標準管線上沒有問題,只要它屬於你已設定的文字轉 語音供應商。上面的供應商規則照樣適用——它是唯一一條沒有例外的規則。

從哪一條開始

從智慧體建立時的設定開始,只有在說得出理由的時候才換。「聽起來稍微好一點」不是 理由;「打斷來電的人」或「聽不清我們街道的名字」是理由。

在電話上驗證變更

/agents 上的開始麥克風測試是快速循環,能告訴你語音聽起來的效果。但它測不出 管線在電話路徑上的表現,因為 “WebRTC 可用於瀏覽器測試。電話路由則需要號碼。”

任何管線變更之後,用一支真正的電話撥打一次號碼。能夠抓住「驗證通過、接線卻 不通」的供應商的,正是這一步。