/agents → 你的智慧體 → 語音管線。四個控制項:管線、供應商、 模型,以及語音。
大多數人應該保持原樣,直到有具體的東西出了問題。這一頁講的是具體的東西出了 問題的時候。這裡的一切也都可以透過請 Octo 來改,那通常是一條更穩妥的路徑—— 原因見本頁最後一條約束。
三條管線
三者都能端到端地處理真人通話和互動式電話選單。差別在成本、可檢查的程度,以及 聽起來的自然程度。
| 管線 | 它是什麼 | 什麼時候選它 |
|---|---|---|
| Standard (STT + LLM + TTS) | 語音轉文字 → 語言模型 → 文字轉語音 | 預設選項。最便宜,也最容易檢查,因為每一環都留下書面紀錄。適合通話量大的場景。 |
| OpenAI Realtime | 單一模型,原生音訊 | 如果你的組織已經全面使用 OpenAI,這是合理選擇。 |
| Gemini Live | 單一模型,原生音訊 | 三者中最乾淨的即時架構,聽起來也最自然。 |
真正重要的分野是標準還是即時,而不是選哪家供應商。標準管線先轉寫,再 思考,然後開口——三個環節,每一個都可以單獨替換。即時管線把聽和答合為一次 操作,這就是它插話和恢復得更像人的原因。
模型
每條管線都有自己的模型家族,選錯家族的模型會被直接拒絕,而不是悄悄替換。
標準管線,小而快的模型是建議的預設——便宜,普通接待綽綽有餘。更大的模型 存在,值得在智慧體聽岔了的時候去用,而不是預設就用。
即時管線,用目前的建議模型。舊模型基於相容性仍然可用,但其中至少一個 處理電話選單的效果明顯更差。如果你要指名某條即時管線,請連同目前的模型 一起指名。
這個選擇在水面下改變的四件事
它們產生的不是錯誤訊息,而是令人困惑的結果。
切換管線不會把語音帶走。 即時管線有各自內建的語音——OpenAI 上是 Alloy、Ash、Coral、Marin、Cedar;Gemini 上是另一套。標準 管線用的是你的文字轉語音供應商的目錄,並附一句 “在 elevenlabs.io 試聽語音。” 一切換,你就得重新從一個不含你原有語音的清單裡挑。
語音屬於產生音訊的那一方。 來自錯誤供應商的語音會被當場拒絕。同一件事從 另一頭看,也是為什麼這兩個問題總是成對出現。
STT 和 TTS 的選項只存在於標準管線。 供應商控制項在標準管線上有意義, 在即時管線上幾乎消失——沒有獨立的轉寫環節可供設定。
並非每個被接受的供應商都已接上。 最鋒利的邊緣。有些組合驗證通過、儲存 順利,然後在真正撥打電話時失敗——這是最壞的發現時機。Octo 會引導你避開它們, 這正是「用說的來換語音」比「直接改設定」更值得做的最大理由。
當它應付不好電話選單時
如果智慧體按錯了按鍵,或者對著剛剛接起的人滔滔不絕,照梯子一級級爬,別瞎猜:
- 同一條管線裡換更大的模型。 往往整件事就解決了,而且是最便宜的嘗試。
- 如果標準管線還是吃力,換到 Gemini Live。 原生音訊理解對付連綿的選單, 比轉寫成文字再讀文本強得多——你需要的時間資訊,正是在轉寫環節被丟掉的。
- 知道你為此付出什麼。 即時管線按進出兩側的音訊秒數計費,長通話比標準 管線貴。對必須可靠打通的選單,這錢花得值;對以人說話為主的普通通話,不值得 當預設。
對行銷活動而言,編輯器裡有一個對應的控制項——電話選單(IVR),就在收件人 旁邊,因為有沒有選單要過,是關於你在打給誰的事實。
自訂語音或複製語音
不在標準清單裡的語音 ID,在標準管線上沒有問題,只要它屬於你已設定的文字轉 語音供應商。上面的供應商規則照樣適用——它是唯一一條沒有例外的規則。
從哪一條開始
從智慧體建立時的設定開始,只有在說得出理由的時候才換。「聽起來稍微好一點」不是 理由;「打斷來電的人」或「聽不清我們街道的名字」是理由。
在電話上驗證變更
/agents 上的開始麥克風測試是快速循環,能告訴你語音聽起來的效果。但它測不出 管線在電話路徑上的表現,因為 “WebRTC 可用於瀏覽器測試。電話路由則需要號碼。”
任何管線變更之後,用一支真正的電話撥打一次號碼。能夠抓住「驗證通過、接線卻 不通」的供應商的,正是這一步。