خطوط معالجة الصوت: ماذا تختار وكم تكلّف

ثلاثة خيارات في قائمة منسدلة واحدة، وعائلة النماذج التي يحملها كل منها، والسلّم الذي تصعده عندما يتعثّر الوكيل في قائمة هاتفية.

آخر تحديث

/agents ← وكيلك ← Voice Pipeline. أربعة عناصر تحكم: Pipeline، Provider، Model، والصوت.

يجب أن يترك معظم الناس هذا حتى يخلب شيء محدّد. هذه الصفحة لما يخلب شيء محدّد. وكل ما هنا يمكن تغييره أيضًا بطلب ذلك من Octo، وهو عادة الطريق الأكثر أمانًا — انظر القيد الأخير أدناه للسبب.

الخطوط الثلاثة

كلها تتعامل من أولها إلى آخرها مع إنسان كذلك مع قائمة هاتفية تفاعلية. تختلف في التكلفة، وقابلية التفتيش، وطبيعية الصوت.

الـPipelineما هومتى يكون هو المناسب
Standard (STT + LLM + TTS)كلام إلى نص ← نموذج لغوي ← نص إلى كلامالافتراضي. الأرخص والأسهل فحصًا، لأن كل مرحلة تترك أثرًا مكتوبًا. الأفضل لأحجام مكالمات كبيرة.
OpenAI Realtimeنموذج واحد، صوت أصليخيار منطقي إن كانت مؤسستك موحّدة على OpenAI أصلًا.
Gemini Liveنموذج واحد، صوت أصليأنظف بنية زمن حقيقي، والأكثر طبيعية صوتًا بين الثلاثة.

الفصل المهم هو قياسي مقابل زمن حقيقي، لا أيّ مزوّد. الـpipeline القياسي ينسخ، ثم يفكّر، ثم يتكلم — ثلاث خطوات يمكنك استبدال كلٍّ منها. الـpipeline ذو الزمن الحقيقي يسمع ويجيب كعملية واحدة، ولهذا يقطع الكلام ويتعافى أكثر مثل إنسان.

النماذج

لكل pipeline عائلته من النماذج، والنموذج من العائلة الخطأ يُرفض ولا يُستبدل في صمت.

في القياسي، النموذج الصغير السريع هو الموصى به افتراضيًّا — رخيص، ويحسن الاستقبال الاعتيادي. توجد نماذج أكبر ويُستحق الوصول إليها عندما يسئ الوكيل السمع، لا افتراضيًّا.

في خطوط الزمن الحقيقي، خذ النموذج الموصى به الحالي. الأقدم لا تزال مقبولة لأسباب توافق، وواحد منها على الأقل يتعامل مع القوائم الهاتفية بدرجة أسوأ ملحوظة. إن كنت ستطلب pipeline زمن حقيقي باسمه، اطلب معه النموذج الحالي.

أربعة أشياء يغيّرها الاختيار في الأعماق

هذه تنتج نتيجة محيّرة بدل رسالة خطأ.

تغيير الـpipeline لا يحمل الصوت معه. خطوط الزمن الحقيقي لها أصواتها المدمجة — Alloy، Ash، Coral، Marin، Cedar على OpenAI؛ ومجموعة أخرى مختلفة على Gemini. القياسي يستخدم كتالوج مزوّد التحويل من نص إلى كلام لديك، مع عبارة “Preview voices at elevenlabs.io.” غيّرتَ، وها أنت تختار من جديد من قائمة لا تحتوي ما كان عندك.

الصوت ينتمي إلى من ينتج الصوت. صوت من المزوّد الخطأ يُرفض تمامًا. الحقيقة نفسها من الاتجاه الآخر، وسبب وصول السؤالين معًا دائمًا.

خيارات STT وTTS موجودة في القياسي فقط. عنصر Provider له معنى هناك ويكاد يغيب في الزمن الحقيقي — لا توجد خطوة نسخ منفصلة تُضبط.

ليس كل مزوّد مقبول موصولًا فعلًا. الحدّ الحاد. بعض التركيبات تجتاز التحقق، تُحفظ بسلاسة، ثم تفشل عندما تُجرى المكالمة فعلًا — أسوأ توقيت ممكن لاكتشاف ذلك. تُبعِدك Octo عن تلك التركيبات، وهذا هو السبب الرئيسي لتغيير الصوت بالطلب لا بتحرير الإعداد مباشرة.

عندما يتعثّر في قائمة هاتفية

إذا ضغط الوكيل أزرارًا خطأ، أو تكلّم فوق شخص رفع السماعة للتوّ، اصعد السلّم بدل التخمين:

  1. نموذج أكبر في الـpipeline نفسه. كثيرًا ما يكون هذا هو الإصلاح كله، وهو أرخص ما يجرَّب.
  2. إن ظل القياسي يعاني، انتقل إلى Gemini Live. الفهم الصوتي الأصلي يتعامل مع قائمة متصلة أفضل من نسخها وقراءة النسخة — في خطوة النسخ تُرمى معلومات التوقيت التي تحتاجها.
  3. اعرف ما تدفعه مقابل ذلك. خطوط الزمن الحقيقي تُحاسَب لكل ثانية صوت داخلة وخارجة، فتكلّف أكثر من القياسي في المكالمات الطويلة. يستحق ذلك لقائمة يجب اختراقها بموثوقية. لا يستحق ذلك افتراضيًّا في مكالمات تكون فيها الغالب حديث شخص.

للحملات الصادرة يوجد عنصر مقابل في المُركِّب — Phone Menu (IVR)، بجوار Recipients، لأن وجود قائمة يجب اختراقها أم لا هو حقيقة عن من تتصل.

صوت مخصص أو مستنسخ

معرّف صوت ليس في القائمة القياسية لا بأس به في الـpipeline القياسي، ما دام ينتمي إلى مزوّد التحويل من نص إلى كلام الذي أعددتَه. قاعدة المزوّد أعلاه ما تزال سارية — إنها القاعدة الوحيدة بلا استثناءات.

من أين تبدأ

ابدأ حيث أُنشئ الوكيل وغيّرها فقط لسبب تستطيع تسميته. «يبدو أفضل قليلًا» ليس سببًا؛ «يتكلّم فوق المتّصلين» أو «يسئ فهم اسم شارعنا» سبب.

اختبر التغيير على الهاتف

Start mic test في /agents هي الحلقة السريعة وستخبرك كيف يبدو الصوت. لن تخبرك إن كان الـpipeline يعمل عبر المسار الهاتفي، لأن “WebRTC works for browser testing. Phone routes need a number.”

بعد أي تغيير في الـpipeline، اتصل بالرقم مرة من هاتف حقيقي. هذه هي الخطوة التي تصطاد المزوّد الذي اجتاز التحقق ثم لم يُجرِ الاتصال.