نموذج كلام فوري على الخط، وخلفه وكيل الذكاء الاصطناعي الإنتاجي نفسه — عقل واحد يجيب على أسئلة الدعم، ويحلّل المبيعات، ويشخّص الأجهزة، وينفّذ إجراءات حقيقية موثّقة. بالعربية والإنجليزية، وباللهجة التي تختارها.
مكالمة ثنائية الاتجاه حية: مقاطعة، واستدعاء أدوات، وأمان الأرقام المنطوقة.
هذه مكالمة حقيقية: متصفحك يتصل مباشرة بمقبس الصوت الثنائي للمحرك، والمساعد يسمعك عبر الميكروفون. اختر اللهجة، وابدأ المكالمة، واسأل ما تشاء — المواضيع الجانبية أفكار للإلهام، لا أزرار.
اضغط «ابدأ المكالمة» — يرد المساعد خلال ثوانٍ ويسمعك عبر الميكروفون.
ليست أزراراً — قلها بأسلوبك أثناء المكالمة.
الوكيل الإنتاجي نفسه الذي يقف خلف المحادثة النصية يرد على الهاتف — بكل ما أعطته إياه منشأتك: الأدوات والبيانات والمعرفة والسياسات.
أسئلة المنتجات والإجراءات تُجاب من قاعدة معرفة مفهرسة بالمتجهات — لا من خيال النموذج. وكل إجابة تحمل المصدر الذي جُلبت منه.
ملخصات المبيعات، وأداء الفروع والأجهزة، وتوزيع وسائل الدفع — تُجلب عبر أدوات MCP من بيانات حية أثناء انتظار المتصل، مع دفع الأرقام إلى الشاشة.
تشخيص أعطال الأجهزة والإجراءات من أدلّتك أنت، مع التصعيد إلى تذكرة صيانة وزيارة فنّي عندما لا تحل الخطوات المشكلة.
يفتح تذاكر الصيانة ويحدّث بيانات التسوية وغيرها — مع رمز تحقق تُمسكه الخوادم لا النموذج، فلا يمكن الالتفاف على مسار حسّاس بالإقناع.
المتصل يقاطع في منتصف الجملة ويُفهم. والكلام الحقيقي يُميَّز عن ضجيج الخلفية وكلمات المجاملة مثل «طيب» و«أيوه» قبل أن يتوقف المساعد عن الكلام.
المخرجات المنطوقة تُصاغ بقواعد ثابتة: الآيبان يظهر بآخر أربعة أرقام فقط، والكسور الطويلة تُقرَّب، والجداول تذهب إلى الشاشة — والصوت يقرأ النتائج حرفياً دون إعادة صياغة.
نموذج كلام فوري يملك الأذنين والفم عبر WebSocket واحد. ووكيلك الحالي يبقى العقل — نفس التعليمات ونفس الأدوات ونفس القياسات كما في المحادثة النصية.
المتصفح أو الهاتف يبث الصوت الخام عبر WebSocket واحد. كشف النشاط الصوتي الدلالي ينهي الأدوار في أقل من ثانية، مع عزل ضوضاء عميق وإلغاء صدى مدمجين.
نموذج كلام فوري يتحاور بأداة واحدة فقط: ask_agent. وحرّاس المراقبة يستعيدون الأدوار المتوقفة، ويلغون الإجابات المتقادمة بالاسم، ويعيدون تسليم الإجابات التي لم تصل إلى المتصل.
ask_agent تنفّذ الدور نفسه الذي تنفّذه محادثتك النصية — نفس الملف والتعليمات وأدوات MCP وقاعدة المعرفة والحفظ والتتبع. والصوت والنص يتشاركان سجل جلسة واحداً.
النموذج يسمع ويولّد الكلام بنفسه — عربية طبيعية بأي لهجة تختارها، بلا سقف تحويل النص إلى كلام. وهو ما يشغّل عرضنا الرئيسي للتجّار.
تعرّف كلام Azure وأصوات عصبية حول نموذج لغوي سريع — داخل المنطقة، وأرخص بنحو 4 مرات في الدقيقة، مع أصوات مسماة لكل لغة.
منظومة Google الفورية — حققت 100% دقة نسخ مطابق في مقارنتنا الثلاثية بين المزوّدين. اختيار المزوّد سطر إعدادات، لا إعادة بناء.
تبديل المزوّد أو النموذج أو المنطقة أو الصوت أو اللهجة هو تعديل سجل في بوابة الإدارة — لا إعادة نشر أبداً.
كل قيمة افتراضية في منظومة الصوت هي قياس يحمل تاريخه. وهذه الأرقام التي تشعر بها في المكالمة.
| ما نقيسه | النتيجة | لماذا يهم |
|---|---|---|
| إلغاء عند المقاطعة | 33 م.ث | الإلغاء المسمّى يوقف الصوت المتقادم فوراً تقريباً — مقابل 2.34 ثانية من الاستمرار بدونه. |
| استعادة التوقف | ~0.4 ث | الدور الذي انتهى بعبارة «لحظة» يكتمل فعلاً — إعادة التحفيز تُنزل استدعاء الأداة المستحق في 0.37 ثانية. |
| تسليم الإجابة ← أول صوت | 0.21–0.33 ث | الفجوة التي يراقبها حارس الإجابة قبل إعادة تسليم إجابة لم يصدر لها صوت. |
| تضمينات داخل المنطقة | ~100 م.ث | داخل المنطقة مقابل ~600–800 مللي ثانية عبر السحابات — عمليات البحث المعرفي لا تُحسب على وقت المتصل. |
| هامش البث | ~4× | 28 ثانية من الكلام تُرسَل في 6 ثوانٍ — إيقاع التشغيل، لا التوليد، هو ما يحدد سرعة المكالمة. |
| ميزانية تعليمات الصوت | −51% | شخصية الصوت ضُغطت من 38.7 ألف إلى 19 ألف حرف مع الحفاظ على كل قاعدة ثنائية اللغة. |
| ميزانية الصوت اليومية | لكل مستأجر | ثواني الصوت تُحتسب وتُسقَّف لكل مستأجر يومياً، مع حدود تزامن لكل هوية ولكل عنوان IP. |
| قياسات زمن الاستجابة | 5 مراحل | كل دور يُصدر قياساته — نهاية الدور ← أول صوت، وزمن التفويض وغيرها — إلى لوحة المراقبة. |
الأرقام قياسات حية من طرف الصوت الثنائي لدينا ومن بيئات العرض؛ وأرقامك تعتمد على المنطقة والمزوّد والأدوات.
المساعد الصوتي ليس صندوقاً أسود — بل ملف وكيل في محرك وج للذكاء الاصطناعي، بنفس انضباط دورة الحياة التي يخضع لها كل وكيل آخر.
المزوّد، والنموذج، والأصوات واللهجات لكل لغة، وتوقيت كشف الكلام، والمقاطعة، والحرّاس، والميزانيات — نحو 25 إعداداً للصوت الحي على ملف الوكيل، كلها قابلة للتعديل في بوابة الإدارة دون نشر.
سيناريوهات صوتية حتمية تُجري مكالمة ثنائية حقيقية مع كل نشر وتتحقق من النص الناتج. ومجموعات اختبارات الوحدات وثوابت الأدوار تغطي كل ترتيب أحداث يمكن أن تنتجه مكالمة فعلياً.
متصل آلي موجَّه بالأهداف يجري محادثات كاملة مع المساعد الصوتي — في المحاكاة أو عبر صوت حقيقي — وحَكَم يقيّم كل معيار، مع بوابات زمن استجابة صارمة تحتسب الإجابة لا عبارة الانتظار.
رقِّ لقطة ثابتة من ملف الوكيل، وقارن جولات التقييم بين النسخ، ودع فحص الانحراف يثبت أن البيئة الحية تقدّم بالضبط التعليمات والإعدادات التي تتوقعها.
واجهة إدارة المحرك هي نفسها خادم MCP: نحو 48 أداة لضبط الملفات، ونشر التعليمات، وربط خوادم MCP وقواعد المعرفة، وتشغيل جولات التقييم، وفحص الانحراف، والترقية والنشر. وكلاؤك أنت — أو Claude — يستطيعون بناء المساعدين الصوتيين واختبارهم وضبطهم من البداية إلى النهاية.
الإعدادات الصامتة هي نمط الفشل في تشغيل الصوت — مقاطعة معطَّلة أو تعليمات قديمة تبدو سليمة حتى تأتي مكالمة حية. فحص الانحراف يقارن ما يقدّمه كل ملف فعلياً بمصدر الحقيقة، ويعلّم على أذرع الطوارئ المنسية.
المساعد الصوتي يرتبط بسطح التكامل نفسه الذي يرتبط به كل وكيل في وج — اربط خادماً في البوابة وتصبح الأدوات جاهزة في المكالمة التالية.
اربط أي خادم MCP واختر مجموعة أدوات فرعية لكل وكيل. بيانات اعتماد المستأجر تُحقن من جهة الخادم وتُحذف من مخططات الأدوات — فالنموذج لا يرى سراً أبداً.
أدوات HTTP تُضبط بالنقر في البوابة — إجراءات التذاكر والآيبان في عرضنا هي هذا بالضبط، مع رمز تحقق تمسكه الخوادم لا النموذج.
المستندات تُستوعب وتُقسَّم وتُضمَّن في فهرس متجهات؛ والمساعد الصوتي يبحث فيها أثناء المكالمة ويذكر ما جلبه.
ذاكرة مستخدم طويلة الأمد، وسجل محادثة مشترك بين الصوت والنص، وبيانات أعمال حية عبر أنظمتك — كل منها قابل للتفعيل لكل ملف على حدة، ومضبوط لزمن استجابة الصوت.
ليست طبقة ترجمة: المساعد الصوتي مهندَس لكل لغة على حدة حتى عبارات الانتظار — واللهجة العربية إعداد تختاره، لا قيمة ثابتة.
مع النموذج الفوري الأصلي يولّد المساعد كلاماً عربياً طبيعياً بنفسه — واللهجة قابلة للضبط: خليجية ومصرية وشامية وغيرها من اللهجات التي يدعمها Azure Voice Live.
لغة المكالمة تُثبَّت من لغتك — ولا يمكن لاسم علامة تجارية أجنبية أن يجرّ المساعد إلى لغة أخرى في منتصف المكالمة.
عبارات الانتظار، وعبارات الاعتذار، و«الأرقام ظاهرة لك على الشاشة»، وعبارات التعاطف، وحتى أصوات التردد («ممم»، «طيب») موجودة لكل لغة — لا إنجليزية تتسرب إلى مكالمة عربية.
اختبار توليدي يلزم قواعد الإنجليزية والعربية بالتطابق قاعدة بقاعدة، فأي تعديل أحادي الجانب يفشل قبل أن يصل إلى الإنتاج.
هذه الصفحة كاملة — والمكالمة التجريبية — موجودة بالإنجليزية أيضاً. انتقل وجرّب الأسئلة نفسها.
مكالمة 30 دقيقة: نتصل معاً بوكيل العرض الحي، ونتجول في بوابة الإدارة، ونحدد شكل مساعد صوتي فوق بياناتك وأدواتك.
بلا أي التزام — وأحضر أصعب أسئلة الدعم لديك.