المحتويات
- 1. ما هو GPT-Live — صوت كامل الازدواج «يستمع ويتكلم في آن واحد»
- 2. ما الفرق بينه وبين Advanced Voice Mode التقليدي
- 3. آلية العمل — قرارات في كل ثانية وتفويض إلى نموذج في الخلفية
- 4. النموذجان والإتاحة حسب الخطة
- 5. أبرز نقاط التطور
- 6. القيود الحالية — لنكن صريحين
- 7. حالات الاستخدام
- 8. وضع إتاحة الـ API والفرق عن GPT-Realtime
- الخلاصة
- الأسئلة الشائعة
في 8 يوليو 2026، أطلقت OpenAI عالميًا نموذجًا جديدًا يجدّد صوت ChatGPT باسم «GPT-Live» (الإعلان الرسمي من OpenAI). جاء الإعلان قبل يوم من الإتاحة العامة لـ GPT-5.6 في اليوم التالي (9 يوليو)، وأبرز ما يميّزه هو بنية «كاملة الازدواج (full-duplex) تستمع وتتكلم في آن واحد».
كانت أنظمة الصوت الذكية حتى الآن قائمة على التناوب: «تنتظر حتى تنهي كلامك ثم تردّ». أما GPT-Live فـيعلّق بإيجاز مثل «مهمم»، ويستوعب المقاطعات، ولا يقاطع صمتك أثناء التفكير، تمامًا كمحادثة بشرية. في هذا المقال نشرح — استنادًا إلى الإعلان الرسمي — ما هو GPT-Live، وما الفرق بينه وبين Advanced Voice Mode التقليدي، وكيف يعمل، وفي أي خطة يتوفر، وما الذي لا يستطيع فعله بعد.
إضافة حتى 25 سبتمبر 2026: بعد النشر تغيّر النموذج المستخدم في الخلفية وحدود استخدام الصوت (9 سبتمبر)، وأصبحت واجهة API متاحة للجميع (10 سبتمبر)، ووصل الصوت إلى ChatGPT Work (23 سبتمبر). أبقينا شرح يوم الإطلاق، وأعدنا كتابة المواضع التي تختلف اليوم مع ذكر التواريخ (المصادر: ملاحظات إصدار OpenAI، مقالة مساعدة ChatGPT Voice، سجل تغييرات API).
نهاية نظام التناوب
— نحو محادثة تشبه البشر، تستمع وتتكلم في آن واحد
1. ما هو GPT-Live — صوت كامل الازدواج «يستمع ويتكلم في آن واحد»
GPT-Live هو سلسلة نماذج صوتية جديدة تتولى المحادثة الصوتية في ChatGPT. وقد طُرح عالميًا اعتبارًا من 8 يوليو 2026 على iOS وAndroid والويب في ChatGPT، ليحلّ محل الميزة الصوتية السابقة (Advanced Voice Mode).
يكمن جوهره في تصميم «كامل الازدواج (full-duplex)». فمثل الهاتف، يعالج المدخل (صوتك) وفي الوقت نفسه يستمر في توليد المخرج (صوت الذكاء الاصطناعي). لذلك —
- يمكنه أن يردّ بتعليقات وجيزة مثل «مهمم» أو «صحيح» بينما أنت تتكلم
- وإذا قاطعتَه أثناء كلامه، يستمع جيدًا ويغيّر مساره
- وإذا صمتَّ للتفكير، لا يفسّر ذلك خطأً على أنه «انتهاء كلامك» فيقاطعك
باختصار، GPT-Live يحقق محادثة آنية بلا «انتظار للدور».
2. ما الفرق بينه وبين Advanced Voice Mode التقليدي
كان الصوت الذكي السابق (Advanced Voice Mode) قائمًا على التناوب (نصف الازدواج). وبحكم تصميمه كانت له نقاط ضعف كهذه.
| الجانب | السابق: Advanced Voice Mode | الجديد: GPT-Live |
|---|---|---|
| الأسلوب الأساسي | تناوب (نصف ازدواج) — ينتظر انتهاء الكلام | كامل الازدواج — يستمع ويتكلم في آن واحد |
| تحديد انتهاء الكلام | يعتمد على الصمت (السكون) | لا ينتظر توقفًا واضحًا: يتابع أثناء الاستماع فترات التوقف والمقاطعات وتغيّر سرعة الكلام، ويقرّر في اللحظة |
| الصمت أثناء التفكير | يفسّره خطأً كـ«انتهى» فيميل إلى المقاطعة | ينتظر دون مقاطعة |
| التعليق الوجيز | غير موجود أساسًا | يردّ بـ«mhmm» و«yeah» ونحوها |
| المقاطعة | قد ينقطع بشكل غير طبيعي | يستوعبها ويتكيّف |
| تواتر القرار | على مستوى الدور | عدة مرات في الثانية (يتكلم/يستمع/يترك فسحة/يقاطع/يستدعي أداة) |
وفقًا لـ OpenAI، في مقارنة قيّمها بشر لمحادثات مدتها 5–10 دقائق بالظروف نفسها، فُضِّل كل من GPT-Live-1 وGPT-Live-1 mini بوضوح على Advanced Voice Mode. كما أُبلغ عن تحسّن في مهام GPQA (الاستدلال العلمي المتخصص) وBrowseComp (البحث الوكيلي على الويب) ومهام دعم العملاء.
3. آلية العمل — قرارات في كل ثانية وتفويض إلى نموذج في الخلفية
يقوم GPT-Live بـمعالجة المدخل الصوتي باستمرار وتوليد المخرج الصوتي في آن واحد، ويتخذ عدة مرات في كل ثانية قرار «ماذا أفعل الآن» — أيتكلم، أم يواصل الاستماع، أم يترك فسحة، أم يقاطع، أم يستدعي أداة. هذا اتخاذ القرار العالي التواتر هو ما يولّد إيقاعًا شبيهًا بالبشر.
وثمة تصميم مهم آخر هو «تفويض المعالجة العميقة إلى نموذج في الخلفية». فسرعة الاستجابة في المحادثة يتولاها GPT-Live، أما حين يلزم بحث على الويب أو استدلال عميق أو عمل معقد، فيمرّر المعالجة خلف الكواليس إلى نموذج أكبر (وهو GPT-5.5 عند الإطلاق)، ثم يعود إلى المحادثة حين تظهر النتيجة. إنها آلية تجمع بين «التفكير» ودون انقطاع المحادثة.
كتبت OpenAI في الإعلان أنها «ستحدّث باستمرار النموذج الذي يستخدمه GPT-Live كلما أطلقت نماذج رائدة جديدة»، وهذا ما حدث: منذ 9 سبتمبر 2026 يستخدم الصوت GPT-5.6 أو GPT-6 Astra (ملاحظات إصدار OpenAI). أي أن اسم نموذج الخلفية سيظل يتغيّر. والجدير بالتذكّر ليس الاسم بل البنية: جزء يدير المحادثة، وجزء آخر يتولّى التفكير. ذكاء الإجابات يتوقف على نموذج الخلفية، وسهولة الحديث تتوقف على GPT-Live.
4. النموذجان والإتاحة حسب الخطة
| الخطة | عند الإطلاق (8 يوليو 2026) | حتى 25 سبتمبر 2026 (الصوت في Chat، لكل 24 ساعة) |
|---|---|---|
| Free (المجانية) | GPT-Live-1 mini | GPT-Live-1 mini (وصول محدود، وقد تتغيّر الحدود) |
| Go | GPT-Live-1 | 3 ساعات مع GPT-Live-1 mini |
| Plus | GPT-Live-1 | 3 ساعات مع GPT-Live-1 |
| Pro | GPT-Live-1 | 15 ساعة في خطة $100، وبلا حدود في خطة $200 (GPT-Live-1) |
| Business / Enterprise / Edu | غير متاح | متاح بحسب إعدادات مساحة العمل. لخطة Business Standard ثلاث ساعات، ولـ Premium خمس عشرة ساعة، والاستخدام الإضافي بـ 1.25 رصيد للدقيقة |
النقطة الأهم أن الخطة المجانية نفسها تستطيع استخدام نسخة mini من GPT-Live، فالمحادثة الطبيعية كاملة الازدواج لا تقتصر على الخطط المدفوعة. عند الإطلاق كان GPT-Live-1 هو الافتراضي في Go/Plus/Pro، لكن منذ 9 سبتمبر 2026 صارت Go تستخدم GPT-Live-1 mini، ولم تعد Plus وPro تنتقلان إلى mini عند بلوغ حد الصوت (ملاحظات إصدار OpenAI). ومساحات عمل Business وEnterprise وEdu، التي استُثنيت عند الإطلاق، يمكنها الآن استخدامه بحسب إعداداتها (OpenAI Help). وهو متاح في ChatGPT على iOS وAndroid وChatGPT.com، وطُرح على مراحل في أنحاء العالم. وبما أن الحدود تُراجَع، فتحقّق من الجدول في OpenAI Help قبل الاعتماد عليها.
5. أبرز نقاط التطور
يتفاعل بـ«مهمم» بينما أنت تتكلم، فينشأ شعور بأنه يصغي إليك.
يقرّر عدة مرات في الثانية أن يتكلم أو يواصل الاستماع، فيجاري إيقاع المحادثة. لا يذكر إعلان OpenAI ولا صفحة النموذج رقمًا لزمن الاستجابة.
حتى لو قاطعتَه في منتصف الكلام، يستمع ويصحّح مسار المحتوى.
لا يحكم خطأً على فسحة التفكير بأنها «انتهاء كلام»، بل ينتظرك.
6. القيود الحالية — لنكن صريحين
بما أن التوقعات قد تسبق الواقع، فمن المفيد أن نكون صريحين بشأن ما لا يستطيع فعله. فيما يلي قسّمنا قيود يوم الإطلاق إلى ما لا يزال قائمًا وما حُلّ بالفعل (حتى 25 سبتمبر 2026).
- 🟡 لا فيديو ولا مشاركة للشاشة: كما عند الإطلاق، لا يتعامل Live مع إدخال الفيديو ولا مشاركة الشاشة (OpenAI Help). وعند الحاجة إليهما، انتقل إلى صوت Advanced السابق في تطبيق iOS أو Android.
- 🟡 الدعم الكامل لكل اللغات لم يكتمل بعد: كتبت OpenAI عند الإطلاق أن GPT-Live محسَّن للغات الأكثر استخدامًا، وأنه قد يظهر في بعض اللغات بلكنة غير أصلية أو بنقص في الطلاقة.
- 🟡 مصمَّم للمحادثة الثنائية: لم يُحسَّن بعد لعدة متحدثين في وقت واحد، وقد يردّ حين يتحدث الناس بعضهم إلى بعض (OpenAI Help).
- 🟢 واجهة API متاحة الآن: كانت «قريبًا» عند الإطلاق، وأصبحت متاحة للجميع في 10 سبتمبر 2026 (انظر الفصل 8).
- 🟡 طرح متدرّج: الميزات المتاحة لك وموعدها يتوقفان على الخطة والمنطقة وإعدادات مساحة العمل وإصدار التطبيق.
يُتوقع أن تتوسّع هذه الأمور في التحديثات المقبلة، لكن من الجيد إدراك أن الأمر ليس «فيديو وشاشة على الفور».
7. حالات الاستخدام
- الاستشارة وتصفية الأفكار دون استخدام اليدين: نظّم أفكارك بصوت عالٍ أثناء المشي أو العمل. ولأنه لا يقاطع صمتك، يقلّ انقطاع تسلسل التفكير.
- التدرّب على المحادثة في تعلم اللغات: بفضل التعليق الوجيز والمقاطعة الطبيعية، يمكنك التدرّب على نحو أقرب إلى المحادثة الواقعية.
- البحث والتلخيص بالصوت: يُفوَّض البحث العميق إلى نموذج في الخلفية، فتستطيع البحث وأنت تتحدث.
- تكليف العمل بالكلام: منذ 23 سبتمبر 2026 يمكنك التحدث إلى ChatGPT Work على الويب والهاتف وطلب إعداد مستندات وشرائح وجداول. وإن كانت المهمة لا تزال جارية عند إنهاء المكالمة، فإنها تستمر نصيًا (يلزم الوصول إلى Voice وWork معًا؛ ملاحظات إصدار OpenAI).
- إتاحة الوصول: في المواقف التي يصعب فيها الكتابة، تكون واجهة صوتية جيدة الإيقاع مفيدة.
وتقدّم OpenAI Help أيضًا نصائح عملية للاستفادة منه أكثر.
- إن أردت التفكير بصوت عالٍ فأخبره مسبقًا: قل في البداية شيئًا مثل «انتظر حتى أطلب منك الرد»، فيتمهّل. لكن فترات الصمت الطويلة أو الأصوات المحيطة قد تدفعه إلى الرد.
- إن كان يقاطعك كثيرًا فغيّر ظروفك: استخدم سماعات، أو انتقل إلى مكان أهدأ، أو ارفع صوت الجهاز. وعلى iPhone افتح مركز التحكم واختر «وضع الميكروفون» وفعّل «عزل الصوت».
- للنص المُملى استخدم الإملاء: نصوص المحادثة الصوتية ليست حرفية وقد لا تطابق ما قيل تمامًا. وإن أردت مراجعة كلامك وتعديله قبل إرساله، فالإملاء (Dictation) أنسب من المحادثة (Voice).
- اعرف كيف تُعامَل التسجيلات: تُحفظ المقاطع الصوتية مع نص المحادثة لمدة 30 يومًا، ولا تُستخدم للتدريب إلا إذا فعّلت مشاركتها بنفسك (ولا يمكن مشاركتها في Business وEnterprise وEdu). أما نصوص المحادثة فقد تُستخدم بحسب إعداد «تحسين النموذج للجميع».
8. وضع إتاحة الـ API والفرق عن GPT-Realtime
عند الإطلاق كانت واجهة API الخاصة بـ GPT-Live «قريبًا»، ولم يكن أمام المطوّرين والشركات سوى التسجيل لتلقي الإشعارات. ثم أصبحت متاحة للجميع في API يوم 10 سبتمبر 2026 (سجل تغييرات OpenAI API). ووفق صفحة النموذج حتى 25 سبتمبر 2026، فإن معرّف النموذج هو gpt-live-1، ويعمل عبر نقطة نهاية Live مخصّصة (v1/live/sessions)، وتكلفة الجلسات الصوتية $0.05 للدقيقة مع احتساب بالثانية. أما نموذج الخلفية والأدوات فتُحتسب تكلفتها منفصلة.
في API، كما في ChatGPT، يُبنى النظام من GPT-Live الذي يدير المحادثة وواجهة خلفية تتولّى التفكير. يمكنك ترك تشغيل نموذج الخلفية لـ OpenAI، أو ربط وكيلك أو خدمتك الخاصة (الدليل الرسمي). ويبقى على تطبيقك التحقق من الصلاحيات وكل ما يمسّ أنظمتك الخاصة.
الخلاصة
- GPT-Live نموذج جديد يحوّل صوت ChatGPT من «التناوب» إلى كامل الازدواج (يستمع ويتكلم في آن واحد) (8 يوليو 2026، عالميًا).
- بفضل التعليق الوجيز والمقاطعة واحتمال الصمت، يحقق إيقاع محادثة قريبًا من البشر. وقد فُضِّل بوضوح على Advanced Voice Mode.
- يتولّى GPT-Live سرعة الاستجابة في المحادثة، بينما يُفوَّض الاستدلال العميق والبحث إلى نموذج في الخلفية (GPT-5.5 عند الإطلاق، وGPT-5.6 أو GPT-6 Astra منذ 9 سبتمبر 2026).
- تستخدم Free وGo نموذج GPT-Live-1 mini، وتستخدم Plus وPro نموذج GPT-Live-1 (حتى 25 سبتمبر 2026). ويمكن لـ Business وEnterprise وEdu استخدامه بحسب الإعدادات. متاح في ChatGPT على iOS/Android/الويب.
- القيود الحالية: لا فيديو ولا مشاركة للشاشة، والدعم الكامل لكل اللغات لم يتحقق بعد. أصبحت واجهة API متاحة للجميع في 10 سبتمبر 2026 ($0.05 للدقيقة). أما GPT-Realtime-2.1 فخط منفصل من نماذج الصوت في API.
الأسئلة الشائعة
س1. هل يمكن استخدام GPT-Live مجانًا؟
نعم. يمكن للخطة المجانية استخدام GPT-Live-1 mini بشكل محدود. وحتى 25 سبتمبر 2026 تستخدم Go أيضًا GPT-Live-1 mini (حتى 3 ساعات يوميًا)، بينما تستخدم Plus وPro النموذج الأعلى GPT-Live-1. متاح في ChatGPT على iOS وAndroid والويب (طرح تدريجي).
س2. ما هو «كامل الازدواج» تحديدًا؟
هو أسلوب يتيح الاستماع والكلام في آن واحد مثل الهاتف. بخلاف التناوب التقليدي (ينتظر انتهاء كلامك ثم يردّ)، يمكنه أن يردّ بتعليق وجيز أثناء كلامك، وأن يستوعب المقاطعة، وأن ينتظر دون أن يقاطع صمتك أثناء التفكير.
س3. ما أكبر فرق بينه وبين Advanced Voice Mode التقليدي؟
طريقة تحديد انتهاء الكلام. كان السابق يعتمد على الصمت (السكون)، فيفسّر خطأً فسحة التفكير كـ«انتهى» ويميل إلى المقاطعة. أما GPT-Live فـلا ينتظر توقفًا واضحًا: يتابع أثناء الاستماع فترات التوقف والمقاطعات وتغيّر سرعة الكلام، ويقرّر عدة مرات في الثانية أن يردّ أو يواصل الاستماع (بطاقة النظام من OpenAI)، فيقلّ مقاطعته ويكون أكثر طبيعية. وقد فُضِّل بوضوح في تقييم البشر أيضًا.
س4. هل يمكنه الإجابة عن الأسئلة الصعبة؟
نعم. يتولّى GPT-Live سرعة الاستجابة في المحادثة، وحين يلزم بحث في الويب أو استدلال عميق يفوّض المعالجة إلى نموذج في الخلفية ثم يعيد النتائج إلى المحادثة. كان ذلك النموذج عند الإطلاق GPT-5.5، ومنذ 9 سبتمبر 2026 يستخدم GPT-5.6 أو GPT-6 Astra، ويُختار النموذج وجهد الاستدلال بأدوات التحكم نفسها المستخدمة في المحادثة النصية.
س5. هل يمكن استخدام الفيديو أو مشاركة الشاشة؟
لا، حتى 25 سبتمبر 2026. لا يدعم Live الفيديو ولا مشاركة الشاشة، فإن احتجت إليهما انتقل إلى صوت Advanced السابق في تطبيق iOS أو Android (OpenAI Help). وقد قالت OpenAI عند الإطلاق إنها تعمل على إضافة هاتين الميزتين.
س6. هل يمكنني دمجه في تطبيقي عبر API؟
نعم. أصبحت واجهة API الخاصة بـ GPT-Live متاحة للجميع في 10 سبتمبر 2026؛ معرّف النموذج gpt-live-1، وتكلفة الجلسات الصوتية $0.05 للدقيقة (ونموذج الخلفية والأدوات تُحتسب منفصلة). وهناك أيضًا الخط المنفصل GPT-Realtime-2.1 / mini، فاختر بحسب ما تقدّمه: طبيعية المحادثة، أم البناء على Realtime API القائمة.
س7. كيف يقارَن بـ Gemini Live من Google؟
يتيح Gemini Live من Google مشاركة الكاميرا أو شاشة الهاتف أثناء الحديث (مساعدة Gemini Live). وحتى 25 سبتمبر 2026 لا يدعم GPT-Live الفيديو ولا مشاركة الشاشة، فإن أردت أن تُريه ما تراه فالأفضلية لـ Gemini Live. أما الميزة التي تبرزها OpenAI في GPT-Live فهي طبيعية المحادثة كاملة الازدواج: يُظهر أنه يُصغي وأنت تتكلم، ويتقبّل المقاطعة في منتصف الجملة، وينتظر صامتًا وأنت تفكّر. لم تنشر OpenAI أرقامًا لزمن الاستجابة، لذا لا يمكن المقارنة في سرعة الرد. لمزيد من التفاصيل راجع أيضًا مقارنة GPT-5.6 مقابل Gemini.
مقالات ذات صلة
- الشرح الكامل لإطلاق GPT-5.6 — مجموعة النماذج الرئيسية في الفترة نفسها
- GPT-5.6 Sol مقابل Gemini — محاور مقارنة تعدد الوسائط/الصوت
- ما هو Google Gemini — أساسيات المنافس
- ما هو ChatGPT Work؟ — وكيل العمل الذي يُعدّ المستندات والجداول والشرائح، ويمكنك الآن تكليفه بالصوت أيضًا
لإرفاق تسجيل موجود بصيغة MP3 أو M4A بمحادثة، راجع دليل رفع الصوت إلى ChatGPT لمعرفة الصيغ والخطط المدفوعة والتحقق من التفريغ وفوترة API المنفصلة وقواعد التخزين.