مدل GPT-Live-1 سرانجام در قالب API عرضه شد تا لایه گفتوگوی صوتی پیوسته را در ابعاد تجاری و فنی در اختیار توسعهدهندگان قرار دهد. این عرضه رسمی در ۱۰ سپتامبر ۲۰۲۶ – ۱۹ شهریور ۱۴۰۵، تعامل صوتی انسان و ماشین را از حالت نوبتی و مقطوع گذشته به یک جریان زنده کلامی تبدیل کرده است.
در این مقاله راهنما، محورهای زیر را بهصورت کامل، مستند و تحلیلی بررسی خواهیم کرد:
- مکانیزم عملکردی تمامدوطرفه: تفاوت ماهوی مدلهای نوین با زنجیرههای سنتی سهمرحلهای (تبدیل گفتار به متن، مدل زبانی، تبدیل متن به گفتار)
- قابلیتهای کاربردی و صوتی: مدیریت حرفهای مکثهای فکری، همپوشانی اصوات، فیلتر نویز محیط و کنترل هوشمند نوبت مکالمه
- نتایج ارزیابیها با دادههای عددی: بررسی دقیق ارقام Full Duplex Bench، سنجههای Tau3 و تحلیل زمان تأخیر زیر یک ثانیه
- نمونههای عملیاتی و کاربردهای محصولی: پیادهسازی در مراکز تماس تلفنی، سامانههای رزرواسیون، یادگیری زبان و دستیاری برنامهنویسی
- تعرفهها و الگوهای دسترسی: شفافسازی هزینههای دقیق زمانی به ازای ثانیه، ساختار تفکیک وظایف و تفاوتهای نسخه مصرفکننده با API
- امکان ارسال پیام صوتی در هوشا: راهنمای استفاده از صدا برای پرسش و پاسخ در پلتفرم بومی هوشا
مدل صوتی جی پی تی لایو ۱ (GPT-Live-1) چیست؟
مدل GPT-Live-1 یک بستر صوتی تمامدوطرفه (Full-Duplex) است؛ به این معنا که سیستم قادر است در آن واحد هم سیگنالهای صوتی مخاطب را دریافت کرده و بشنود و هم بدون ایجاد نویز یا قطعی جریان، پاسخ صوتی را تولید و پخش کند.
ویژگی بنیادین دیگر این مدل، قابلیت تفویض وظایف (Delegation) است؛ یعنی به محض اینکه نیاز به تفکر تحلیلی عمیق، استعلام پایگاه داده یا محاسبات پیشرفته پیش بیاید، کار را به یک مدل پشتیبان واگذار میکند و خود به عنوان لایه صوتی ارتباط را گرم و فعال نگه میدارد.
تفاوت GPT-Live-1 با دستیارهای صوتی
در معماریهای سنتی دستیارهای صوتی، یک خط سهبخشی مجزا اجرا میشد:
- مدل تبدیل گفتار به متن (STT مانند Whisper) صدای کاربر را دریافت و به متن تبدیل میکرد.
- مدل زبانی بزرگ (LLM) متن را پردازش میکرد و جواب را در قالب نویسهها مینوشت.
- مدل تبدیل متن به گفتار (TTS) نوشته را به امواج صوتی تبدیل میکرد و برای کاربر میخواند.
این رویکرد گسسته باعث ایجاد تأخیرهای زمانی طولانی میشد، لحن و احساسات صدای کاربر را در جریان تبدیل به متن از بین میبرد و اگر کاربر وسط صحبت هوش مصنوعی مداخله میکرد، سیستم از کار بازمیماند.
اما همانطور که در منبع رسمی معرفی API جی پی تی لایو ۱ توسط OpenAI تصریح شده است، این مدل صوتی تمام این زنجیره را در یک فرآیند بومی و پیوسته تلفیق کرده است. در این شیوه نوین، مدل مستقیماً صدا را تحلیل میکند و گفتوگو حتی حین اجرای پردازشهای سنگین در پسزمینه متوقف نمیشود.

قابلیتهای هوش مصنوعی صوتی GPT-Live-1
ظهور هوش مصنوعی صوتی GPT-Live-1 امکانات پیشرفتهای را در پردازش صوت فراهم کرده که در ادامه مهمترین ابعاد آن را بررسی میکنیم:
۱. مدیریت قطعکردن صحبت، مکث و صدای محیط
در تعاملات انسانی طبیعی، گوینده ممکن است برای فکر کردن چند ثانیه سکوت کند یا ناگهان حرف طرف مقابل را اصلاح نماید. این مدل هوشمند با تحلیل جریان صدا، تفاوت میان مکث تفکر و پایان قطعی جمله را متوجه میشود و زودتر از موعد کلام مخاطب را قطع نمیکند.
همچنین در صورت تداخل صدا و ورود همزمان مخاطب، بلادرنگ صدای خود را تنظیم کرده و داده ورودی جدید را مبنای پاسخ قرار میدهد. صداهای پیرامونی مانند همهمه اداری یا تردد خیابان نیز فیلتر شده و اختلالی در روند گفتوگو ایجاد نمیکنند. برای مقایسه چنین پیشرفتهایی با سایر فناوریها، راهنمای جامع ابزارهای هوش مصنوعی در وبلاگ تصویری شفاف به دست میدهد.
۲. تنظیم لحن، سرعت و سبک با دستور سیستمی
توسعهدهندگان در تنظیمات پیکربندی نشست (Session Instructions) میتوانند شخصیت صوتی دستیار را طراحی کنند. تعیین سرعت ادای کلمات، تمایز میان لحن رسمی اداری و لحن صمیمانه، و حتی القای حس همدلی در گویش، همگی بدون درگیر کردن منطق اصلی برنامهنویسی قابل تعیین هستند.
۳. رونوشت گفتار و متن پاسخ
علاوه بر تبادل بلادرنگ موجهای صوتی، این مدل در هر لحظه رونوشت متنی صدای کاربر و متن جمله بازتولیدشده توسط هوش مصنوعی را به صورت استریم به سامانه ارسال میکند. این فرآیند امکان پایش مداوم، ثبت در پرونده مشتریان و تحلیل معنایی خودکار را بدون نیاز به ماژولهای شنیداری اضافه میسر میسازد.
۴. تشخیص نوبت صحبت (Turn-taking)
به جای تکیه بر ابزارهای قدیمی تشخیص فعالیت صوتی (VAD) که صرفاً با قطع شدن فرکانس صدا عمل میکردند، این سیستم از درک چندوجهی زبان بهره میبرد. مدل هم نوسان صدا و هم ساختار گرامری جمله را میسنجد تا اطمینان حاصل کند که نوبت مکالمه تغییر یافته است.
۵. پایداری گفتوگوهای طولانی
یکی از چالشهای اساسی تعاملات زنده، انباشت کانتکست و افزایش تصاعدی زمان پاسخدهی در جلسات طولانی بود. این فناوری با مدیریت پویا و فشردهسازی جریان گفتوگو، پایداری مکالمه را حتی در نشستهای طولانیمدت به شکل یکدست حفظ مینماید.
۶. واگذاری استدلال و فراخوانی ابزار
وقتی مکالمه به مرحلهای میرسد که به استعلام وضعیت پرواز، بررسی تراز مالی یا اجرای کدهای سرور نیاز است، مدل صوتی این عملیات را به مدل محاسباتی پشتیبان محول میکند. در مدتزمان پردازش بکاند، هوش مصنوعی صوتی GPT-Live-1 با ارائه علائم کلامی طبیعی (مانند تایید کلامی یا اعلام در جریان بودن کار)، حس بلاتکلیفی کاربر در پشت خط را از بین میبرد.
۷. پشتیبانی تماس تلفنی
پروتکلهای ورودی و خروجی داده در این API بهگونهای پیادهسازی شدهاند که بتوان آنها را بدون نیاز به مبدلهای پیچیده و با کمترین میزان تأخیر، با خطوط ویپ (VoIP)، ترانکهای SIP و مراکز تماس ابری ادغام کرد.
بنچمارکهای GPT-Live-1 چه میگویند؟
بر پایه ارزیابیهای فنی منتشرشده در صفحه رسمی عرضه API توسط OpenAI در ۱۰ سپتامبر ۲۰۲۶، مقایسه دقیق عملکرد این نسخه در برابر نسلهای پیشین خانواده Realtime به شرح زیر ثبت شده است:
| بنچمارک و شاخص ارزیابی | GPT-Live-1 | GPT-Realtime-2.1 | GPT-Realtime-2 |
| صحت فراخوانی ابزارها (Full Duplex Bench v3 – Pass@1) | ۸۷٫۰٪ | ۶۰٫۰٪ | ۵۸٫۰٪ |
| کیفیت خروجی پاسخ (Full Duplex Bench v3) | ۹۰٫۰٪ | ۸۸٫۰٪ | ۸۱٫۰٪ |
| تعاملی بودن مکالمه (Full Duplex Bench v1.5) | ۸۰٫۱۰٪ | ۴۵٫۴٪ | ۴۷٫۸٪ |
| تأخیر جابهجایی نوبت گفتوگو (Turn-taking Latency) | ۰٫۷۹۸ ثانیه | ۱٫۴۱ ثانیه | ۱٫۶۳ ثانیه |
| هوش عمومی و استدلال (Tau3 Voice – Pass@1) | ۸۶٫۲٪ | ۴۵٫۷٪ | ۴۲٫۴٪ |
| دانش تخصصی در حوزه بانکداری (Tau Banking Voice) | ۳۲٫۰٪ | ۱۲٫۴٪ | ۱۰٫۳٪ |
| پویایی طبیعی گفتوگو (Artificial Analysis Dynamics) | ۹۷٫۳٪ | ۹۵٫۷٪ | ۹۵٫۳٪ |
وابستگی نتایج به مدل پشتیبان و تنظیمات آزمون
تحلیل موشکافانه این اعداد نشان میدهد که عملکرد سیستم صوتی جدید کاملاً به ساختار جفتشده با آن وابسته است:
- دستیابی به نرخ موفقیت ۸۷٫۰ درصدی در فراخوانی ابزارها در بنچمارک Full Duplex Bench v3 زمانی ثبت شده که مدل پشتیبان GPT-5.6 Terra با سطح استدلال پایین (Low reasoning effort) به آن متصل بوده است.
- رشد ۳۰ واحد درصدی نسبت به GPT-Realtime-2.1 و دستیابی به رتبه نخست در آزمون Tau3 حاصل اتصال به مدل محاسباتی GPT-6 Astra با سطح استدلال متوسط (Medium effort) بوده است.
همچنین کاهش تأخیر نوبتگیری گفتوگو به ۰٫۷۹۸ ثانیه یک رکورد به حساب میآید؛ زیرا در روانشناسی مکالمه، مکث بیش از یک ثانیه جریان طبیعی کلام را مخدوش میکند. از این رو، ارقام بنچمارک توصیفکننده یک زوج سیستمی متشکل از لایه صوتی و موتور بکاند هستند و بسته به ابزارهای مورد استفاده تغییر خواهند کرد.

کاربردهای مدل صوتی GPT-Live-1
عملیاتیسازی توانمندیهای هوش مصنوعی GPT-Live-1 در قالب یک سرویس کاربردی، مستلزم تأمین اشتراک API، معماری صحیح مدل پشتیبان و تعریف ابزارهای تعاملی متناسب با کسبوکار است. در ادامه چند سناریوی پیادهسازی آورده شده است:
۱. پشتیبانی تلفنی مشتریان
سناریو: فردی جهت پیگیری سفارش خرید تماس میگیرد و حین بیان کد رهگیری ناگهان میگوید: «ببخشید، رقم آخر رو اشتباه گفتم، پنج نیست، نه هست.» مدل صوتی بدون گیج شدن یا قطع تماس، عدد جدید را جایگزین کرده، استعلام را از دیتابیس دریافت میکند و بدون ایجاد وقفه گزارش میدهد.
۲. سامانههای رزرو و پاسخگویی آنلاین
سناریو: مشتری برای هماهنگی نوبت درمانگاه تماس میگیرد و عنوان میکند: «برای چهارشنبه عصر ساعت ۶ نوبت میخوام، اگر پر بود پنجشنبه صبح هم میتونم بیام.» مدل با سیستم نوبتدهی ارتباط برقرار کرده و بهترین گزینه را بلافاصله پیشنهاد میدهد. برای آشنایی با زیرساختهای ساخت صدا، میتوانید مقاله تبدیل متن به صدا با هوش مصنوعی را نیز مطالعه نمایید.
۳. آموزش زبانهای خارجی
سناریو: دانشآموز در حین تمرین مکالمه زبان دچار تردید شده و مکث میکند. دستیار با تشخیص مکث آموزشی کلام او را قطع نمیکند، اجازه تکمیل جمله را میدهد و سپس اشتباهات گرامری را به شکل محاورهای تشریح مینماید.
۴. دستیار اداری و سازمانی
سناریو: مدیر سازمان در خودرو و بهصورت صوتی از سیستم میخواهد صورتجلسه روز گذشته را بررسی کند، نکات حیاتی را بخواند و ایمیل تأییدیه را برای اعضای هیئتمدیره بفرستد.
۵. راهنمایی و پشتیبانی درون محصولی
سناریو: کاربر در جریان ثبت درخواست در یک نرمافزار پیچیده مالی دچار مشکل میشود. مدل بهصورت گفتاری و گامبهگام او را راهنمایی میکند و با اصلاح اشتباهات ورودی کاربر، مانع از ثبت فرمهای غلط میشود.
۶. دستیار کدنویسی صوتی
سناریو: توسعهدهنده نرمافزار بدون تغییر پنجره کد، منطق یک تابع را با صدای بلند بازگو میکند؛ سیستم هوشمند کد مربوطه را به شکل موازی تحلیل کرده و خطاهای احتمالی را بهصورت صوتی به برنامهنویس گوشزد میکند.
نحوه دسترسی به GPT-Live-1
دسترسی به GPT-Live-1 بسته به نوع کاربری، در دو مسیر کاملاً مجزا ارائه میشود:
۱. کاربران نسخه کاربری ChatGPT
OpenAI در بیانیه رسمی میگوید GPT Live‑1 در ۸ ژوئیهٔ ۲۰۲۶ برای کاربران چت جی پی تی معرفی شد و عرضه بهتدریج انجام میشود؛ GPTLive‑1 برای پلنهای پولی و نسخهٔ mini برای کاربران رایگان در نظر گرفته شده است.
این نسخه برای مکالمات عمومی و کاربریهای روزمره شخصی مناسب است و محدودیتهای زمانی مشخصی دارد.
۲. توسعهدهندگان نرمافزار و سازمانها (دسترسی API)
برای استقرار در نرمافزارهای مستقل، دسترسی از طریق اندپوینت اختصاصی Live sessions در مستندات برنامهنویسی فراهم است:
- هزینه لایه صوتی: ۰٫۰۵ دلار به ازای هر دقیقه مکالمه که بهطور دقیق بر حسب ثانیه محاسبه میشود.
- تفکیک هزینهها: مبالغ مربوط به مدلهای محاسباتی پشتیبان مانند مدلهای GPT5.6 یا تحلیل سناریوهای پیشرفته مرتبط با قابلیتهای GPT و هزینه وبهوکها به شکل جداگانه محاسبه میگردند.
- محدودیت نرخ مصرف: این بستر در پلنهای رایگان فعال نیست و سقف ظرفیت بر مبنای تعداد نشستهای همزمان (Concurrent Sessions) کنترل میشود. جزئیات توسعه در راهنمای رسمی مهندسی پرامپت زنده و همچنین مستندات ساخت عاملهای صوتی هوشمند تشریح شده است. همچنین یادآوری میشود که سامانههای بومی هیچگاه ادعای ارائه API رسمی این مدل را ندارند.
ارسال پیام صوتی در هوشا
کاربران در این پلتفرم هوش مصنوعی فارسی میتوانند بدون نیاز به تایپ دستی کلمات، پیامهای صوتی خود را ثبت و ارسال کنند تا هوش مصنوعی درخواستهای نگارشی، ترجمه، برنامهنویسی و اداری آنها را بررسی کرده و پاسخ را در همان محیط گفتوگو ارائه دهد.
باید با صراحت فنی بیان کرد که امکان ارسال پیام صوتی در هوشا، ابزاری کاربردی برای پرسش و پاسخ آسان است و نباید آن را با سازوکار گفتوگوی تمامدوطرفه بلادرنگ مدل هوش مصنوعی GPT-Live-1 یا دسترسی مستقیم به API اختصاصی آن اشتباه گرفت.
هوشا محیطی دسترسپذیر و بومیشده را برای پاسخگویی به نیازهای کاری روزانه فراهم ساخته است. برای تجربه این امکانات میتوانید به سایت هوش مصنوعی هوشا مراجعه کنید.
جمعبندی
توسعه مدل GPT-Live-1 یک تحول ساختاری در تعاملات کلامی ماشین با دنیای پیرامون به شمار میآید. کاهش تأخیر نوبت مکالمه به کمتر از هشتدهم ثانیه و تفکیک لایه سخنگویی از پردازشهای سنگین داده، امکان خلق سیستمهای تلفنی و دستیارهای تعاملی طبیعی را فراهم آورده است.
برای تیمهای فنی، ارزیابی دقیق معماری تفویض کار و مستندات رسمی نخستین گام پیادهسازی است؛ در حالی که کاربران عادی میتوانند با استفاده از ابزار ارسال پیام صوتی در پلتفرم بومی هوشا، فعالیتهای روزانه خود را سریعتر و بدون زحمت تایپ پیش ببرند.
نویسنده: الهه میرمیران
GPT-Live-1 چیست؟
مدل صوتی OpenAI برای گفتوگوی پیوسته و طبیعی است که میتواند همزمان ورودی صوتی را دریافت و پاسخ صوتی تولید کند. برای کارهای عمیقتر، از مدل یا ابزار پشتیبان کمک میگیرد.
تفاوت GPT-Live-1 با مدلهای صوتی معمولی چیست؟
در معماری تمامدوطرفه، مدل لازم نیست همیشه تا پایان صحبت کاربر صبر کند. میتواند مکث، قطعکردن صحبت و نشانههای گفتوگو را طبیعیتر مدیریت کند.
آیا GPT-Live-1 از طریق API در دسترس است؟
بله. طبق اعلام OpenAI، این مدل در API عرضه شده است. هزینه لایه صوتی ۰٫۰۵ دلار برای هر دقیقه است و هزینه مدل پشتیبان و ابزارها جداگانه محاسبه میشود.
آیا GPT-Live-1 برای تماس تلفنی مناسب است؟
بله. OpenAI از پشتیبانی تلفنی و کاربردهایی مانند رزرو، پشتیبانی مشتری و پاسخگویی تلفنی نام برده است؛ پیادهسازی آن به زیرساخت محصول و رعایت سیاستهای حریم خصوصی نیاز دارد.
آیا در هوشا میتوانم با صدا درخواست بدهم؟
بله، میتوانید پیام صوتی بفرستید و درخواست خود را با صدا مطرح کنید. این قابلیت را نباید معادل دسترسی توسعهدهندگان به API یا گفتوگوی تمامدوطرفه GPT-Live-1 دانست.
آیا GPT-Live-1 جایگزین مدلهای متنی میشود؟
خیر. این مدل لایه گفتوگوی صوتی را مدیریت میکند و برای استدلال، جستوجو و انجام کارها میتواند به یک مدل متنی یا ابزارهای پشتیبان متصل شود.
هوش مصنوعی ساخت عکس با چهره خودم با ۱۴ پرامپت آماده و رایگان
جی پی تی لایو GPT-Live-1 چیست؟ معرفی مدل صوتی جدید OpenAI
Gemini 4 Pro جمنای ۴ پرو چیست؟ تاریخ انتشار و شایعات
ساخت عکس دهه ۸۰ میلادی با چت جی پی تی (ترند اینستاگرام)؛ آموزش و ۱۰ پرامپت
میلیاردر شدن با هوش مصنوعی؛ چرا تیم آرمو AI را موج بعدی ثروت میداند؟