Gemini 3.8 Live و GPT-Live-1 مدلهای جدید هوش مصنوعی صوتی هستند که در شهریور ۱۴۰۵ وارد بازار شدند. جی پی تی لایو ۱ در ۱۰ سپتامبر و جمنای ۳.۸ لایو در ۱۵ سپتامبر وارد APIهای OpenAI و Google شدند.
اما این دو مدل دقیقاً چه تفاوتی دارند؟ در ادامه، Gemini 3.8 Live و GPT-Live-1 را از نظر قابلیتهای صوتی، ورودیهای چندرسانهای، قیمت API، بنچمارکها و محدودیتها بررسی میکنیم.
در این مقاله میخوانید:
- تفاوت Gemini 3.8 Live و GPT-Live-1 در قابلیتهای صوتی
- قیمت API و هزینه استفاده از مکالمه صوتی هر کدام
- محدودیتهای جمنای 3.8 Live و جی پی تی GPT-Live-1
- مقایسه عملکرد جمنای ۳.۸ لایو و جیپیتی لایو ۱ در بنچمارکهای Artificial Analysis
معرفی جمنای Gemini 3.8 Live
Gemini 3.8 Live مدل صوتی جدید گوگل (Google) برای ساخت تجربههای مکالمهای و Voice Agent یا دستیارهای صوتی است. این مدل در ۱۵ سپتامبر ۲۰۲۶ (۲۴ شهریور ۱۴۰۵) عرضه شد و در Gemini API و Google AI Studio در دسترس قرار گرفت.
Google در کنار مدل استاندارد، Gemini 3.8 Live Extended Thinking را نیز عرضه کرده است. نسخه Extended Thinking برای کارهایی طراحی شده که به استدلال چندمرحلهای بیشتری نیاز دارند.
Gemini 3.8 Live چیست؟ معرفی کامل کاربردها + بنچمارکها
معرفی GPT-Live-1
GPT-Live-1 مدل صوتی اوپنایآی (OpenAI) برای ساخت تجربههای مکالمهای زنده است. جی پی تی لایو ۱ در ۱۰ سپتامبر ۲۰۲۶ (۱۹ شهریور ۱۴۰۵) در API OpenAI عرضه شد.
جی پی تی لایو ۱ برای مدیریت وقفه، مکث و تغییر مسیر مکالمه طراحی شده است. در عین حال، بر اساس توضیحات OpenAI، این مدل میتواند کارهای پیچیدهتر را برای پردازش بیشتر به یک مدل پشتیبان (Backend)، ابزارها یا سیستمهای دیگر بسپارد.
جی پی تی لایو GPT-Live-1 مدل صوتی جدید OpenAI
مقایسه قابلیتهای جمنای ۳.۸ لایو و GPT لایو ۱ در یک نگاه
جدول زیر تفاوتهای اصلی دو مدل Gemini 3.8 Live و GPT-Live-1 را نشان میدهد.
توجه: اطلاعات جدول بر اساس راهنمای رسمی OpenAI و گوگل در سپتامبر ۲۰۲۶ (شهریور ۱۴۰۵) تنظیم شده است.
| قابلیت | Gemini 3.8 Live | GPT-Live-1 |
| مکالمه صوتی زنده | ✅ | ✅ |
| ورودی صدا و متن | ✅ | ✅ |
| ورودی تصویر | ✅ (تقریباً همزمان) | ❌ |
| ورودی ویدیو | ✅ (از طریق فریمها) | ❌ |
| مدیریت وقفه | ✅ | ✅ |
| تعداد زبانهای اعلامشده | ۹۷ زبان | اعلام نشده |
| API | Gemini Live API | OpenAI Live API |
| مناسب برای | تجربههای صوتی و چندرسانهای | مکالمه صوتی و دستیار صوتی |
بهطور کلی، جمنای ۳.۸ لایو برای پروژههایی که به ورودی تصویری یا ویدیویی در جریان مکالمه نیاز دارند، قابلیتهای بیشتری ارائه میکند؛ در حالی که GPT لایو ۱ تمرکز بیشتری بر تعامل صوتی تمامدوطرفه (Full-Duplex) و اتصال به Backend دارد.
مقایسه قابلیت صوتی Gemini 3.8 Live و GPT-Live-1
هر دو هوش مصنوعی برای مکالمه صوتی بلادرنگ (real-time conversation) با تاخیر کم ساخته شدهاند و روی کاهش فاصله بین صحبت کاربر و پاسخ مدل تمرکز دارند.
جی پی تی لایو ۱ برای مکالمه دوطرفه و طبیعی طراحی شده است. این مدل میتواند هنگام مکالمه به صحبت کاربر واکنش نشان دهد و در صورت قطع شدن پاسخ، مسیر مکالمه را با شرایط جدید ادامه دهد.
جمنای ۳.۸ لایو برای گفتوگوی زنده با تاخیر کم طراحی شده است. تفاوت مهم آن، امکان ترکیب صوت با ورودیهای تصویر و ویدیو در یک تجربه زنده است.
مقایسه Gemini و ChatGPT؛ بررسی تفاوتها و برتریها

Full-Duplex چیست؟
Full-Duplex به توانایی سیستم برای دریافت صدای کاربر و تولید پاسخ صوتی بهصورت همزمان گفته میشود.
این قابلیت برای دستیارهای صوتی که قرار است مکالمهای شبیه گفتوگوی انسانی داشته باشند اهمیت زیادی دارد؛ زیرا کاربر میتواند وسط پاسخ دستیار وارد مکالمه شود.
مقایسه ورودی و خروجی Gemini 3.8 Live و GPT-Live-1
پشتیبانی از تصویر و ویدیو یکی از تفاوتهای مهم جمنای و جی پی تی است. جمنای ۳.۸ لایو در Live API از متن، صوت، تصویر و ویدیو پشتیبانی میکند. منظور از ویدیو، فریمهای ویدیویی است که بهعنوان تصاویر متوالی به مدل ارسال میشوند.
در مقابل، طبق مشخصات فعلی API، ورودی تصویر و ویدیو برای جی پی تی لایو ۱ پشتیبانی نمیشود.
Gemini 3.8 Flash؛ جزئیات، قیمت و بنچمارک جمنای ۳.۸ فلش
مقایسه استفاده از ابزار در Gemini 3.8 Live و GPT-Live-1
تفاوت دیگر این دو مدل به معماری اجرای ابزارها و وظایف پیچیده مربوط میشود.
Gemini 3.8 Live از فراخوانی ابزارها (Function Calling) و اجرای غیرهمزمان ابزارها پشتیبانی میکند. در نتیجه، برخی عملیات ابزار میتوانند بدون متوقف شدن کامل روند مکالمه انجام شوند.
جی پی تی لایو ۱ نیز از استفاده از ابزارها (Function Calling) پشتیبانی میکند و میتواند کارهای پیچیدهتر را برای پردازش بیشتر به مدل پشتیبان (Backend) یا ابزارهای دیگر بسپارد.
GPT-6 Astra چیست؟ بررسی قابلیتها و کاربردهای جی پی تی ۶

پشتیبانی زبانی Gemini 3.8 Live و GPT-Live-1
طبق توضیحات گوگل، Gemini 3.8 Live از ۹۷ زبان پشتیبانی میکند. برای GPT-Live-1 نیز قابلیت چندزبانه وجود دارد، اما عدد مشخصی در صفحه مشخصات مدل اعلام نشده است.
مقایسه Gemini 3.8 Live و GPT-Live-1 از نظر کاربرد
جمنای ۳.۸ لایو برای زمانی که دستیار صوتی باید علاوه بر صدا، تصویر یا ویدیو را نیز درک کند، کاربرد دارد. این قابلیت برای دستیارهای آموزشی، تحلیل محتوای تصویری و برنامههایی که ورودی ویدیویی دارند، اهمیت دارد.
در مقابل، جیپیتی لایو ۱ تمرکز بیشتری بر تعامل صوتی، مدیریت وقفه، مکالمه Full-Duplex و اتصال به Backend دارد.
| کاربرد | Gemini 3.8 Live | GPT-Live-1 |
| دستیار صوتی | ✅ | ✅ |
| پشتیبانی مشتری | ✅ | ✅ |
| تحلیل تصویر در جریان مکالمه | ✅ | ❌ |
| دریافت ویدیو در Live API | ✅ | ❌ |
| تعامل صوتی Full-Duplex | ✅ | ✅ |
| اتصال به ابزارها | ✅ | ✅ |
مقایسه قیمت Gemini 3.8 Live و GPT-Live-1
روش محاسبه هزینه در جمنای ۳.۸ لایو و جی پی تی لایو ۱ متفاوت است. در Gemini ۳.۸ لایو، هزینه بر اساس توکنهای متن و نرخهای اعلامشده برای ورودی و خروجی صوتی، تصویری و ویدیویی محاسبه میشود.
در GPT-Live-1، هزینه بخش صوتی به مدت زمان مکالمه بستگی دارد. اگر از مدلهای دیگر یا ابزارهای اضافی در کنار جیپیتی لایو ۱ استفاده شود، هزینه آنها جداگانه محاسبه میشود.
قیمت Gemini 3.8 Live در پلن پولی
بر اساس توضیحات گوگل، هزینه استفاده از جمنای ۳.۸ لایو در پلن پولی به شرح زیر است. گوگل برای این مدل یک نسخه رایگان (Free Tier) هم ارائه میکند، اما شرایط و محدودیتهای آن با پلن پولی متفاوت است.
| نوع مصرف | قیمت |
| ورودی متنی | ۰٫۷۵ دلار به ازای هر ۱ میلیون توکن |
| ورودی صوتی | ۰٫۰۰۵ دلار به ازای هر دقیقه |
| ورودی تصویر/ویدیو | ۰٫۰۰۲ دلار به ازای هر دقیقه |
| خروجی متنی | ۴٫۵۰ دلار به ازای هر ۱ میلیون توکن |
| خروجی صوتی | ۰٫۰۱۸ دلار به ازای هر دقیقه |
قیمت GPT-Live-1
طبق توضیحات OpenAI، جی پی تی لایو ۱ برای بخش صوتی ۰٫۰۵ دلار به ازای هر دقیقه هزینه دارد. این هزینه بر اساس ثانیه محاسبه میشود؛ بنابراین استفاده از بخشی از یک دقیقه نیز متناسب با مدت واقعی استفاده هزینه خواهد داشت.
اگر GPT جیپیتی لایو ۱ برای انجام یک کار به مدل پشتیبان (Backend) یا ابزار دیگری نیاز داشته باشد، هزینه استفاده از آنها جداگانه محاسبه میشود.

Gemini 3.8 Live یا GPT-Live-1؛ کدام مدل هزینه بیشتری دارد؟
مقایسه مستقیم قیمت این دو مدل به دلیل تفاوت روش محاسبه ساده نیست. Gemini هزینه را بر اساس توکنها و نوع داده محاسبه میکند و برای ورودی صوتی، تصویر و ویدیو معادل دقیقهای نیز ارائه میدهد؛ در مقابل، GPT-Live-1 برای لایه صوتی مستقیماً بر اساس مدت زمان جلسه هزینه دریافت میکند.
Gemini 3.8 Live در Google AI Studio و API دارای Free Tier است، اما جیپیتی لایو ۱ در API برای Tier رایگان قابل استفاده نیست. در هر دو سرویس، اگر مدل برای انجام وظایف از قابلیتها یا سرویسهای دیگری استفاده کند، ممکن است هزینههای جداگانهای ایجاد شود.
بنچمارکهای Gemini 3.8 Live و GPT-Live-1
بر پایه ارزیابیهای فنی منتشرشده در Artificial Analysis، مقایسه عملکرد این مدلها به شرح زیر ثبت شده است:
توجه: اعداد جدول از ارزیابی Artificial Analysis به دست آمده و نباید آنها را بهعنوان یک رتبهبندی مطلق در نظر گرفت. پیکربندی مدل، backend، نوع بنچمارک و روش ارزیابی میتواند نتیجه را تغییر دهد.
| معیار | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking | GPT-Live-1 (Astra, medium) | GPT-Live-1 (Sol, low) |
| Speech-to-Speech Index | ۷۶٫۰ | ۸۲٫۶ | ۸۱٫۵ | ۸۰٫۱ |
| Speech Reasoning | ۹۲٪ | ۹۸٪ | ۹۰٪ | ۸۹٪ |
| Conversational Dynamics | ۹۶٫۱٪ | ۹۱٫۹٪ | ۹۴٫۹٪ | ۹۷٫۳٪ |
| Agentic Performance | ۳۰٫۱٪ | ۶۸٫۶٪ | ۶۷٫۹٪ | ۵۹٫۳٪ |
| Arena Preference Elo | ۱۰۸۳ | ۹۹۰ | ۱۰۴۸ | ۱۰۵۳ |
| Task Success Rate | ۹۳٫۲٪ | ۸۹٫۱٪ | ۸۷٫۴٪ | ۹۰٫۹٪ |
| Time to First Audio | ۱٫۱۸ ثانیه | ۱٫۳۵ ثانیه | ۱٫۳۴ ثانیه | ۱٫۲۴ ثانیه |
| Cost per Hour of Input Audio | ۰٫۸۴ دلار | ۳٫۵۰ دلار | ۵٫۸۳ دلار | ۴٫۴۷ دلار |
نکته: در معیار Time to First Audio، مقدار کمتر بهتر است؛ در سایر معیارها، امتیاز یا درصد بیشتر نشاندهنده عملکرد بهتر است.
محدودیتهای Gemini 3.8 Live و GPT-Live-1
هر دو مدل در کنار قابلیتهای پیشرفته، محدودیتهایی دارند که هنگام انتخاب مدل باید در نظر گرفته شوند.
محدودیتهای جمنای ۳.۸ لایو
Gemini 3.8 Live با وجود قابلیتهای چند وجهی، برای همه انواع پروژههای هوش مصنوعی ساخته نشده است. مهمترین محدودیتهای این مدل عبارتند از:
- تمرکز اصلی مدل روی تجربههای صوتی بلادرنگ است.
- برای تولید تصویر، باید از مدلها و API های تخصصی مربوط به تولید تصویر استفاده شود.
- جلسات صوتی و ویدیویی Live محدودیت زمانی دارند؛ مستندات فعلی Google سقف ۱۵ دقیقه برای جلسه صوتی و ۲ دقیقه برای جلسه صوتی همراه با ویدیو را ذکر میکنند، هرچند با روشهای مدیریت جلسه میتوان این محدودیت را برای تجربههای طولانیتر مدیریت کرد.
- هزینه ورودی و خروجی صوتی و سایر ورودیهای رسانهای جداگانه محاسبه میشود.
- Gemini 3.8 Live از استدلال در جریان مکالمه پشتیبانی میکند، اما برای سناریوهایی که به استدلال عمیقتر و چندمرحلهای نیاز دارند، Google نسخه Extended Thinking را ارائه کرده است.
محدودیتهای جی پی تی لایو ۱
محدودیت اصلی GPT-Live-1 در مقایسه با Gemini 3.8 Live، نبود ورودی تصویر و ویدیو در مشخصات فعلی مدل است. به طور کلی مهمترین محدودیتهای این مدل عبارتند از:
- ورودی تصویر پشتیبانی نمیشود.
- ورودی ویدیو پشتیبانی نمیشود.
- هزینه مدل Backend و ابزارها جدا از جلسه صوتی است.
- کیفیت و هزینه نهایی، به مدل Backend و ابزارهای انتخابشده نیز وابسته است.
- در پروژههایی که نیاز به ورودی تصویری یا ویدیویی دارند، باید یک مدل یا لایه پردازش چندرسانهای جداگانه در معماری در نظر گرفته شود.

جمعبندی
در این مقاله Gemini 3.8 Live و GPT-Live-1 را از نظر قابلیتهای صوتی، ورودی تصویر و ویدیو، استفاده از ابزارها، قیمت و عملکرد بررسی کردیم. جمنای ۳.۸ لایو از ورودی تصویر و ویدیو در Live API پشتیبانی میکند و نسخه Extended Thinking را نیز در اختیار توسعهدهندگان قرار میدهد، در حالی که جیپیتی لایو ۱ بیشتر بر مکالمه Full-Duplex، مدیریت وقفه و اتصال به Backend و ابزارها تمرکز دارد.
اگر قصد دارید با مدلهای مختلف هوش مصنوعی کار کنید و به ابزارهای متنوع در یک سایت هوش مصنوعی دسترسی داشته باشید، میتوانید از امکانات هوشا استفاده کنید و مدلهایی مانند چت جی پی تی فارسی و جمنای Gemini را در کنار ابزارهای هوش مصنوعی دیگر تجربه کنید.
نویسنده: نگین ناظری
Gemini 3.8 Live چه زمانی عرضه شد؟
Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking در سپتامبر ۲۰۲۶ معرفی شدند و از طریق Gemini Live API در دسترس قرار گرفتند.
GPT-Live-1 چه زمانی در API عرضه شد؟
OpenAI GPT-Live-1 را در ۱۰ سپتامبر ۲۰۲۶ در API عرضه کرد.
آیا GPT-Live-1 از تصویر و ویدیو پشتیبانی میکند؟
خیر، طبق مشخصات فعلی مدل در OpenAI API، ورودی تصویر و ویدیو برای GPT-Live-1 پشتیبانی نمیشود.
آیا جمنای ۳.۸ لایو از ویدیو پشتیبانی میکند؟
بله، Gemini Live API میتواند فریمهای ویدیویی را دریافت کند. این فریمها بهصورت تصاویر متوالی به مدل ارسال میشوند.
GPT-Live-1 چقدر هزینه دارد؟
هزینه مکالمه صوتی در GPT-Live-1 برابر با ۰٫۰۵ دلار به ازای هر دقیقه است و بر اساس ثانیه محاسبه میشود. هزینه مدل Backend و ابزارهای مورد استفاده جداگانه است.
Gemini 3.8 Live چقدر هزینه دارد؟
در پلن پولی، ورودی صوتی ۰٫۰۰۵ دلار در دقیقه و خروجی صوتی ۰٫۰۱۸ دلار در دقیقه قیمت دارد. ورودی متن، تصویر و ویدیو نیز بر اساس نرخ توکنی مربوط به خود محاسبه میشود. گوگل برای این مدل Free Tier نیز اعلام کرده است.
Full-Duplex در هوش مصنوعی چیست؟
Full-Duplex به قابلیتی گفته میشود که سیستم میتواند دریافت صدای کاربر و تولید پاسخ صوتی را همزمان مدیریت کند. در نتیجه کاربر میتواند وسط پاسخ مدل صحبت کند، مکث کند یا مسیر مکالمه را تغییر دهد.
Gemini 3.8 Live Extended Thinking چیست؟
Gemini 3.8 Live Extended Thinking یک مدل جداگانه در خانواده Gemini Live است که برای سناریوهای نیازمند استدلال بیشتر ارائه شده است. این مدل از سطحهای مختلف thinking پشتیبانی میکند، در حالی که مدل پایه Gemini 3.8 Live از پارامتر thinkingLevel پشتیبانی نمیکند.
Gemini 3.8 Live بهتر است یا GPT-Live-1؟
انتخاب بین Gemini 3.8 Live و GPT-Live-1 به نیاز پروژه بستگی دارد. Gemini 3.8 Live از ورودی تصویر و ویدیو در Live API پشتیبانی میکند، در حالی که GPT-Live-1 روی مکالمه صوتی Full-Duplex و واگذاری وظایف به Backend و ابزارها تمرکز دارد.
AI TypeSafe چیست؟ معرفی کامل شرکت سازنده Jev و رویکرد تازه آن به هوش مصنوعی
Jev AI چیست؟ معرفی کامل قابلیتها، قیمت و بنچمارکها
۱۱ پرامپت تیمارستان با هوش مصنوعی؛ ساخت تصاویر تیمارستانی واقعی
مقایسه Gemini 3.8 Live و GPT-Live-1؛ تفاوت قابلیتها، قیمت و عملکرد
۱۰ پرامپت عکس پرسنلی هوش مصنوعی با استاندارد ۳×۴ (آماده کپی)