Gemini 3.8 Live چیست؟ معرفی کامل کاربردها + بنچمارک‌های مدل صوتی گوگل

آخرین به‌روزرسانی: 25 شهریور 1405, 6:08 ب.ظ
هوشا 25 شهریور 1405 تکنولوژی و هوش مصنوعی ۱۴ دقیقه زمان مطالعه 0 دیدگاه ( ۰ امتیاز )

گوگل با عرضه دو مدل Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking، قابلیت‌های صوتی بلادرنگ خود را برای ساخت تجربه‌های مکالمه‌ای پیشرفته‌تر توسعه داده است. این دو مدل تنها پنج روز پس از عرضه GPT-Live-1 توسط OpenAI معرفی شدند و نشان می‌دهند که مدل‌های صوتی بلادرنگ به یکی از محورهای مهم توسعه هوش مصنوعی تبدیل شده‌اند. 

در این مقاله، مهم‌ترین قابلیت‌ها و مشخصات فنی جمنای لایو را بررسی می‌کنیم و عملکرد آن را در بخش‌های مختلف با GPT-Live-1 مقایسه خواهیم کرد:

  • معماری و عملکرد صوتی: بررسی قابلیت Speech-to-Speech و نحوه پردازش مکالمه صوتی بلادرنگ
  • استدلال صوتی: بررسی نحوه مدیریت مکث‌ها، پاسخ‌گویی هم‌زمان و ارائه روند استدلال در مکالمه
  • بنچمارک‌ها و نتایج رسمی: بررسی نتایج منتشر شده برای Gemini 3.8 Live در معیارهای مختلف ارزیابی صوتی
  • مقایسه با GPT-Live-1: بررسی تفاوت دو مدل از نظر تأخیر، کیفیت مکالمه و اجرای وظایف عامل‌های هوشمند
  • قیمت‌گذاری و بهینه‌سازی API: بررسی تعرفه‌ها، Context Caching و راهکارهای کاهش هزینه استفاده از API
  • دسترسی به گفت‌وگوی صوتی Gemini: بررسی روش استفاده از قابلیت مکالمه صوتی جمنای

مدل صوتی جمنای ۳.۸ لایو (Gemini 3.8 Live) چیست؟

معرفی و بررسی فنی مدل‌های صوتی بلادرنگ Gemini 3.8 Live و Extended Thinking گوگل

Gemini 3.8 Live جدیدترین مدل صوتی گوگل است که بر پایه معماری بومی چندوجهی (Native Multimodal) توسعه یافته و برای مکالمه بلادرنگ طراحی شده است. این مدل برخلاف سامانه‌های سنتی که گفتار را ابتدا به متن و سپس دوباره به صدا تبدیل می‌کنند، می‌تواند ورودی صوتی را به‌صورت مستقیم پردازش کرده و پاسخ‌هایی با لحن، مکث و الگوهای گفتاری طبیعی تولید کند.

گوگل هم‌زمان با این مدل، نسخه Gemini 3.8 Live Extended Thinking را هم معرفی کرده است. این نسخه برای انجام وظایف پیچیده‌تر مانند حل مسائل ریاضی، کدنویسی و تحلیل داده بهینه شده و در حین پردازش، بازخوردهای صوتی میان‌مرحله‌ای ارائه می‌دهد تا جریان مکالمه حفظ شود و کاربر در زمان انتظار با سکوت طولانی مواجه نشود.

پارامترهای فنی و ورودی‌های API در Gemini 3.8 Live

طبق داده‌های ثبت‌شده در منبع رسمی گوگل، مشخصات فنی این مدل به شرح زیر است:

مشخصهجزئیات فنی
شناسه مدل (Model Code)gemini-3.8-live
فرمت‌های ورودی (Inputs)متن، تصویر، صدا، ویدیو (Text, Images, Audio, Video)
فرمت‌های خروجی (Outputs)متن و صدا (Text, Audio)
سقف توکن ورودی (Input Limit)۱۳۱٫۰۷۲ توکن
سقف توکن خروجی (Output Limit)۶۵٫۵۳۶ توکن
آخرین به‌روزرسانیسپتامبر ۲۰۲۶ (شهریور ۱۴۰۵)

تفاوت‌های کلیدی جمنای لایو 3.8 با نسخه Extended Thinking

طبق مستندات رسمی توسعه‌دهندگان گوگل که در ۱۵ سپتامبر ۲۰۲۶ (۲۴ شهریور ۱۴۰۵ ) به‌روزرسانی شده‌اند، Gemini 3.8 Live در دو نسخه ارائه شده است. نسخه اصلی برای مکالمه صوتی سریع و طبیعی طراحی شده و Gemini 3.8 Live Extended Thinking برای انجام وظایف پیچیده‌تر و نیازمند استدلال مناسب است. تفاوت‌های اصلی این دو مدل را می‌توانید در جدول زیر ببینید:

ویژگیGemini 3.8 LiveGemini 3.8 Live Extended Thinking
هدف اصلیمکالمات روزمره، سریع، طبیعی و مقرون‌به‌صرفهحل مسائل پیچیده، استدلال چندمرحله‌ای و پردازش سنگین
قابلیت ویژهدرک سریع ورودی‌های تصویری و تعویض خودکار زباناستدلال صوتی (Vocalized Reasoning) و گزارش مرحله‌به‌مرحلۀ فکر کردن
امتیاز Artificial Analysisحضور در رتبه‌های بالای ارزیابی کیفیت گفتارامتیاز ۸۲٫۶ (رتبه اول شاخص گفتار به گفتار)
پشتیبانی زبانی۹۷ زبان (با تشخیص خودکار)۹۷ زبان (با قابلیت استدلال هم‌زمان)

قابلیت‌های کلیدی؛ چرا Gemini 3.8 Live تجربه مکالمه صوتی را متحول می‌کند؟

تا پیش از این، مکالمه صوتی با جمنای یا سایر مدل‌های صوتی چالش بزرگ قطعی کلام داشت؛ یعنی به محض اینکه مدل می‌خواست ابزاری را فراخوانی کند یا کدی اجرا کند، ارتباط صوتی قطع یا دچار مکث‌های طولانی می‌شد. گوگل در سری ۳.۸ این مشکل را به‌طور کامل برطرف کرده است.

اصلی‌ترین قابلیت‌های تکنولوژی جدید جمنای لایو عبارتند از:

  1. اجرای ابزارها بدون وقفه‌ در صحبت: مدل‌ها می‌توانند هنگام صحبت با کاربر، در پس‌زمینه کدهای API را اجرا کنند یا به ابزارهای جانبی متصل شوند، بدون آنکه رشته کلام یا جریان تعامل قطع شود.
  2. درک بصری هم‌زمان (Visual Grounding): در جریان گفت‌وگوی صوتی با جمنای، مدل می‌تواند ورودی دوربین یا تصویر را تقریباً به‌صورت بلادرنگ ببیند و درباره آن صحبت کند (مثلاً تحلیل طرح روی تخته‌سیاه و کدنویسی هم‌زمان بر اساس آن).
  3. پشتیبانی هوشمند از ۹۷ زبان: سیستم جدید تعویض خودکار زبان در میانه‌ی مکالمه، نیاز به تغییر تنظیمات دستی را کاملاً از بین برده است.

همچنین در نسخه Extended Thinking، فرایند «فکر کردن» با جملات طبیعی و لحنی انسانی به کاربر گزارش داده می‌شود تا حس معطلی یا تاخیر در مکالمه ایجاد نشود.

بنر رسمی گوگل برای معرفی مدل‌های Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking
کاور رسمی گوگل به مناسبت انتشار مدل‌های هوش مصنوعی صوتی Gemini 3.8 Live و نسخه Extended Thinking

بررسی عملکرد و بنچمارک‌ها؛ Gemini 3.8 در برابر GPT-Live-1

Gemini 3.8 Live و GPT-Live-1 هر دو برای مکالمه صوتی بلادرنگ توسعه یافته‌اند، اما در معماری و قابلیت‌های خود تفاوت‌هایی دارند. طبق داده‌های ثبت‌شده در گزارش کیفیت گفتار موسسه Artificial Analysis, عملکرد این مدل‌ها بر اساس شاخص‌های تاخیر (Latency) و طبیعی بودن صدا ارزیابی می‌شود

در کنار این زیرساخت‌ها، چت جی پی تی فارسی هم یکی از گزینه‌های در دسترس برای کاربران است تا بتوانند مدل‌های هوش مصنوعی متنی و تحلیلی را در یک محیط فارسی‌سازی شده تجربه کنند.

مقایسه جامع فنی مدل های صوتی Gemini 3.8 Live و GPT-Live-1

جدول زیر جزییات عملکردی و فنی این مدل‌ها را در کنار یکدیگر مقایسه می‌کند:

شاخص / ویژگیGemini 3.8 LiveGemini 3.8 Live Extended ThinkingOpenAI GPT-Live-1
توسعه‌دهندهGoogleGoogleOpenAI
تاریخ عرضه۱۵ سپتامبر ۲۰۲۶۱۵ سپتامبر ۲۰۲۶۱۰ سپتامبر ۲۰۲۶
معماری اصلیMultimodal Audio NativeMultimodal Audio Native + Vocalized ReasoningAdvanced Voice Mode Generation
کیفیت گفتار (Artificial Analysis)۷۹٫۲۸۲٫۶ (رتبه یک جهان)۸۰٫۴ (رتبه ۲)
میانگین تاخیر (Latency)حدود ۲۴۰ میلی‌ثانیهحدود ۳۸۰ میلی‌ثانیه (شامل زمان استدلال)حدود ۲۸۰ میلی‌ثانیه
استدلال صوتی (Vocalized Reasoning)✅ (گزارش مرحله‌به‌مرحله فکر)❌ (توقف در استدلال سنگین)
پشتیبانی زبانی۹۷ زبان (سوئیچ خودکار)۹۷ زبان (سوئیچ خودکار)۵۰ زبان
قیمت ورودی صوتی (۱M توکن)۳ دلار۶ تا ۱۰ دلار۱۰ دلار
قیمت خروجی صوتی (۱M توکن)۱۲ دلار۲۴ تا ۳۰ دلار۳۰ دلار
قابلیت Tool Calling بدون قطعی✅ پشتیبانی کامل✅ پشتیبانی کامل❌ نیاز به مکث کوتاه در اجرا

برای آشنایی کامل با زیرساخت، نحوه عملکرد و بنچمارک‌های مدل صوتی اوپن‌ای‌آی GPT-Live-1، راهنمای جامع زیر را مطالعه کنید. 

جی پی تی لایو GPT-Live-1 مدل صوتی جدید OpenAI

تحلیل شاخص‌های عملکرد گفت‌ و گوی صوتی با جمنای ۳.۸ لایو

داده‌های منتشرشده در مستندات و منابع رسمی توسعه‌دهندگان گوگل، عملکرد Gemini 3.8 Live Extended Thinking را در چند معیار مختلف نشان می‌دهد. این ارزیابی‌ها، کیفیت گفتار، درک صوتی و توانایی مدل در اجرای وظایف پیچیده را بررسی می‌کنند:

  • کیفیت گفتار (Artificial Analysis): بر اساس گزارش Artificial Analysis، این مدل امتیاز ۸۲٫۶ را در شاخص Speech-to-Speech به دست آورده است.
  • اجرای وظایف عامل‌محور (τ-Voice): مدل در ارزیابی τ-Voice امتیاز ۶۸٫۶٪ و در τ-Voice-banking امتیاز ۳۵٫۱٪ کسب کرده است. این معیارها عملکرد مدل را در اجرای وظایف چندمرحله‌ای و تعامل با ابزارها و APIها ارزیابی می‌کنند.
  • درک صوتی Big Bench Audio : Gemini 3.8 Live Extended Thinking در این بنچمارک امتیاز ۹۷٫۷٪ را ثبت کرده است که عملکرد آن را در درک و استدلال روی ورودی‌های صوتی نشان می‌دهد.
نمودار مقایسه بنچمارک Speech to Speech مدل Gemini 3.8 Live Extended Thinking و GPT-Live-1 در مرجع Artificial Analysis
رتبه‌بندی مدل‌های صوتی بلادرنگ در شاخص Speech to Speech مرجع Artificial Analysis؛ Gemini 3.8 Live Extended Thinking با امتیاز ۸۲٫۶٪ در صدر جدول قرار دارد.

حل چالش تاخیر با گزارش صوتی استدلال (Vocalized Reasoning)

مدل‌های هوش مصنوعی برای انجام استدلال چندمرحله‌ای و پردازش‌های سنگین ممکن است به زمان بیشتری نیاز داشته باشند؛ مسئله‌ای که در مکالمه صوتی بلادرنگ می‌تواند به ایجاد سکوت‌های طولانی منجر شود.

گوگل برای مدیریت این وقفه از مکانیزم Live Progress Narration استفاده کرده است. 

در این روش، هنگام پردازش یک درخواست پیچیده، مدل با جملات کوتاه و طبیعی مانند «اجازه بده این موضوع را بررسی کنم…» به کاربر بازخورد صوتی می‌دهد. 

به این ترتیب، مکالمه در زمان پردازش ادامه پیدا می‌کند و کاربر از وضعیت پاسخ‌گویی مدل مطلع می‌ماند.

کاربردهای مکالمه صوتی با جمنای در دنیای واقعی

پیاده‌سازی قابلیت‌های مدل‌های صوتی جدید گوگل، امکان ساخت محصولات هوشمندتری را فراهم کرده است. مهم‌ترین سناریوهای کاربری این فناوری عبارتند از:

۱. دستیاری و اشکال‌زدایی صوتی کدنویسی

توسعه‌دهندگان می‌توانند بدون دست زدن به کیبورد، منطق برنامه‌نویسی را زنده تشریح کنند تا مدل با استدلال هم‌زمان، خطاهای کد را به‌صورت صوتی گوشزد کند.

۲. مراکز تماس و پشتیبانی پیشرفته تلفنی

به لطف تاخیر زیر نیم ثانیه و پشتیبانی از ۹۷ زبان، سامانه‌های IVR می‌توانند مکالمات پیچیده مشتریان را با لحنی کاملاً طبیعی و بدون قطع ارتباط مدیریت کنند.

۳. آموزش تعاملی و حل گام‌به‌گام مسائل

در برنامه‌های آموزشی، مدل با بازگو کردن مراحل تفکر (Vocalized Reasoning)، دانش‌آموز را مرحله‌به‌مرحله در حل مسائل ریاضی و تحلیل داده راهنمایی می‌کند.

۴. دستیارهای همراه هوشمند با درک بصری

ترکیب جریان صوتی با ورودی دوربین (Visual Grounding) به کاربران اجازه می‌دهد در لحظه درباره آن‌چه می‌بینند (مانند سند اداری یا قطعه صنعتی) مشورت صوتی دریافت کنند.

بررسی سناریوهای عملیاتی نشان می‌دهد که رقابت در عرصه سیستم‌های صوتی بلادرنگ وارد مرحله تازه‌ای شده است؛ برتری در این میدان بیش از هر چیز به پایداری ارتباط، مدیریت تاخیر و حفظ جریان طبیعی گفتار بستگی دارد.  کاربران و کسب‌وکارهایی که قصد بهره‌گیری از این امکانات پردازشی را دارند، می‌توانند از طریق سرویس‌های هوش مصنوعی آنلاین به فناوری‌های صوتی و متنی دسترسی داشته باشند. 

طرح مفهومی بهینه‌سازی و کاهش هزینه API هوش مصنوعی صوتی Gemini 3.8
دریافت مشاوره صوتی با قابلیت درک بصری

راهکارهای بهینه‌سازی و کاهش هزینه API در جمنای لایو

استفاده از مدل‌های گفتار به گفتار (S2S) به دلیل حجم بالای داده‌های صوتی می‌تواند هزینه‌های زیرساختی را افزایش دهد. برای بهره‌برداری حداکثری از توان پردازشی Gemini 3.8 Series و مدیریت بهینه منابع، رعایت چند نکته فنی الزامی است:

مدیریت هوشمند سکوت با VAD (Voice Activity Detection):

ارسال پیوسته جریان صوتی (Stream) به API، حتی زمانی که کاربر سکوت کرده، مصرف توکن را به شدت بالا می‌برد. با پیاده‌سازی سیستم‌های لایه کلاینت برای تشخیص فعالیت صوتی (VAD)، تنها زمانی داده‌ها را به Gemini API بفرستید که صوت کاربر فعال است.

استفاده از سیستم Context Caching

اگر در برنامه کاربردی خود از پرامپت‌های سیستمی طولانی، داده‌های زمینه (Context) یا فایل‌های راهنمای صوتی مشترک استفاده می‌کنید، با قابلیت کش کردن زمینه (Context Caching)، توکن‌های تکراری را ذخیره کنید تا هزینه ورودی تا بیش از ۵۰٪ کاهش یابد.

انتخاب هوشمندانه بین دو مدل پایه و استدلالی

تمامی بخش‌های اپلیکیشن شما نیازی به استدلال سنگین ندارند. برای سناریوهای ساده (مثل دریافت دستورات صوتی کوتاه یا پاسخ‌های احوالپرسی) از مدل Gemini 3.8 Live استفاده کنید و فراخوان‌های پیچیده (مانند تحلیل محاسباتی یا استخراج داده از چند منبع) را به Gemini 3.8 Live Extended Thinking هدایت کنید.

دسترسی به Gemini 3.8 Live؛ راهنمای توسعه‌دهندگان و کاربران

دسترسی به امکانات صوتی بلادرنگ سری جدید Gemini 3.8 به دو روش مستقیم و واسط امکان‌پذیر است:

توسعه‌دهندگان و کسب‌وکارها (API مستقیم)

توسعه‌دهندگان می‌توانند از طریق Google AI Studio و Vertex AI کلیدهای API را دریافت کنند. این مدل‌ها ذیل پروتکل WebSocket و معماری Gemini Multimodal Live API ارائه شده‌اند تا جریان صوتی (Audio Streaming) را با کمترین تاخیر ممکن منتقل کنند. همچنین فریم‌ورک‌های LiveKit، LangChain و Pipecat کتابخانه‌های یکپارچه‌سازی اختصاصی این مدل را عرضه کرده‌اند.

ارسال پیام صوتی و دسترسی کاربران ایرانی در هوشا

از آنجا که دسترسی مستقیم به ‌APIهای گوگل برای کاربران داخل ایران به دلیل تحریم‌ها و چالش‌های پرداخت ارزی پیچیده است، استفاده از یک هوش مصنوعی همه کاره راه‌حلی پایدار محسوب می‌شود. از این طریق کاربران می‌توانند بدون نیاز به تایپ دستی، درخواست‌های اداری، ترجمه و برنامه‌نویسی خود را به‌صورت صوتی ارسال کنند.

نکته فنی: امکان تعاملی ارسال پیام صوتی در هوشا یک رابط کاربری تسهیل‌شده برای پرسش‌وپاسخ روزمره است و نباید آن را با جریان ارتباطی تمام‌دوطرفه، بلادرنگ و بدون تاخیر ‌APIهای سری Gemini 3.8 Live اشتباه گرفت.

دکمه چت صوتی و قابلیت‌های ابزار هوش مصنوعی در محیط فارسی هوشا
رابط کاربری هوشا؛ دسترسی سریع به قابلیت‌های صوتی. کاربران می‌توانند با کلیک بر روی آیکون میکروفون، تجربه مکالمه صوتی را داشته باشند.

جمع‌بندی؛ Gemini 3.8 Live چه تغییری در مکالمات صوتی ایجاد می‌کند؟

عرضه Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking، قابلیت‌های مکالمه صوتی بلادرنگ گوگل را وارد مرحله تازه‌ای کرده است. این مدل‌ها با تمرکز بر پردازش صوتی بلادرنگ، استدلال و اجرای وظایف چندمرحله‌ای، گزینه‌های متفاوتی را برای توسعه تجربه‌های صوتی مبتنی بر هوش مصنوعی در اختیار توسعه‌دهندگان قرار می‌دهند.

انتخاب میان دو نسخه به نیاز پروژه بستگی دارد:

  • سرعت و هزینه: Gemini 3.8 Live برای کاربردهایی که پاسخ سریع و تعامل صوتی روان اهمیت دارد، گزینه مناسب‌تری است.
  • وظایف پیچیده و نیازمند استدلال: Gemini 3.8 Live Extended Thinking برای سناریوهایی طراحی شده است که به پردازش و استدلال بیشتر نیاز دارند و می‌تواند بازخورد صوتی میان‌مرحله‌ای ارائه دهد.

در نهایت، انتخاب مدل باید بر اساس عواملی مانند نوع کاربرد، میزان پیچیدگی وظایف، تأخیر قابل‌قبول، هزینه API و نیاز به ابزارهایی مانند Function Calling انجام شود. مقایسه این معیارها با نیازهای واقعی پروژه، تصویر دقیق‌تری از مدل مناسب برای هر کاربرد ارائه می‌دهد.

نویسنده: حمیده نیکویان

سوالات متداول این بخش
نظرات کاربران

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مقالات مشابه
5 هوش مصنوعی برای تولید و طراحی انیمیشن بدون تیم و هزینه زیاد
آیا می‌خواهید بدون نیاز به تیم بزرگ یا هزینه زیاد، انیمیشن حرفه‌ای بسازید؟…
تیم AI هوشا ( ۵ امتیاز )
آیا هوش مصنوعی می‌تواند امنیت و حریم خصوصی ما را تهدید کند؟
خطرات و تهدیدات هوش مصنوعی روزبه‌روز بیشتر مورد توجه متخصصان و عموم مردم قر…
تیم AI هوشا ( ۳ امتیاز )
بهترین ابزارهای هوش مصنوعی برای نوشتن داستان از GPT-4 تا ShortlyAI
اگر دوست دارید راحت‌تر و خلاقانه‌تر داستان بنویسید، خبر خوب اینکه این روزها…
تیم AI هوشا ( ۲.۷ امتیاز )