ساخت آواتار با هوش مصنوعی؛ معرفی، مقایسه و آموزش بهترین مدل‌ها

آخرین به‌روزرسانی: 08 شهریور 1405, 5:25 ب.ظ
زهرا کاظمی 08 شهریور 1405 تکنولوژی و هوش مصنوعی ۲۶ دقیقه زمان مطالعه 0 دیدگاه ( ۰ امتیاز )

اگر می‌خواهید یک کاراکتر ثابت را در ویدیوهای مختلف استفاده کنید، صرفاً ساخت یک عکس آواتار کافی نیست. در این آموزش، ساخت آواتار با هوش مصنوعی را در هوشا از مرحله طراحی یک کاراکتر اختصاصی شروع می‌کنیم، ویژگی‌های ظاهری آن را با Character Sheet تثبیت می‌کنیم و در ادامه همان شخصیت را به یک ویدیوی سخنگو تبدیل می‌کنیم. سپس با استفاده از یک سناریوی یکسان، خروجی سه مدل Grok، Veo و Gemini Omni را با هم مقایسه می‌کنیم تا عملکرد آن‌ها را از نظر حفظ چهره، طبیعی بودن حرکات و اجرای زبان فارسی بسنجیم. شما نیز می‌توانید تمامی این مراحل را در هوشا اجرا کنید. 

آواتار با هوش مصنوعی چیست و آواتار سخنگو چه فرقی با تصویر آواتار دارد؟

تصویر آواتارهای ساخته شده با هوش مصنوعی

آواتار تصویری فقط یک عکس است که می‌تواند برای پروفایل شبکه‌های اجتماعی، لوگوی شخصی یا کاراکتر بازی استفاده شود، اما حرکتی ندارد. آواتار سخنگو یک قدم جلوتر می‌رود؛ همان کاراکتر به یک خروجی ویدیویی تبدیل می‌شود که صدا/دیالوگ دارد، لب‌هایش با کلمات هماهنگ حرکت می‌کند و معمولا حرکات سر و بدن هم به آن اضافه می‌شود.

برای ساخت آواتار سخنگو با هوش مصنوعی به‌طور معمول باید دو مرحله را طی کنید: 

  1. ابتدا یک تصویر مرجع ثابت از کاراکتر مورد نظرتان بسازید.
  2.  سپس آن تصویر را به ویدیو متحرک و دارای دیالوگ، تبدیل کنید.

قبل از ساخت آواتار: کاراکتر شیت چیست و چرا ثبات کاراکتر مهم است؟

شیت کاراکتر مجموعه‌ای از تصاویر مرجع است که شخصیت را از زوایای مختلف، مانند نمای روبه‌رو، نیم‌رخ و سه‌رخ، و همچنین با حالت‌های مختلف چهره نشان می‌دهد. در صورت نیاز می‌توان جزئیات دیگری مانند لباس، مدل مو، رنگ‌ها و ویژگی‌های ظاهری شاخص کاراکتر را نیز در آن مشخص کرد.

هدف اصلی از ساخت شیت کاراکتر با هوش مصنوعی، ایجاد یک مرجع بصری یکپارچه برای تولید تصاویر و ویدیوهای بعدی است. استفاده از این مرجع می‌تواند به مدل‌های هوش مصنوعی کمک کند ویژگی‌هایی مانند فرم چهره، مدل مو، لباس و استایل کلی کاراکتر را در خروجی‌های مختلف، تا حد زیادی ثابت نگه دارند و احتمال تغییرات ناخواسته بین فریم‌ها یا صحنه‌ها کاهش پیدا کند.

آموزش ساخت آواتار با هوش مصنوعی در هوشا؛ مرحله‌به‌مرحله

در ادامه به‌صورت گام‌به‌گام، نحوه ساخت ویدیو آواتار با هوش مصنوعی را از طریق پلتفرم هوشا و به زبان کاملا فارسی، به شما آموزش می‌دهیم.

فاز اول: خلق هویت بصری و کاراکتر شیت پایه

در اولین قدم از ساخت آواتار سخنگو با هوش مصنوعی شما باید کاراکتر مورد نظر خود را بسازید که در ادامه به شما می‌گوییم که چگونه با نوشتن پرامپت می‌توانید یک کاراکتر (در این مثال، یک بلاگر هوش مصنوعی) بسازید.

۱. تعریف ایده در دستیار متنی کلود

 پس از ورود به پلتفرم هوش مصنوعی هوشا، مدل زبانی Claude Opus 5.0 را انتخاب کنید. سپس از هوش مصنوعی بخواهید تا شما را برای ساخت یک کاراکتر شیت دقیق جهت طراحی یک بلاگر هوش مصنوعی (یا هر شخصیت دیگری که مد نظرتان است)، راهنمایی کند.

محیط چت با مدل هوش مصنوعی کلود اپوس در پلتفرم هوشا برای دریافت پرامپت ساخت کاراکتر بلاگر
برای دریافت پرامپت مناسب ساخت آواتار، ایده خود را برای هوش مصنوعی کلود شرح دهید.

۲. تدوین پرامپت ساخت کاراکتر به‌صورت یکپارچه

حال از هوش مصنوعی کلود درخواست کنید ویژگی‌های ظاهری مدنظرتان را به پرامپت‌های اجرایی تبدیل کرده و در نهایت، تمام این جزئیات را در یک «پرامپت کاراکتر شیت پایه و جامع» ترکیب کند تا هویت آواتار شما یکپارچه شود.

پرامپت نهایی برای ساخت کاراکتر

اگر شماهم می‌خواهید طبق این آموزش پیش بروید، می‌توانید از پرامپت زیر استفاده کنید تا خروجی نهایی مشابه خروجی‌های گرفته شده در این آموزش شود.

یک زن ایرانی ۲۴ ساله، بلاگر لایف‌استایل و تکنولوژی.
قومیت و پوست: ایرانی، پوست گندمی صاف و یکدست با درخشش طبیعی.
مو: موهای مشکی، بلند تا زیر سینه، صاف و براق، فرق وسط یا کج ملایم.
چشم: چشمان قهوه‌ای تیره و درشت، مژه‌های پرپشت، نگاه گرم و دوستانه.
ابرو: ابروهای پرپشت و طبیعی، فرم قوسی متناسب با صورت.
فرم صورت: صورت بیضی، استخوان گونه ملایم، بینی متناسب و کوچک، لب‌های متوسط با رژ لب صورتی کم‌رنگ یا نود.
آرایش: آرایش ملایم و روزمره، طبیعی و شیک.
قد و اندام: قد متوسط (حدود ۱۶۵ سانتی‌متر)، اندام متناسب و ورزیده.
ویژگی خاص: یک خال کوچک زیر گوشه چپ لب (نشانه ثابت برای تشخیص کاراکتر).
استایل لباس: کژوال شیک و مدرن (تی‌شرت ساده، جین، یا مانتوی اسپرت بسته به موقعیت)، همیشه شیک و مرتب.
پرسونا و حالت چهره: بشاش، پرانرژی، اعتمادبه‌نفس بالا، لبخند ملایم و طبیعی، نگاه مستقیم و صمیمی به دوربین.
کیفیت تصویر: عکاسی حرفه‌ای، فوق‌واقع‌گرایانه، نورپردازی نرم و طبیعی، جزئیات دقیق پوست و مو، کیفیت سینمایی ۸K.
اسکرین شات از نمونه متن پرامپت ترکیبی و جامع برای ساخت کاراکتر شیت پایه با جزئیات ظاهری دقیق
تدوین و یکپارچه‌سازی ویژگی‌های ظاهری، مدل مو و استایل کاراکتر در قالب یک پرامپت واحد

۳. دریافت تصویر مرجع

حال نوبت به ساخت عکس با هوش مصنوعی است. برای اینکه تصویر کاراکتر مورد نظرتان را بسازید، به سرویس ساخت تصویر هوشا بروید. در این صفحه ابتدا مدل هوش مصنوعی تصویرساز NanoBanana (یا مدل‌های دیگر نظیر سیدریم و چت‌جی‌پی‌تی) را انتخاب و در کادر متن، پرامپت جامعی که در مرحله قبل از کلود دریافت کردید را کپی کنید.

برای دریافت خروجی استاندارد و باکیفیت، رزولوشن را روی 4K و ابعاد تصویر را روی ۱۶:۹ (افقی) تنظیم کرده و دکمه تولید را بزنید تا پرامپت شما پردازش و تصویرتان ساخته شود.

اسکرین شات از پنل تولید تصویر هوش مصنوعی با تنظیمات رزولوشن 4K و نسبت تصویر ۱۶ به ۹ افقی
خلق اولین تصویر مرجع و پایه آواتار با استفاده از مدل تصویرساز NanoBanana در پلتفرم هوشا

فاز دوم: تثبیت زوایا و حفظ یکپارچگی کاراکتر

حال که تصویر پایه کاراکتر شما ساخته شده است؛ باید کاراکتر شیت آن را از زوایای مختلف بسازید که در ادامه آموزش می‌دهیم.

۴. توسعه زوایای دید

 برای اینکه چهره بلاگر در ویدیوها و سکانس‌های مختلف ثابت بماند، مجددا به بخش کلود بازگردید و پرامپت‌هایی برای نمایش کاراکتر از تمام زوایا (روبه‌رو، نیم‌رخ، تمام‌قد و…) درخواست کنید. سپس از هوش مصنوعی بخواهید این موارد را در یک پرامپت پایه جدید ترکیب کند تا بتوانید به‌صورت یک‌جا آن را کپی کنید.

پرامپت نهایی ساخت کاراکتر شیت از چند زاویه

از پرامپت زیر برای ساخت کاراکتر شیت در زاویه‌های مختلف، استفاده کنید.

یک شیت مرجع کاراکتر (character turnaround sheet) با پس‌زمینه ساده خاکستری روشن و یکدست، نمایش‌دهنده یک زن ایرانی ۲۴ ساله، بلاگر لایف‌استایل و تکنولوژی، در چند نمای مختلف در کنار هم به‌صورت شبکه‌ای مرتب:
مشخصات ثابت کاراکتر: پوست گندمی صاف و یکدست، موهای مشکی بلند تا زیر سینه صاف و براق، چشمان قهوه‌ای تیره و درشت با مژه‌های پرپشت، ابروهای پرپشت طبیعی قوسی، صورت بیضی با بینی متناسب کوچک و لب‌های متوسط با رژ لب صورتی کم‌رنگ، یک خال کوچک زیر گوشه چپ لب، آرایش ملایم روزمره، قد متوسط حدود ۱۶۵ سانتی‌متر و اندام متناسب، استایل کژوال شیک با تی‌شرت ساده و شلوار جین، حالت بشاش و اعتمادبه‌نفس بالا.
نماهای موردنیاز در شیت:
۱. پرتره نمای کاملاً روبه‌رو
۲. پرتره نیم‌رخ چپ ۴۵ درجه
۳. پرتره نیم‌رخ راست ۴۵ درجه
۴. پرتره کاملاً جانبی (پروفایل ۹۰ درجه)
۵. پرتره از پشت با چرخش صورت روی شانه
۶. عکس تمام‌قد از نمای روبه‌رو
۷. عکس تمام‌قد از نمای پشت
۸. عکس تمام‌قد از نمای جانبی
تمام نماها باید دقیقاً همان چهره، رنگ مو، رنگ چشم، خال، اندام و لباس یکسان را نشان دهند تا هویت کاراکتر در تمام زوایا کاملاً ثابت و یکسان باشد. سبک عکاسی حرفه‌ای، فوق‌واقع‌گرایانه، نورپردازی نرم و یکنواخت استودیویی، جزئیات دقیق پوست و مو، کیفیت رفرنس شیت مدل، کیفیت ۸K.
اسکرین‌شات از صفحه گفت‌وگو با کلود برای استخراج زوایای مختلف روبه‌رو، نیم‌رخ و تمام‌قد کاراکتر
دریافت دستورات متنی تخصصی از کلود جهت نمایش کاراکتر از زوایای گوناگون برای حفظ ثبات چهره

۵. خلق کاراکتر شیت چندزاویه‌ای

دوباره وارد ابزار ساخت تصویر هوشا شوید. این بار، تصویری را که در مرحله اول ساخته‌اید به‌عنوان تصویر مرجع آپلود کنید و سپس پرامپت مربوط به طراحی Character Sheet از زوایای مختلف را در کادر متن وارد کنید. در ادامه، همان تنظیمات قبلی Nano Banana، یعنی کیفیت 4K و نسبت تصویر ۱۶:۹ را حفظ کنید و تصویر چندزاویه‌ای کاراکتر را تولید کنید. 

اسکرین‌شات از تصویر خروجی شامل زوایای مختلف چهره و استایل کاراکتر بلاگر هوش مصنوعی
آپلود تصویر مرجع قبلی و تولید کاراکتر شیت چندزاویه‌ای برای تثبیت هویت بصری آواتار

فاز سوم: فضاسازی استودیویی و تولید محتوای ولاگ

تا به اینجای آموزش ساخت آواتار سخنگو با هوش مصنوعی شما موفق به ساخت کاراکتر شیت خود از زوایای مختلف شده‌اید. وقت آن است که فضای مورد نظرتان برای قرارگیری کاراکتر را مشخص کنید.

۶. طراحی لوکیشن‌ها

ابتدا هر دو تصویر تولیدشده در مراحل قبل (عکس کاراکتر پایه و عکس کاراکتر شیت ساخته شده از زوایای مختلف) را در چت کلود آپلود کنید. سپس از کلود بخواهید بخواهید پرامپت‌هایی اختصاصی برای قرار دادن این کاراکتر در موقعیت‌های مختلف یک ولاگ (مانند اتاق خواب، استودیو گیمینگ، آشپزخانه یا استودیو گریم) بنویسد.

پرامپت قرار دادن کاراکتر در موقعیت مورد نظر

زن ایرانی در تصویر رفرنس، ۲۴ ساله، موهای مشکی بلند صاف و براق با فرق وسط، چشمان قهوه‌ای درشت، پوست گندمی صاف، آرایش ملایم طبیعی با رژ لب صورتی، پوشیدن تی‌شرت اورسایز بنفش روشن، حفظ کامل شباهت چهره با تصویر رفرنس
نشسته روبه‌روی آینه گرد با لامپ‌های دایره‌ای دور آن (رینگ‌لایت میرور)، لوازم آرایش روی میز چیده‌شده، در حال نگاه به دوربین با لبخند، نورپردازی حرفه‌ای بیوتی-ولاگ، حس محتوای معرفی محصولات آرایشی، کیفیت سینمایی
اسکرین‌شات از محیط چت کلود همراه با آپلود تصاویر کاراکتر برای دریافت پرامپت‌های طراحی استودیو و اتاق
درخواست پرامپت‌های اختصاصی از کلود جهت قرار دادن آواتار در موقعیت‌های مختلف مانند اتاق یا استودیو

۷. دریافت تصویر کاراکتر در محیط مورد نظر

پرامپت‌های لوکیشن مورد نظرتان را کپی کرده و مجددا به سرویس ساخت تصویر بروید. عکس کاراکتر شیت از زوایای مختلف را آپلود کرده و پرامپت‌های خود را در کادر نوشتن پرامپت، جای‌گذاری کنید. در این مرحله نیز مدل نانو بنانا را انتخاب کنید، کیفیت را روی 4k قرار دهید و ابعاد خروجی را روی نسبت ۹:۱۶، قرار دهید. سپس روی دکمه تولید کن بزنید تا خروجی مورد نظرتان ساخته شود.

اسکرین‌شات از تصویر خروجی نهایی کاراکتر بلاگر قرار گرفته پشت میز آرایش با نسبت تصویر ۹ به ۱۶ عمودی
ترکیب کاراکتر شیت با پرامپت لوکیشن و تولید عکس نهایی با کیفیت 4K در ابعاد مناسب ویدیوهای عمودی

فاز چهارم: متحرک‌سازی و تولید ویدیوی سخنگو

در آخرین مرحله باید کاراکتر ساخته شده در مراحل قبلی را به ویدیو تبدیل کنید.

۸. نگارش اسکریپت ویدیو

برای ساخت ویدیوی آواتار با هوش مصنوعی، به چتِ کلود برگشته و یک اسکریپت یا دیالوگ جذاب (به زبان‌های فارسی یا انگلیسی) برای ویدیوهای بلاگر هوش مصنوعی خود درخواست کنید.

اسکرین‌شات از متن اسکریپت آماده شده به زبان فارسی در محیط چت هوش مصنوعی کلود برای ویدیوی سخنگو
نگارش دیالوگ جذاب و طبیعی به زبان فارسی جهت هماهنگی با حرکات لب آواتار

۹. خلق ویدیوی نهایی

حال نوبت به ساخت ویدیو با هوش مصنوعی می‌رسد. برای ساخت ویدیو، ابتدا متن اسکریپت مورد نظر را کپی کرده و وارد سرویس ساخت ویدیو هوشا شود. سپس پرامپت را در کادر متن جایگذاری کرده و یکی از مدل‌های قدرتمند ویدیویی مانند Grok، Google Omni یا VEO را انتخاب کنید.

پس از تنظیم دقیق کیفیت، مدت‌زمان ویدیو و کادر تصویر، خروجی نهایی آواتار متحرک و سخنگوی خود را دریافت کنید.

محیط سرویس ویدیوساز هوشا با گزینه‌های انتخاب مدل‌های گروک، وئو و گوگل اومنی
تبدیل تصویر ثابت به ویدیوی متحرک و سخنگو با استفاده از مدل‌های پیشرفته ویدیویی هوش مصنوعی

پرامپت و دیالوگ مشترک برای تست سه مدل

تصویر رفرنس کاراکتر آپلود شده، همان زن نشسته پشت میز آرایش، دست زیر چانه و لبخند به دوربین، لب زدن دقیق متن فارسی:

«قبل از هر آرایشی، پوستم رو کامل آبرسانی می‌کنم، این کار باعث می‌شه آرایش خیلی بهتر بشینه»

حالت اعتمادبه‌نفس و دوستانه، نور نرم و طبیعی، حفظ کامل شباهت چهره با تصویر رفرنس, حرکات دست مناسب با صحبت اضافه بشه و دست زیر چونه نباشه زیاد و مدیوم تصویر سینمایی باشه وایبش و جنس تصویر با کیفیت به سبک دوربین های red و imax باشه

مقایسه خروجی Grok، Veo و Gemini Omni برای ساخت آواتار سخنگوی فارسی

برای این مقایسه، هر سه مدل هوش مصنوعی Grok، Veo و Gemini Omni با یک تصویر مرجع و دیالوگ فارسی مشابه آزمایش شدند و نسبت تصویر، مدت ویدیو و کیفیت تا حد امکان یکسان بود. 

در نهایت هر ۳ خروجی را با معیارهایی شامل اجرای دیالوگ فارسی، Lip-sync، ثبات چهره، حرکت بدن، پایبندی به پرامپت و کیفیت بصری بررسی کردیم.  هر سه مدل هوش مصنوعی از نظر کیفیت، نورپردازی محیط و یکپارچگی چهره سوژه در سطح خوبی قرار دارند، اما در گفتار فارسی و طبیعی بودن حرکات بدن، تفاوت‌های مشهودی از خود نشان دادند.

پیش‌نمایش و مقایسه جانبی خروجی‌های ویدیویی آواتار سخنگوی فارسی در سه مدل مختلف هوش مصنوعی
بررسی عملکرد نهایی مدل‌های Grok، Veo و Gemini Omni از نظر هماهنگی لب، زبان بدن و روانی زبان فارسی

در جدول زیر به‌طور کامل خروجی هر سه مدل را مورد بررسی قرار داده‌ایم:

شاخص ارزیابیگوگل Google Omniگروک Grokوئو Veo
اجرای صحیح دیالوگ فارسینسبتا روان اما دارای خطای جزئی در تلفظ فارسیکاملا صحیح، روان و با لحن طبیعیلحن مصنوعی و دارای خطای تلفظی در زبان فارسی
هماهنگی حرکت لب با فارسی (Lip-sync)متوسط، یکنواخت و کمی خطینرم، دقیق و کاملاً هماهنگ با احساسات کلماتناهماهنگی جزئی همراه با حرکات اغراق‌آمیز دهان
ثبات چهره و هویت کاراکتربالا و کاملاً استیبل، بدون تغییر فرم بالا و کاملاً استیبل، بدون تغییر فرم بالا و کاملاً استیبل، بدون تغییر فرم 
طبیعی بودن حرکت سر/صورت/بدنچهره طبیعی؛ حرکات بدن کمی خشک و رباتیک است.طبیعی، همراه با لبخند و حرکت ظریف دست‌ها روی گونهحرکات نسبتا مصنوعی و کمی اغراق‌آمیز دست‌ها
پایبندی به پرامپت و سناریوپایبندی کامل به فضای بصری (میز آرایش)، اما فاقد پویایی در اجرااجرای بی‌نقص و زنده سناریو به عنوان یک بیوتی‌بلاگرتلاش برای اجرای اکتیو سناریو، اما با خروجی ناموفق در زبان بدن و تلفظ
کیفیت بصری و میزان آرتیفکتکیفیت عالی، بدون آرتیفکت یا اعوجاجکیفیت عالی، بدون آرتیفکت یا اعوجاجکیفیت کلی خوب، اما حرکات تند دست‌ها باعث ایجاد حس مصنوعی شده است
پایداری جزئیات لباس و پس‌زمینهپایدار (نورپردازی، میز آرایش و تیشرت کاملاً ثابت است)پایدار (نورپردازی، میز آرایش و تیشرت کاملاً ثابت است)پایدار (نورپردازی، میز آرایش و تیشرت کاملاً ثابت است)

خروجی Google Omni

  • از لحاظ بصری: تصویر کاملاً باثبات است و هیچ‌گونه اعوجاج یا تغییر فرم (Morphing) در چهره و دست‌ها دیده نمی‌شود.
  • بیان و حرکت: ادای کلمات فارسی کمی خطا دارد، اما حرکات بدن پویایی کمی دارد که باعث می‌شود خروجی بیشتر شبیه به خواندن یک متن از روی اتوکیو (Teleprompter) به نظر برسد تا یک گفتگوی صمیمی.

خروجی Grok

  • از لحاظ بصری: در بین این سه مدل، هوش مصنوعی گروک طبیعی‌ترین و باورپذیرترین خروجی بصری را دارد. حرکت ظریف دست‌ها به سمت گونه‌ها و لمس صورت بسیار دقیق رندر شده و از نظر آناتومی مشکلی ندارد.
  • بیان و حرکت: لبخند زدن سوژه در حین صحبت و هماهنگی حرکات لب با ریتم جملات فارسی، حس یک ویدیوی بلاگری واقعی را به‌خوبی منتقل می‌کند. لحن صدا و تصویر به‌خوبی در هم آمیخته‌اند.

خروجی VEO

  • بصری: هوش مصنوعی VEO نیز تلاش کرده تا زبان بدن فعال‌تری (صحبت با دست‌ها) را شبیه‌سازی کند، اما حرکات دست‌ها کمی سریع، نامنظم و بیش از حد اغراق‌آمیز هستند.
  • بیان و حرکت: بزرگترین نقطه ضعف این خروجی، خطای آشکار در تلفظ کلمات به زبان فارسی است که حتی با اعراب‌گزاری نیز قابل بهبود نیست.

نتیجه مقایسه: کدام مدل برای آواتار فارسی بهتر بود؟

با توجه به نتایج ویدیوهای تولیدشده، می‌توان گفت گروک در حال حاضر یکی از بهترین مدل‌های هوش مصنوعی برای ساخت آواتار سخنگوی فارسی است. 

تبدیل عکس به آواتار سخنگو؛ آیا می‌توان از یک عکس آماده شروع کرد؟

بله. برای ساخت آواتار سخنگو لزوماً لازم نیست کاراکتر را از صفر طراحی کنید. اگر از قبل یک عکس مناسب در اختیار دارید، می‌توانید همان تصویر را به‌عنوان تصویر مرجع در ابزارهای تبدیل عکس به ویدیو یا آواتار سخنگو آپلود کنید. بسیاری از سرویس‌های امروزی، از یک تصویر ثابت برای ساخت ویدیویی استفاده می‌کنند که در آن چهره حرکت می‌کند، صحبت می‌کند و با متن یا فایل صوتی هماهنگ می‌شود.

در تبدیل عکس به ویدیو سخنگو با هوش مصنوعی، کیفیت تصویر اولیه اهمیت زیادی دارد. بهتر است عکس واضح باشد، چهره به‌خوبی دیده شود و تا حد امکان رو به دوربین باشد. تصاویر تار، بسیار دور، دارای پوشش روی بخش زیادی از صورت یا با نور نامناسب می‌توانند باعث کاهش کیفیت حرکت چهره و هماهنگی لب‌ها شوند.

ساخت آواتار با هوش مصنوعی رایگان یا آنلاین؛ چه محدودیت‌هایی وجود دارد؟

مهم‌ترین محدودیت‌ها عبارت‌اند از:

  • دسترسی محدود به مدل‌ها: جدیدترین مدل‌های آواتار، لیپ‌سینک یا انیمیشن ممکن است فقط در پلن‌های پولی قابل استفاده باشند.
  • تعداد یا مدت ویدیو: نسخه رایگان ممکن است تعداد مشخصی ویدیو یا مدت محدودی برای تولید در اختیار شما قرار دهد..
  • محدودیت تعداد تولید: ممکن است تعداد دفعات تولید تصویر یا ویدیو در یک بازه زمانی مشخص محدود باشد.
  • کیفیت خروجی: برخی سرویس‌ها کیفیت یا امکانات خروجی را در طرح‌های رایگان محدود می‌کنند.
  • واترمارک: در بعضی ابزارهای رایگان، نام یا لوگوی سرویس روی ویدیوی نهایی قرار می‌گیرد.
  • محدودیت در کنترل حرکات: در نسخه‌های ساده‌تر، کنترل مستقیمی روی ژست، حرکت سر، حالت چهره یا میزان حرکت آواتار وجود ندارد.
  • محدودیت زبان و صدا: پشتیبانی از یک زبان در بخش متن یا ترجمه الزاماً به معنای کیفیت بالای تلفظ و لیپ‌سینک همان زبان نیست؛ بنابراین برای محتوای فارسی بهتر است خروجی واقعی ابزار را قبل از استفاده نهایی آزمایش کنید.

سایت ساخت آواتار با هوش مصنوعی چه امکاناتی باید داشته باشد؟

قبل از انتخاب سایت ساخت آواتار سخنگو، این معیارها را بررسی کنید:

  • پشتیبانی از تصویر مرجع ثابت: بتوانید یک عکس مشخص را به‌عنوان مرجع کاراکتر استفاده کنید.
  • حفظ هویت و چهره کاراکتر: چهره در فریم‌های مختلف دچار تغییر محسوس نشود.
  • تبدیل عکس به ویدیوی سخنگو: ابزار فقط تصویر را متحرک نکند و امکان تولید گفتار و هماهنگی لب با صدا را نیز داشته باشد.
  • کیفیت زبان فارسی: متن فارسی را درست بخواند و تلفظ، مکث و آهنگ گفتار قابل‌قبولی داشته باشد.
  • لیپ‌سینک مناسب: حرکت لب‌ها با صدای تولیدشده هماهنگ باشد.
  • امکان استفاده از متن یا فایل صوتی: بتوانید هم اسکریپت را وارد کنید و هم در صورت نیاز صدای آماده در اختیار ابزار قرار دهید.
  • کنترل حرکت و حالت چهره: در صورت نیاز بتوانید حرکات، ژست یا حالت اجرای آواتار را کنترل کنید.
  • انتخاب مدل‌های مختلف: امکان مقایسه چند مدل و انتخاب مدلی که برای کاراکتر و زبان فارسی نتیجه بهتری می‌دهد.
  • تنظیمات شفاف خروجی: پیش از تولید، ابعاد، نسبت تصویر، مدت و کیفیت خروجی مشخص باشد.
  • امکان تولید در نسبت‌های مختلف: برای مثال 9:16 برای محتوای عمودی و شبکه‌های اجتماعی و 16:9 برای ویدیوهای افقی.
  • پیش‌نمایش و امکان تولید مجدد: بتوانید نتیجه را بررسی و در صورت وجود مشکل، بدون تغییر کل پروژه، دوباره ویدیو را تولید کنید.

تجربه ساخت آواتار در پلتفرم هوش مصنوعی هوشا

در این آموزش، پلتفرم هوش مصنوعی هوشا به‌عنوان محیط اجرای مراحل عملی مورد استفاده قرار گرفته است. در این تست، ابتدا تصویر مرجع و Character Sheet کاراکتر آماده شد و سپس با استفاده از یک تصویر و دیالوگ یکسان، خروجی چند مدل مختلف برای ساخت آواتار سخنگوی فارسی تولید شد. در نهایت، کیفیت حفظ چهره، هماهنگی لب و گفتار، طبیعی‌بودن حرکات و کیفیت کلی ویدیوها با یکدیگر مقایسه شده است.

نکات مهم برای گرفتن خروجی طبیعی‌تر از آواتار سخنگو

حتی اگر ابزار مورد استفاده از مدل قدرتمندی بهره ببرد، کیفیت تصویر ورودی و نحوه آماده‌سازی متن و صدا تاثیر زیادی بر نتیجه نهایی دارد. برای رسیدن به خروجی طبیعی‌تر در ساخت ویدیو با آواتار سخنگو، این نکات را رعایت کنید:

۱. تصویر مرجع باکیفیت انتخاب کنید

از تصویری استفاده کنید که صورت واضح، نور مناسب و جزئیات کافی داشته باشد. تصویر پرتره و از روبه‌رو معمولا برای آواتار سخنگو انتخاب بهتری است.

۲. صورت در فاصله‌ی مناسبی از دوربین باشد

اگر چهره بخش کوچکی از تصویر باشد، مدل اطلاعات کمتری برای تولید حرکات ظریف صورت و لب در اختیار دارد. برای آواتار سخنگو، بهتر است صورت و بخش بالاتنه به اندازه کافی در تصویر قابل تشخیص باشد.

۳. متن فارسی را ساده و قابل‌خواندن بنویسید

جملات بسیار طولانی، نشانه‌گذاری نامناسب، اعداد پیچیده و کلمات اختصاری می‌توانند در بعضی موتورهای تبدیل متن به گفتار باعث تلفظ غیرطبیعی شوند. بهتر است متن را به جمله‌های کوتاه‌تر تقسیم کنید و در جاهایی که لازم است، از علائم نگارشی و اعراب‌گذاری برای ایجاد مکث و تلفظ طبیعی استفاده کنید.

۴. فقط به درست بودن متن اکتفا نکنید

ممکن است ابزار، متن فارسی را از نظر نوشتاری درست دریافت کند، اما تلفظ بعضی واژه‌ها همچنان طبیعی نباشد. بنابراین قبل از تولید نسخه نهایی، چند جمله نمونه را با همان صدا و مدل آزمایش کنید. پشتیبانی از زبان فارسی لزوما به معنای تلفظ بی‌نقص فارسی نیست.

۵. حرکت را بیش از حد زیاد نکنید

حرکت زیاد سر، دست یا صورت همیشه به معنی طبیعی‌تر شدن آواتار نیست. در بسیاری از موارد، حرکات کنترل‌شده و ظریف نتیجه باورپذیری ایجاد می‌کنند. بعضی ابزارهای جدید امکان کنترل حرکت و ژست را با پرامپت فراهم می‌کنند، اما بهتر است این کنترل را برای حرکات ساده و متناسب با گفتار استفاده کنید.

۶. قبل از تولید نهایی، خروجی کوتاه بگیرید

اگر ابزار امکان تولید آزمایشی دارد، ابتدا یک بخش کوتاه از متن را آزمایش کنید. در این مرحله می‌توانید مشکلاتی مثل تلفظ نادرست، هماهنگ نبودن لب و صدا، تغییر چهره یا حرکات غیرطبیعی را شناسایی کنید و سپس نسخه کامل را بسازید.

۷. مدل‌ها را روی یک سناریوی یکسان مقایسه کنید

اگر چند مدل در اختیار دارید، همه را با یک تصویر، یک متن، یک صدا و تنظیمات مشابه آزمایش کنید. این روش مقایسه دقیق‌تری به شما می‌دهد و مشخص می‌کند کدام مدل برای کاراکتر و زبان مورد نظر عملکرد بهتری دارد.

جمع‌بندی

برای ساخت آواتار با هوش مصنوعی و رسیدن به ویدیویی طبیعی، انتخاب مدل به‌تنهایی کافی نیست. کیفیت تصویر مرجع، دقت Character Sheet، آماده‌سازی متن و صدا و نحوه اجرای سناریو همگی روی نتیجه نهایی تاثیر می‌گذارند.

اگر قصد دارید از یک کاراکتر ثابت برای تولید ویدیوهای آموزشی، تبلیغاتی یا شبکه‌های اجتماعی استفاده کنید، بهتر است قبل از تولید نهایی، مدل‌های مختلف را با شرایط یکسان امتحان کنید و بر اساس خروجی واقعی بهترین گزینه را انتخاب کنید. همانگونه که در این آموزش سه مدل Grok، Veo و Gemini Omni را با یک سناریوی یکسان مقایسه کردیم تا تفاوت خروجی آن‌ها را بهتر ببینیم.

۱. چطور آواتار سخنگو با هوش مصنوعی بسازیم؟

 ابتدا یک تصویر مرجع با ظاهر مشخص و ثابت آماده کنید. سپس آن را در یک ابزار هوش مصنوعی تولید ویدیو قرار دهید، دیالوگ یا صدای مورد نظر را اضافه کنید و با تنظیم پرامپت و پارامترهای خروجی، ویدیوی نهایی را تولید کنید.

۲. آیا می‌توان آواتار سخنگوی فارسی ساخت؟

بله از طریق پلتفرم هوشا و طبق آموزش داده شده در این محتوا شما می‌توانید یک آواتار سخنگوی فارسی بسازید.

۳. کدام مدل برای ساخت آواتار سخنگوی فارسی بهتر است؟

 در میان مدل‌های تست شده در این آموزش، هوش مصنوعی گروک نتیجه‌ی بهتری در زبان فارسی داشت.

۴. آیا ساخت آواتار سخنگو با هوش مصنوعی رایگان است؟

 بستگی به ابزار و مدل مورد استفاده دارد. بعضی سرویس‌ها امکان استفاده رایگان یا آزمایشی دارند، اما تعداد تولید، مدت ویدیو، کیفیت خروجی یا دسترسی به برخی مدل‌ها ممکن است محدود باشد. در هوشا برای ساخت آواتار نیاز به خرید اشتراک خواهید داشت.

۵. برای ثابت ماندن چهره آواتار در ویدیو چه کار کنیم؟

 از یک تصویر مرجع باکیفیت و مشخصات ظاهری ثابت استفاده کنید. تهیه Character Sheet نیز می‌تواند به‌عنوان مرجع بصری، ثبات کاراکتر را در نماها و صحنه‌های مختلف بهتر کند.

سوالات متداول این بخش
نظرات کاربران

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مقالات مشابه
نقش DeepSeek در کاهش هزینه‌های توسعه هوش مصنوعی در سطح جهان
برآورد هزینه توسعه DeepSeek نشان‌دهنده سرمایه‌گذاری عظیم و چند میلیون دلاری…
تیم AI هوشا ( ۰ امتیاز )
جنگ سایبری و حملات هوشمند چیست؟
جنگ سایبری و حملات هوشمند نه مرز جغرافیایی می‌شناسند و نه شب و روز؛ آن‌ها م…
تیم تحریریه ( ۰ امتیاز )
هوش مصنوعی سورا Sora 2: آموزش، پرامپت آماده + نمونه ویدیو
سورا Sora 2 یکی از پیشرفته‌ترین مدل‌های هوش مصنوعی ساخت ویدیو است که نگاه ب…
زهرا کاظمی ( ۵ امتیاز )