ساخت ویدیو ASMR با هوش مصنوعی ۰ تا ۱۰۰ (تست واقعی پرامپت)

آخرین به‌روزرسانی: 11 مهر 1405, 3:12 ب.ظ
هوشا 11 مهر 1405 آموزش ۳۰ دقیقه زمان مطالعه 0 دیدگاه ( ۰ امتیاز )

 اگر در شبکه‌های اجتماعی مثل اینستاگرام و یوتیوب فعال باشید، حتماً دیده‌اید که ویدیوهای ASMR مانند خرد کردن صابون، فشردن ژل‌های شفاف یا ضربه آرام ناخن روی اشیا چقدر بازدید میلیونی می‌گیرند.

الان با هوش مصنوعی می‌توانید بدون نیاز به دوربین‌های گران‌قیمت، میکروفون‌های چند ده‌میلیونی یا استودیوی عایق صدا، ویدیوهای ASMR بسازید؛ ویدیوهایی که هم تصویرشان واقعی است و هم صدای هم‌زمان و گوش‌نوازی دارند.

در این مقاله یاد می‌گیرید:

  • چطور یک پرامپت ASMR دقیق بنویسید؟ 
  • پرامپت ASMR  چگونه باشد که حرکت دست‌ها طبیعی باشد و صدا با تصویر هماهنگ باشد.
  • کدام مدل‌های هوش مصنوعی برای ساخت ویدیو ASMR مناسبترند.
  • چطور با هوشا ویدیو ASMR بسازید.
  • چطور خطاهای رایج مثل دفرمه شدن انگشت‌ها یا نویزهای اضافی را برطرف کنید.

ویدیو ASMR چیست؟

آموزش ساخت ویدیو ASMR با پرامپت در هوشا

اصطلاح ASMR مخفف Autonomous Sensory Meridian Response  است و به حس آرامش، حس گزگز ملایم و لذت‌بخشی گفته می‌شود که با شنیدن صداهای بسیار ریز و دیدن تصویرهای آرام به انسان دست می‌دهد. 

در دنیای واقعی، این ویدیوها با صداهایی مثل کشیدن آرام ناخن روی چوب، بریدن صابون‌های ترد یا له کردن ژل‌های رنگی ساخته می‌شوند.

نمونه ویدیو ASMR ساخته شده در پلتفرم هوش مصنوعی هوشا

در این بخش ویدیوی ۱۵ ثانیه‌ای ساخته شده با مدل Seedance 2.5 در هوشا را مشاهده می‌کنید. در ادامه مقاله قدم به قدم نحوه ساخت این ویدیو را آموزش خواهید دید:

تصاویر مرجع استفاده شده در این ویدیو

تصویر سوژه را در این قسمت مشاهده می‌کنید:

مرد جوان با موهای مجعد تیره و تیشرت طوسی روشن در آشپزخانه‌ای مدرن
پرتره مرد جوان در فضای آشپزخانه مدرن چوبی که به عنوان عکس مرجع در ساخت ویدیو استفاده شده است.

در این قسمت نیز تصویر غذایی که سوژه در فیلم می‌خورد، مشاهده می‌کنید.

بشقاب قورمه سبزی با گوشت و لوبیا قرمز به همراه چلو زعفرانی، ته دیگ ترد، سالاد شیرازی، زیتون و پیاز قرمز
سفره غذای سنتی ایرانی؛ چلو قورمه سبزی همراه با مخلفات در ظرف چینی که به عنوان عکس مرجع در ساخت ویدیو استفاده شده است.

انواع ویدیوهای ASMR

در دنیای ASMR وقتی سراغ ساخت ویدیو با هوش مصنوعی می‌روید، معمولاً با دو سبک کلی روبه‌رو می‌شوید:

  1. ویدیوهای فانتزی و اشیامحور: این کلیپ‌ها بیشتر روی اجسام غیرواقعی تمرکز دارند؛ مثل هندوانه‌ای که از جنس شیشه تراشیده شده یا صابونی که هنگام برش مثل کریستال می‌درخشد. این سبک جذابیت بصری دارد، اما مخاطب حس واقعی از آن نمی‌گیرد.
  2. ویدیوهای رئال و کاراکترمحور: در این مدل، دست‌های یک انسان واقعی در کادر قرار می‌گیرد و با یک جسم تعامل دارد. ناخن‌ها، بافت پوست و نحوه فشردن جسم کاملاً طبیعی شبیه‌سازی می‌شوند. مخاطب با دیدن این ویدیو دقیقاً حس می‌کند که یک نفر روبه‌روی او نشسته و در حال لمس اشیاست؛ به همین دلیل این سبک بازدید و ماندگاری مخاطب بسیار بالاتری دارد.

جدول مقایسه انواع ویدیوهای ASMR

سبک ویدیوموضوع و نوع صحنهنوع صداگذاریحس دریافتی مخاطب
انیمیشن و فانتزیبریدن میوه‌های شیشه‌ای و اسلایم‌های براقمعمولاً بی‌صدا یا نیازمند افزودن دستی صدا در برنامه‌های ادیتبیشتر جنبه تماشای گرافیکی دارد و حس لمس واقعی منتقل نمی‌شود.
رئال و کاراکترمحوردست انسان در حال لمس، ضربه زدن یا فشردن مواد مختلفصدای طبیعی و هم‌زمان که درست در لحظه لمس تولید می‌شودحس واقعی ASMR، کاهش استرس و تعامل بسیار بالای تماشاگر.

نکته کلیدی در یک ویدیوی آرامش‌بخش، هماهنگی دقیق حرکت با صداست؛ اگر دست به جسم برخورد کند اما صدا یک ثانیه دیرتر پخش شود، حس بیننده کاملاً از بین می‌رود. به همین خاطر، باید از ابزارها و دستورهایی استفاده کنیم که صدا و تصویر را هم‌زمان تولید کنند.

ساخت ویدیو ASMR با هوش مصنوعی

با هوش مصنوعی می‌توانیم ویدیوی ASMR بسازیم و همین حس تماس فیزیکی و صداهای ظریف را تنها با هوش مصنوعی بازسازی کنیم، بدون اینکه به فیلم‌برداری واقعی نیاز داشته باشیم.

پرامپت ویدیو ASMR چگونه نوشته می‌شود؟

برای اینکه هوش مصنوعی یک ویدیوی طبیعی بسازد، نباید به یک جمله ساده مثل «یک ویدیوی ASMR برای خوردن غذا بساز» اکتفا کنید.

هوش مصنوعی برای درک صحنه، نیاز به جزئیات مشخص دارد؛ باید دقیقاً بگویید دست چه شکلی است، روی چه میزی قرار دارد، چه حرکتی انجام می‌دهد و چه صدایی تولید می‌کند.

پرامپت چیست؟ آموزش پرامپت‌نویسی با ۲۰ مثال‌ واقعی و تست‌شده

فرمول پرامپت نویسی ساخت ویدیو ASMR با هوش مصنوعی

برای نوشتن یک پرامپت ویدیو ASMR بدون نقص، از این فرمول ساده استفاده کنید:

[سوژه و ظاهر دست] + [محیط و میز کار] + [یک حرکت آرام و مشخص] + [نوع صدا و کیفیت ضبط] + [ریتم و سرعت ملایم] + [زاویه و کادربندی دوربین] + [نورپردازی] + [محدودیت‌ها]

در دنیای ویدیوهای ASMR، دو قانون طلایی وجود دارد:

  •  اول اینکه هرگز چند حرکت هم‌زمان را در یک پرامپت ننویسید (مثلاً نباید هم‌‌زمان بگویید دست جسم را ببرد، سپس بچرخاند و بعد له کند؛ فقط یک کار مشخص را انتخاب کنید). 
  • دوم اینکه صدا را حتماً به‌صورت «نزدیک به میکروفون، استریو و بدون موزیک یا صحبت اضافه» توصیف کنید تا مدل صدای اضافه نسازد.

ساختار پیشنهادی پرامپت ASMR

برای پیاده‌سازی این فرمول در ساخت ASMR با هوش مصنوعی، کافی است جدول زیر را به عنوان چک‌لیست جلوی دست خود بگذارید:

بخش پرامپتدر این بخش چه چیزی بنویسیم؟مثال کوتاه کاربردی
سوژه (Subject)سن، تمیزی ناخن‌ها و ظاهر دست را دقیق بنویسید.Calm woman’s hands with natural manicured nails
محیط (Environment)سطحی مات و ساده مشخص کنید تا بازتاب مزاحم نسازد.On a dark slate cutting board in a quiet studio
حرکت (Action)یک تک‌حرکت مشخص را با واژه‌های آرام توصیف کنید.Deliberately tapping and pressing fingertips
صدا (Audio)نوع صدای خرد شدن یا فشردن و کیفیت نزدیک آن را بیاورید.Crisp tactile crunching, near-field binaural ASMR, no music
ریتم (Rhythm)سرعت حرکت را روی آهسته و باحوصله تنظیم کنید.Extremely slow, rhythmic and deliberate pace
دوربین (Camera)نمای نزدیک و پس‌زمینه مات را مشخص کنید.Macro close-up shot, 85mm lens, shallow depth of field
نور (Lighting)نوری نرم انتخاب کنید تا بافت جسم به‌خوبی دیده شود.Soft side-lighting highlighting micro-textures
محدودیت (Limits)لرزش دوربین و حرکات ناگهانی را حذف کنید.Static tripod framing, zero camera shake

پرامپت تیم هوشا برای ساخته ویدیو ASMR خوردن غذای ایرانی

تیم هوشا برای تست واقعی یک ویدیوی موکبانگ و ASMR خوردن غذای ایرانی، از پرامپت ساختاریافته زیر استفاده کرده است:

توجه: ویدیوی موکبانگ (Mukbang) نوعی ویدیو است که در آن فرد جلوی دوربین غذا می‌خورد و معمولاً هم‌زمان با مخاطب صحبت می‌کند یا صدای خوردن غذا را برجسته می‌کند. 

SCENE CONTEXT15-second vertical 9:16 home mukbang / eating ASMR clip. A young man sits alone at a table in his own kitchen, facing the camera, and silently eats a home-cooked Persian meal of ghormeh sabzi with saffron rice and crispy tahdig. No talking at all, only close-mic eating sounds. The camera is a phone on a static tripod, like a real food-creator video.ACTIVE REFERENCES@image1 is the man and the kitchen. His face, dark wavy hair with a messy fringe, thick straight eyebrows, thin moustache and short chin beard, and his light sage-grey crewneck t-shirt 100% match the reference. The background 100% matches the kitchen in the reference: warm walnut wood-panel wall, dark grey stone counter with a black coffee machine, glass storage jars, upturned glasses and a wicker utensil pot. Ignore the selfie angle, his raised arm and the blue lens flare in the reference.


@image2 is the food. The meal 100% matches the reference: ghormeh sabzi (dark green herb stew with tender beef chunks and red kidney beans in a glossy green-brown sauce), fluffy white basmati rice topped with saffron-yellow grains, golden crispy tahdig triangles, raw red onion rings, shirazi salad of diced tomato and cucumber, whole green olives and long fresh green chilies. Everything is served on white scalloped porcelain with a green floral pattern and gold rim. Ignore the top-down camera angle of the reference.


LOCATION MAPThe man sits at a white tabletop in the foreground of his kitchen, torso squared to the camera. The walnut wall and grey counter from @image1 are about 1.5 m behind him, softly out of focus. On the table directly in front of him is his main plate: a mound of rice with a saffron top, ghormeh sabzi spooned beside it, and two tahdig triangles leaning against the rice. Closest to the camera, lined up along the bottom edge of the frame, are three small porcelain dishes: red onion rings on the left, shirazi salad in the center, green olives on the right. Two green chilies lie beside the main plate on screen-right.FIRST FRAME AND SPATIAL BLOCKINGFirst frame: he is already seated and centered, eyes down on his plate, holding a spoon in his right hand (screen-left) and a fork in his left hand (screen-right) above the food. The top of his head sits just below the top of the frame, his face is at the upper-middle of the frame, the tabletop and plate fill the lower third, and the three side dishes line the very bottom edge.FORMAT MODEOne continuous 15-second take, no cuts.OPTICSAbout 75° diagonal field of view, natural smartphone main-camera rectilinear look. Face and food both sharp; kitchen background gently soft. Lens locked for the whole shot.CAMERAThe phone stands on a tripod on the far side of the table, about 1 m from his chest, at roughly his chest height, aimed slightly down so the plate and side dishes read clearly in the foreground and his face sits in the upper frame. Completely locked-off: no push, no pan, no handheld movement.ACTION TIMING0.0-3.0s: He uses the fork to push ghormeh sabzi onto the spoon with rice, lifts a full spoonful, and takes the bite, closing his lips around the spoon and sliding it out clean. His eyes close, he chews slowly and gives a small satisfied nod.3.0-6.5s: He sets the spoon down, picks up a tahdig triangle with his right hand and snaps off a corner with a loud crunch, crumbs falling onto the rice. He dunks the piece into the stew sauce and bites it with a crisp crunch; his eyebrows lift in pleasure.6.5-9.0s: With his fingertips he takes a red onion ring from the front-left dish and bites it raw with a sharp snap, chewing while looking down at his plate.9.0-12.0s: He picks the spoon back up, scoops shirazi salad over a little rice and eats it; a sheen of juice on his lips, he licks his bottom lip.12.0-15.0s: He lifts the second tahdig triangle with both hands and bites a big crunchy chunk, chewing with eyes closed. He licks his thumb, then glances up at the camera with a content half-smile, still chewing as the clip ends.PHYSICSThe loaded spoon has weight and a little sauce drips back to the plate. The tahdig is rigid and brittle: it cracks along a clean fracture into shards and scatters golden crumbs. Rice grains cling to the spoon; the onion ring flexes slightly before it snaps. Chewing shows real jaw motion, cheek movement and a visible throat swallow. Utensils touch the porcelain with real contact. The food on the plate visibly decreases with each bite.LIGHTINGSoft daylight from a window just off camera-left falls across the table and his face, leaving a gentle shadow on his screen-right cheek. Warm ceiling light glows on the walnut wall behind him. Glossy highlights on the stew oil, saffron rice and tahdig crust; his eyes stay clear and readable.AUDIOClose-mic eating ASMR only: spoon clinking on porcelain, soft wet squish of the stew, loud crisp crunch and crackle of tahdig, sharp snap of raw onion, juicy crunch of cucumber, slow chewing, lip smacks, swallowing, quiet breathing through the nose, faint kitchen room tone. No music, no speech, no voiceover.STYLEAuthentic social-media food-creator realism, true-to-life natural colours, crisp phone-video clarity, no film grain, no cinematic colour grade, no on-screen text or subtitles.QUALITYSharp clarity, stable picture, readable face, realistic mouth, teeth and chewing, correct hands with five fingers, utensils stay rigid, natural light motion blur only on quick hand movements, no ghosting, no flicker.POSITIVE CONSTRAINTSExactly one person appears for the whole clip: the man from @image1, seated at the table and facing the camera. The camera stays fixed on the far side of the table the entire time. All food and dishes match @image2. The frame stays vertical 9:16.

ترجمه روان فارسی پرامپت ویدیو ASMR:

«فضای صحنه: ویدیوی موکبانگ و ASMR غذا خوردن ۱۵ ثانیه‌ای عمودی (۹:۱۶) در خانه. یک مرد جوان تنها پشت میز آشپزخانه خود نشسته، رو به دوربین است و در سکوت کامل یک وعده غذای خانگی ایرانی شامل قورمه‌سبزی، برنج زعفرانی و ته‌دیگ ترد می‌خورد. اصلاً صحبتی در کار نیست و فقط صداهای نزدیک به میکروفون از غذا خوردن شنیده می‌شود. دوربین درست مانند ویدیوهای واقعی ولاگرهای غذا، یک گوشی موبایل روی سه‌پایه ثابت است.
تصاویر مرجع فعال: تصویر image1@ مربوط به فرد و آشپزخانه است؛ چهره، موهای موج‌دار تیره با چتری‌های نامرتب، ابروهای پرپشت و صاف، سبیل باریک و ریش کوتاه چانه، و تیشرت یقه گرد خاکستری-سبز او ۱۰۰٪ مطابق تصویر مرجع هستند. پس‌زمینه نیز ۱۰۰٪ با آشپزخانه مرجع مطابقت دارد: دیوار با پنل‌های چوب گردوی گرم، پیشخوان سنگی خاکستری تیره با دستگاه قهوه‌ساز مشکی، شیشه‌های نگهداری مواد، لیوان‌های وارونه و ظرف حصیری قاشق و چنگال. زاویه سلفی، دست بالارفته و انعکاس نور آبی در عکس مرجع نادیده گرفته شود.
تصویر image2@ مربوط به غذا است؛ وعده غذایی ۱۰۰٪ مطابق مرجع است: قورمه‌سبزی (خورش سبزی تیره با تکه‌های گوشت لطیف و لوبیای قرمز در روغنی براق و سبزرنگ)، برنج سفید باسماتی با تزیین زعفرانی، مثلث‌های ته‌دیگ طلایی و ترد، حلقه‌های پیاز قرمز خام، سالاد شیرازی با خیار و گوجه نگینی، زیتون سبز درسته و فلفل‌های تند سبز تازه. همه غذاها در ظروف چینی دالبری سفید با طرح گل سبز و لبه طلایی سرو شده‌اند. زاویه از بالای عکس مرجع نادیده گرفته شود.
چیدمان و موقعیت: مرد پشت یک میز سفید در جلوی کادر نشسته و سینه‌اش کاملاً رو به دوربین است. دیوار چوبی و پیشخوان تصویر image1@ در فاصله حدود ۱.۵ متری پشت سر او با تاری ملایم قرار دارند. روی میز دقیقاً روبه‌روی او بشقاب اصلی قرار دارد: تپه‌ای از برنج زعفرانی، قورمه‌سبزی ریخته‌شده کنار آن، و دو مثلث ته‌دیگ تکیه‌داده‌شده به برنج. نزدیک‌ترین بخش به دوربین در لبه پایینی تصویر، سه ظرف کوچک چینی چیده شده‌اند: پیاز قرمز در سمت چپ، سالاد شیرازی در وسط، و زیتون سبز در سمت راست. دو فلفل سبز در کنار بشقاب اصلی در سمت راست کادر قرار دارند.
فریم اول: او از پیش نشسته و در مرکز کادر قرار دارد، چشمانش رو به بشقاب است و در دست راست (سمت چپ تصویر) قاشق و در دست چپ (سمت راست تصویر) چنگال بالای غذا دارد. سرش کمی پایین‌تر از بالای کادر، چهره‌اش در نیمه بالایی، میز و بشقاب در یک‌سوم پایینی، و سه پیاله در لبه پایین تصویر هستند.
فرمت: یک برداشت ممتد ۱۵ ثانیه‌ای بدون هیچ برشی.
اپتیک و دوربین: زاویه دید حدود ۷۵ درجه طبیعی با دوربین اصلی گوشی موبایل، چهره و غذا کاملاً شارپ و شفاف، پس‌زمینه آشپزخانه کمی مات و لنز کاملاً قفل‌شده. گوشی روی سه‌پایه در فاصله یک متری سینه او و هم‌ارتفاع با سینه‌اش قرار دارد و کمی رو به پایین است تا بشقاب واضح دیده شود؛ کاملاً ثابت و بدون حرکت دست، چرخش یا زوم.
زمان‌بندی حرکت‌ها:
۰ تا ۳ ثانیه: با چنگال قورمه‌سبزی را روی قاشق پر از برنج هدایت می‌کند، قاشق پر را بالا می‌آورد و لقمه را داخل دهان می‌گذارد، لب‌ها را دور قاشق می‌بندد و آن را تمیز بیرون می‌کشد. چشم‌هایش را می‌بندد، آرام می‌جود و با رضایت سر تکان می‌دهد.
۳ تا ۶.۵ ثانیه: قاشق را پایین می‌گذارد، یک تکه ته‌دیگ مثلثی را با دست راست برمی‌دارد و گوشه‌اش را با صدای خرد شدن ترد و بلندی جدا می‌کند طوری که خرده‌هایش روی برنج می‌ریزد. تکه ته‌دیگ را داخل سس خورش می‌زند و با صدایی ترد گاز می‌زند؛ ابروهایش از روی لذت بالا می‌رود.
۶.۵ تا ۹ ثانیه: با سرانگشتان یک حلقه پیاز قرمز از پیاله سمت چپ برمی‌دارد و با صدایی تیز و ترق‌‌توروق گاز می‌زند و درحالی‌که به بشقاب نگاه می‌کند می‌جود.
۹ تا ۱۲ ثانیه: دوباره قاشق را برمی‌دارد، مقداری سالاد شیرازی با کمی برنج پر می‌کند و می‌خورد؛ برقی از آب سالاد روی لب‌هایش می‌ماند و لب پایینش را لیس می‌‌زند.
۱۲ تا ۱۵ ثانیه: دومین تکه ته‌دیگ را با دو دست برمی‌دارد، یک لقمه ترد بزرگ گاز می‌زند و با چشم‌های بسته می‌جود. انگشت شستش را لیس می‌زند، سپس با لبخندی آرام و درحالی‌که هنوز در حال جویدن است به دوربین نگاه می‌کند و کلیپ پایان می‌یابد.
فیزیک حرکت: قاشق پر سنگینی دارد و کمی سس روی بشقاب می‌چکد. ته‌دیگ سفت و شکننده است، از خط شکستگی خرد می‌شود و خرده‌های طلایی پخش می‌کند. دانه‌های برنج به قاشق می‌چسبند و پیاز قبل از شکستن کمی خم می‌شود. جویدن همراه با حرکت واقعی فک، گونه‌ها و بلع واضح در گلو است. تماس قاشق و چنگال با چینی کاملاً واقعی است و با هر لقمه از حجم غذای داخل بشقاب کاسته می‌شود.
نورپردازی: نور ملایم روز از پنجره سمت چپ کادر روی میز و چهره‌اش می‌تابد و سایه ملایمی روی گونه راست او می‌اندازد. نور گرم سقف روی دیوار چوبی می‌درخشد. بازتاب‌های براق روی روغن خورش، برنج زعفرانی و پوست ته‌دیگ دیده می‌شود و چشم‌هایش کاملاً واضح هستند.
صدا: فقط صدای ضبط نزدیک (کلوزمایک) غذا خوردن ASMR: برخورد قاشق با چینی، صدای خیس و نرم خورش، خرد شدن و ترق‌توروق بلند ته‌دیگ، شکستن تیز پیاز خام، صدای ترد و آبدار خیار، جویدن آرام، ملچ‌ملوچ ملایم لب‌ها، قورت دادن، تنفس آرام از بینی و صدای خفیف اتاق آشپزخانه. بدون هیچ موزیک، صحبت یا صدای گوینده.
سبک و کیفیت: رئالیسم واقعی ویدیوهای غذایی شبکه‌های اجتماعی با رنگ‌های طبیعی و وضوح بالای گوشی، بدون گرین سینمایی یا متن روی صفحه. چهره واضح، دندان‌ها و جویدن واقعی، دست‌های درست با پنج انگشت، قاشق و چنگال محکم و بدون تغییر شکل، و تصویر بدون محوشدگی یا پرش.»

تحلیل بخش‌های مختلف پرامپت ویدیوی ASMR:

  • تثبیت چهره و محیط با رفرنس‌ها (ACTIVE REFERENCES): ارجاع به تصاویر ثابت باعث شده هوش مصنوعی در طول ویدیو چهره جوان، مدل مو، ریش و محیط آشپزخانه را بدون کوچک‌ترین تغییری حفظ کند.
  • زمان‌بندی گام‌به‌گام حرکات (ACTION TIMING): مشخص کردن دقیق اینکه در هر ثانیه چه غذایی خورده شود، از تداخل دست‌ها، قاشق و چنگال جلوگیری کرده و حرکتی بسیار نرم و طبیعی ساخته است.
  • طراحی دقیق صداهای ریز (AUDIO): توصیف جداگانه صدای ترق‌توروق ته‌دیگ، شکستن پیاز خام و صدای قاشق روی بشقاب، موتور صوتی را وادار کرده صداهایی زنده، تفکیک‌شده و درست در لحظه برخورد بسازد.
  • شبیه‌سازی قوانین فیزیک (PHYSICS): دستوراتی مثل ریختن خرده‌های ته‌دیگ، سنگینی قاشق پر و کم شدن تدریجی محتویات بشقاب، ویدیو را از حالت یک انیمیشن ساده خارج کرده و جلوه‌ای ۱۰۰٪ واقعی به آن بخشیده است.

نمونه قالب پرامپت قابل‌‌کپی برای سناریوهای دیگر

اگر می‌‌خواهید برای سوژه‌های دیگر مثل تست سایر غذاها، برش صابون یا لمس اشیا پرامپت ویدیوهای ASMR بسازید، کافی است کلمات داخل کروشه در قالب زیر را عوض کنید:

SCENE CONTEXT[مدت زمان ویدیو مثلاً 15-second] vertical 9:16 [نوع ASMR مثلاً home mukbang / tactile ASMR clip]. [توصیف سوژه یا فرد] sits at a table and silently [توصیف کار مشخص مثلاً eats / touches / cuts] the [جنس جسم یا خوراکی]. No talking, only close-mic [نوع صداها] sounds. Camera on a static tripod.ACTION TIMING0.0-3.0s: [کنش اول و نحوه شروع حرکت]3.0-8.0s: [کنش دوم و ایجاد صدای اصلی]8.0-15.0s: [کنش نهایی، پایان حرکت و حس رضایت]AUDIOClose-mic ASMR only: [لیست دقیق صداها مثلاً crisp crunch, soft squish, tapping], slow chewing/contact sounds, clean room tone, zero background music, zero speech.CAMERA & LIGHTINGStatic tripod framing, vertical 9:16, [نوع نورپردازی مثلاً soft window daylight], sharp focus on subject, authentic social-media realism.

اگر برای ساختن ایده‌های خلاقانه یا تنظیم دقیق بخش‌های زمانی و توصیف صداها به زبان انگلیسی به کمک نیاز دارید، می‌توانید از دستیار هوشمند چت جی پی تی بخواهید تا پرامپت انگلیسی شما را بر اساس همین ساختار آماده کند.

آموزش ساخت ویدیو ASMR با هوش مصنوعی هوشا

برای تولید این ویدیوها نیازی به درگیر شدن با سایت‌های خارجی، پرداخت دلاری یا دردسرهای اتصال اینترنت ندارید.

ساخت ویدیو با هوش مصنوعی ایرانی (با دیالوگ + امکانات حرفه‌ای)

مراحل ساخت ASMR با هوش مصنوعی در هوشا به این صورت است:

مرحله ۱: ابتدا وارد بخش ساخت ویدیو با هوش مصنوعی در داشبورد هوشا شوید.

داشبورد پلتفرم هوشا و انتخاب گزینه ویدیو از منوی سرویس‌های اصلی برای تولید ویدیو با هوش مصنوعی
گام اول؛ انتخاب بخش ویدیو در پنل هوشا

مرحله ۲: برای کیفیت و خروجی بهتر و دقیق تر مدل ویدیویی سیدانس ۲.۵ و برای مصرف اعتبار کمتر و خروجی قابل قبول مدل گوگل امنی را می‌توانید انتخاب کنید.

انتخاب مدل هوش مصنوعی Seedance 2.5 از لیست مدل‌های ویدیویی در پنل هوشا برای دریافت بالاترین کیفیت خروجی
انتخاب مدل Seedance 2.5 جهت تولید ویدیوی باکیفیت و دقیق در هوشا

مرحله ۳: دو عکس رفرنس را به ترتیب عکس اول کاراکتر و عکس دوم غذا آپلود می‌کنیم.

پنجره آپلود تصاویر مرجع در هوشا شامل عکس چهره کاراکتر به عنوان تصویر اول و بشقاب غذا به عنوان تصویر دوم
بارگذاری تصاویر رفرنس کاراکتر و غذا به ترتیب در داشبورد هوشا

مرحله ۴: بعد از آپلود عکس پرامپت را وارد میکنیم و تنظیمات ویدیو را چک میکنیم و روی تولید کن میزنیم.

پنل ورود متن پرامپت و اعمال تنظیمات نسبت تصویر، زمان و کیفیت در مدل Seedance 2.5 پلتفرم هوشا
تنظیمات نهایی و کلیک روی دکمه «تولید کن» با مدل Seedance 2.5 در هوشا

مرحله ۵: اگر خروجی اول خروجی دلخواهمان بود روی دکمه دانلود میزنیم و ویدیو را دانلود می‌کنیم.

پنجره پیش‌نمایش ویدیوی هوش مصنوعی و کلیک روی دکمه دانلود در پنل هوشا
مشاهده خروجی ویدیو و دانلود فایل نهایی از پنل هوشا

نمونه خروجی طبق پرامپت بالا با مدل Seedance 2.5 در 10 ثانیه:

برای اینکه ایده خود را همین حالا امتحان کنید، وارد پنل ویدیوساز شوید.

بهترین مدل هوش مصنوعی برای ساخت ویدیو ASMR کدام است؟

برای انتخاب یک هوش مصنوعی ساخت ویدیو ASMR حرفه‌ای، مهم‌ترین معیار این است که مدل بتواند ویدیو و صدا را در یک مرحله و به صورت هماهنگ تولید کند. در گذشته، ابزارها ویدیو را بدون صدا تحویل می‌دادند و شما مجبور بودید خودتان ساعت‌ها دنبال فایل صوتی بگردید و آن را روی تصویر سینک کنید.

 اما امروزه مدل‌های نسل جدید، حرکت ماده را درک می‌کنند و هم‌زمان با ضربه زدن، صدای طبیعی آن را می‌سازند.

تولید ویدئو با هوش مصنوعی؛ چگونه بدون بازیگر و استودیو محتوای ویدیویی بسازیم؟

امروزه دو مدل برجسته پیشتاز تولید هم‌زمان صدا و تصویر هستند:

۱. مدل Seedance 2.5: این مدل شاهکار شرکت بایت‌دنس است. مدل هوش مصنوعی Seedanceکنترل فوق‌العاده‌ای روی ثبات دست‌ها و انگشتان دارد، فیزیک موادی مثل ژل و آب را کاملاً طبیعی درک می‌کند و صدای استریوی بسیار تمیزی متناسب با کنش فیزیکی ارائه می‌دهد.

هوش مصنوعی سی دنس Seedance؛ نمونه خروجی + آموزش ساخت ویدیو

۲. مدل Google Veo 3: این مدل توسط گوگل دیپ‌مایند طراحی شده و توانایی بی‌نظیری در تولید بافت‌های سینمایی، نورپردازی عمیق و صدای محیطی دارد. با استفاده از هوش مصنوعی Veo 3 می‌توانید ویدیوهایی با ظاهر استودیویی واقعی بسازید.

هوش مصنوعی Veo 3.1 گوگل؛ خرید اکانت و راهنمای کامل استفاده

۳. مدل Kling 2.1: این ابزار کلید فعال‌سازی افکت‌های صوتی دارد، اما در حفظ هماهنگی صدا و جزئیات دست‌ها در مقایسه با Seedance کمی نیاز به آزمون و خطای بیشتری دارد.

مدل هوش مصنوعیوضعیت تولید صداکیفیت حرکت دست و مادهبهترین کاربرد برای ASMR
Seedance 2.5صدای بومی استریو کاملاً هماهنگ با ضربهعالی؛ حفظ کامل تعداد انگشتان و کشسانی طبیعی مادهتعامل دست با ژل، اسلایم، میوه و صابون
Google Veo 3صدای محیطی و فولی بومی با کیفیت بالاعالی؛ نورپردازی سینمایی و شکست نور در شیشه و آبسطوح کریستالی، شیشه‌ای و صحنه‌های ریلکسیشن
Kling 2.1پشتیبانی از افکت صوتی با تیک Sound Effects متوسط به بالا؛ احتمال تار شدن دست در حرکات سریع ویدیوهای ساده اشیامحور و انیمیشن

نمونه ویدیو ASMR ساخته شده مدل Google Omni

در این قسمت همان ویدیو را با همان پرامپت توسط هوش مصنوعی Google Omni در هوشا می‌سازیم.

صفحه وارد کردن پرامپت انگلیسی، رفرنس‌ها و تنظیمات وضوح و ابعاد مدل Google Omni در داشبورد ساخت ویدیوی هوشا
بررسی تنظیمات، درج پرامپت و آماده‌سازی برای تولید ویدیو با مدل Google Omni

نمونه خروجی طبق پرامپت تستی با مدل Google Omni در 10 ثانیه:

بررسی و تحلیل عملکرد هوشا در تولید ویدیو ASMR

بررسی نتیجه تست عملی تیم هوشا نشان می‌دهد که هوش مصنوعی ساخت ASMR در بازآفرینی صحنه‌های پیچیده کاراکترمحور مانند موکبانگ و غذا خوردن به سطح چشمگیری از واقع‌گرایی رسیده است. 

در این آزمایش که با سناریوی قورمه‌سبزی و ته‌دیگ ترد انجام شد، خروجی به‌دست‌آمده نقاط قوت درخشان و نکات فنی مشخصی را نشان داد.

نقاط قوت در تست عملی:

  • ثبات کامل چهره، ریش و موهای کاراکتر در تمام ۱۵ ثانیه بدون کوچک‌ترین پرش پیکسلی یا تغییر قیافه به دلیل پایبندی به عکس مرجع image1@ حفظ شد.
  • هماهنگی صدای خرد شدن ته‌‌دیگ و گاز زدن پیاز با حرکت دهان فوق‌العاده بود و صدا دقیقاً در همان لحظه گاز زدن و بسته شدن دندان‌ها پخش شد.
  • وسایل غذاخوری مثل قاشق و چنگال فلزی فرم صلب و طبیعی خود را حفظ کردند و دست‌ها با پنج انگشت درست و بدون به هم ریختگی قاشق را بالا آوردند.
  • فیزیک غذا کاملاً باورپذیر بود؛ تکه‌های ته‌دیگ با شکستن خرد شدند، خرده‌های طلایی روی برنج ریخت و حجم غذای بشقاب با هر لقمه کمتر شد.

چالش‌ها و راه‌حل رفع آن‌ها:

 در صورتی که بازه‌های زمانی (Action Timing) در پرامپت قید نشود، مدل ممکن است تلاش کند چند حرکت را هم‌زمان انجام دهد که باعث انحنا پیدا کردن دسته قاشق یا ناپدید شدن ته‌‌دیگ در فریم‌های میانی می‌شود. راه‌حل قطعی برای رفع این ایراد، تعریف دقیق ثانیه‌ها برای هر لقمه و درج قیود بازدارنده مثل utensils stay rigid, correct hands with five fingers در متن پرامپت است تا تصویر کاملاً پایدار بماند.

ساخت ویدیو واقعی با هوش مصنوعی؛ آموزش کامل از عکس تا ویدیو حرفه‌ای

خطاهای رایج در ساخت ویدیو ASMR و راه‌حل آن‌ها

هنگام کار با ابزارهای تولید ویدیو ممکن است با اشکالاتی در تصویر یا صدا مواجه شوید. جدول زیر به شما کمک می‌کند هر مشکل در ویدیو هوش مصنوعی ASMR را در چند ثانیه شناسایی و رفع کنید:

ایراد مشاهده‌شده در ویدیوعلت اصلی بروز مشکلراهکار سریع و اصلاح پرامپت
صدا با تصویر هماهنگ نیستتوصیف جداگانه زمان صدا و حرکت حرکت و صدا را در یک عبارت بنویسید: sound emitted at the exact moment of touch
انگشت‌ها غیرطبیعی یا اضافه می‌شونددرخواست حرکات تند و پیچیده دستحرکت را به یک ضربه ساده عمودی محدود کنید و بنویسید: anatomically precise hand, simple downward tap
صدای تولیدشده بیش از حد بلند استاستفاده از صفت‌هایی مثل Loud یا Ultra از عبارت‌های استاندارد میکروفون استفاده کنید: delicate low-gain, subtle near-field audio
تصویر لرزش غیرعادی داردمشخص نکردن وضعیت سه‌پایه دوربین اول پرامپت قید کنید: locked-off tripod shot, completely still camera 
حرکت‌ها قاطی می‌شوند و تصویر خراب استنوشتن چند کار مختلف در یک پرامپت فقط یک کار مشخص را بخواهید؛ مثلاً فقط برش زدن یا فقط لمس کردن 
بافت اجسام مصنوعی و پلاستیکی استنبود نورپردازی مایل و سایه‌های ملایم نور را تنظیم کنید: soft directional side lighting, realistic surface texture

ساخت ویدیوی ASMR با هوشا چه مزیتی دارد؟

ساخت محتوا برای کاربران ایرانی همیشه با دردسرهایی مثل تحریم، قطعی وی‌پی‌ان و نداشتن کارت‌های اعتباری بین‌المللی همراه بوده است . هوشا به عنوان یک پلتفرم هوش مصنوعی کامل، محیطی فراهم کرده که همه این موانع را دور می‌زند و بهترین سرویس‌های جهانی را یکجا در اختیارتان قرار می‌دهد.

مهم‌ترین مزایای کار با هوشا در تولید هوش مصنوعی ASMR:

  • دسترسی به بهترین مدل‌ها در یک پنل: نیازی به ثبت‌نام در ده‌ها سایت مختلف ندارید؛ ابزارهای برتر ویدیوساز در دسترس شما هستند .
  • پرداخت ریالی آسان: هزینه‌ها را بدون نیاز به حساب‌های خارجی یا رمزارز پرداخت می‌کنید.
  • محیط کاملاً فارسی و سریع: کار با بخش هوش مصنوعی آنلاین در هوشا بسیار ساده است و نیازی به دانش فنی پیچیده ندارد.
  • دانلود مستقیم و باکیفیت: برای دانلود هوش مصنوعی ASMR و ذخیره ویدیوها نیاز به نرم‌‌افزار جانبی ندارید و فایل را با بهترین کیفیت دریافت می‌کنید.

نکته مهم درباره اعتبارات: در پلتفرم هوشا، روزانه ۲۰ گفت‌وگوی رایگان برای چت جی‌‌پی‌تی در نظر گرفته شده است؛ اما بخش تولید ویدیو به دلیل نیاز به سرورهای گرافیکی فوق‌العاده قدرتمند، نیازمند شارژ حساب کاربری متناسب با مدت رندر است .

نویسنده: معین معرک‌ نژاد

آیا واقعاً می‌توان با هوش مصنوعی ویدیوی ASMR صدادار ساخت؟

بله؛ مدل‌های ویدیویی نسل جدید به قابلیت تولید صدای بومی مجهز هستند و می‌توانند هم‌زمان با لمس یا برش جسم، صدای متناسب با آن را بدون نیاز به ابزار جداگانه بسازند.

بهترین مدل برای ساخت ویدیوی ASMR با دست و صدای واقعی چیست؟

مدل‌های Seedance 2.5 و Google Veo 3 بهترین خروجی را دارند، زیرا فیزیک ماده را به‌خوبی درک می‌کنند و دست‌ها را با فرم کاملاً طبیعی نمایش می‌دهند.

پرامپت ویدیوی ASMR چه بخش‌هایی دارد؟

پرامپت مناسب باید شامل ظاهر دست، جنس سطح، یک حرکت آرام، نوع صدای نزدیک، زاویه لنز ماکرو، نور نرم و دوربین ثابت روی سه‌پایه باشد.

چطور صدا را با حرکت دست هماهنگ کنیم؟

باید در پرامپت خود قید کنید که صدا دقیقاً در لحظه تماس ایجاد شود و از نوشتن چند حرکت پیچیده هم‌زمان خودداری کنید.

آیا برای ساخت و دانلود ویدیو در هوشا باید نرم‌افزار نصب کنیم؟

خیر؛ کلیه مراحل ساخت و دانلود به صورت آنلاین داخل مرورگر انجام می‌شود و هیچ نیازی به نصب اپلیکیشن نیست.

علت به هم ریختن فرم انگشت‌ها در ویدیو چیست؟

حرکات ناگهانی دوربین یا نوشتن کارهای متعدد در پرامپت باعث این خطا می‌شود؛ با انتخاب یک حرکت ساده و آهسته، دست‌ها کاملاً طبیعی می‌مانند.

سوالات متداول این بخش
نظرات کاربران

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

مقالات مشابه
هوش مصنوعی برای ایفون و IOS (معرفی بهترین برنامه‌ها + لینک دانلود)
اگر به‌دنبال بهترین هوش مصنوعی برای ایفون هستید تا کارهای روزمره، تولید محت…
زهرا کاظمی ( ۱.۵ امتیاز )
هوش مصنوعی برای تحلیل اینستاگرام، معرفی بهترین ابزارها برای آنالیز پیج
برای تحلیل اینستاگرام با هوش مصنوعی، از ابزارهای تحلیلی پیشرفته استفاد…
تیم AI هوشا ( ۰ امتیاز )
آموزش کامل استفاده از Perplexity AI به زبان ساده
اگر دنبال راهی ساده و سریع برای جست‌وجوی دقیق و دریافت پاسخ‌های حرفه‌ای هست…
تیم AI هوشا ( ۰ امتیاز )